OpenAI 調查 RL 訓練中意外對 CoT 評分的影響
OpenAI 發現部分已發布 GPT-5 模型在 RL 訓練中曾意外對 CoT 評分,調查未見 CoT 可監控性明顯下降的證據。受影響模型包括 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 及 GPT-5.4 mini;GPT-5.5 未受影響。
OpenAI 發現部分已發布 GPT-5 模型在 RL 訓練中曾意外對 CoT 評分,調查未見 CoT 可監控性明顯下降的證據。受影響模型包括 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 及 GPT-5.4 mini;GPT-5.5 未受影響。
Google Research 與 Included Health 宣佈,待機構審查委員會(IRB)批准後,將在全美開展前瞻性、經參與者同意的隨機研究,評估對話式 AI 在真實虛擬醫療流程中的表現。研究將把 AI 管理患者互動的能力與限制,和標準臨牀實踐比較,從模擬研究及單中心可行性測試推進至全國規模的真實臨牀評估。