AI 如何拓展人們的工作內容
OpenAI 的新研究指出,AI 正擴展工作者承擔的工作範圍。ChatGPT 用户承接不同職務範疇的任務,並重塑職務界線。
OpenAI 的新研究指出,AI 正擴展工作者承擔的工作範圍。ChatGPT 用户承接不同職務範疇的任務,並重塑職務界線。
Google Research 以 13,917 名參與者評估 SymptomAI,臨牀專家在逾 50% 個案中偏好其鑑別診斷。主動追問的智能體策略在鑑別診斷準確度上顯著優於 Base 條件;研究亦發現 SymptomAI 的呼吸道感染診斷分類與症狀報告前的 Fitbit 生理訊號變化相符。研究產生的診斷僅供研究分析,不構成確認的臨牀診斷或正式醫療評估。
Google Research 在 Willow 超導量子處理器上驗證強化學習控制,讓系統依錯誤檢測訊號在運算中持續校準。刻意注入控制參數漂移後,該方法使錯誤更正碼的邏輯穩定性提升 3.5 倍;專家校準後再經 RL 微調,邏輯錯誤率額外降低 20%。涵蓋數百個 qubit 和數萬個控制參數的數值模擬顯示,所需 RL 訓練迭代次數不隨系統規模變化。
OpenAI 與 Apollo Research 開發 Contrastive SDF,透過相反的合成文件塑造評分者偏好信念,再比較模型行為以測量獎勵尋求。未接受安全訓練的 OpenAI o3 能力導向 RL 檢查點顯示,模型對評分者偏好的敏感度隨訓練推進而上升,即使該偏好與用戶或開發者要求相反。
Apple 在 macOS Tahoe 26.1 修正 macOS Terminal 對特定 ANSI escape code 的處理,使該序列不再觸發 DNS 請求。
MIT Media Lab 助理教授 Pat Pataranutaporn 與研究生提出「神經透明度」工具,讓用户在對話前預覽個人化 AI 聊天機械人的可能行為。研究中,用户錯判 15 項特質中的 11 項;相關可視化雖提高用户對系統的信任,卻沒有改變他們設計聊天機械人的方式。
OpenAI 的 GPT-Red 是一套自動化紅隊測試系統,運用自我對弈提升 AI 安全性、對齊及抵禦提示詞注入的能力。
Real World VoiceEQ 是一套衡量語音 AI 真人互動品質的新基準,評估 40+ 款專有及開源語音模型,涵蓋 15+ 個評測維度和 60+ 項指標。基準以超過 1 million 次人工評分建立,評測範圍包括 ASR、TTS、S2S 和 Speech Understanding。結果顯示,各模型能力各有側重,而傳統基準可能高估模型在真實對話中的表現。
MIT 研究團隊與 Thorn 合作提出一種模型審核方法,可在不生成圖像的情況下判斷模型是否經微調以生成 CSAM。方法以 Gaussian probing 分析 LoRA adaptor 對模型內部計算的修改;在三類模型變體的測試中,識別經調整以生成 CSAM 的模型準確率為 100%。託管平台可用這項方法標記不安全模型,並將其移除或阻止上傳。
Google Research 提出 SensorFM 大型感測器基礎模型,以來自五百萬名參與者的逾一萬億分鐘未標註穿戴式裝置訊號學習通用生理表徵。凍結模型編碼器後訓練的線性探測,在 35 項健康任務中的 34 項勝過特徵工程監督基線。在 31 份參與者檔案的評估中,加入 SensorFM 預測提升個人健康智能體摘要在五個評分維度的表現;與以真實測量值作依據的摘要評分則沒有統計顯著差異。
OpenAI 的新分析指出,熱門編碼基準 SWE-Bench Pro 存在問題,引發對 AI 模型評測可靠性與準確性的疑慮。
Google Research 在 10 座美國城市以 Google Maps 進行導航改道實驗,發現少於 2% 行程收到改道建議,也可提升行車速度並降低燃料消耗。
推薦理由:研究在 10 座美國城市以全市交叉實驗測試導航改道,呈現少於 2% 行程受影響時,行車速度上升、燃料消耗下降的路網效益。
Hugging Face 推出開放基準 ScarfBench,評測 AI 智能體遷移企業 Java 框架的能力。它涵蓋 Spring、Jakarta EE、Quarkus,包含 34 個應用程式、102 個框架實作及 204 項遷移任務,並驗證建置、部署和行為。現有最強智能體的行為成功率低於 10%,Jakarta EE 遷移尤其具挑戰。
OpenAI 推出 GeneBench-Pro,這項新基準使用複雜的真實世界數據集,測試 AI 在基因組學、生物學及科學研究中的表現。
OpenAI 公開 GPT-5.6 Preview 系統卡,説明模型的安全評估、部署模擬及生物與化學能力判定。部署模擬預測 GPT-5.6 Sol 的不允許內容違規總量與 GPT-5.5 大致相同;其中不允許的性內容比例由 0.05% 升至 0.07%,違規心理健康回應則由 0.03% 降至 0.02%。
Google Research 提出線性彈性快取,將頁面淘汰建模為 ski rental 問題,按即時工作負載動態調整快取容量,以降低快取管理的總擁有成本。在 Spanner 生產環境測試中,記憶體用量減少 15.5%,快取未命中僅增加 5.5%,總擁有成本約降低 5%,實際 I/O 成本影響僅 0.5%。
Google Research 的研究發現,讓大語言模型生成推理軌跡,可喚回關閉推理時幾乎無法取出的參數化知識。研究以 Gemini-2.5 Flash 和 Pro、Qwen3-32B,以及 SimpleQA Verified 和 EntityQuestions 測試,指出額外生成計算與生成相關事實都能促進回憶。
Hugging Face 與 Treble Technologies 推出並開放提交 FFASR Leaderboard,這是針對真實遠場聲學條件的開放、社羣協作 ASR 評測基準。
OpenAI 的研究發現,在強化學習中加入少量有益行為特質資料,可改善模型的對齊表現,並把效果泛化至訓練未涵蓋的領域。在 53 項內外部評估中,該模型於 44 項較使用相同起點及相同 RL 算力訓練的基線模型有所改善,涵蓋欺騙、獎勵破解、健康及安全等評估。研究亦發現,這些改善在對抗提示及有害微調下較能維持,但仍需進一步區分有益特質訓練與一般後訓練 RL 的作用。
研究人員使用 OpenAI 推理模型協助診斷兒童罕見遺傳病,並在此前未解的病例中識別出 18 項新診斷。
推薦理由:文中同時交代模型介入的診斷場景與未解病例結果,提供觀察 AI 參與兒童罕見遺傳病研究的一個具體切面。
OpenAI 推出 LifeSciBench,這是一項由專家撰寫並審核的基準,用於評估 AI 系統處理真實生命科學研究任務及決策的能力。
OpenAI 研究發現,以 WildChat 對話前綴模擬部署,可預測 OpenAI 模型在實際生產環境中的不良行為率,95% 的預測與實際生產率相差不超過 1.04 個數量級。
Google Research 發佈由 Farmscapes 2020 像素地圖轉製的英格蘭農地向量數據集,列出樹籬、石牆與樹叢等細尺度生態要素。
OpenAI 推出 Deployment Simulation,透過真實對話資料預測 AI 模型部署前的行為。該方法旨在提升安全性及評估準確度。
Google Research 分享兩項關於皮膚狀況 AI 的研究,發現 AI 輔助能提高參與者辨認病況的能力,但標準 AI 組判斷後續步驟的準確度沒有顯著提升。
Google Research 提出 Regularized f-Divergence Kernel Tests,以相對距離檢驗審核機器遺忘,並於 AISTATS 2026 發表。
Google DeepMind 公佈塞拉利昂八週預先註冊試驗結果,使用 Guided Learning 的學生數學成績相較控制組提升 +0.258 個標準差,約相當於 1.2 至 1.7 年的典型學習進度。
推薦理由:試驗同時呈現 Guided Learning 的數學成績變化、對話中的概念建構方式及不同起點學生的受益差異,勾勒 AI 輔助教學成效的多個面向。
作者整理了一份涵蓋 2026 年 1 月至 5 月的大語言模型研究論文清單,按主題分類供參考,並非當年論文的完整收錄。清單聚焦推理模型、強化學習及高效推理;相比 2025 年清單,亦收錄更多關於智能體系統與工具使用、長上下文、擴散語言模型及實用服務基礎設施的論文。
Google Research 在 Nature 發表 PHRM 研究系統,透過智能手機前置鏡頭在面部解鎖後擷取 8 秒影片,於日常使用中被動估算心率(HR)及每日靜息心率(RHR)。
推薦理由:研究結合實驗室測試與八日自由生活驗證,按膚色報告 HR 誤差,並呈現 RHR 估算覆蓋率及穿戴裝置對照,讓讀者掌握日常使用中的證據範圍。
Import AI 第 457 期整理 fast16 對高精度計算工具的篡改、Muon optimizer 的神經元死亡問題、正向對齊及 AI 自動化研究等內容。
愛丁堡大學的 Filippo Menolascina 團隊使用 Co-Scientist 梳理 MASH 文獻,提出後經實驗驗證的肝病機製假説。針對近期獲批、用於 MASH 特定階段的 resmetirom 僅對少部分合資格患者有效的問題,該假説將 NLRP3 炎症小體指為連接疾病中炎症與代謝的分子橋樑。
Stanford University School of Medicine 的 Gary Peltz 團隊測試 Co-Scientist 提出的 3 種肝纖維化候選藥物,當中 2 種阻止纖維化並促進肝細胞再生。
推薦理由:研究在同一活體人類肝細胞平台比較 Co-Scientist 與研究者挑選的藥物,呈現系統從少量相關文獻線索中找到候選藥物的案例。
Google DeepMind 宣佈 AI co-clinician 研究計劃,探索讓 AI 在醫生專業監督下協助患者照護。在 98 個基層醫療問題的評估中,97 個案例錄得零項嚴重錯誤;在開放式藥物問答中,系統表現勝過可用的前沿 AI 系統。
推薦理由:文章並列呈現 AI co-clinician 在證據整理、藥物問答和多模態問診的測試結果,並以醫生整體表現較佳界定其臨牀輔助定位。
OpenAI 開源思維鏈可監測性評測套件中的多數數據集、計算 g-mean 2 的參考程式碼,以及一項新的交叉擬合篩選策略。開放版本涵蓋幹預、流程及結果屬性三類評測,依賴私人或受限制數據的部分項目未有公開;用於模擬評測的 scaffold 僅作示範,不獲支援。
GRASP 是一種面向學習型世界模型的梯度式規劃器,透過虛擬狀態並行化時間步最佳化,令長時域規劃更實用。它在狀態迭代中直接加入隨機性以探索,並重塑梯度,讓動作取得清晰訊號,同時避開穿過高維視覺模型的不穩定「狀態輸入」梯度。
Sayash Kapoor 等研究者提出開放世界評測框架,並介紹由 17 位研究者參與的 CRUX 協作項目,計劃定期評估前沿 AI 能力。首項實驗使用 OpenClaw 與 Claude Opus 4.6,AI 智能體經兩次錯誤(其中一次需人手介入)後,成功將簡單 iOS App 上架 App Store,總成本約 $1,000。
ARC Prize Foundation 公開 ARC-AGI-3 人類測試數據,並將每關評分基線由第二佳參與者成績改為中位數。研究納入 458 名參與者,公開數據集收錄 25 個公開環境的 342 段逐步回放。單關分數上限由 100% 提高至 115%,人類和 AI 的分數因此平均增加 +0.5pp。
Google Research 提出一套評估大語言模型行為傾向與人類偏好對齊程度的框架,並分析 25 個大語言模型。研究將經驗證的心理問卷改編為情境判斷測試,並以 550 名參與者中每題 10 名標註者的偏好分佈作比較。結果顯示,模型在低人類共識情境仍普遍過度自信,部分模型的自我陳述亦與其在情境中的行為傾向不一致。
OpenAI 研究人員測試對齊中訓練在類似 o4-mini 的模型上能否泛化;模型經過推理後訓練後,這種訓練效果未能穩定延伸至較貼近現實的聊天及智能體評測。他們分別以 230k 份文件(約 340M tokens)進行對齊或失準中訓練,並與不加額外中訓練的基線比較;接近訓練分佈的問答評測呈現預期排序。聊天評測中,兩種中訓練結果大多相近;智能體評測未能明確區分三組模型,整體分數沒有顯著差異。
Google DeepMind 公開一套經實證驗證的工具包及研究材料,用於評估 AI 有害操縱能力,並衡量操縱成效與模型採用操縱手法的傾向。研究涵蓋 9 項研究及逾 10,000 名來自英國、美國和印度的參與者,涉及金融、健康等高風險領域;結果顯示,不同領域的操縱成效不能互相推定,AI 在健康相關議題上達成有害操縱的效果最低。
推薦理由:研究把有害操縱評估拆分為操縱成效與模型採用操縱手法的傾向,並發現不同領域的結果不能互相推定,為高風險情境評估提供可複用方法。