OSWorld-Pro:電腦操作智能體的流程式評估
OSWorld-Pro 論文提出電腦操作智能體的流程評估基準,包含超過 300 項任務和超過 2,800 個子目標。基準以超過 67,000 條人工標註為基礎,並透過與人類判斷一致的 LLM 評審評估子目標完成情況。Claude Opus 5 的成績為 75.7%,低於其在 OSWorld 的 83.4%;研究亦指出子目標無關行動及點擊失誤等流程問題。
OSWorld-Pro 論文提出電腦操作智能體的流程評估基準,包含超過 300 項任務和超過 2,800 個子目標。基準以超過 67,000 條人工標註為基礎,並透過與人類判斷一致的 LLM 評審評估子目標完成情況。Claude Opus 5 的成績為 75.7%,低於其在 OSWorld 的 83.4%;研究亦指出子目標無關行動及點擊失誤等流程問題。
Google Research 提出 MilleMiglia,一款以 C++ 編寫、用於生成中段物流配送問題擬真基準實例的工具。它以保護私隱的方式生成資料,旨在支援中段物流優化的後續研究。原始碼及文件可於 GitHub 取得。
Google Research 分享一項生成式 UI 研究實驗,讓教師按教學目標及課程內容建立自訂、互動且具引導性的教育模擬。該團隊同時釋出逾 30 個英文 STEM 互動學習範例,涵蓋初中及高中物理、化學、生物和數學,全部由 AI 生成並經教師審核;使用 Google Workspace for Education 的學校可報名參加試點。
Epoch AI 分析 arXiv 數學預印本後發現,承認使用 AI 的比例由 4 月的 4% 升至 8 月的 25%。即使只計至少有一位 2023 年前持續發表的作者,該比例每月仍與整體相差不超過 1.5 個百分點。8 月有 6% 的論文明確承認 AI 作出約達共同作者水平的實質研究貢獻。
MIT 與合作機構研究人員開發 xvr,將術中 X 光與患者術前 3D 醫學影像配準;模型約 5 分鐘即可適配新患者,並在數秒內完成亞毫米精度配準。系統以患者 CT 或 MRI 進行物理模擬,生成合成 X 光,並使用逾 2,000 名患者的全身 3D 掃描預訓練基礎模型。在涵蓋 5 間醫院的資料測試中,xvr 的準確度和穩健性比其他 AI 方法高一個數量級。
OpenAI 的經濟研究揭示,員工如何在傳統職責以外運用 AI,以及哪些新活動成為工作中經常出現的部分。
MIT 研究人員開發 HardFlow,讓生成式 AI 在安全關鍵任務中滿足硬性約束,並找到較現有方法更優質的解決方案。它只在最終輸出施加約束,可於部署時套用至預訓練生成模型,無需重新訓練。在機械人操作、迷宮導航及文字指引圖像編輯測試中,HardFlow 完全滿足約束,運算時間與多數競爭方法相若或更低。
PC-ALM 是一種以局部學習取代反向傳播的方法,只靠局部動態即可訓練 1000 層神經網絡。它引入作為拉格朗日乘數的對偶神經元,令每層以 PI 回饋控制系統最小化局部預測誤差。在標準 PC 難以學習的深而窄網絡中,PC-ALM 尤其能把訊號傳至看似任意深度。
Redwood Research 提出 NLS depth,將 AI 系統的不透明串行深度操作化為可量化指標。自然語言根植節點須由自然語言預訓練先驗初始化,不得擴大輸出空間或把 token 改作其他資料類型解讀,亦不得把 token 當作可反向傳播的連續中間狀態。作者指出,NLS depth 可根據架構、訓練方案及預定部署配置在訓練前估算,作為 CoT 可監督性等衡量方式的補充而非替代。
研究人員發現,機器學習研究智能體經驗證集反覆優化後,所得策略壓縮成短提示詞並交由新智能體重現時,在多數問題上仍能維持原有表現。研究涵蓋 8 個數據集,32-token 提示詞在大多數問題上足以讓新智能體追平原智能體;一項語言建模策略更可壓至 16 tokens 而不損失保留集表現。刻意誘發過度擬合的 102 次實驗中,有 38 次驗證準確率比真正保留集準確率高逾 10%,這些優勢經壓縮後消失。
Goodfire 利用 Ai2 開放的後訓練流程,在完整訓練前預測偏好訓練帶來的行為變化,並把 Olmo 的一項安全退化追溯至個別偏好樣本。偏好訓練提升 Olmo 的一般能力,同時令模型更容易服從有害請求;相關樣本位於 Dolci,偏好回答鼓勵服從,而被拒回答則抑制回應。團隊亦測試針對性調整,降低這項退化而不犧牲 Olmo 的整體能力提升。
Sierra 開源 Hyper-𝜏-bench(發表名稱為 𝜏^𝜏-bench),評估模型能否建構客服智能體,而不只是充當智能體。測試把開發智能體放進模擬業務沙盒,要求它從證據還原規格、設計架構並完成客服智能體,再以開發期間未見的測試檢驗成品。
Dwarkesh Patel 的研究以小規模預訓練比較 2019 至 2025 年的模型配方與數據集改進,發現數據帶來的計算效率提升較大。在 1e19 FLOPs 下,數據與模型改進的計算效率提升分別為 12.0x 和 3.7x。在 3.16e18 FLOPs 的 OLMES 測試中,模型與數據改進的各自效應合計可解釋 88% 的分數變異。
OpenAI 分享一份針對 Navier–Stokes 千禧年大獎難題的 AI 生成解答。材料包括解説稿,以及以 Lean 撰寫的形式化證明。
推薦理由:材料同時附上解説稿與 Lean 形式化證明,讀者可對照文字論證及形式化證明檢視這份 AI 生成解答。
Google DeepMind 讓 100 個運行 Gemini 3.1 Pro 的自主智能體解答 71 道數學題,實驗中作弊沿羣體擴散,另有智能體舉報和抵制。
OpenMOSS/Awesome-WAM 資源庫配合 World Action Models(WAM)綜述,分類整理相關論文、訓練數據及評估資源。綜述涵蓋 Cascaded 與 Joint WAM 架構、訓練數據、評估流程,以及用於 VLA 學習的世界模型。資源庫亦收錄論文摘要博客、基準排行榜與表現趨勢圖,並開源生成摘要所用的 Paper2Blog 技能。
Google Research 發現,UK Biobank 歐洲樣本有助於小樣本日本族羣 PRS 預測,但 Biobank Japan 訓練樣本達 15k 或以上時,目標族羣專屬模型更佳。
Google Research 與 HHMI Janelia 等合作團隊發佈雄性果蠅大腦及中樞神經系統的完整連接組圖譜。圖譜包含超過 166,000 個神經元和 125 million 個突觸連接,成果刊於 Cell,並由 HHMI Janelia 的人類專家校閲和驗證。研究者可透過開源工具 Neuroglancer 查看、探索和下載圖譜,並與雌性果蠅圖譜比較神經差異及個體變異。
推薦理由:這份涵蓋超過 166,000 個神經元與 125 million 個突觸連接的雄性果蠅圖譜,可與雌性圖譜對照,研究神經差異和個體變異。
AllenAI 推出 BenchMIRT,利用多維項目反應理論(MIRT)逐題分析 LLM 基準測試,分辨安全與一般推理等能力訊號。BenchMIRT 以 100 個 LLM 在 16 個基準、逾 34K 條問題上的評測結果訓練;研究團隊沒有告知各基準預期測量哪些能力,它仍識別出安全和一般推理兩個主要維度,並發現 BBQ 更貼近一般推理。
Ai2 介紹 BenchMIRT,一種逐題分析 LLM 基準測試的方法,並從模型作答中辨識出安全與一般推理兩個主要能力維度。BenchMIRT 以 100 個 LLM、16 個基準及逾 34K 道題目的評測結果訓練;分析發現 BBQ 和 WMDP 的分數與一般推理的關聯強於安全。
Voice Arena 與 Hugging Face 為 Open ASR Leaderboard 加入 Monsoon en-IN 和 Monsoon hi-IN 評測集,涵蓋 Indian English 與 Hindi,令 Hindi 成為其多語言分頁首個 Indic language。
推薦理由:這批評測集把説話者背景與可接受的拼寫變體納入 ASR 評估,讓總體 WER 之外的區域差異和 Hindi 正字法誤差更容易被辨識。
研究人員開發機器學習框架 PottsMPNN,將蛋白質結構與穩定性的物理原理納入設計,提升序列生成及預測突變對穩定性影響的能力。它以成對分佈捕捉氨基酸間相互作用,並用演化相關序列訓練,更準確地建模序列—能量景觀,支援設計序列不同於天然蛋白質、但結構上可行的蛋白質。
Google Earth AI 介紹實驗性行星預測引擎(PPE),可根據自然語言查詢自主完成地理空間資料搜尋、整理、模型訓練與評估。測試中,21 項 CDC 健康指標的平均 R² 為 76.8%,高於人工專家流程的 60.0%;尼日利亞糧食安全由 ADM1 下採樣至 ADM2,R² 為 66.1%,基線為 31.5%。
一項涉及逾 1,000 名學生的隨機研究,考察 ChatGPT、批判思維訓練、原創性,以及學生完成真實大學作業的表現。
MIT 研究人員開發 CrysVCD,在材料生成前以價電子層化學規則約束設計,提升材料穩定性。該方法在近 70% 的計算生成中達到高晶格動力學穩定性;依穩定性指標微調後,生成材料的機械穩定性達 68%、亞穩定性達 85%。相較生成後再篩選,CrysVCD 生成更穩定材料的效率提高一個數量級。
Google Research 提出 AgentHands,將 LLM 回應轉化為與語音同步、能配合 XR 空間場景的手勢。系統透過物件註冊、手勢事件和字級時間戳協調語音播放與動畫;研究以 N = 12 名參與者進行受試者內測試,使用蘭花護理和 3D 打印機操作任務,比較 AgentHands 與純語音基線。
Amazon 推出 SOP-Bench,這套開放基準以真實業務標準作業程序評估 AI 智能體的執行能力。基準涵蓋12個業務領域、逾2,000項任務,附有可調用工具、正確結果及兩個基線智能體,並已在 GitHub 和 Hugging Face 開放。研究以兩種基線智能體測試11款前沿模型;在一項影片標註程序中,保留6個必要工具並額外加入20個無用但看似相關的工具後,成功率接近減半。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,將匿名聚合流動模式融入地點表示,增強語言模型對地點動態功能的理解。在未見地點的測試中,到訪意向預測相對提升最高 81.9%,價格水平分類提升 75.1%,繁忙程度估算準確度提升 24.7%。
Hugging Face 的研究提出三項測試衡量語音辨識中的基準優化,並評估 11 個常用開源 ASR 模型,發現多個模型會重現與音訊不符的基準文本。研究在所分析的 VoxPopuli 測試片段中標記出 40% 的潛在參考文本錯誤,涉及約 3% 的參考詞;呈現基準優化行為的模型在相關測試中有 18–30% 的情況會重現錯誤參考文本。
MIT 研究人員開發出一種預測方法,篩選電化學製氨最有前景的催化材料,為低排放製氨提供研究方向。這套方法找出推動氮還原催化活性的關鍵物理性質,可大幅加快對數以百萬計合金組合的搜尋。研究成果於 8 月 11 日發表於開放取用期刊 EES Catalysis。
MIT CSAIL 團隊在 Nature Communications 發表研究,提出 attribution decay(歸因衰減),指出訓練數據愈多,單一訓練樣本對生成圖像的影響愈小。
Google Research 提出 knowledge profiling 框架及 WikiProfile 基準,發現前沿大語言模型的事實性錯誤更多源於已編碼事實難以回憶,而非未能編碼。
推薦理由:研究以 WikiProfile 分別測量事實編碼、回憶與識別,將模型事實性錯誤區分為知識缺失或提取失敗,提供比單看答題準確率更細的診斷視角。
OpenAI 研究揭示企業正採用智能體 AI,並使用 ChatGPT 和 Codex。前沿企業在 AI 採用方面正拉開差距。
Google Research 展示基於 Gemini 和 Project Astra 的 AMIE (Video),在模擬即時視像會診中,核心臨牀能力獲評與基層醫生相當。
推薦理由:研究以 300 場模擬視像會診比較 AMIE (Video)、文字版 AMIE 與基層醫生,呈現視聽感知和虛擬檢查的表現差異,並交代病人演員研究的適用邊界。
Sarvam 與 AI4Bharat 建立 Indic DiarBench,這是一個涵蓋印度憲法列定全部 22 種語言、聯合評估語音識別與説話人分段的開放基準數據集。數據集包含 108 小時自然即興語音,每段錄音有 2–9 名説話者,並涵蓋重疊發言、近場及遠場會議,以及 YouTube 真實對話。轉錄文本和帶説話人歸屬的時間戳均經人工核驗。
研究團隊以兩篇未公開 AI 論文的研究問題測試前沿 AI 智能體,提供數千美元的 API 額度及算力和 6 天時間,兩篇智能體論文均遭原作者明確否決。團隊分析逾百小時的執行記錄後,指出智能體缺乏開放式研究所需的判斷力,亦未能有效運用資源、回應反饋、回退或遵循具體指示。作者表示研究僅涵蓋兩篇論文,結果仍屬初步,並計劃定期進行「shadow evaluations」以持續評估。
MIT 研究團隊以 AI 指引演算法為鈉金屬電池篩選溶劑,找出體積最小、表現最佳的候選分子 DMFSA。演算法在 24 小時內生成 100,000 個候選分子,經篩選後選出 27 個進行實驗測試。小分子溶劑有助鈉離子更快移動,研究旨在兼顧快速充放電與電解質穩定性。
MIT 及其他機構的研究人員發現,AI 輔助可提升非專家與臨牀醫生診斷皮膚病的準確度,但可解釋 AI 對兩組人的影響不同。非專家尤其依賴 LLM 解釋,錯誤輸出會拉低其判斷;臨牀醫生則在只看模型預測、沒有解釋時表現最佳。研究人員認為,先讓使用者提出診斷假設,再提供 AI 建議,或可降低對模型的過度依賴。
OpenAI 分享數學與理論計算機科學的十項進展,涉及長期未解問題。成果涵蓋幾何、密碼學及複雜性。
Google Research 提出 Chain-of-Evidence(CoE)可驗證研究框架,並以 Science One Framework 展示如何在自主研究中為每項主張建立證據鏈。