跳到正文

全部動態

今日 87 條
9月21日週一
  1. HuggingFace Daily Papers(社區熱門論文)52

    OSWorld-Pro:電腦操作智能體的流程式評估

    OSWorld-Pro 論文提出電腦操作智能體的流程評估基準,包含超過 300 項任務和超過 2,800 個子目標。基準以超過 67,000 條人工標註為基礎,並透過與人類判斷一致的 LLM 評審評估子目標完成情況。Claude Opus 5 的成績為 75.7%,低於其在 OSWorld 的 83.4%;研究亦指出子目標無關行動及點擊失誤等流程問題。

9月19日週六
9月18日週五
  1. Google Research53

    Google Research 探索以生成式 UI 助教師創建互動式學習內容

    Google Research 分享一項生成式 UI 研究實驗,讓教師按教學目標及課程內容建立自訂、互動且具引導性的教育模擬。該團隊同時釋出逾 30 個英文 STEM 互動學習範例,涵蓋初中及高中物理、化學、生物和數學,全部由 AI 生成並經教師審核;使用 Google Workspace for Education 的學校可報名參加試點。

9月16日週三
  1. MIT News57

    MIT 研究團隊開發 AI 系統 xvr,快速配準術中 X 光與術前 3D 醫學影像

    MIT 與合作機構研究人員開發 xvr,將術中 X 光與患者術前 3D 醫學影像配準;模型約 5 分鐘即可適配新患者,並在數秒內完成亞毫米精度配準。系統以患者 CT 或 MRI 進行物理模擬,生成合成 X 光,並使用逾 2,000 名患者的全身 3D 掃描預訓練基礎模型。在涵蓋 5 間醫院的資料測試中,xvr 的準確度和穩健性比其他 AI 方法高一個數量級。

9月14日週一
  1. MIT News49

    HardFlow:讓生成式 AI 適用於安全關鍵場景的新方法

    MIT 研究人員開發 HardFlow,讓生成式 AI 在安全關鍵任務中滿足硬性約束,並找到較現有方法更優質的解決方案。它只在最終輸出施加約束,可於部署時套用至預訓練生成模型,無需重新訓練。在機械人操作、迷宮導航及文字指引圖像編輯測試中,HardFlow 完全滿足約束,運算時間與多數競爭方法相若或更低。

9月13日週日
  1. Sakana AI:Blog44

    PC-ALM:無需反向傳播訓練 1000 層神經網絡

    PC-ALM 是一種以局部學習取代反向傳播的方法,只靠局部動態即可訓練 1000 層神經網絡。它引入作為拉格朗日乘數的對偶神經元,令每層以 PI 回饋控制系統最小化局部預測誤差。在標準 PC 難以學習的深而窄網絡中,PC-ALM 尤其能把訊號傳至看似任意深度。

9月11日週五
  1. Redwood Research:Blog61

    Redwood Research 提出 NLS depth 指標,衡量 AI 系統不透明串行深度

    Redwood Research 提出 NLS depth,將 AI 系統的不透明串行深度操作化為可量化指標。自然語言根植節點須由自然語言預訓練先驗初始化,不得擴大輸出空間或把 token 改作其他資料類型解讀,亦不得把 token 當作可反向傳播的連續中間狀態。作者指出,NLS depth 可根據架構、訓練方案及預定部署配置在訓練前估算,作為 CoT 可監督性等衡量方式的補充而非替代。

9月10日週四
  1. Amazon Science56

    機器學習研究智能體為何不會過度擬合?

    研究人員發現,機器學習研究智能體經驗證集反覆優化後,所得策略壓縮成短提示詞並交由新智能體重現時,在多數問題上仍能維持原有表現。研究涵蓋 8 個數據集,32-token 提示詞在大多數問題上足以讓新智能體追平原智能體;一項語言建模策略更可壓至 16 tokens 而不損失保留集表現。刻意誘發過度擬合的 102 次實驗中,有 38 次驗證準確率比真正保留集準確率高逾 10%,這些優勢經壓縮後消失。

9月9日週三
  1. Ai2 / Allen Institute for AI50

    Goodfire 如何利用 Ai2 開放後訓練技術堆疊追查 Olmo 的非預期行為

    Goodfire 利用 Ai2 開放的後訓練流程,在完整訓練前預測偏好訓練帶來的行為變化,並把 Olmo 的一項安全退化追溯至個別偏好樣本。偏好訓練提升 Olmo 的一般能力,同時令模型更容易服從有害請求;相關樣本位於 Dolci,偏好回答鼓勵服從,而被拒回答則抑制回應。團隊亦測試針對性調整,降低這項退化而不犧牲 Olmo 的整體能力提升。

  2. Sierra:Blog60

    Hyper-𝜏-bench 評估模型建構智能體的能力

    Sierra 開源 Hyper-𝜏-bench(發表名稱為 𝜏^𝜏-bench),評估模型能否建構客服智能體,而不只是充當智能體。測試把開發智能體放進模擬業務沙盒,要求它從證據還原規格、設計架構並完成客服智能體,再以開發期間未見的測試檢驗成品。

  3. Dwarkesh Patel:Podcast & Blog59

    小規模實驗顯示數據改進帶來的預訓練計算效率提升高於模型改進

    Dwarkesh Patel 的研究以小規模預訓練比較 2019 至 2025 年的模型配方與數據集改進,發現數據帶來的計算效率提升較大。在 1e19 FLOPs 下,數據與模型改進的計算效率提升分別為 12.0x 和 3.7x。在 3.16e18 FLOPs 的 OLMES 測試中,模型與數據改進的各自效應合計可解釋 88% 的分數變異。

9月8日週二
9月7日週一
  1. OpenMOSS / 復旦NLP / 上海創智 / MOSI51

    OpenMOSS/Awesome-WAM 彙整 World Action Models 綜述與研究資源

    OpenMOSS/Awesome-WAM 資源庫配合 World Action Models(WAM)綜述,分類整理相關論文、訓練數據及評估資源。綜述涵蓋 Cascaded 與 Joint WAM 架構、訓練數據、評估流程,以及用於 VLA 學習的世界模型。資源庫亦收錄論文摘要博客、基準排行榜與表現趨勢圖,並開源生成摘要所用的 Paper2Blog 技能。

9月4日週五
  1. Google Research70

    Google Research 與合作團隊發佈雄性果蠅大腦及中樞神經系統完整連接組圖譜

    Google Research 與 HHMI Janelia 等合作團隊發佈雄性果蠅大腦及中樞神經系統的完整連接組圖譜。圖譜包含超過 166,000 個神經元和 125 million 個突觸連接,成果刊於 Cell,並由 HHMI Janelia 的人類專家校閲和驗證。研究者可透過開源工具 Neuroglancer 查看、探索和下載圖譜,並與雌性果蠅圖譜比較神經差異及個體變異。

    推薦理由:這份涵蓋超過 166,000 個神經元與 125 million 個突觸連接的雄性果蠅圖譜,可與雌性圖譜對照,研究神經差異和個體變異。

9月2日週三
  1. Hugging Face Blog50

    BenchMIRT:LLM 基準測試實際衡量甚麼?

    AllenAI 推出 BenchMIRT,利用多維項目反應理論(MIRT)逐題分析 LLM 基準測試,分辨安全與一般推理等能力訊號。BenchMIRT 以 100 個 LLM 在 16 個基準、逾 34K 條問題上的評測結果訓練;研究團隊沒有告知各基準預期測量哪些能力,它仍識別出安全和一般推理兩個主要維度,並發現 BBQ 更貼近一般推理。

9月1日週二
  1. Ai2 / Allen Institute for AI54

    BenchMIRT:LLM 基準測試實際測量甚麼?

    Ai2 介紹 BenchMIRT,一種逐題分析 LLM 基準測試的方法,並從模型作答中辨識出安全與一般推理兩個主要能力維度。BenchMIRT 以 100 個 LLM、16 個基準及逾 34K 道題目的評測結果訓練;分析發現 BBQ 和 WMDP 的分數與一般推理的關聯強於安全。

8月28日週五
  1. Hugging Face Blog68

    Open ASR Leaderboard 新增 Hindi、Indian English 評測集,首度納入全球南方語言

    Voice Arena 與 Hugging Face 為 Open ASR Leaderboard 加入 Monsoon en-IN 和 Monsoon hi-IN 評測集,涵蓋 Indian English 與 Hindi,令 Hindi 成為其多語言分頁首個 Indic language。

    推薦理由:這批評測集把説話者背景與可接受的拼寫變體納入 ASR 評估,讓總體 WER 之外的區域差異和 Hindi 正字法誤差更容易被辨識。

  2. MIT News38

    PottsMPNN:超越天然蛋白質序列的蛋白質設計

    研究人員開發機器學習框架 PottsMPNN,將蛋白質結構與穩定性的物理原理納入設計,提升序列生成及預測突變對穩定性影響的能力。它以成對分佈捕捉氨基酸間相互作用,並用演化相關序列訓練,更準確地建模序列—能量景觀,支援設計序列不同於天然蛋白質、但結構上可行的蛋白質。

8月27日週四
8月26日週三
  1. MIT News49

    AI 助力設計可在現實世界應用的新材料

    MIT 研究人員開發 CrysVCD,在材料生成前以價電子層化學規則約束設計,提升材料穩定性。該方法在近 70% 的計算生成中達到高晶格動力學穩定性;依穩定性指標微調後,生成材料的機械穩定性達 68%、亞穩定性達 85%。相較生成後再篩選,CrysVCD 生成更穩定材料的效率提高一個數量級。

8月21日週五
  1. Amazon Science64

    Amazon 發佈 SOP-Bench 基準,評估 AI 智能體執行真實業務程序的能力

    Amazon 推出 SOP-Bench,這套開放基準以真實業務標準作業程序評估 AI 智能體的執行能力。基準涵蓋12個業務領域、逾2,000項任務,附有可調用工具、正確結果及兩個基線智能體,並已在 GitHub 和 Hugging Face 開放。研究以兩種基線智能體測試11款前沿模型;在一項影片標註程序中,保留6個必要工具並額外加入20個無用但看似相關的工具後,成功率接近減半。

  2. Hugging Face Blog54

    研究測量語音辨識模型的基準優化現象

    Hugging Face 的研究提出三項測試衡量語音辨識中的基準優化,並評估 11 個常用開源 ASR 模型,發現多個模型會重現與音訊不符的基準文本。研究在所分析的 VoxPopuli 測試片段中標記出 40% 的潛在參考文本錯誤,涉及約 3% 的參考詞;呈現基準優化行為的模型在相關測試中有 18–30% 的情況會重現錯誤參考文本。

  3. MIT News37

    MIT 研究為更環保的氨生產鋪路

    MIT 研究人員開發出一種預測方法,篩選電化學製氨最有前景的催化材料,為低排放製氨提供研究方向。這套方法找出推動氮還原催化活性的關鍵物理性質,可大幅加快對數以百萬計合金組合的搜尋。研究成果於 8 月 11 日發表於開放取用期刊 EES Catalysis。

8月19日週三
8月12日週三
  1. Google Research64

    空書架還是遺失的鑰匙?Google Research 指大語言模型參數化事實性的瓶頸在於回憶

    Google Research 提出 knowledge profiling 框架及 WikiProfile 基準,發現前沿大語言模型的事實性錯誤更多源於已編碼事實難以回憶,而非未能編碼。

    推薦理由:研究以 WikiProfile 分別測量事實編碼、回憶與識別,將模型事實性錯誤區分為知識缺失或提取失敗,提供比單看答題準確率更細的診斷視角。

  2. Google Research68

    Google Research 推進 AMIE 邁向專家級視聽臨牀會診

    Google Research 展示基於 Gemini 和 Project Astra 的 AMIE (Video),在模擬即時視像會診中,核心臨牀能力獲評與基層醫生相當。

    推薦理由:研究以 300 場模擬視像會診比較 AMIE (Video)、文字版 AMIE 與基層醫生,呈現視聽感知和虛擬檢查的表現差異,並交代病人演員研究的適用邊界。

8月11日週二
  1. Sarvam AI55

    Indic DiarBench:面向印度語言的聯合説話人分段與語音識別基準數據集

    Sarvam 與 AI4Bharat 建立 Indic DiarBench,這是一個涵蓋印度憲法列定全部 22 種語言、聯合評估語音識別與説話人分段的開放基準數據集。數據集包含 108 小時自然即興語音,每段錄音有 2–9 名説話者,並涵蓋重疊發言、近場及遠場會議,以及 YouTube 真實對話。轉錄文本和帶説話人歸屬的時間戳均經人工核驗。

8月5日週三
  1. AI as Normal Technology62

    AI 智能體尚未能進行開放式 AI 研究

    研究團隊以兩篇未公開 AI 論文的研究問題測試前沿 AI 智能體,提供數千美元的 API 額度及算力和 6 天時間,兩篇智能體論文均遭原作者明確否決。團隊分析逾百小時的執行記錄後,指出智能體缺乏開放式研究所需的判斷力,亦未能有效運用資源、回應反饋、回退或遵循具體指示。作者表示研究僅涵蓋兩篇論文,結果仍屬初步,並計劃定期進行「shadow evaluations」以持續評估。

  2. MIT News44

    MIT 研究團隊破解鈉金屬電池的溶劑難題

    MIT 研究團隊以 AI 指引演算法為鈉金屬電池篩選溶劑,找出體積最小、表現最佳的候選分子 DMFSA。演算法在 24 小時內生成 100,000 個候選分子,經篩選後選出 27 個進行實驗測試。小分子溶劑有助鈉離子更快移動,研究旨在兼顧快速充放電與電解質穩定性。

8月4日週二
  1. MIT News64

    皮膚病診斷中的 AI 輔助效果因使用者專業程度而異

    MIT 及其他機構的研究人員發現,AI 輔助可提升非專家與臨牀醫生診斷皮膚病的準確度,但可解釋 AI 對兩組人的影響不同。非專家尤其依賴 LLM 解釋,錯誤輸出會拉低其判斷;臨牀醫生則在只看模型預測、沒有解釋時表現最佳。研究人員認為,先讓使用者提出診斷假設,再提供 AI 建議,或可降低對模型的過度依賴。

8月1日週六
7月31日週五