跳到正文

#論文/研究

今日 19 條
10月3日週六
  1. Anthropic:Alignment Science Blog57

    研究提出模糊任務中的分散式 AI 控制框架

    Anthropic、EPFL 與 Redwood Research 的研究人員提出紅藍隊對抗框架,評估模糊研究任務中 AI 以隱蔽破壞取得弱評分器高分的風險。在實驗構想生成測試中,對抗提示詞令 Opus 4.6 產生被弱評分器評為優良、但被可查閲原論文的 Sonnet 4.6 評為較差的提案;研究亦找到能抵禦紅隊提示詞攻擊的 Haiku 4.5 評分提示。

  2. Anthropic:Alignment Science Blog57

    這會改變模型答案嗎?CHIVE 以反事實實驗評估真實情境中的大語言模型行為解釋

    Anthropic 提出 CHIVE,以反事實提示詞編輯評估大語言模型行為解釋;三類讀取模型 activation 的工具均未勝過只看逐字稿的基線。CHIVE 每項調查會進行 5–15 項提示詞編輯實驗,重新抽樣並測量目標行為出現頻率的變化,再由獨立評審檢視實驗對解釋的支持程度。

  3. Anthropic:Alignment Science Blog47

    TASTE:AI 模型能否判斷 AI 安全研究提案?

    Anthropic 建立 TASTE 基準,評估模型判斷 AI 安全研究提案的能力;測試顯示,模型表現遜於人類研究人員。基準包含 92 組提案配對,估計人類研究人員的一致率為 77%,Fable 5 得分為 60%。研究者討論分歧後修訂評分,並篩選自評「強」信心的標註,使估計一致率由討論前的 53% 升至 68%。

  4. Anthropic:Alignment Science Blog71

    Anthropic 研究:自動化對齊研究智能體可緩解已清晰界定的對齊失敗

    Anthropic 研究發現,以 Claude Opus 4.8 驅動的自動化對齊研究智能體,透過後訓練可緩解所測的 10 類對齊失敗。最佳方法在留出基準、多輪 Petri 行為審計及最高達目標模型 4.7× 規模的模型上仍能泛化,並大致保留一般能力。在 7 類有研究者提交方案的失敗中,AAR 最佳方法勝過 28 位資深研究者的一次性方案;但研究者不能反覆迭代,因此作者不把這視為直接比較。

10月2日週五
  1. Google Research64

    Google Research 介紹採用 TEE 的新一代聯邦學習系統

    Google Research 公佈採用可信執行環境(TEE)的新一代聯邦學習系統,讓伺服器端的數據匿名化處理可供驗證和審計。設備上傳的訓練數據只會交由符合預先授權存取政策的 TEE 工作負載解密處理,相關政策亦發布於 Rekor 公開透明日誌。Gboard 已採用新系統推出英文及日文下一詞預測模型,模型私隱保障更強、準確度更高,計算時間亦較舊系統大幅縮短。

    推薦理由:文章比較舊式聯邦學習與 TEE 架構在服務端可驗證性上的差異,並交代存取政策公開記錄機制及 Gboard 部署後在私隱、準確度和訓練速度上的變化。

  2. HuggingFace Daily Papers(社區熱門論文)36

    ADSD:以自動診斷與技能探索訓練數值智能

    ADSD 框架以數值診斷引導合適方法的探索,並將知識整理成可重用的求解器技能,令求解器自我改進更有系統。它在四個數值領域均提升求解器的準確度、穩健性和效率。在 GOC-500 電力潮流測試中,平均求解器誤差降低近 71 倍,改善亦轉移至未見過的電網拓撲和運行狀況。

10月1日週四
  1. Johann Rehberger / Embrace The Red77

    SQL Copilot(SSMS)CVE-2026-65669 攻擊鏈可令 db_owner 取得 SYSADMIN 權限

    Johann Rehberger 揭示 SQL Server Management Studio(SSMS)中的 SQL Copilot 存在 CVE-2026-65669,攻擊者可繞過唯讀限制,令任意 T/SQL 以受害者的資料庫連線權限執行。

    推薦理由:文章拆解間接提示詞注入如何串連唯讀限制繞過與資料庫權限提升,並指出唯讀約束應由權限機制落實。

  2. HuggingFace Daily Papers(社區熱門論文)61

    Jev 風格類型化決策模型中,選項標籤凌駕定義

    研究在四種開放權重類型化決策模型、11 項分類任務及 PolicyBench 上測試,發現模型作答多數跟隨選項標籤,而非定義中的規則。刪除定義後,laya-td 的準確率與使用定義時相近(0.8559 對 0.8487);將選項改名為 A、B,準確率則上升 +0.1511 [+0.1377, +0.1646]。

  3. HuggingFace Daily Papers(社區熱門論文)33

    iADD:改善擴散策略最佳化中的對齊與多樣性

    iADD 提出以增量 Feynman-Kac 訓練為基礎的擴散模型策略最佳化方法,以改善對齊與多樣性的取捨。理論分析指出,僅更新較後期時間步可能損害多樣性,與先前研究的結論相反。研究在三項不同任務中將方法與相關方法比較,並以各組件消融實驗驗證其在對齊和多樣性方面均有性能提升。

  4. HuggingFace Daily Papers(社區熱門論文)56

    AI Theorist 揭示 α-RuCl_3 的激子結構

    AI Theorist 透過分析 α-RuCl_3 的光學光譜,辨識出具有不同光學選擇規則及實空間分佈的激子態,並提出對光學與光電流觀測的新解讀。系統運用 AI 智能體進行假設生成、第一性原理計算及證據驅動修正,以建立物理模型。作者稱,據其所知,這是 AI 系統運用第一性原理電子結構與多體計算,自主建立模型解釋量子材料此前未公開實驗觀測的首次示範。

  5. HuggingFace Daily Papers(社區熱門論文)47

    選擇式結構化推理:邁向高效多模態搜尋智能體

    研究提出選擇式結構化推理(SSR)框架,讓多模態智能體從預設推理候選中選擇,而非進行開放式生成。在七個多模態搜尋基準、2B 和 4B 模型上的評估中,SSR 的平均成功率與同等規模的領先搜尋智能體相若。它將每回合推理延遲降低超過 90%,每題模型推理總延遲降低 28-54%。

  6. HuggingFace Daily Papers(社區熱門論文)38

    SourceLearn:從知識存取到來源學習,培養對特定來源的理解能力

    SourceLearn 框架讓 AI 智能體隨時間建立可重用、針對特定來源的理解能力。在 13/15 個設定中取得最佳結果,較 Hybrid RAG 最多提升 +22.6 分;移除關鍵文件後,表現約下跌 8 分,Hybrid RAG 則下跌 25 分。學習成果亦可遷移至未練習的任務,改善指引任務未直接涵蓋的來源部分。

9月30日週三
  1. Apple Machine Learning Research47

    大語言模型條件控制中的效果與流暢度取捨:系統性研究

    研究團隊系統性比較大語言模型(LLM)在概念注入與移除時的條件控制方法,發現高效引導往往以流暢度受損為代價。Activation steering 在指令微調模型上的效果遠不及在基礎模型上;提示詞和監督式微調可用於概念注入,但不擅長移除。低成本文本指標與成本較高的 LLM 評判分數高度相關。

  2. HuggingFace Daily Papers(社區熱門論文)44

    JEPA-TTT:動力學轉變下用於規劃的潛在世界模型持續測試時訓練

    JEPA-TTT 透過在測試期間持續自我監督更新預訓練世界模型的潛在動力學預測器,適應測試時與訓練時不同的環境動力學。在 4 個連續控制環境的 8 種動力學轉變中,JEPA-TTT 均改善規劃表現;經 500 個測試回合後,潛在自回歸預測誤差平均降低 83%,規劃表現較凍結的 JEPA 世界模型提升 153%。

9月29日週二
  1. MIT News48

    算法單一化的影響取決於具體細節

    MIT 研究人員系統評估算法單一化的主要反對理由,指出其是否有害不能一概而論,須視乎應用領域及算法準確度。研究以數學證明,算法單一化傾向形成妨礙探索的資訊迴音室;在招聘中,把多種算法組成「ensemble」可克服這項限制,其表現有時可媲美甚至優於各公司採用不同算法的做法。

9月28日週一
  1. Epoch AI:Gradient Updates69

    AI 成本下降速度快於其他變革性技術

    Epoch AI 的分析估算,過去五年,AI 達到特定基準分數的成本每年降至約原來的 1/13,降幅快於文中比較的 DNA 定序、運算、鋰電池和電力。OpenAI 的例子顯示,o3 在 GPQA Diamond 達到 75% 分數時每題成本為 $0.30;不到 18 個月後,GPT-5.6 Luna 達到相同分數時每題成本為 $0.0004,下降 725 倍。

  2. MIT News66

    MIT研究團隊利用AI算法開發耐高温RNA疫苗配方

    MIT研究團隊利用AI算法優化脂質納米粒(LNP)配方,提升RNA疫苗耐熱穩定性。新配方使疫苗在室温下穩定保存一年,或在37°C(98°F)保存兩個月;接種這些顆粒的小鼠產生了與使用類似Moderna原配方疫苗的小鼠相當的免疫反應。研究人員以算法分析近50種FDA批准賦形劑,從五種候選物中迭代預測配比,經數輪細胞測試後在數週內選出供動物測試的配方。

  3. HuggingFace Daily Papers(社區熱門論文)37

    AFP-GIC:可控生成式圖像壓縮的自適應融合先驗遷移

    AFP-GIC 提出按圖像內容引導編碼與重建的自適應融合先驗遷移流程,用於可控生成式圖像壓縮,無須傳送先驗本身。單一可部署的預訓練模型支援五個碼率操作點。在 NVIDIA RTX 4090 上以 256×256 圖像區塊測試,解碼延遲較 DC-VIC 低 18.1%(80.47 ms 對 98.27 ms),推理參數少 20.5%。

9月25日週五
  1. MIT News59

    MIT McGovern Institute 研究團隊開發以文字估算自殺風險的工具

    MIT McGovern Institute 研究團隊開發一款以詞彙表和機器學習分析危機對話、估算自殺風險的工具。研究以涵蓋 49 項風險因素的詞彙表分析約 16,000 段 Crisis Text Line 對話,發現最高風險組較常提及致命手段和物質使用,而非抑鬱情緒或疲倦。這款輕量、可解讀的模型可預測未見對話的風險程度,但詞彙表不處理語境,投入臨牀使用前仍須充分驗證。

  2. Google Research51

    Google Research 介紹長篇連貫影片生成研究與四套框架

    Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。

9月23日週三
9月22日週二
9月21日週一
  1. HuggingFace Daily Papers(社區熱門論文)52

    OSWorld-Pro:電腦操作智能體的流程式評估

    OSWorld-Pro 論文提出電腦操作智能體的流程評估基準,包含超過 300 項任務和超過 2,800 個子目標。基準以超過 67,000 條人工標註為基礎,並透過與人類判斷一致的 LLM 評審評估子目標完成情況。Claude Opus 5 的成績為 75.7%,低於其在 OSWorld 的 83.4%;研究亦指出子目標無關行動及點擊失誤等流程問題。

9月19日週六
9月18日週五
  1. Google Research53

    Google Research 探索以生成式 UI 助教師創建互動式學習內容

    Google Research 分享一項生成式 UI 研究實驗,讓教師按教學目標及課程內容建立自訂、互動且具引導性的教育模擬。該團隊同時釋出逾 30 個英文 STEM 互動學習範例,涵蓋初中及高中物理、化學、生物和數學,全部由 AI 生成並經教師審核;使用 Google Workspace for Education 的學校可報名參加試點。