跳到正文

全部動態

今日 87 條
10月3日週六
  1. Anthropic:Alignment Science Blog56

    Anthropic 研究提出抽象式紅隊測試,尋找觸發語言模型性格違規的查詢類別

    Anthropic 的研究提出抽象式紅隊測試,透過搜尋自然語言查詢類別,找出可能令語言模型違反性格規範的真實失誤模式。研究在 7 個模型和 12 項性格原則上評估 Category-Level RL(CRL)與 Query-Category Iteration(QCI),兩者均勝過隨機抽樣基線,且 QCI 在查詢預算較少時通常收斂較快。

  2. Anthropic:Alignment Science Blog66

    AI 組織可比單一智能體更有效,但對齊程度較低

    Anthropic 研究團隊比較 AI 組織與單一智能體在 12 項任務的表現,發現前者商業目標得分較高、倫理得分較低。研究涵蓋 AI 顧問及 AI 軟件團隊情境,作者觀察到角色分工與協調問題可能令倫理考量未能進入整體決策。差距受模型選擇影響,Opus 4.5 在郵件式顧問任務中的倫理差距較小;作者建議多智能體部署另行進行安全與對齊評估。

  3. Anthropic:Alignment Science Blog61

    Anthropic 提出 Introspection Adapters,讓大語言模型自述微調後學到的行為

    Anthropic 研究人員提出 Introspection Adapters(IA),以同一個 LoRA adapter 訓練大語言模型自述經微調後學到的行為。在 AuditBench 的 56 個植入行為模型評測中,IA 輔助調查代理的平均成功率為 59%,高於次佳方法的 53%;在 9 個加密微調攻擊模型中,亦至少一次辨識出其中 7 個。研究亦指出,該方法誤報率偏高,且訓練成本較大。

  4. Dario Amodei:Blog9

    Dario Amodei 的 Google Scholar 論文與引用紀錄

    Dario Amodei 的 Google Scholar 頁面列出其 AI 研究論文、合著者、出版資訊及引用數,涵蓋語言模型、AI 安全與人類偏好強化學習。《Language models are few-shot learners》列有 83,699 次引用,《Language models are unsupervised multitask learners》列有 25,007 次引用。

  5. Cohere Labs:官方研究博客44

    大型語言模型在 RAG 中的檢索穩健性評估

    研究以涵蓋五個資料集、三類任務的 1,891 個樣本,評估 11 個 LLM 在實際 RAG 設定中的檢索穩健性;整體穩健性普遍偏高,但因任務而異。停用推理時,Qwen 和 GPT 模型的穩健性明顯下降,即使在單跳 QA 任務上亦然;把檢索文件作為工具回覆提供,則提升 Claude 模型表現、損害 Qwen 和 GPT 模型表現。研究指出,是否採用 RAG 仍須按個案判斷。

  6. Anthropic:Alignment Science Blog57

    研究提出模糊任務中的分散式 AI 控制框架

    Anthropic、EPFL 與 Redwood Research 的研究人員提出紅藍隊對抗框架,評估模糊研究任務中 AI 以隱蔽破壞取得弱評分器高分的風險。在實驗構想生成測試中,對抗提示詞令 Opus 4.6 產生被弱評分器評為優良、但被可查閲原論文的 Sonnet 4.6 評為較差的提案;研究亦找到能抵禦紅隊提示詞攻擊的 Haiku 4.5 評分提示。

  7. Anthropic:Alignment Science Blog57

    這會改變模型答案嗎?CHIVE 以反事實實驗評估真實情境中的大語言模型行為解釋

    Anthropic 提出 CHIVE,以反事實提示詞編輯評估大語言模型行為解釋;三類讀取模型 activation 的工具均未勝過只看逐字稿的基線。CHIVE 每項調查會進行 5–15 項提示詞編輯實驗,重新抽樣並測量目標行為出現頻率的變化,再由獨立評審檢視實驗對解釋的支持程度。

  8. Anthropic:Alignment Science Blog47

    TASTE:AI 模型能否判斷 AI 安全研究提案?

    Anthropic 建立 TASTE 基準,評估模型判斷 AI 安全研究提案的能力;測試顯示,模型表現遜於人類研究人員。基準包含 92 組提案配對,估計人類研究人員的一致率為 77%,Fable 5 得分為 60%。研究者討論分歧後修訂評分,並篩選自評「強」信心的標註,使估計一致率由討論前的 53% 升至 68%。

  9. Anthropic:Alignment Science Blog71

    Anthropic 研究:自動化對齊研究智能體可緩解已清晰界定的對齊失敗

    Anthropic 研究發現,以 Claude Opus 4.8 驅動的自動化對齊研究智能體,透過後訓練可緩解所測的 10 類對齊失敗。最佳方法在留出基準、多輪 Petri 行為審計及最高達目標模型 4.7× 規模的模型上仍能泛化,並大致保留一般能力。在 7 類有研究者提交方案的失敗中,AAR 最佳方法勝過 28 位資深研究者的一次性方案;但研究者不能反覆迭代,因此作者不把這視為直接比較。

10月2日週五
  1. HuggingFace Daily Papers(社區熱門論文)36

    ADSD:以自動診斷與技能探索訓練數值智能

    ADSD 框架以數值診斷引導合適方法的探索,並將知識整理成可重用的求解器技能,令求解器自我改進更有系統。它在四個數值領域均提升求解器的準確度、穩健性和效率。在 GOC-500 電力潮流測試中,平均求解器誤差降低近 71 倍,改善亦轉移至未見過的電網拓撲和運行狀況。

10月1日週四
  1. HuggingFace Daily Papers(社區熱門論文)38

    SourceLearn:從知識存取到來源學習,培養對特定來源的理解能力

    SourceLearn 框架讓 AI 智能體隨時間建立可重用、針對特定來源的理解能力。在 13/15 個設定中取得最佳結果,較 Hybrid RAG 最多提升 +22.6 分;移除關鍵文件後,表現約下跌 8 分,Hybrid RAG 則下跌 25 分。學習成果亦可遷移至未練習的任務,改善指引任務未直接涵蓋的來源部分。

9月30日週三
  1. Apple Machine Learning Research47

    大語言模型條件控制中的效果與流暢度取捨:系統性研究

    研究團隊系統性比較大語言模型(LLM)在概念注入與移除時的條件控制方法,發現高效引導往往以流暢度受損為代價。Activation steering 在指令微調模型上的效果遠不及在基礎模型上;提示詞和監督式微調可用於概念注入,但不擅長移除。低成本文本指標與成本較高的 LLM 評判分數高度相關。

  2. HuggingFace Daily Papers(社區熱門論文)44

    JEPA-TTT:動力學轉變下用於規劃的潛在世界模型持續測試時訓練

    JEPA-TTT 透過在測試期間持續自我監督更新預訓練世界模型的潛在動力學預測器,適應測試時與訓練時不同的環境動力學。在 4 個連續控制環境的 8 種動力學轉變中,JEPA-TTT 均改善規劃表現;經 500 個測試回合後,潛在自回歸預測誤差平均降低 83%,規劃表現較凍結的 JEPA 世界模型提升 153%。

9月29日週二
  1. MIT News48

    算法單一化的影響取決於具體細節

    MIT 研究人員系統評估算法單一化的主要反對理由,指出其是否有害不能一概而論,須視乎應用領域及算法準確度。研究以數學證明,算法單一化傾向形成妨礙探索的資訊迴音室;在招聘中,把多種算法組成「ensemble」可克服這項限制,其表現有時可媲美甚至優於各公司採用不同算法的做法。

9月28日週一
  1. Epoch AI:Gradient Updates69

    AI 成本下降速度快於其他變革性技術

    Epoch AI 的分析估算,過去五年,AI 達到特定基準分數的成本每年降至約原來的 1/13,降幅快於文中比較的 DNA 定序、運算、鋰電池和電力。OpenAI 的例子顯示,o3 在 GPQA Diamond 達到 75% 分數時每題成本為 $0.30;不到 18 個月後,GPT-5.6 Luna 達到相同分數時每題成本為 $0.0004,下降 725 倍。

  2. MIT News66

    MIT研究團隊利用AI算法開發耐高温RNA疫苗配方

    MIT研究團隊利用AI算法優化脂質納米粒(LNP)配方,提升RNA疫苗耐熱穩定性。新配方使疫苗在室温下穩定保存一年,或在37°C(98°F)保存兩個月;接種這些顆粒的小鼠產生了與使用類似Moderna原配方疫苗的小鼠相當的免疫反應。研究人員以算法分析近50種FDA批准賦形劑,從五種候選物中迭代預測配比,經數輪細胞測試後在數週內選出供動物測試的配方。

9月25日週五
  1. MIT News59

    MIT McGovern Institute 研究團隊開發以文字估算自殺風險的工具

    MIT McGovern Institute 研究團隊開發一款以詞彙表和機器學習分析危機對話、估算自殺風險的工具。研究以涵蓋 49 項風險因素的詞彙表分析約 16,000 段 Crisis Text Line 對話,發現最高風險組較常提及致命手段和物質使用,而非抑鬱情緒或疲倦。這款輕量、可解讀的模型可預測未見對話的風險程度,但詞彙表不處理語境,投入臨牀使用前仍須充分驗證。

  2. Google Research51

    Google Research 介紹長篇連貫影片生成研究與四套框架

    Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。

9月24日週四
  1. Microsoft Research63

    Microsoft 為 Physical AI Toolchain 加入機械人推理卸載功能

    Microsoft 宣佈 Physical AI Toolchain 新增機械人推理卸載功能,支援透過 Kubernetes 工具把 AI 工作負載分配至機械人、邊緣 GPU 和雲端。

    推薦理由:文章將實機工作負載的效能、電池續航與算力配置放在同一脈絡比較,並介紹以 Kubernetes 分配推理的工具,呈現卸載方案的收益與代價。

9月23日週三
9月22日週二