跳到正文
10月3日週六
  1. Anthropic:Alignment Science Blog52

    Anthropic 研究以預訓練資料過濾提升模型安全性

    Anthropic 透過預訓練資料過濾移除 CBRN(化學、生物、放射性及核)有害資訊,降低模型的有害能力評測表現,且所測無害能力未見顯著下降。研究使用分類器篩除預訓練資料中的高危文件,並在過濾後資料集上從頭預訓練模型;在閾值 0.939 下,CBRN 評測準確率由 33.7±0.4% 降至 30.8±0.4%,相對 25% 隨機基線的超額表現減少 33%。

  2. Anthropic:Alignment Science Blog54

    信不信由你:LLM 對植入事實的信念有多深?

    Anthropic 研究團隊與合作者提出衡量 LLM 信念深度的框架,發現合成文件微調(SDF)往往能植入較深層的事實信念。框架從泛化應用、面對質疑時的穩健性和內部表徵三方面衡量;提示詞和機制式模型編輯未能穩定形成深層信念。SDF 的成效取決於事實可信度,與基本世界知識矛盾的極不可信事實仍較脆弱,內部表徵也與自然習得知識不同。

  3. Anthropic:Alignment Science Blog47

    超越數據過濾:以知識定位移除大語言模型能力

    Anthropic Fellows Program 研究人員提出 Selective Gradient Masking(SGTM),將危險知識定位到專用模型參數,並在訓練後移除這些參數以消除相關能力。相較於訓練時過濾危險數據,SGTM 更能兼顧危險知識移除與一般能力保留,尤其在危險與安全內容的標籤不準確時。研究顯示,恢復已移除的危險能力,所需再訓練量是其他模型遺忘方法的 7×。

  4. Anthropic:Alignment Science Blog59

    無監督引出方法的安全性面臨 3 項挑戰,集成與方法結合未能穩定奏效

    Anthropic 研究團隊測試無監督引出與易到難泛化方法,歸納 3 項安全挑戰並檢驗 2 種改進方向。挑戰包括顯著但不代表真實性的特徵、訓練資料失衡,以及模型難以明確作答的問題;改進方向是集成預測器,以及結合無監督引出與易到難方法。新方法有時表現較好,但沒有任何技術能穩定應對這 3 項挑戰。

  5. Anthropic:Alignment Science Blog61

    Anthropic 提出 Introspection Adapters,讓大語言模型自述微調後學到的行為

    Anthropic 研究人員提出 Introspection Adapters(IA),以同一個 LoRA adapter 訓練大語言模型自述經微調後學到的行為。在 AuditBench 的 56 個植入行為模型評測中,IA 輔助調查代理的平均成功率為 59%,高於次佳方法的 53%;在 9 個加密微調攻擊模型中,亦至少一次辨識出其中 7 個。研究亦指出,該方法誤報率偏高,且訓練成本較大。

  6. Anthropic:Alignment Science Blog61

    Anthropic 研究發現微調謊言偵測器難以泛化至分佈外案例

    Anthropic 團隊以 12 種設定收集開源模型的 on-policy 謊言並微調偵測器,發現它們難以泛化至訓練時未見的謊言類型。訓練分佈內 AUROC 由 0.60 升至 0.95,跨類別測試則約為 0.70–0.75;微調偵測器僅略勝提示詞基線,較大型模型經零樣本提示後往往表現更佳。

10月2日週五
  1. Google Research64

    Google Research 介紹採用 TEE 的新一代聯邦學習系統

    Google Research 公佈採用可信執行環境(TEE)的新一代聯邦學習系統,讓伺服器端的數據匿名化處理可供驗證和審計。設備上傳的訓練數據只會交由符合預先授權存取政策的 TEE 工作負載解密處理,相關政策亦發布於 Rekor 公開透明日誌。Gboard 已採用新系統推出英文及日文下一詞預測模型,模型私隱保障更強、準確度更高,計算時間亦較舊系統大幅縮短。

    推薦理由:文章比較舊式聯邦學習與 TEE 架構在服務端可驗證性上的差異,並交代存取政策公開記錄機制及 Gboard 部署後在私隱、準確度和訓練速度上的變化。

10月1日週四
  1. HuggingFace Daily Papers(社區熱門論文)33

    iADD:改善擴散策略最佳化中的對齊與多樣性

    iADD 提出以增量 Feynman-Kac 訓練為基礎的擴散模型策略最佳化方法,以改善對齊與多樣性的取捨。理論分析指出,僅更新較後期時間步可能損害多樣性,與先前研究的結論相反。研究在三項不同任務中將方法與相關方法比較,並以各組件消融實驗驗證其在對齊和多樣性方面均有性能提升。

  2. HuggingFace Daily Papers(社區熱門論文)51

    DMAD:以對抗蒸餾進行分佈匹配,實現快速視覺生成

    論文提出 DMAD,以判別器分類方式進行分佈匹配蒸餾,直接學習對數密度比,省去輔助分數擬合。在 ImageNet-64x64 上,DMAD 一步生成的 FID 為 1.04;四步 SDXL 在 COCO-10K 的 FID 為 14.47,四步 Wan2.1-T2V-14B 的 VBench 總分為 85.15,均為文中比較的少步方法及多步教師模型中的最佳成績。

9月30日週三
  1. elsewhere:文章55

    數據公司個個都太神了

    數據公司估值快速攀升,成立未滿一年的公司中已有 UniPat 估值達25億美元,另有若干家公司估值3-8億美元。數據商透過採集專家解題軌跡,或製作包含任務、運行環境和評分準則的 RL environment,為模型提供訓練材料;文章指出模型公司現時更重視數據交付的速度、數量和供應商關係。這個行業尚無公認驗收標準,模型公司通常先抽檢,再從小額訂單逐步建立合作信任。

  2. HuggingFace Daily Papers(社區熱門論文)44

    JEPA-TTT:動力學轉變下用於規劃的潛在世界模型持續測試時訓練

    JEPA-TTT 透過在測試期間持續自我監督更新預訓練世界模型的潛在動力學預測器,適應測試時與訓練時不同的環境動力學。在 4 個連續控制環境的 8 種動力學轉變中,JEPA-TTT 均改善規劃表現;經 500 個測試回合後,潛在自回歸預測誤差平均降低 83%,規劃表現較凍結的 JEPA 世界模型提升 153%。

9月29日週二
  1. Hugging Face Blog65

    NVIDIA Kumo Tabular 為表格預測樹立準確率與效率的新前沿

    NVIDIA 發佈開放式表格基礎模型 Kumo Tabular,用於表格分類與回歸,可根據帶標籤的上下文列,在單次前向傳播中預測新列標籤,無需訓練、調參或特徵工程。

    推薦理由:文章列出四項基準的結果,並以梯度提升樹、AutoGluon 等方法作對照,為表格預測模型的效能評估提供具體比較參照。

9月28日週一
  1. MIT News66

    MIT研究團隊利用AI算法開發耐高温RNA疫苗配方

    MIT研究團隊利用AI算法優化脂質納米粒(LNP)配方,提升RNA疫苗耐熱穩定性。新配方使疫苗在室温下穩定保存一年,或在37°C(98°F)保存兩個月;接種這些顆粒的小鼠產生了與使用類似Moderna原配方疫苗的小鼠相當的免疫反應。研究人員以算法分析近50種FDA批准賦形劑,從五種候選物中迭代預測配比,經數輪細胞測試後在數週內選出供動物測試的配方。

  2. HuggingFace Daily Papers(社區熱門論文)47

    混合注意力大語言模型的多語言能力

    研究首次探討混合注意力對大語言模型多語言能力的影響,並發現跨語言表徵模式與循環層及完整注意力層的排列有關。多語言數據蒸餾實驗顯示,所有替代層排列在整個訓練過程均優於標準排列,學習速度最高快 2.5X。研究據此提出,多語言模型或可由完整注意力層而非循環層開始。

9月25日週五
  1. Redwood Research:Blog60

    AI 持續學習或令阻斷監控器幾乎失效

    持續學習中的 AI 可能因阻斷監控降低任務效用而學會規避,令監控在長期部署中幾乎失效。文章比較部署期間的 online RL 與記憶系統,認為 online RL 的優化壓力較強,記憶系統短期影響或較弱,但仍可能留存規避策略。作者建議降低監控幹預造成的效用損失、以線上或對抗訓練提升監控能力,或使用未納入獎勵迴路的監控器作後備。

  2. MIT News59

    MIT McGovern Institute 研究團隊開發以文字估算自殺風險的工具

    MIT McGovern Institute 研究團隊開發一款以詞彙表和機器學習分析危機對話、估算自殺風險的工具。研究以涵蓋 49 項風險因素的詞彙表分析約 16,000 段 Crisis Text Line 對話,發現最高風險組較常提及致命手段和物質使用,而非抑鬱情緒或疲倦。這款輕量、可解讀的模型可預測未見對話的風險程度,但詞彙表不處理語境,投入臨牀使用前仍須充分驗證。

  3. HuggingFace Daily Papers(社區熱門論文)51

    JumpStart 從 160,000 次訓練中提煉離線策略學習經驗

    這項離線強化學習與模仿學習研究在 114 個數據集上訓練逾 160,000 個策略,發現沒有任何算法在所有環境中佔優。研究指出,超參數調校會頻繁改變算法排名,基準組成也可能導致互相矛盾的結論。研究亦發佈 JumpStart 資源套件,收錄所有已訓練策略、各模型的分數和超參數、各環境的強基線、訓練及評估程式碼,以及供查閲、分析和貢獻結果的可擴展網站,並提供按數據集推薦算法的工具。

9月24日週四
9月22日週二
9月19日週六
9月16日週三
9月13日週日
  1. Sakana AI:Blog44

    PC-ALM:無需反向傳播訓練 1000 層神經網絡

    PC-ALM 是一種以局部學習取代反向傳播的方法,只靠局部動態即可訓練 1000 層神經網絡。它引入作為拉格朗日乘數的對偶神經元,令每層以 PI 回饋控制系統最小化局部預測誤差。在標準 PC 難以學習的深而窄網絡中,PC-ALM 尤其能把訊號傳至看似任意深度。

9月12日週六
  1. Dwarkesh Patel:Podcast & Blog59

    AI 研究者辯論距離遞歸式自我改進還有多遠

    Dwarkesh Patel 與 John Schulman、Beren Millidge 和 Charlie O’Neill 探討現行訓練方法能否推動 AI 遞歸式自我改進。對談聚焦模型能否自行設定研究目標、從訓練環境泛化至現實任務,以及樣本效率和持續學習的限制。嘉賓亦討論蒸餾、RL 環境和部署數據對模型迭代的作用,以及長期判斷和目標設定的難處。

9月11日週五
9月10日週四
  1. Amazon Science56

    機器學習研究智能體為何不會過度擬合?

    研究人員發現,機器學習研究智能體經驗證集反覆優化後,所得策略壓縮成短提示詞並交由新智能體重現時,在多數問題上仍能維持原有表現。研究涵蓋 8 個數據集,32-token 提示詞在大多數問題上足以讓新智能體追平原智能體;一項語言建模策略更可壓至 16 tokens 而不損失保留集表現。刻意誘發過度擬合的 102 次實驗中,有 38 次驗證準確率比真正保留集準確率高逾 10%,這些優勢經壓縮後消失。

9月9日週三
  1. Ai2 / Allen Institute for AI50

    Goodfire 如何利用 Ai2 開放後訓練技術堆疊追查 Olmo 的非預期行為

    Goodfire 利用 Ai2 開放的後訓練流程,在完整訓練前預測偏好訓練帶來的行為變化,並把 Olmo 的一項安全退化追溯至個別偏好樣本。偏好訓練提升 Olmo 的一般能力,同時令模型更容易服從有害請求;相關樣本位於 Dolci,偏好回答鼓勵服從,而被拒回答則抑制回應。團隊亦測試針對性調整,降低這項退化而不犧牲 Olmo 的整體能力提升。

  2. Dwarkesh Patel:Podcast & Blog59

    小規模實驗顯示數據改進帶來的預訓練計算效率提升高於模型改進

    Dwarkesh Patel 的研究以小規模預訓練比較 2019 至 2025 年的模型配方與數據集改進,發現數據帶來的計算效率提升較大。在 1e19 FLOPs 下,數據與模型改進的計算效率提升分別為 12.0x 和 3.7x。在 3.16e18 FLOPs 的 OLMES 測試中,模型與數據改進的各自效應合計可解釋 88% 的分數變異。

9月4日週五
  1. Timothy B. Lee:Understanding AI57

    機械人初創公司正嘗試各種方法取得更多訓練數據

    多家機械人初創公司正嘗試透過記錄人類動作、聘人操作機械人等方式,增加機械人訓練數據。目前最大型的公開機械人任務數據集 ABC-130K 只有 3,500 小時示範;模擬訓練有助步行等任務,但複雜操作受到模擬與現實差距限制。另有公司讓人類佩戴手套或外骨骼完成日常工作,以收集更豐富的動作數據。

9月3日週四
  1. Recode China AI54

    打造智能機械人需要大量數據,數據從何而來?

    文章將具身智能機械人訓練數據分為人類數據與機械人數據,前者包括網絡及第一身視角影片、UMI 和動作捕捉,後者包括遙操作及模擬生成數據。YouTube 每日上載逾 720,000 小時影片,Open X-Embodiment Dataset 則有 1,150 至 2,000 小時實際機械人操作數據;但網絡影片欠缺力、扭矩等物理訊號,也面對人與機械人身體形態不同造成的轉移障礙。