Anthropic 研究以預訓練資料過濾提升模型安全性
Anthropic 透過預訓練資料過濾移除 CBRN(化學、生物、放射性及核)有害資訊,降低模型的有害能力評測表現,且所測無害能力未見顯著下降。研究使用分類器篩除預訓練資料中的高危文件,並在過濾後資料集上從頭預訓練模型;在閾值 0.939 下,CBRN 評測準確率由 33.7±0.4% 降至 30.8±0.4%,相對 25% 隨機基線的超額表現減少 33%。
Anthropic 透過預訓練資料過濾移除 CBRN(化學、生物、放射性及核)有害資訊,降低模型的有害能力評測表現,且所測無害能力未見顯著下降。研究使用分類器篩除預訓練資料中的高危文件,並在過濾後資料集上從頭預訓練模型;在閾值 0.939 下,CBRN 評測準確率由 33.7±0.4% 降至 30.8±0.4%,相對 25% 隨機基線的超額表現減少 33%。
Anthropic 研究團隊與合作者提出衡量 LLM 信念深度的框架,發現合成文件微調(SDF)往往能植入較深層的事實信念。框架從泛化應用、面對質疑時的穩健性和內部表徵三方面衡量;提示詞和機制式模型編輯未能穩定形成深層信念。SDF 的成效取決於事實可信度,與基本世界知識矛盾的極不可信事實仍較脆弱,內部表徵也與自然習得知識不同。
Anthropic Fellows Program 研究人員提出 Selective Gradient Masking(SGTM),將危險知識定位到專用模型參數,並在訓練後移除這些參數以消除相關能力。相較於訓練時過濾危險數據,SGTM 更能兼顧危險知識移除與一般能力保留,尤其在危險與安全內容的標籤不準確時。研究顯示,恢復已移除的危險能力,所需再訓練量是其他模型遺忘方法的 7×。
Anthropic 研究團隊測試無監督引出與易到難泛化方法,歸納 3 項安全挑戰並檢驗 2 種改進方向。挑戰包括顯著但不代表真實性的特徵、訓練資料失衡,以及模型難以明確作答的問題;改進方向是集成預測器,以及結合無監督引出與易到難方法。新方法有時表現較好,但沒有任何技術能穩定應對這 3 項挑戰。
Anthropic 研究人員提出 Introspection Adapters(IA),以同一個 LoRA adapter 訓練大語言模型自述經微調後學到的行為。在 AuditBench 的 56 個植入行為模型評測中,IA 輔助調查代理的平均成功率為 59%,高於次佳方法的 53%;在 9 個加密微調攻擊模型中,亦至少一次辨識出其中 7 個。研究亦指出,該方法誤報率偏高,且訓練成本較大。
Anthropic 研究人員測試以微調資料集投毒,能否在不明顯削弱穩健性的情況下為憲法分類器植入後門。在以 Qwen3 8B 和 LoRA 訓練的分類器實驗中,約 32 個投毒樣本在不同訓練集規模下便足以植入後門;Anthropic 內部分類器的測試則需 32 至 128 個。
uniopen 以 Amazon SageMaker AI 監督式微調及提示詞優化客製化 Amazon Nova 2 Lite,令兩項零售審核分類指標均達到生產門檻。
Meta AI 公佈 Brain2Qwerty v2 研究,展示以非侵入式腦訊號即時解碼句子的端到端流程,詞準確率達 61%,高於文中所述其他非侵入式方法的 8%。
AE Studio 與 Anthropic 合作的研究團隊提出 Gradient-Routed Auxiliary Modules(GRAM),以可切換的輔助模組隔離語言模型中的特定雙重用途能力。
Anthropic 團隊以 12 種設定收集開源模型的 on-policy 謊言並微調偵測器,發現它們難以泛化至訓練時未見的謊言類型。訓練分佈內 AUROC 由 0.60 升至 0.95,跨類別測試則約為 0.70–0.75;微調偵測器僅略勝提示詞基線,較大型模型經零樣本提示後往往表現更佳。
Ai2 開源 AstaBrief 8B,這款模型可把研究問題和檢索到的文獻摘錄生成帶引用報告,並已在 Asta 的 Generate a report 功能中提供 Fast mode。
Google Research 公佈採用可信執行環境(TEE)的新一代聯邦學習系統,讓伺服器端的數據匿名化處理可供驗證和審計。設備上傳的訓練數據只會交由符合預先授權存取政策的 TEE 工作負載解密處理,相關政策亦發布於 Rekor 公開透明日誌。Gboard 已採用新系統推出英文及日文下一詞預測模型,模型私隱保障更強、準確度更高,計算時間亦較舊系統大幅縮短。
推薦理由:文章比較舊式聯邦學習與 TEE 架構在服務端可驗證性上的差異,並交代存取政策公開記錄機制及 Gboard 部署後在私隱、準確度和訓練速度上的變化。
Ai2 開源 AstaBrief 8B 及其訓練資料,並將這款科學報告生成模型加入 Asta 的 Fast mode。它以 Qwen3-8B 為基礎,根據研究問題和檢索到的文獻摘錄一次生成附引文報告;Asta 全流程中,Fast mode 平均每份報告需時 51.1 秒,較 Thinking mode 的 178.5 秒快約 3.5 倍。
研究提出以 MoE 路由器輸出作為對齊目標,為僅解碼器大語言模型進行跨語言對比學習。在 4 個開源 MoE 上進行受控的持續預訓練實驗顯示,加入路由損失可對齊不同語言的底層隱藏表徵,並提升多語言評測表現。
Modal 宣佈 Modal Clusters 正式向所有工作區開放,用戶可透過單一 decorator `@modal.clustered` 啟動多節點叢集,並按秒付費。
iADD 提出以增量 Feynman-Kac 訓練為基礎的擴散模型策略最佳化方法,以改善對齊與多樣性的取捨。理論分析指出,僅更新較後期時間步可能損害多樣性,與先前研究的結論相反。研究在三項不同任務中將方法與相關方法比較,並以各組件消融實驗驗證其在對齊和多樣性方面均有性能提升。
論文提出 DMAD,以判別器分類方式進行分佈匹配蒸餾,直接學習對數密度比,省去輔助分數擬合。在 ImageNet-64x64 上,DMAD 一步生成的 FID 為 1.04;四步 SDXL 在 COCO-10K 的 FID 為 14.47,四步 Wan2.1-T2V-14B 的 VBench 總分為 85.15,均為文中比較的少步方法及多步教師模型中的最佳成績。
OpenAI 挫敗一場旨在提取受保護模型推理過程的協同蒸餾行動。該公司正加強防禦,以應對對抗性蒸餾。
數據公司估值快速攀升,成立未滿一年的公司中已有 UniPat 估值達25億美元,另有若干家公司估值3-8億美元。數據商透過採集專家解題軌跡,或製作包含任務、運行環境和評分準則的 RL environment,為模型提供訓練材料;文章指出模型公司現時更重視數據交付的速度、數量和供應商關係。這個行業尚無公認驗收標準,模型公司通常先抽檢,再從小額訂單逐步建立合作信任。
Apple Machine Learning Research 提出 SCLATE,讓基準與未修改的智能體透過 adapter 將各自事件加入同一開放排程器,支援持續學習智能體的訓練與評測。
JEPA-TTT 透過在測試期間持續自我監督更新預訓練世界模型的潛在動力學預測器,適應測試時與訓練時不同的環境動力學。在 4 個連續控制環境的 8 種動力學轉變中,JEPA-TTT 均改善規劃表現;經 500 個測試回合後,潛在自回歸預測誤差平均降低 83%,規劃表現較凍結的 JEPA 世界模型提升 153%。
NVIDIA 發佈開放式表格基礎模型 Kumo Tabular,用於表格分類與回歸,可根據帶標籤的上下文列,在單次前向傳播中預測新列標籤,無需訓練、調參或特徵工程。
推薦理由:文章列出四項基準的結果,並以梯度提升樹、AutoGluon 等方法作對照,為表格預測模型的效能評估提供具體比較參照。
MIT研究團隊利用AI算法優化脂質納米粒(LNP)配方,提升RNA疫苗耐熱穩定性。新配方使疫苗在室温下穩定保存一年,或在37°C(98°F)保存兩個月;接種這些顆粒的小鼠產生了與使用類似Moderna原配方疫苗的小鼠相當的免疫反應。研究人員以算法分析近50種FDA批准賦形劑,從五種候選物中迭代預測配比,經數輪細胞測試後在數週內選出供動物測試的配方。
研究首次探討混合注意力對大語言模型多語言能力的影響,並發現跨語言表徵模式與循環層及完整注意力層的排列有關。多語言數據蒸餾實驗顯示,所有替代層排列在整個訓練過程均優於標準排列,學習速度最高快 2.5X。研究據此提出,多語言模型或可由完整注意力層而非循環層開始。
持續學習中的 AI 可能因阻斷監控降低任務效用而學會規避,令監控在長期部署中幾乎失效。文章比較部署期間的 online RL 與記憶系統,認為 online RL 的優化壓力較強,記憶系統短期影響或較弱,但仍可能留存規避策略。作者建議降低監控幹預造成的效用損失、以線上或對抗訓練提升監控能力,或使用未納入獎勵迴路的監控器作後備。
MIT McGovern Institute 研究團隊開發一款以詞彙表和機器學習分析危機對話、估算自殺風險的工具。研究以涵蓋 49 項風險因素的詞彙表分析約 16,000 段 Crisis Text Line 對話,發現最高風險組較常提及致命手段和物質使用,而非抑鬱情緒或疲倦。這款輕量、可解讀的模型可預測未見對話的風險程度,但詞彙表不處理語境,投入臨牀使用前仍須充分驗證。
這項離線強化學習與模仿學習研究在 114 個數據集上訓練逾 160,000 個策略,發現沒有任何算法在所有環境中佔優。研究指出,超參數調校會頻繁改變算法排名,基準組成也可能導致互相矛盾的結論。研究亦發佈 JumpStart 資源套件,收錄所有已訓練策略、各模型的分數和超參數、各環境的強基線、訓練及評估程式碼,以及供查閲、分析和貢獻結果的可擴展網站,並提供按數據集推薦算法的工具。
Sarvam AI 發佈 Sarvam Vision 2.1,強化表格解析、表單鍵值擷取及 Indic 手寫識別。在 olmOCR-Bench 官方集合中,模型得 87.3 分,為表列最高;在 OmniDocBench v1.6 得 94.97 分,低於 PaddleOCR-VL 1.6 的 96.01 分。
Amazon Science 團隊介紹三項研究,分別用 MochiBind 排序抗體結合力、用 CA-MAP 預測抗體可開發性,並以 Agent 協助設計及實驗驗證抗體。
Google Research 提出 MilleMiglia,一款以 C++ 編寫、用於生成中段物流配送問題擬真基準實例的工具。它以保護私隱的方式生成資料,旨在支援中段物流優化的後續研究。原始碼及文件可於 GitHub 取得。
MIT 政治學家 Naoki Egami 研究社會科學方法,著重準確衡量政治現象,並檢視研究結果能否適用於其他情境。他亦研究 AI 工具用於社會科學研究時的準確性,探索如何系統辨識其引入的錯誤並在研究中加以考量;這項研究早於 ChatGPT 於 2022 年底帶動的 AI 熱潮。
PC-ALM 是一種以局部學習取代反向傳播的方法,只靠局部動態即可訓練 1000 層神經網絡。它引入作為拉格朗日乘數的對偶神經元,令每層以 PI 回饋控制系統最小化局部預測誤差。在標準 PC 難以學習的深而窄網絡中,PC-ALM 尤其能把訊號傳至看似任意深度。
Dwarkesh Patel 與 John Schulman、Beren Millidge 和 Charlie O’Neill 探討現行訓練方法能否推動 AI 遞歸式自我改進。對談聚焦模型能否自行設定研究目標、從訓練環境泛化至現實任務,以及樣本效率和持續學習的限制。嘉賓亦討論蒸餾、RL 環境和部署數據對模型迭代的作用,以及長期判斷和目標設定的難處。
Together AI 擴展 Together Fine-Tuning,加入更多開放權重模型、即時實驗追蹤及更精細的訓練和數據處理控制,並下調多數支援模型的訓練價格。
研究人員發現,機器學習研究智能體經驗證集反覆優化後,所得策略壓縮成短提示詞並交由新智能體重現時,在多數問題上仍能維持原有表現。研究涵蓋 8 個數據集,32-token 提示詞在大多數問題上足以讓新智能體追平原智能體;一項語言建模策略更可壓至 16 tokens 而不損失保留集表現。刻意誘發過度擬合的 102 次實驗中,有 38 次驗證準確率比真正保留集準確率高逾 10%,這些優勢經壓縮後消失。
Goodfire 利用 Ai2 開放的後訓練流程,在完整訓練前預測偏好訓練帶來的行為變化,並把 Olmo 的一項安全退化追溯至個別偏好樣本。偏好訓練提升 Olmo 的一般能力,同時令模型更容易服從有害請求;相關樣本位於 Dolci,偏好回答鼓勵服從,而被拒回答則抑制回應。團隊亦測試針對性調整,降低這項退化而不犧牲 Olmo 的整體能力提升。
Dwarkesh Patel 的研究以小規模預訓練比較 2019 至 2025 年的模型配方與數據集改進,發現數據帶來的計算效率提升較大。在 1e19 FLOPs 下,數據與模型改進的計算效率提升分別為 12.0x 和 3.7x。在 3.16e18 FLOPs 的 OLMES 測試中,模型與數據改進的各自效應合計可解釋 88% 的分數變異。
Google Research 發現,UK Biobank 歐洲樣本有助於小樣本日本族羣 PRS 預測,但 Biobank Japan 訓練樣本達 15k 或以上時,目標族羣專屬模型更佳。
多家機械人初創公司正嘗試透過記錄人類動作、聘人操作機械人等方式,增加機械人訓練數據。目前最大型的公開機械人任務數據集 ABC-130K 只有 3,500 小時示範;模擬訓練有助步行等任務,但複雜操作受到模擬與現實差距限制。另有公司讓人類佩戴手套或外骨骼完成日常工作,以收集更豐富的動作數據。
文章將具身智能機械人訓練數據分為人類數據與機械人數據,前者包括網絡及第一身視角影片、UMI 和動作捕捉,後者包括遙操作及模擬生成數據。YouTube 每日上載逾 720,000 小時影片,Open X-Embodiment Dataset 則有 1,150 至 2,000 小時實際機械人操作數據;但網絡影片欠缺力、扭矩等物理訊號,也面對人與機械人身體形態不同造成的轉移障礙。