AI 現在能否自動化 AI 研發?Epoch AI 的 InnovationEval 初步結果
Epoch AI 公佈 InnovationEval 初步結果,評估 AI 能否端到端發現媲美人類研究成果的機器學習創新。Claude Fable 5 和 GPT-5.6 Sol 的 GPU 開支分別約為 $6,700 和 $14,000,仍未接近 on-policy self-distillation 的表現;兩者之中只有 GPT-5.6 Sol 帶來小幅提升。
Epoch AI 公佈 InnovationEval 初步結果,評估 AI 能否端到端發現媲美人類研究成果的機器學習創新。Claude Fable 5 和 GPT-5.6 Sol 的 GPU 開支分別約為 $6,700 和 $14,000,仍未接近 on-policy self-distillation 的表現;兩者之中只有 GPT-5.6 Sol 帶來小幅提升。
Sherpa 是一個多輪強化學習框架,透過模擬不同學習偏好的學生類型,訓練 LLM 教師按學生的學習成效調整教學。經 Sherpa 訓練的教師模型,令各類學生的表現平均提升 20.5 個百分點,MathTutorBench 教學評分由 52.5% 升至 79.2%。人類研究中,受訓教師在 79.6% 的配對比較中獲選勝過基礎模型。
EmbodiedSmith 提出一套模擬框架,透過遞迴自我改進擴展具身數據生成,並整合資產、場景和任務生成。其智能體改進循環讓場景與任務互相引導修訂,並支援移動操作機械人、人形機械人、靈巧手,以及涉及可變形物件和流體的互動。實驗顯示,增加數據多樣性可提升下游策略的泛化能力;框架亦可用於機械人預訓練和評估。
中國多個科研機構合作完成的研究成果於10月6日晚在《細胞》(Cell)網上發表,研究團隊全球首次構建出涵蓋水稻由種子萌發至開花結實全過程的三維時空細胞圖譜。圖譜整合基因組測序、單細胞測序及空間轉錄組測序;團隊亦建成可供全球研究者使用的資料庫與水稻單細胞基礎模型,支援基因查詢、空間表達展示和比較分析。
研究利用先驗數據擬合網絡(PFN)的表示進行表格數據異常偵測,提出無需微調的 ZEN 及微調方法 FOCUS。在 ADBench 基準測試中,ZEN 的平均 AUROC 高於所有基線,FOCUS 則進一步提升表現。這些方法亦可泛化至不同 PFN 模型。
研究提出 300M 參數的 Prior-Fitted Language Model(PFLM),讓模型在凍結權重下從真實文本前綴推斷語言並預測後續內容。它只以合成的非語言先驗樣本預訓練;每條訓練序列均由從分佈中重新抽取的遞迴結構因果模型生成,因此模型未見過任何真實語言的詞,也不會在訓練中兩次遇到同一語言。
AI Security Institute、Anthropic 與 Alan Turing Institute 的研究發現,少至 250 份文件便可能成功污染所有受測模型的訓練資料。研究以同一後門攻擊測試四種模型,參數量由 600M 至 13B;所需文件數沒有隨模型或資料集規模增加。這與過往認為攻擊者須污染一定比例資料才能成功的假設不同,研究指出投毒攻擊可能比先前認為更可行。
研究顯示,固定基礎模型回答開頭的特定 token 線索,可令其在數學及編碼任務上取得媲美 RL 訓練模型的表現。例如,指定線索令 Olmo-3-7B 在 MATH-500 的 pass@1 準確率由 42% 升至 78%,而 Qwen3-14B 則由 72% 升至 87%。
Cohere 分析超過 5.6 million 個涵蓋不同訓練階段的樣本,發現文化多樣性由預訓練進入後訓練時持續收窄。增加語言種類可擴大地理多樣性,但整體文化內容比例會趨於停滯。在 TinyAya base model 微調時加入文化標記後,NormAd、BBQ、GMMLU 分別提升 +8%、+6%、+2.3%,且一般多語能力未受損。
Zyphra 公佈 Zyda,一個包含 1.3T tokens、供語言模型訓練使用的開放數據集。它整合七個開放數據集,經統一的品質過濾及跨數據集去重,並以開放且寬鬆的授權發布。消融研究顯示,Zyda 表現勝過 Dolma、Fineweb、Pile、RefinedWeb 和 SlimPajama 等現有開放數據集。
Goodfire Research 提出模型差分放大法,放大模型在後訓練前後的 logits 差異,以協助浮現罕見不良行為。實驗顯示,該方法令湧現失配回覆增加 10 至 300 倍;當資料集含 5% 不良醫療建議時,有害回覆由每 10,000 次抽樣 1 次增至每 30 次 1 次。研究亦把此法用於監察後訓練和偵測後門行為;作者指出,放大後的回覆頻率不代表模型行為的實際發生率。
Prime Intellect 發佈開放數據集 SYNTHETIC-2,收錄 400 萬條經驗證的推理軌跡,涵蓋複雜強化學習任務。全球共有 1,253 張 GPU 參與生成;TOPLOC v2 的誤報率為 0.000925%,證明驗證中位成本跨模型平均比重新執行原始推理低 25 倍。
Goodfire 與 Rakuten 合作研究以 SAE probes 偵測 Rakuten 的 AI 智能體用戶訊息中的 PII,Rakuten 已將該方法部署至生產環境。
Goodfire Research 提出以損失曲率辨識記憶方向的模型編輯方法,移除低曲率權重方向以抑制背誦,無需標註指定遺忘資料。在採用 10% 隨機標籤噪聲的 ViT 實驗中,噪聲標籤記憶率由 81.6% 降至 3.5%,驗證準確率則由 67% 升至 71.7%。語言模型的純記憶任務準確率降至原有水平的 3–16%,邏輯推理維持或略有改善,但算術和封閉式事實回憶較易受影響。
研究提出協方差池化,以 token 激活的截斷二階矩聚合基因組基礎模型的序列表示,保留均值池化忽略的特徵聯合結構。在 NTv3 的 Gene Ontology 預測及基因組軌道預測中,該方法表現大幅優於均值池化。它可透過重建二階矩學習低秩分解,生成定長嵌入,並用於有監督探測及無監督嵌入學習。
Prime Intellect 以 Llama 3.2-1B-Instruct 進行受控 RL 實驗,指出 reward hacking 是梯度動態問題,受可見獎勵與隱藏獎勵的競爭影響。
Goodfire Research 以探針式數據歸因追查 OLMo 2 7B DPO 訓練中出現的有害行為,移除相關數據後有害回應率下降 63%。方法以模型激活向量的餘弦相似度排序訓練樣本;交換排名靠前樣本的 accepted/rejected 標籤,可令有害回應率下降 78%。按數據來源移除四個問題最突出的模型生成的樣本,則可令有害回應率下降 84%。
Zyphra Research 發現,非嵌入參數量介乎 5M 至 314M 的 GPT 式 Transformer,在多語言持續學習中會出現可塑性損失。研究提出縮放定律 T = 1.3 × 10^-5 · P^0.8269,預測可塑性損失的出現時間隨非嵌入參數量呈次線性增長,增加參數量的延後作用會遞減。研究亦在平穩學習中觀察到相似現象,表明可塑性損失並非只見於持續學習設定。
Zyphra Research 介紹 PUFFER,一套為持續增長的訓練語料設計的增量模糊去重系統,可逐批加入數據集而無須重建完整索引。
頁面內容稱此頁應重新導向 arXiv,卻未提供大型模型為何學得更多的研究內容或結論。頁面另列三項研究及其日期,並介紹 Silico 為可解釋性 Agent,以先進的可解釋性方法及基礎設施解釋、除錯並精確控制模型行為。
Goodfire Research 發佈 Predictive Data Debugging 研究,提出在訓練前預測偏好數據如何影響模型行為的方法。其預測與模型實際學到的結果達到 R² = 0.9,並可追溯至相關數據羣組。使用 Dolci 和 Tulu 3 數據集的案例顯示,DPO 可能削弱模型對部分有害請求的穩健性;以除錯數據訓練則可同時改善安全與效能。
Baseten Base Labs 以 Qwen3 模型測試持續將事實寫入權重,發現後續寫入會幹擾先前事實的提取;需要組合或抵受後續寫入的事實,透過上下文提供較可靠。連續寫入 20 次後,單句陳述訓練寫入的事實準確率為 1%,以廣泛學習資料寫入的事實則為 46%。研究亦發現,行為上被遺忘的事實仍保留大部分寫入所增加的對數概率;把被遺忘的研究事實放入提示詞後,相關問題準確率回升至 77–80%。
Baseten Base Labs 比較 Qwen3 不同規模先蒸餾再接受 GRPO 的效果,發現蒸餾在強化學習後的收益因模型大小和任務而異。經 80M RL response tokens 後,SFT + RL 在 0.6B、1.7B 和 4B 分別領先 11.3%、13.1% 和 2.1%,而 8B 則由 RL only 領先 6.4%。
NAVER 在聖地亞哥舉行的 NeurIPS 2025 展示 9 篇研究論文及最新技術示範,研究聚焦效率、可控性與真實世界 AI。其中,KVzip 的記憶體節省幅度最高達 4 倍、速度提升接近 2 倍;CodeGEMM 令 70B 模型運行速度最高提升 8.93 倍。NAVER 亦提出 C-SEO Bench,並以開源方式發布數據集、程式碼及基準。
NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。
Thinking Machines Lab 以經專家核驗的 BIRD-Platinum 資料進行 RLVR 微調 Kimi-K2.6,訓練出 text-to-SQL 模型 ReViSQL-K2.6。
Q Labs Research 提出 Dust,一種以模型中間表示擾動訓練 Transformer 語言模型、毋須反向傳播的零階最佳化方法。Dust 在每個 token 獨立加入擾動,令每個 token 成為虛擬族羣成員,並以一次前向傳播並行評估。
MiniCorp 是一個辦公室模擬器,讓 AI 智能體協作營運公司,並大規模生成供智能體訓練與評估使用的企業數據。它記錄智能體的通訊、決策及後續業務結果,並可重播相同情境以比較不同決策。實驗顯示,智能體能跨角色協作,並根據市場回饋調整決策。
研究發現,良性監督式微調(SFT)大幅降低軟件工程智能體中後門的攻擊成功率,但後續任務級強化學習(RL)往往保留殘餘後門行為,有時甚至提高攻擊成功率。
研究提出 One-stage Policy Optimization(OnePO),以僅用 RL 的方式把基礎模型適配至目標領域,並將教師輸出作為暫時指引。在醫療適配中,OnePO 僅用 20K 訓練樣本便在 HealthBench (Total) 取得 67.2 分,較 SFT+RL 和純 RL 分別高 2.7 和 7.4 分。
WildMatch 研究僅以身份標籤弱監督適配預訓練關鍵點匹配器,用於野生動物個體再識別。在多個開源野生動物再識別數據集上,該方法準確率高於未適配匹配器及一種最先進的局部—全局融合方法。在留出個體的開放世界測試中,模型學得可遷移的對應先驗,而非記憶訓練身份。
Google Research 公佈以 TEE 為基礎的新一代聯邦學習系統,並稱其中央差分隱私(DP)保證可由外部驗證。裝置會在本地加密訓練樣本,存取政策公開記錄於 Rekor,KMS 只向符合政策的工作負載發放金鑰。Gboard 已用新系統推出英文及日文下一詞預測模型;訓練現可跨機器並行,瓶頸轉為 TEE 資源,Google 未公佈具體加速倍數。
DiffGate 提出結果門控目標,將 GRPO 與按羣組難度調整的有界教師指導結合,只對失敗軌跡施加教師監督。在 Qwen3-0.6B 和 Qwen3-1.7B 上,程式碼 avg@8 較對應的 GRPO 分別提升 +1.7、+1.8 分,pass@8 提升 +1.6、+5.7 分;數學 pass@8 則提升 +1.1、+3.9 分,avg@8 與 GRPO 相差不超過 0.5 分。
Anthropic 研究展示如何將 influence functions 擴展至最多 52 billion parameters 的大型語言模型,以追蹤哪些訓練序列影響模型輸出。
Anthropic 團隊提出 ICM 無監督演算法,透過模型自行標註資料微調預訓練語言模型,無需外部標籤即可提取能力。在 Llama 3 的 GSM8k-verification、TruthfulQA 和 Alpaca reward modeling 任務中,ICM 匹配以資料集標籤微調的表現,並超過眾包人類標籤。該方法無法提取預訓練模型中不顯著的技能,也不適用於長輸入。
Anthropic 透過預訓練資料過濾移除 CBRN(化學、生物、放射性及核)有害資訊,降低模型的有害能力評測表現,且所測無害能力未見顯著下降。研究使用分類器篩除預訓練資料中的高危文件,並在過濾後資料集上從頭預訓練模型;在閾值 0.939 下,CBRN 評測準確率由 33.7±0.4% 降至 30.8±0.4%,相對 25% 隨機基線的超額表現減少 33%。
Anthropic 研究團隊與合作者提出衡量 LLM 信念深度的框架,發現合成文件微調(SDF)往往能植入較深層的事實信念。框架從泛化應用、面對質疑時的穩健性和內部表徵三方面衡量;提示詞和機制式模型編輯未能穩定形成深層信念。SDF 的成效取決於事實可信度,與基本世界知識矛盾的極不可信事實仍較脆弱,內部表徵也與自然習得知識不同。
Anthropic Fellows Program 研究人員提出 Selective Gradient Masking(SGTM),將危險知識定位到專用模型參數,並在訓練後移除這些參數以消除相關能力。相較於訓練時過濾危險數據,SGTM 更能兼顧危險知識移除與一般能力保留,尤其在危險與安全內容的標籤不準確時。研究顯示,恢復已移除的危險能力,所需再訓練量是其他模型遺忘方法的 7×。
Anthropic 研究團隊測試無監督引出與易到難泛化方法,歸納 3 項安全挑戰並檢驗 2 種改進方向。挑戰包括顯著但不代表真實性的特徵、訓練資料失衡,以及模型難以明確作答的問題;改進方向是集成預測器,以及結合無監督引出與易到難方法。新方法有時表現較好,但沒有任何技術能穩定應對這 3 項挑戰。
Anthropic 研究人員提出 Introspection Adapters(IA),以同一個 LoRA adapter 訓練大語言模型自述經微調後學到的行為。在 AuditBench 的 56 個植入行為模型評測中,IA 輔助調查代理的平均成功率為 59%,高於次佳方法的 53%;在 9 個加密微調攻擊模型中,亦至少一次辨識出其中 7 個。研究亦指出,該方法誤報率偏高,且訓練成本較大。