跳到正文
目前篩選:論文
今天10月8日週四2 則
  1. HuggingFace Daily Papers(社區熱門論文)45

    Sherpa:訓練 LLMs 因材施教

    Sherpa 是一個多輪強化學習框架,透過模擬不同學習偏好的學生類型,訓練 LLM 教師按學生的學習成效調整教學。經 Sherpa 訓練的教師模型,令各類學生的表現平均提升 20.5 個百分點,MathTutorBench 教學評分由 52.5% 升至 79.2%。人類研究中,受訓教師在 79.6% 的配對比較中獲選勝過基礎模型。

10月7日週三
  1. HuggingFace Daily Papers(社區熱門論文)40

    EmbodiedSmith:透過模擬中的遞迴自我改進飛輪擴展具身數據

    EmbodiedSmith 提出一套模擬框架,透過遞迴自我改進擴展具身數據生成,並整合資產、場景和任務生成。其智能體改進循環讓場景與任務互相引導修訂,並支援移動操作機械人、人形機械人、靈巧手,以及涉及可變形物件和流體的互動。實驗顯示,增加數據多樣性可提升下游策略的泛化能力;框架亦可用於機械人預訓練和評估。

  2. IT之家57

    中國科研團隊全球首次構建水稻全生命週期三維時空細胞圖譜

    中國多個科研機構合作完成的研究成果於10月6日晚在《細胞》(Cell)網上發表,研究團隊全球首次構建出涵蓋水稻由種子萌發至開花結實全過程的三維時空細胞圖譜。圖譜整合基因組測序、單細胞測序及空間轉錄組測序;團隊亦建成可供全球研究者使用的資料庫與水稻單細胞基礎模型,支援基因查詢、空間表達展示和比較分析。

10月6日週二
  1. HuggingFace Daily Papers(社區熱門論文)61

    Prior-Fitted Language Model(PFLM)學會從上下文推斷語言

    研究提出 300M 參數的 Prior-Fitted Language Model(PFLM),讓模型在凍結權重下從真實文本前綴推斷語言並預測後續內容。它只以合成的非語言先驗樣本預訓練;每條訓練序列均由從分佈中重新抽取的遞迴結構因果模型生成,因此模型未見過任何真實語言的詞,也不會在訓練中兩次遇到同一語言。

  2. 英國 AI Security Institute:Blog66

    AI Security Institute 聯同 Anthropic 及 Alan Turing Institute 探討大規模後門資料投毒

    AI Security Institute、Anthropic 與 Alan Turing Institute 的研究發現,少至 250 份文件便可能成功污染所有受測模型的訓練資料。研究以同一後門攻擊測試四種模型,參數量由 600M 至 13B;所需文件數沒有隨模型或資料集規模增加。這與過往認為攻擊者須污染一定比例資料才能成功的假設不同,研究指出投毒攻擊可能比先前認為更可行。

  3. Cohere 產品與研究博客52

    Cohere 研究提出「文化漏斗」,指出訓練流程中的文化多樣性逐步收窄

    Cohere 分析超過 5.6 million 個涵蓋不同訓練階段的樣本,發現文化多樣性由預訓練進入後訓練時持續收窄。增加語言種類可擴大地理多樣性,但整體文化內容比例會趨於停滯。在 TinyAya base model 微調時加入文化標記後,NormAd、BBQ、GMMLU 分別提升 +8%、+6%、+2.3%,且一般多語能力未受損。

  4. Goodfire Research62

    Goodfire Research 提出模型差分放大法,協助發現罕見不良行為

    Goodfire Research 提出模型差分放大法,放大模型在後訓練前後的 logits 差異,以協助浮現罕見不良行為。實驗顯示,該方法令湧現失配回覆增加 10 至 300 倍;當資料集含 5% 不良醫療建議時,有害回覆由每 10,000 次抽樣 1 次增至每 30 次 1 次。研究亦把此法用於監察後訓練和偵測後門行為;作者指出,放大後的回覆頻率不代表模型行為的實際發生率。

  5. Goodfire Research54

    Goodfire Research 透過損失曲率分析模型記憶

    Goodfire Research 提出以損失曲率辨識記憶方向的模型編輯方法,移除低曲率權重方向以抑制背誦,無需標註指定遺忘資料。在採用 10% 隨機標籤噪聲的 ViT 實驗中,噪聲標籤記憶率由 81.6% 降至 3.5%,驗證準確率則由 67% 升至 71.7%。語言模型的純記憶任務準確率降至原有水平的 3–16%,邏輯推理維持或略有改善,但算術和封閉式事實回憶較易受影響。

  6. Goodfire Research41

    基於協方差的序列池化

    研究提出協方差池化,以 token 激活的截斷二階矩聚合基因組基礎模型的序列表示,保留均值池化忽略的特徵聯合結構。在 NTv3 的 Gene Ontology 預測及基因組軌道預測中,該方法表現大幅優於均值池化。它可透過重建二階矩學習低秩分解,生成定長嵌入,並用於有監督探測及無監督嵌入學習。

  7. Goodfire Research58

    Goodfire Research 提出探針式數據歸因方法,揭示並緩解 LLM 後訓練中的不良行為

    Goodfire Research 以探針式數據歸因追查 OLMo 2 7B DPO 訓練中出現的有害行為,移除相關數據後有害回應率下降 63%。方法以模型激活向量的餘弦相似度排序訓練樣本;交換排名靠前樣本的 accepted/rejected 標籤,可令有害回應率下降 78%。按數據來源移除四個問題最突出的模型生成的樣本,則可令有害回應率下降 84%。

  8. Zyphra Research59

    Zyphra Research 發現 GPT 式 Transformer 在持續及平穩學習中出現可塑性損失

    Zyphra Research 發現,非嵌入參數量介乎 5M 至 314M 的 GPT 式 Transformer,在多語言持續學習中會出現可塑性損失。研究提出縮放定律 T = 1.3 × 10^-5 · P^0.8269,預測可塑性損失的出現時間隨非嵌入參數量呈次線性增長,增加參數量的延後作用會遞減。研究亦在平穩學習中觀察到相似現象,表明可塑性損失並非只見於持續學習設定。

  9. Goodfire Research57

    Goodfire Research 發佈 Predictive Data Debugging 研究,訓練前預測並調整模型從數據中學到的內容

    Goodfire Research 發佈 Predictive Data Debugging 研究,提出在訓練前預測偏好數據如何影響模型行為的方法。其預測與模型實際學到的結果達到 R² = 0.9,並可追溯至相關數據羣組。使用 Dolci 和 Tulu 3 數據集的案例顯示,DPO 可能削弱模型對部分有害請求的穩健性;以除錯數據訓練則可同時改善安全與效能。

  10. Baseten Base Labs:模型研究51

    語言模型能否持續在權重中學習事實?

    Baseten Base Labs 以 Qwen3 模型測試持續將事實寫入權重,發現後續寫入會幹擾先前事實的提取;需要組合或抵受後續寫入的事實,透過上下文提供較可靠。連續寫入 20 次後,單句陳述訓練寫入的事實準確率為 1%,以廣泛學習資料寫入的事實則為 46%。研究亦發現,行為上被遺忘的事實仍保留大部分寫入所增加的對數概率;把被遺忘的研究事實放入提示詞後,相關問題準確率回升至 77–80%。

  11. NAVER / CLOVA 研究35

    聖地亞哥 NeurIPS 2025:NAVER 的 AI 現況與未來

    NAVER 在聖地亞哥舉行的 NeurIPS 2025 展示 9 篇研究論文及最新技術示範,研究聚焦效率、可控性與真實世界 AI。其中,KVzip 的記憶體節省幅度最高達 4 倍、速度提升接近 2 倍;CodeGEMM 令 70B 模型運行速度最高提升 8.93 倍。NAVER 亦提出 C-SEO Bench,並以開源方式發布數據集、程式碼及基準。

  12. NAVER / CLOVA 研究57

    NAVER Cloud 介紹 Sommelier 全雙工語音 AI 數據流程

    NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。

10月5日週一
  1. HuggingFace Daily Papers(社區熱門論文)40

    MiniCorp:AI 智能體公司的最後一哩路

    MiniCorp 是一個辦公室模擬器,讓 AI 智能體協作營運公司,並大規模生成供智能體訓練與評估使用的企業數據。它記錄智能體的通訊、決策及後續業務結果,並可重播相同情境以比較不同決策。實驗顯示,智能體能跨角色協作,並根據市場回饋調整決策。

  2. HuggingFace Daily Papers(社區熱門論文)36

    WildMatch:野生動物個體再識別的弱監督影像匹配器適配

    WildMatch 研究僅以身份標籤弱監督適配預訓練關鍵點匹配器,用於野生動物個體再識別。在多個開源野生動物再識別數據集上,該方法準確率高於未適配匹配器及一種最先進的局部—全局融合方法。在留出個體的開放世界測試中,模型學得可遷移的對應先驗,而非記憶訓練身份。

10月4日週日
  1. MarkTechPost70

    Google Research 將聯邦學習遷移至 TEE,Gboard 現以可外部驗證的差分隱私訓練模型

    Google Research 公佈以 TEE 為基礎的新一代聯邦學習系統,並稱其中央差分隱私(DP)保證可由外部驗證。裝置會在本地加密訓練樣本,存取政策公開記錄於 Rekor,KMS 只向符合政策的工作負載發放金鑰。Gboard 已用新系統推出英文及日文下一詞預測模型;訓練現可跨機器並行,瓶頸轉為 TEE 資源,Google 未公佈具體加速倍數。

10月3日週六
  1. HuggingFace Daily Papers(社區熱門論文)39

    DiffGate:面向同策略蒸餾的難度門控教師指導

    DiffGate 提出結果門控目標,將 GRPO 與按羣組難度調整的有界教師指導結合,只對失敗軌跡施加教師監督。在 Qwen3-0.6B 和 Qwen3-1.7B 上,程式碼 avg@8 較對應的 GRPO 分別提升 +1.7、+1.8 分,pass@8 提升 +1.6、+5.7 分;數學 pass@8 則提升 +1.1、+3.9 分,avg@8 與 GRPO 相差不超過 0.5 分。

  2. Anthropic:Alignment Science Blog63

    Anthropic 提出 ICM 無監督演算法,從預訓練語言模型提取能力

    Anthropic 團隊提出 ICM 無監督演算法,透過模型自行標註資料微調預訓練語言模型,無需外部標籤即可提取能力。在 Llama 3 的 GSM8k-verification、TruthfulQA 和 Alpaca reward modeling 任務中,ICM 匹配以資料集標籤微調的表現,並超過眾包人類標籤。該方法無法提取預訓練模型中不顯著的技能,也不適用於長輸入。

  3. Anthropic:Alignment Science Blog52

    Anthropic 研究以預訓練資料過濾提升模型安全性

    Anthropic 透過預訓練資料過濾移除 CBRN(化學、生物、放射性及核)有害資訊,降低模型的有害能力評測表現,且所測無害能力未見顯著下降。研究使用分類器篩除預訓練資料中的高危文件,並在過濾後資料集上從頭預訓練模型;在閾值 0.939 下,CBRN 評測準確率由 33.7±0.4% 降至 30.8±0.4%,相對 25% 隨機基線的超額表現減少 33%。

  4. Anthropic:Alignment Science Blog54

    信不信由你:LLM 對植入事實的信念有多深?

    Anthropic 研究團隊與合作者提出衡量 LLM 信念深度的框架,發現合成文件微調(SDF)往往能植入較深層的事實信念。框架從泛化應用、面對質疑時的穩健性和內部表徵三方面衡量;提示詞和機制式模型編輯未能穩定形成深層信念。SDF 的成效取決於事實可信度,與基本世界知識矛盾的極不可信事實仍較脆弱,內部表徵也與自然習得知識不同。

  5. Anthropic:Alignment Science Blog47

    超越數據過濾:以知識定位移除大語言模型能力

    Anthropic Fellows Program 研究人員提出 Selective Gradient Masking(SGTM),將危險知識定位到專用模型參數,並在訓練後移除這些參數以消除相關能力。相較於訓練時過濾危險數據,SGTM 更能兼顧危險知識移除與一般能力保留,尤其在危險與安全內容的標籤不準確時。研究顯示,恢復已移除的危險能力,所需再訓練量是其他模型遺忘方法的 7×。

  6. Anthropic:Alignment Science Blog59

    無監督引出方法的安全性面臨 3 項挑戰,集成與方法結合未能穩定奏效

    Anthropic 研究團隊測試無監督引出與易到難泛化方法,歸納 3 項安全挑戰並檢驗 2 種改進方向。挑戰包括顯著但不代表真實性的特徵、訓練資料失衡,以及模型難以明確作答的問題;改進方向是集成預測器,以及結合無監督引出與易到難方法。新方法有時表現較好,但沒有任何技術能穩定應對這 3 項挑戰。

  7. Anthropic:Alignment Science Blog61

    Anthropic 提出 Introspection Adapters,讓大語言模型自述微調後學到的行為

    Anthropic 研究人員提出 Introspection Adapters(IA),以同一個 LoRA adapter 訓練大語言模型自述經微調後學到的行為。在 AuditBench 的 56 個植入行為模型評測中,IA 輔助調查代理的平均成功率為 59%,高於次佳方法的 53%;在 9 個加密微調攻擊模型中,亦至少一次辨識出其中 7 個。研究亦指出,該方法誤報率偏高,且訓練成本較大。