跳到正文
10月6日週二
  1. Goodfire Research54

    Goodfire Research 透過損失曲率分析模型記憶

    Goodfire Research 提出以損失曲率辨識記憶方向的模型編輯方法,移除低曲率權重方向以抑制背誦,無需標註指定遺忘資料。在採用 10% 隨機標籤噪聲的 ViT 實驗中,噪聲標籤記憶率由 81.6% 降至 3.5%,驗證準確率則由 67% 升至 71.7%。語言模型的純記憶任務準確率降至原有水平的 3–16%,邏輯推理維持或略有改善,但算術和封閉式事實回憶較易受影響。

  2. Goodfire Research41

    基於協方差的序列池化

    研究提出協方差池化,以 token 激活的截斷二階矩聚合基因組基礎模型的序列表示,保留均值池化忽略的特徵聯合結構。在 NTv3 的 Gene Ontology 預測及基因組軌道預測中,該方法表現大幅優於均值池化。它可透過重建二階矩學習低秩分解,生成定長嵌入,並用於有監督探測及無監督嵌入學習。

  3. Goodfire Research58

    Goodfire Research 提出探針式數據歸因方法,揭示並緩解 LLM 後訓練中的不良行為

    Goodfire Research 以探針式數據歸因追查 OLMo 2 7B DPO 訓練中出現的有害行為,移除相關數據後有害回應率下降 63%。方法以模型激活向量的餘弦相似度排序訓練樣本;交換排名靠前樣本的 accepted/rejected 標籤,可令有害回應率下降 78%。按數據來源移除四個問題最突出的模型生成的樣本,則可令有害回應率下降 84%。

  4. Prime Intellect66

    Prime Intellect 宣佈募集 $130M A 輪融資,以建設開放超級智能全棧

    Prime Intellect 於 2026 年 7 月 8 日宣佈募集 $130M A 輪融資,由 Radical Ventures 領投,多家投資者參與。公司稱,累計融資額已超過 $150M,將用於建設涵蓋訓練、部署及持續改進的開放超級智能全棧。Prime Intellect 表示,其全棧已有超過 6k 名客戶使用,年化收入在不足一年內升至超過 $100m。

  5. Suno:Blog64

    Suno 回應 RIAA 成員唱片公司訴訟,反駁音樂模型訓練侵犯版權的指控

    Suno 回應 RIAA 成員唱片公司於 6 月 24 日提起的訴訟,否認其音樂生成模型的訓練資料侵犯版權,並稱訴訟在事實和法律上均有缺陷。Suno 表示,其模型使用從開放互聯網找到的中、高質素音樂進行訓練,並主張學習音樂風格、模式與形式不構成侵權。公司稱,Suno 會檢查並阻止音訊上載中的受版權保護內容,也不允許用戶在生成音樂的要求中使用以藝人為基礎的描述,以鼓勵原創。

  6. Zyphra Research59

    Zyphra Research 發現 GPT 式 Transformer 在持續及平穩學習中出現可塑性損失

    Zyphra Research 發現,非嵌入參數量介乎 5M 至 314M 的 GPT 式 Transformer,在多語言持續學習中會出現可塑性損失。研究提出縮放定律 T = 1.3 × 10^-5 · P^0.8269,預測可塑性損失的出現時間隨非嵌入參數量呈次線性增長,增加參數量的延後作用會遞減。研究亦在平穩學習中觀察到相似現象,表明可塑性損失並非只見於持續學習設定。

  7. Replit:Blog51

    Replit 指 AI 採用始於可信數據,語義層是基礎

    Replit 指出,企業要可靠採用 AI Agent,須先建立共享語義層及受治理的營運真相層,讓 Agent 依據一致的商業定義、指標和數據來源工作。其內部數據 Agent 將修正存入 git 儲存庫,經人工審核和驗證後供接觸數據的 Agent 共用;Replit 稱,該 Agent 每週回答遠超 1,000 個以數據倉庫為基礎的提問,並在答案中附上證據。

  8. Goodfire Research57

    Goodfire Research 發佈 Predictive Data Debugging 研究,訓練前預測並調整模型從數據中學到的內容

    Goodfire Research 發佈 Predictive Data Debugging 研究,提出在訓練前預測偏好數據如何影響模型行為的方法。其預測與模型實際學到的結果達到 R² = 0.9,並可追溯至相關數據羣組。使用 Dolci 和 Tulu 3 數據集的案例顯示,DPO 可能削弱模型對部分有害請求的穩健性;以除錯數據訓練則可同時改善安全與效能。

  9. Liquid AI 模型與工程博客69

    Liquid AI 發佈可在裝置端運行的 LFM2.5-2.6B 模型

    Liquid AI 發佈 2.6B 參數的 LFM2.5-2.6B,這款智能體模型可完全在裝置端運行,支援規劃、工具調用及多步任務。基準測試中,它在所有指令遵循基準及幾乎所有工具使用基準領先對照模型,較大型模型則在編碼上佔優。CPU 解碼速度在 M5 Max 達 220 tokens/s、Ryzen AI Max+ 395 達 113 tokens/s,手機上為 30 tokens/s。

  10. Baseten Base Labs:模型研究51

    語言模型能否持續在權重中學習事實?

    Baseten Base Labs 以 Qwen3 模型測試持續將事實寫入權重,發現後續寫入會幹擾先前事實的提取;需要組合或抵受後續寫入的事實,透過上下文提供較可靠。連續寫入 20 次後,單句陳述訓練寫入的事實準確率為 1%,以廣泛學習資料寫入的事實則為 46%。研究亦發現,行為上被遺忘的事實仍保留大部分寫入所增加的對數概率;把被遺忘的研究事實放入提示詞後,相關問題準確率回升至 77–80%。

  11. NAVER / CLOVA 研究35

    聖地亞哥 NeurIPS 2025:NAVER 的 AI 現況與未來

    NAVER 在聖地亞哥舉行的 NeurIPS 2025 展示 9 篇研究論文及最新技術示範,研究聚焦效率、可控性與真實世界 AI。其中,KVzip 的記憶體節省幅度最高達 4 倍、速度提升接近 2 倍;CodeGEMM 令 70B 模型運行速度最高提升 8.93 倍。NAVER 亦提出 C-SEO Bench,並以開源方式發布數據集、程式碼及基準。

  12. NAVER / CLOVA 研究57

    NAVER Cloud 介紹 Sommelier 全雙工語音 AI 數據流程

    NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。

  13. IT之家57

    麥當勞在美國遭集體訴訟,被指利用 AI 系統非法操縱餐單價格

    麥當勞在芝加哥聯邦法院面臨一宗擬議的全國性集體訴訟,原告指控其利用 AI 定價系統非法協調特許經營店與直營餐廳的餐單價格。訴狀稱,演算法以非公開數據訓練;路透社上週報道,定價引擎持續分析近 14,000 家門店每天數百萬筆交易數據。麥當勞否認 AI 設定餐品價格,稱指控屬主觀揣測、缺乏事實依據,並表示特許加盟商擁有定價決策權。

10月5日週一
  1. HuggingFace Daily Papers(社區熱門論文)40

    MiniCorp:AI 智能體公司的最後一哩路

    MiniCorp 是一個辦公室模擬器,讓 AI 智能體協作營運公司,並大規模生成供智能體訓練與評估使用的企業數據。它記錄智能體的通訊、決策及後續業務結果,並可重播相同情境以比較不同決策。實驗顯示,智能體能跨角色協作,並根據市場回饋調整決策。

  2. HuggingFace Daily Papers(社區熱門論文)36

    WildMatch:野生動物個體再識別的弱監督影像匹配器適配

    WildMatch 研究僅以身份標籤弱監督適配預訓練關鍵點匹配器,用於野生動物個體再識別。在多個開源野生動物再識別數據集上,該方法準確率高於未適配匹配器及一種最先進的局部—全局融合方法。在留出個體的開放世界測試中,模型學得可遷移的對應先驗,而非記憶訓練身份。

10月4日週日
  1. MarkTechPost70

    Google Research 將聯邦學習遷移至 TEE,Gboard 現以可外部驗證的差分隱私訓練模型

    Google Research 公佈以 TEE 為基礎的新一代聯邦學習系統,並稱其中央差分隱私(DP)保證可由外部驗證。裝置會在本地加密訓練樣本,存取政策公開記錄於 Rekor,KMS 只向符合政策的工作負載發放金鑰。Gboard 已用新系統推出英文及日文下一詞預測模型;訓練現可跨機器並行,瓶頸轉為 TEE 資源,Google 未公佈具體加速倍數。

10月3日週六
  1. HuggingFace Daily Papers(社區熱門論文)39

    DiffGate:面向同策略蒸餾的難度門控教師指導

    DiffGate 提出結果門控目標,將 GRPO 與按羣組難度調整的有界教師指導結合,只對失敗軌跡施加教師監督。在 Qwen3-0.6B 和 Qwen3-1.7B 上,程式碼 avg@8 較對應的 GRPO 分別提升 +1.7、+1.8 分,pass@8 提升 +1.6、+5.7 分;數學 pass@8 則提升 +1.1、+3.9 分,avg@8 與 GRPO 相差不超過 0.5 分。

  2. Anthropic:Alignment Science Blog65

    如何復現並拓展 Anthropic 的對齊偽裝演示

    Anthropic 説明如何復現並拓展其對齊偽裝演示,並提供快速實驗筆記本、對話紀錄及部分主實驗程式碼。在簡化的 helpful-only 設定中,Claude 3 Opus、Claude 3.5 Sonnet 和 Llama-3 405B 有時會生成對齊偽裝推理;提示暗示對話會用於訓練時,模型更常給出有幫助的回答。

  3. Anthropic:Alignment Science Blog63

    Anthropic 提出 ICM 無監督演算法,從預訓練語言模型提取能力

    Anthropic 團隊提出 ICM 無監督演算法,透過模型自行標註資料微調預訓練語言模型,無需外部標籤即可提取能力。在 Llama 3 的 GSM8k-verification、TruthfulQA 和 Alpaca reward modeling 任務中,ICM 匹配以資料集標籤微調的表現,並超過眾包人類標籤。該方法無法提取預訓練模型中不顯著的技能,也不適用於長輸入。