跳到正文

#論文/研究

今日 19 條
10月6日週二
  1. 英國 AI Security Institute:Blog52

    AI 系統會否愈來愈難監督?

    英國 AI Security Institute 的報告指出,現有 AI 監督所依賴的基礎可能逐漸削弱,而新興方法尚未成熟到足以彌補。報告梳理內部激活、思維鏈、外部行動及智能體間通訊四類監督面向,並列出二十多條監督能力退化路徑。開發者可採取措施維持現有監督渠道,並投資新興技術,作為監督能力退化時的後備方案。

  2. HuggingFace Daily Papers(社區熱門論文)48

    RealtimeWAM:一步式非同步世界動作模型

    RealtimeWAM 透過一步動作生成與非同步推理,提升世界動作模型(WAM)的推理效率。其提出 Teacher-Anchored Consistency Distillation(TACD)及 Cross-Expert Wavefront Pipelining(CEWP),分別減少動作生成的多步迭代與影片、動作專家之間的等待。

  3. HuggingFace Daily Papers(社區熱門論文)62

    研究提出以校準式內容認證判斷影像真實性可否被合理否認

    研究提出並評估一種以生成器忠實重建能力校準的內容認證方法,用來判斷影像真實性是否可被合理否認。研究測試 20 款深偽檢測器對 10 個近四年推出的生成器,準確率由接近完美的 99.5% 降至 76%;對抗性擾動則令所有基線檢測器的準確率跌至 2% 以下。新方法可校準至生成內容遭錯誤認證的比例不超過 1%,並在所評估的有界擾動攻擊下維持此上限,但不涵蓋任意對抗性轉換。

  4. Cohere 產品與研究博客52

    Cohere 研究提出「文化漏斗」,指出訓練流程中的文化多樣性逐步收窄

    Cohere 分析超過 5.6 million 個涵蓋不同訓練階段的樣本,發現文化多樣性由預訓練進入後訓練時持續收窄。增加語言種類可擴大地理多樣性,但整體文化內容比例會趨於停滯。在 TinyAya base model 微調時加入文化標記後,NormAd、BBQ、GMMLU 分別提升 +8%、+6%、+2.3%,且一般多語能力未受損。

  5. Cohere 產品與研究博客65

    Cohere Labs 分析 ATE 數據集:696,291 項 MCP 工具中,僅 2.6% 可端到端執行已記錄職業任務

    Cohere Labs 公開 Agentic Task Ecosystem(ATE)數據集,分析智能體工具對職業任務的自動化覆蓋。數據集收錄 696,291 項來自 123,069 個公開 MCP 伺服器的工具;按嚴格標準,僅 2.6% 能端到端執行已記錄的職業任務,923 個職業中有 419 個沒有任何智能體工具活動。

  6. Zyphra Research41

    Tree Attention:面向 GPU 叢集長上下文注意力的拓撲感知解碼

    Zyphra 提出 Tree Attention,以樹狀歸約平行化多 GPU Transformer 解碼,實測可提升長上下文注意力的解碼速度並降低記憶體開銷。Zyphra 估算,在 1M 序列長度下,Tree Attention 的解碼速度較 Ring Attention 快逾 8x,通訊量則減至一半或更低。其跨裝置複雜度為對數級,而 Ring Attention 為線性級。

  7. Zyphra Research31

    MixPR:用於長上下文預處理的 Mixture-of-PageRanks 檢索器

    Zyphra 提出 MixPR,一套結合兩類 PageRank 檢索、用於高效預處理長上下文輸入的 RAG 系統。系統按任務採用 PageRank 作全域檢索,或 Personalized PageRank 作局部檢索,並在多項長上下文基準測試取得 SOTA 結果。MixPR 可配合任何現有基礎模型,把有效 LLM 上下文長度延伸至十億級,並可在 CPU 上高效運行。

  8. Zyphra Research43

    Zyphra 提出 Online Vector-Quantized (OVQ) Attention 處理長上下文

    Zyphra 提出 Online Vector-Quantized(OVQ)attention,以線性計算複雜度和常數記憶體複雜度處理長上下文。其稀疏狀態更新可擴大記憶容量;實驗顯示,在 16k+ 上下文長度下,OVQ-attention 使用的記憶狀態僅為強自注意力基線的一小部分,表現相若或略有差距。長上下文任務中,OVQ-attention 顯著勝過線性注意力及 SSM 基線。

  9. Goodfire Research46

    解讀 Evo 2:Arc Institute 的下一代基因組基礎模型

    Goodfire 與 Arc Institute 合作將可解釋性技術應用於 Evo 2,識別出多種具生物學意義的模型特徵。Evo 2 提供 7B 和 40B 參數架構,可處理長達 1M 個鹼基對的序列。以特徵引導 Evo 2 精確設計新蛋白質結構的研究仍處早期,尚需進一步研究。

  10. Goodfire Research57

    Goodfire 剖析 DeepSeek R1 推理模型內部機制,公開兩個 SAE

    Goodfire 公開兩個以 DeepSeek R1 激活值訓練的稀疏自編碼器(SAE),並分享對推理模型內部機制及操控方式的早期研究。研究發現,R1 的特徵操控需等模型開始輸出「Okay, so the user has asked a question about…」一類思考前綴後才有效;部分特徵被過度操控時,模型反而會回復原有行為。

  11. Goodfire Research62

    Goodfire Research 提出模型差分放大法,協助發現罕見不良行為

    Goodfire Research 提出模型差分放大法,放大模型在後訓練前後的 logits 差異,以協助浮現罕見不良行為。實驗顯示,該方法令湧現失配回覆增加 10 至 300 倍;當資料集含 5% 不良醫療建議時,有害回覆由每 10,000 次抽樣 1 次增至每 30 次 1 次。研究亦把此法用於監察後訓練和偵測後門行為;作者指出,放大後的回覆頻率不代表模型行為的實際發生率。

  12. Goodfire Research8

    對抗樣本不是錯誤,而是疊加現象

    文章主張,對抗樣本並非錯誤,而是疊加現象。頁面另列出以蛋白質嵌入向量改善 AI 智能體生物安全監測、規模化捕捉模型獎勵作弊,以及估算文字生成不確定性動態的研究。頁面亦介紹 Silico,稱其為可解釋性智能體,可用於解釋、除錯及精確控制模型行為,並提供可解釋性方法與基礎設施。

  13. Goodfire Research14

    時間先驗:語言模型可解釋性中缺失的歸納偏置

    題為《時間先驗》的文章聚焦語言模型可解釋性中缺失的歸納偏置。頁面另列出以蛋白質嵌入向量改善 AI 智能體生物安全監察、在大規模情況下捕捉模型獎勵破解,以及估算文字生成不確定性動態的研究。頁面亦介紹 Silico,稱其為可解釋性智能體,可用於解釋、除錯及精確控制模型行為。

  14. Goodfire Research54

    Goodfire Research 透過損失曲率分析模型記憶

    Goodfire Research 提出以損失曲率辨識記憶方向的模型編輯方法,移除低曲率權重方向以抑制背誦,無需標註指定遺忘資料。在採用 10% 隨機標籤噪聲的 ViT 實驗中,噪聲標籤記憶率由 81.6% 降至 3.5%,驗證準確率則由 67% 升至 71.7%。語言模型的純記憶任務準確率降至原有水平的 3–16%,邏輯推理維持或略有改善,但算術和封閉式事實回憶較易受影響。

  15. Goodfire Research45

    Goodfire 與 Radical AI 用自我修正搜尋加速材料發現

    Goodfire 與 Radical AI 合作,利用可解釋性工具讓擴散模型從自身內部取得回饋並自我修正,使目標範圍內的可行候選材料增加約 30%。研究在 MatterGen 取樣時利用 probe 從模型嵌入向量提取結構作修正,改善目標命中率而不犧牲獨特性。自我修正搜尋亦可能適用於蛋白質設計和藥物發現等領域。

  16. Goodfire Research41

    基於協方差的序列池化

    研究提出協方差池化,以 token 激活的截斷二階矩聚合基因組基礎模型的序列表示,保留均值池化忽略的特徵聯合結構。在 NTv3 的 Gene Ontology 預測及基因組軌道預測中,該方法表現大幅優於均值池化。它可透過重建二階矩學習低秩分解,生成定長嵌入,並用於有監督探測及無監督嵌入學習。

  17. Goodfire Research58

    Goodfire Research 提出探針式數據歸因方法,揭示並緩解 LLM 後訓練中的不良行為

    Goodfire Research 以探針式數據歸因追查 OLMo 2 7B DPO 訓練中出現的有害行為,移除相關數據後有害回應率下降 63%。方法以模型激活向量的餘弦相似度排序訓練樣本;交換排名靠前樣本的 accepted/rejected 標籤,可令有害回應率下降 78%。按數據來源移除四個問題最突出的模型生成的樣本,則可令有害回應率下降 84%。

  18. Goodfire Research48

    解讀語言模型參數

    這項研究提出 adVersarial Parameter Decomposition(VPD),把語言模型參數拆成小型子元件,以分析模型如何計算輸出。VPD 旨在大量子元件遭消融(包括經對抗性選取的消融)時,仍保留模型的輸入—輸出行為。研究亦追蹤參數子元件的互動序列,分析它們如何共同產生特定輸入的模型輸出,形成新一類「電路」分析。

  19. Goodfire Research54

    論文摘要:Goodfire Research 以 VPD 解讀語言模型參數

    Goodfire Research 使用 VPD(Adversarial Parameter Decomposition)拆解一個 67M 參數語言模型的權重矩陣,以研究模型參數中的計算結構。這項方法把參數分解為秩一矩陣,並識別出分散於多個注意力頭的算法、可無需訓練直接編輯行為的子元件,以及特定預測所需的子網絡。研究團隊分解網絡全部 24 個矩陣,共識別約 10,000 個子元件。

  20. Goodfire Research52

    Goodfire 在 Llama 3.1 8B 第 18 層發現以圓形表徵運作的加法模組

    Goodfire 在 Llama 3.1 8B 第 18 層發現一個加法模組,透過多個圓形表徵並行計算不同模數下的和。該模組亦用於一般算術、星期及月份等循環概念的推算,數字以 Fourier features 表示。研究人員操控這些圓形表徵後觀察到月份預測隨輸出改變,作為模組參與月份推算的因果證據;文章指出相關實證仍未完整。

  21. Goodfire Research45

    稀疏自編碼器(SAE)能否捕捉神經幾何結構?

    稀疏自編碼器(SAE)可用「碎裂」、「緊湊捕捉」和「稀釋」三種方式表徵神經表徵中的流形,但單一特徵只能呈現局部結構。研究者建立無監督流程,按 SAE 特徵觸發模式的統計依賴進行聚類,以發掘整體幾何結構。這套流程在 Llama 3.1 8B 中找到多種流形,而實際神經網絡表徵主要呈現「稀釋」模式。

  22. Zyphra Research59

    Zyphra Research 發現 GPT 式 Transformer 在持續及平穩學習中出現可塑性損失

    Zyphra Research 發現,非嵌入參數量介乎 5M 至 314M 的 GPT 式 Transformer,在多語言持續學習中會出現可塑性損失。研究提出縮放定律 T = 1.3 × 10^-5 · P^0.8269,預測可塑性損失的出現時間隨非嵌入參數量呈次線性增長,增加參數量的延後作用會遞減。研究亦在平穩學習中觀察到相似現象,表明可塑性損失並非只見於持續學習設定。

  23. Goodfire Research57

    Goodfire Research 發佈 Predictive Data Debugging 研究,訓練前預測並調整模型從數據中學到的內容

    Goodfire Research 發佈 Predictive Data Debugging 研究,提出在訓練前預測偏好數據如何影響模型行為的方法。其預測與模型實際學到的結果達到 R² = 0.9,並可追溯至相關數據羣組。使用 Dolci 和 Tulu 3 數據集的案例顯示,DPO 可能削弱模型對部分有害請求的穩健性;以除錯數據訓練則可同時改善安全與效能。

  24. METR:Blog71

    METR 紅隊測試 Anthropic 內部智能體監測系統,發現多項新漏洞

    METR 員工 David Rein 與 Anthropic 合作,花三週對 Anthropic 部分內部智能體監測及安全系統進行紅隊測試,發現多項新漏洞。部分漏洞其後已修補,測試亦找出停用或欺騙監測器的途徑;David 認為現有監測很可能在數天或數週內捕捉到高度未對齊模型的部分攻擊,但未必能捕捉每一次。