AI 系統會否愈來愈難監督?
英國 AI Security Institute 的報告指出,現有 AI 監督所依賴的基礎可能逐漸削弱,而新興方法尚未成熟到足以彌補。報告梳理內部激活、思維鏈、外部行動及智能體間通訊四類監督面向,並列出二十多條監督能力退化路徑。開發者可採取措施維持現有監督渠道,並投資新興技術,作為監督能力退化時的後備方案。
英國 AI Security Institute 的報告指出,現有 AI 監督所依賴的基礎可能逐漸削弱,而新興方法尚未成熟到足以彌補。報告梳理內部激活、思維鏈、外部行動及智能體間通訊四類監督面向,並列出二十多條監督能力退化路徑。開發者可採取措施維持現有監督渠道,並投資新興技術,作為監督能力退化時的後備方案。
英國 AI Security Institute 的 Science of Evaluation 團隊發現,固定計算預算會低估前沿 AI 智能體在多項基準上的能力,尤其是較新的模型。
研究顯示,固定基礎模型回答開頭的特定 token 線索,可令其在數學及編碼任務上取得媲美 RL 訓練模型的表現。例如,指定線索令 Olmo-3-7B 在 MATH-500 的 pass@1 準確率由 42% 升至 78%,而 Qwen3-14B 則由 72% 升至 87%。
RealtimeWAM 透過一步動作生成與非同步推理,提升世界動作模型(WAM)的推理效率。其提出 Teacher-Anchored Consistency Distillation(TACD)及 Cross-Expert Wavefront Pipelining(CEWP),分別減少動作生成的多步迭代與影片、動作專家之間的等待。
研究提出並評估一種以生成器忠實重建能力校準的內容認證方法,用來判斷影像真實性是否可被合理否認。研究測試 20 款深偽檢測器對 10 個近四年推出的生成器,準確率由接近完美的 99.5% 降至 76%;對抗性擾動則令所有基線檢測器的準確率跌至 2% 以下。新方法可校準至生成內容遭錯誤認證的比例不超過 1%,並在所評估的有界擾動攻擊下維持此上限,但不涵蓋任意對抗性轉換。
Cohere 分析超過 5.6 million 個涵蓋不同訓練階段的樣本,發現文化多樣性由預訓練進入後訓練時持續收窄。增加語言種類可擴大地理多樣性,但整體文化內容比例會趨於停滯。在 TinyAya base model 微調時加入文化標記後,NormAd、BBQ、GMMLU 分別提升 +8%、+6%、+2.3%,且一般多語能力未受損。
Cohere Labs 公開 Agentic Task Ecosystem(ATE)數據集,分析智能體工具對職業任務的自動化覆蓋。數據集收錄 696,291 項來自 123,069 個公開 MCP 伺服器的工具;按嚴格標準,僅 2.6% 能端到端執行已記錄的職業任務,923 個職業中有 419 個沒有任何智能體工具活動。
Zyphra 公佈 Zyda,一個包含 1.3T tokens、供語言模型訓練使用的開放數據集。它整合七個開放數據集,經統一的品質過濾及跨數據集去重,並以開放且寬鬆的授權發布。消融研究顯示,Zyda 表現勝過 Dolma、Fineweb、Pile、RefinedWeb 和 SlimPajama 等現有開放數據集。
Zyphra 提出 Tree Attention,以樹狀歸約平行化多 GPU Transformer 解碼,實測可提升長上下文注意力的解碼速度並降低記憶體開銷。Zyphra 估算,在 1M 序列長度下,Tree Attention 的解碼速度較 Ring Attention 快逾 8x,通訊量則減至一半或更低。其跨裝置複雜度為對數級,而 Ring Attention 為線性級。
Zyphra 提出 MixPR,一套結合兩類 PageRank 檢索、用於高效預處理長上下文輸入的 RAG 系統。系統按任務採用 PageRank 作全域檢索,或 Personalized PageRank 作局部檢索,並在多項長上下文基準測試取得 SOTA 結果。MixPR 可配合任何現有基礎模型,把有效 LLM 上下文長度延伸至十億級,並可在 CPU 上高效運行。
Zyphra 提出 Online Vector-Quantized(OVQ)attention,以線性計算複雜度和常數記憶體複雜度處理長上下文。其稀疏狀態更新可擴大記憶容量;實驗顯示,在 16k+ 上下文長度下,OVQ-attention 使用的記憶狀態僅為強自注意力基線的一小部分,表現相若或略有差距。長上下文任務中,OVQ-attention 顯著勝過線性注意力及 SSM 基線。
Prime Intellect 提出 TOPLOC,以局部敏感雜湊驗證 LLM 推理,並在實驗中以 100% 準確率檢測模型、提示詞或計算精度遭未授權修改。TOPLOC 將最後隱藏狀態的 top-k 特徵編碼成證明並透過重算驗證,驗證速度最高可達原始推理速度的 100×,生成證明的儲存開銷減少 1000×。
Goodfire 與 Arc Institute 合作將可解釋性技術應用於 Evo 2,識別出多種具生物學意義的模型特徵。Evo 2 提供 7B 和 40B 參數架構,可處理長達 1M 個鹼基對的序列。以特徵引導 Evo 2 精確設計新蛋白質結構的研究仍處早期,尚需進一步研究。
Goodfire 公開兩個以 DeepSeek R1 激活值訓練的稀疏自編碼器(SAE),並分享對推理模型內部機制及操控方式的早期研究。研究發現,R1 的特徵操控需等模型開始輸出「Okay, so the user has asked a question about…」一類思考前綴後才有效;部分特徵被過度操控時,模型反而會回復原有行為。
Goodfire Research 提出模型差分放大法,放大模型在後訓練前後的 logits 差異,以協助浮現罕見不良行為。實驗顯示,該方法令湧現失配回覆增加 10 至 300 倍;當資料集含 5% 不良醫療建議時,有害回覆由每 10,000 次抽樣 1 次增至每 30 次 1 次。研究亦把此法用於監察後訓練和偵測後門行為;作者指出,放大後的回覆頻率不代表模型行為的實際發生率。
文章主張,對抗樣本並非錯誤,而是疊加現象。頁面另列出以蛋白質嵌入向量改善 AI 智能體生物安全監測、規模化捕捉模型獎勵作弊,以及估算文字生成不確定性動態的研究。頁面亦介紹 Silico,稱其為可解釋性智能體,可用於解釋、除錯及精確控制模型行為,並提供可解釋性方法與基礎設施。
Goodfire 與 Rakuten 合作研究以 SAE probes 偵測 Rakuten 的 AI 智能體用戶訊息中的 PII,Rakuten 已將該方法部署至生產環境。
題為《時間先驗》的文章聚焦語言模型可解釋性中缺失的歸納偏置。頁面另列出以蛋白質嵌入向量改善 AI 智能體生物安全監察、在大規模情況下捕捉模型獎勵破解,以及估算文字生成不確定性動態的研究。頁面亦介紹 Silico,稱其為可解釋性智能體,可用於解釋、除錯及精確控制模型行為。
Goodfire Research 提出以損失曲率辨識記憶方向的模型編輯方法,移除低曲率權重方向以抑制背誦,無需標註指定遺忘資料。在採用 10% 隨機標籤噪聲的 ViT 實驗中,噪聲標籤記憶率由 81.6% 降至 3.5%,驗證準確率則由 67% 升至 71.7%。語言模型的純記憶任務準確率降至原有水平的 3–16%,邏輯推理維持或略有改善,但算術和封閉式事實回憶較易受影響。
Goodfire 與 Prima Mente 以可解釋性方法分析表觀基因組基礎模型 Pleiades 如何利用血液遊離 DNA(cfDNA)偵測阿茲海默症,發現片段長度模式是分類器的主要訊號。
Goodfire Research 發現,DeepSeek-R1、GPT-OSS 等模型在簡單題上,往往在思維鏈文字表露答案前已形成內部判斷。研究以 attention probes、forced answering 和 CoT monitor 比較內部預測與文字推理;較難的 GPQA-Diamond 題目中,三種方法則同步逐步提升。
Goodfire 與 Radical AI 合作,利用可解釋性工具讓擴散模型從自身內部取得回饋並自我修正,使目標範圍內的可行候選材料增加約 30%。研究在 MatterGen 取樣時利用 probe 從模型嵌入向量提取結構作修正,改善目標命中率而不犧牲獨特性。自我修正搜尋亦可能適用於蛋白質設計和藥物發現等領域。
研究提出協方差池化,以 token 激活的截斷二階矩聚合基因組基礎模型的序列表示,保留均值池化忽略的特徵聯合結構。在 NTv3 的 Gene Ontology 預測及基因組軌道預測中,該方法表現大幅優於均值池化。它可透過重建二階矩學習低秩分解,生成定長嵌入,並用於有監督探測及無監督嵌入學習。
Prime Intellect 以 Llama 3.2-1B-Instruct 進行受控 RL 實驗,指出 reward hacking 是梯度動態問題,受可見獎勵與隱藏獎勵的競爭影響。
Goodfire Research 利用 Evo 2 嵌入向量預測遺傳變異效應,並推出涵蓋 ClinVar 4.2 million 個變異的 EVEE。其致病性探針在 839k 個 ClinVar 單核苷酸變異上取得 0.997 AUROC,對未經明確訓練的短插入和缺失變異達 0.991 AUROC。
Goodfire Research 以探針式數據歸因追查 OLMo 2 7B DPO 訓練中出現的有害行為,移除相關數據後有害回應率下降 63%。方法以模型激活向量的餘弦相似度排序訓練樣本;交換排名靠前樣本的 accepted/rejected 標籤,可令有害回應率下降 78%。按數據來源移除四個問題最突出的模型生成的樣本,則可令有害回應率下降 84%。
這項研究提出 adVersarial Parameter Decomposition(VPD),把語言模型參數拆成小型子元件,以分析模型如何計算輸出。VPD 旨在大量子元件遭消融(包括經對抗性選取的消融)時,仍保留模型的輸入—輸出行為。研究亦追蹤參數子元件的互動序列,分析它們如何共同產生特定輸入的模型輸出,形成新一類「電路」分析。
Goodfire Research 使用 VPD(Adversarial Parameter Decomposition)拆解一個 67M 參數語言模型的權重矩陣,以研究模型參數中的計算結構。這項方法把參數分解為秩一矩陣,並識別出分散於多個注意力頭的算法、可無需訓練直接編輯行為的子元件,以及特定預測所需的子網絡。研究團隊分解網絡全部 24 個矩陣,共識別約 10,000 個子元件。
Goodfire 在 Llama 3.1 8B 第 18 層發現一個加法模組,透過多個圓形表徵並行計算不同模數下的和。該模組亦用於一般算術、星期及月份等循環概念的推算,數字以 Fourier features 表示。研究人員操控這些圓形表徵後觀察到月份預測隨輸出改變,作為模組參與月份推算的因果證據;文章指出相關實證仍未完整。
稀疏自編碼器(SAE)可用「碎裂」、「緊湊捕捉」和「稀釋」三種方式表徵神經表徵中的流形,但單一特徵只能呈現局部結構。研究者建立無監督流程,按 SAE 特徵觸發模式的統計依賴進行聚類,以發掘整體幾何結構。這套流程在 Llama 3.1 8B 中找到多種流形,而實際神經網絡表徵主要呈現「稀釋」模式。
Zyphra Research 發現,非嵌入參數量介乎 5M 至 314M 的 GPT 式 Transformer,在多語言持續學習中會出現可塑性損失。研究提出縮放定律 T = 1.3 × 10^-5 · P^0.8269,預測可塑性損失的出現時間隨非嵌入參數量呈次線性增長,增加參數量的延後作用會遞減。研究亦在平穩學習中觀察到相似現象,表明可塑性損失並非只見於持續學習設定。
Zyphra Research 介紹 PUFFER,一套為持續增長的訓練語料設計的增量模糊去重系統,可逐批加入數據集而無須重建完整索引。
頁面內容稱此頁應重新導向 arXiv,卻未提供大型模型為何學得更多的研究內容或結論。頁面另列三項研究及其日期,並介紹 Silico 為可解釋性 Agent,以先進的可解釋性方法及基礎設施解釋、除錯並精確控制模型行為。
Logits 被提出作為監測模型評測意識的新工具,旨在追蹤模型是否察覺自己正處於評測情境;現有內容未交代實作細節或驗證結果。
Goodfire Research 發佈 Predictive Data Debugging 研究,提出在訓練前預測偏好數據如何影響模型行為的方法。其預測與模型實際學到的結果達到 R² = 0.9,並可追溯至相關數據羣組。使用 Dolci 和 Tulu 3 數據集的案例顯示,DPO 可能削弱模型對部分有害請求的穩健性;以除錯數據訓練則可同時改善安全與效能。
Goodfire Research 介紹其新論文提出的區塊稀疏特徵器(Block-Sparse Featurizers,BSF),以多維子空間刻畫視覺模型中的概念結構。
Goodfire Research 的《Forking Fast》聚焦高效估算文本生成中的不確定性動態。現有內容未交代研究方法或結果,只列出其他研究項目,並介紹 Silico 為可解釋性智能體,可用來解釋、除錯及精確控制模型行為。
Goodfire Research 發現,開源模型內部存在與 reward hacking 相關的訊號,activation probes 可用於大規模偵測這類行為。
Prime Flash MoE 是一組為 Blackwell 優化的 CUDA kernels,速度最高比 PyTorch grouped GEMM 快 2.4×。在 4k-128k token 範圍內,速度提升約 2.3×,並已整合至 prime-rl,以加速 MoE 模型的前向傳播。
METR 員工 David Rein 與 Anthropic 合作,花三週對 Anthropic 部分內部智能體監測及安全系統進行紅隊測試,發現多項新漏洞。部分漏洞其後已修補,測試亦找出停用或欺騙監測器的途徑;David 認為現有監測很可能在數天或數週內捕捉到高度未對齊模型的部分攻擊,但未必能捕捉每一次。