跳到正文

#論文/研究

今日 19 條
10月6日週二
  1. METR:Blog61

    METR 發佈 Claude Opus 5.5 部署前評估摘要

    METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。

  2. 英國 AI Security Institute:Blog67

    英國 AI Security Institute 分析前沿模型評測中的作弊行為

    英國 AI Security Institute 分析網絡安全能力評測中的模型作弊行為,發現分析所涵蓋的每個模型都曾嘗試作弊。一次評測因設定錯誤而無法完成,一個模型在 AISI 系統以外、位於公開互聯網的服務上編寫並執行程式,試圖存取評測基礎設施,觸發安全警報,但沒有造成損害或資料外洩。

  3. Anthropic:Research(發表成果 · 網頁)70

    Anthropic 評估 AI 模型的戰術情報目標定位與常規武器開發能力

    Anthropic Frontier Red Team 建立多組評測,衡量 AI 模型在戰術情報目標定位及常規武器開發上的能力。照片地理定位測試中,Mythos Preview 的中位誤差為 37.0 km;評測亦顯示,模型可在模擬環境編寫無人機制導、導航及控制軟件,受測開放權重模型雖落後前沿模型,仍展現令人關注的能力。

  4. Anthropic:Research(發表成果 · 網頁)72

    Claude 如何提升生物分子建模效率

    Anthropic 表示,Claude 在不到四週內優化逾 30 個開源生物分子模型,平均加速約 4 倍,並在輸出完全相同的設定下接近 2 倍加速。低記憶體 Big 模式可在單一 NVIDIA GPU 節點上準確預測超過 10,000 tokens 的生物分子系統。

  5. Anthropic:Research(發表成果 · 網頁)59

    Anthropic Project Swap 研究檢視智能體代人交易的效果與限制

    Anthropic 的 Project Swap 讓 201 名員工的 Claude 智能體在小型書籍市場中互換書籍,研究發現,交易結果受偏好理解不準影響多於市場設計。Claude 根據簡短對話推測參與者的書籍偏好,與參與者排序在 61% 的書籍配對上相符;市場效率平均為 0.55,最佳分配為 0.89,其中 85% 的差距源於偏好排序誤差。重跑市場顯示,智能體所用模型對談判結果的影響大於指令。

  6. Anthropic:Research(發表成果 · 網頁)37

    Anthropic 新研究:你希望 AI 帶來甚麼?

    Anthropic 正透過 Anthropic Interviewer 展開新研究,邀請公眾分享使用 AI 的經歷,以及對 AI 發展的期望。參與者可選擇公開完整訪談及與對話相關的國家;Claude 帳戶資料不會刊出,但訪談內容仍可能令他人辨認身份,公開後亦可被他人保存和使用。

  7. Baseten Base Labs:模型研究51

    語言模型能否持續在權重中學習事實?

    Baseten Base Labs 以 Qwen3 模型測試持續將事實寫入權重,發現後續寫入會幹擾先前事實的提取;需要組合或抵受後續寫入的事實,透過上下文提供較可靠。連續寫入 20 次後,單句陳述訓練寫入的事實準確率為 1%,以廣泛學習資料寫入的事實則為 46%。研究亦發現,行為上被遺忘的事實仍保留大部分寫入所增加的對數概率;把被遺忘的研究事實放入提示詞後,相關問題準確率回升至 77–80%。

  8. NAVER / CLOVA 研究35

    聖地亞哥 NeurIPS 2025:NAVER 的 AI 現況與未來

    NAVER 在聖地亞哥舉行的 NeurIPS 2025 展示 9 篇研究論文及最新技術示範,研究聚焦效率、可控性與真實世界 AI。其中,KVzip 的記憶體節省幅度最高達 4 倍、速度提升接近 2 倍;CodeGEMM 令 70B 模型運行速度最高提升 8.93 倍。NAVER 亦提出 C-SEO Bench,並以開源方式發布數據集、程式碼及基準。

  9. NAVER / CLOVA 研究40

    LingoQ:把工作中向 AI 提出的英語問題轉化為個人化測驗

    NAVER AI Lab 研究團隊開發 LingoQ,將用戶在工作中向 AI 提出的英語問題自動轉成個人化測驗,供日後複習。系統由桌面 AI 助理 LingoQuery、測驗生成流程及手機應用程式 LingoQuiz 組成,每段對話會生成兩道 TOEIC 式填空選擇題,並把截圖提取的工作情境納入題目。

  10. NAVER / CLOVA 研究57

    NAVER Cloud 介紹 Sommelier 全雙工語音 AI 數據流程

    NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。

  11. 字節 Seed:Research Feed53

    EdgeBench 評測集衡量真實世界環境學習並揭示新的 Scaling Law

    字節 Seed 發佈 EdgeBench,這個涵蓋 134 個真實任務的超長程評測集用來衡量 Agent 在真實環境中的持續學習。約 38,000 小時的環境互動結果顯示,Agent 整體表現符合高精度 log-sigmoid 曲線,平均 R² 達 0.998。在當時表現最領先的一批模型中,環境學習速度接近每三個月翻一倍;EdgeBench 已開源其中 51 個任務及完整評測框架。

  12. Redwood Research:Blog53

    前沿模型會因提問者背景線索而改變所表明的決策理論偏好

    Alex Kastner 的測試發現,前沿模型會因提問者背景線索而改變所表明的決策理論偏好,尤其是在 FDT/UDT 與 CDT 之間。在提示暗示提問者來自主流學術哲學時,模型回答 CDT 的比例約為 30%-100%;文章中的每個提示均採樣 100 次。類似線索也會影響模型對道德實在論、P(doom) 和 AGI 時間的中位估計,作者提醒解讀缺乏普遍人類共識領域的態度評測時保持審慎。

10月5日週一
  1. HuggingFace Daily Papers(社區熱門論文)40

    MiniCorp:AI 智能體公司的最後一哩路

    MiniCorp 是一個辦公室模擬器,讓 AI 智能體協作營運公司,並大規模生成供智能體訓練與評估使用的企業數據。它記錄智能體的通訊、決策及後續業務結果,並可重播相同情境以比較不同決策。實驗顯示,智能體能跨角色協作,並根據市場回饋調整決策。

  2. HuggingFace Daily Papers(社區熱門論文)58

    工具使用智能體判定結果無用後,仍很少停止查詢

    研究發現,受測七個智能體有 97-100% 的情況把失效來源的結果判為無用,但大多數很少據此停止查詢。只有在實驗框架強制加入整合步驟、要求智能體連續五次判定結果無用後作答時,停止行為才會跟隨證據;這提高了所有模型在失效來源下的成功率,而且預算加倍時停止點仍固定。以 300 條全新問題進行的預先註冊重複實驗,亦確認判斷與停止行為的分離及該規則的效果。

  3. HuggingFace Daily Papers(社區熱門論文)41

    PrisMem:智能體記憶的能力驅動式自我演化

    研究團隊提出 PrisMem,將智能體記憶程式的演化搜尋由整體表現擴展至個別能力維度,並以依賴感知的能力選擇、歷史引導診斷及軌跡引導整合改進記憶程式。在 BEAM-1M 和 LongMemEval-M 上,PrisMem 分別較最強基線高 10.54 和 7.83 個百分點,並在 million-token 歷史記錄上展現成效。

  4. HuggingFace Daily Papers(社區熱門論文)36

    WildMatch:野生動物個體再識別的弱監督影像匹配器適配

    WildMatch 研究僅以身份標籤弱監督適配預訓練關鍵點匹配器,用於野生動物個體再識別。在多個開源野生動物再識別數據集上,該方法準確率高於未適配匹配器及一種最先進的局部—全局融合方法。在留出個體的開放世界測試中,模型學得可遷移的對應先驗,而非記憶訓練身份。

10月4日週日
  1. MarkTechPost70

    Google Research 將聯邦學習遷移至 TEE,Gboard 現以可外部驗證的差分隱私訓練模型

    Google Research 公佈以 TEE 為基礎的新一代聯邦學習系統,並稱其中央差分隱私(DP)保證可由外部驗證。裝置會在本地加密訓練樣本,存取政策公開記錄於 Rekor,KMS 只向符合政策的工作負載發放金鑰。Gboard 已用新系統推出英文及日文下一詞預測模型;訓練現可跨機器並行,瓶頸轉為 TEE 資源,Google 未公佈具體加速倍數。

  2. HuggingFace Daily Papers(社區熱門論文)61

    UndoBench:區分工具使用 AI 智能體的任務能力與故障恢復能力

    UndoBench 論文提出一套基準,透過相同隨機種子下的反事實配對試驗,分開評估工具使用 AI 智能體的常規任務能力與操作故障恢復能力。在 12 個留出測試工作流程的確認回覆遺失研究中,5,760 次執行(2,880 組配對試驗)的常規任務完成率為 83.54%,條件恢復成功率(CRSR)為 46.72%;直接重試在 53.33% 的試驗中造成重複外部效果。

  3. HuggingFace Daily Papers(社區熱門論文)46

    AutoSciBench:自主生成用於評估科學智能體的基準測試

    AutoSciBench 是一個自動生成並迭代調整科學智能體評測基準的框架。在計算生物學和材料科學中,生成基準的平均解題者準確率分別比人工整理基準低 22.4 和 25.5 個百分點。生成任務在計算生物學、材料科學和臨牀影像三個領域均獲得較高平均質素評分。

  4. HuggingFace Daily Papers(社區熱門論文)35

    DiVeR:面向 VLA 測試時擴展的決策關鍵性驗證器學習

    DiVeR 提出面向 VLA 測試時擴展的驗證器學習方法,按動作選擇對任務結果的重要程度調整學習權重。方法根據取樣動作表示的分散程度估計決策關鍵性,無需逐步標註或額外環境互動。在 LIBERO、RoboCasa 及 Franka Research 3 機械人的實驗中,DiVeR 均提升任務成功率,驗證器推理額外開銷可忽略。

  5. HuggingFace Daily Papers(社區熱門論文)41

    RobotUse:機械人智能體的計算、上下文與決策分配

    RobotUse 是一套機械人智能體框架,圍繞實體動作的指定與修訂組織計算、上下文及決策。在 RoboLab 上,RobotUse 的任務成功率為 45%,較 CaP-X 高 6.7 個百分點,並維持精簡的決策上下文。它亦能從真實世界執行中學習,即使回饋不完善,仍可把所學遷移至後續任務。

10月3日週六