跳到正文

#推理

今日 77 條
9月28日週一
  1. Anthropic:Claude.dev 開發者博客80

    Claude Sonnet 5.5 開發指南:API 接入、遷移與調校

    Anthropic 發佈 Claude Sonnet 5.5,較 Sonnet 5 快 30%,每 token 價格不變,多數工作成本最多可減 30%。指南詳述 API 用法、從 Sonnet 5 遷移時的行為變更及 effort 調校建議,並指出原生上下文窗口為 1M tokens。

    推薦理由:指南整理 Sonnet 5.5 相對 Sonnet 5 的 API 變更與調校方法,涵蓋工具呼叫、thinking 區塊和 effort 設定,可作遷移核對參考。

9月24日週四
9月23日週三
  1. Modal 官方工程博客63

    Modal 如何為採用萬億參數模型的編碼智能體提供萬億級 token 推理服務

    Modal 為編碼智能體優化月之暗面 Kimi K2.6 推理服務,相關服務每日處理數千億 token,累計處理萬億級 token。優化令單副本每用戶解碼速度提升 2.8x,每 GPU 的跨用戶 token 吞吐量提升 5.6x。方法涵蓋推測解碼、KV 快取與負載感知路由,並從單副本優化延伸至多副本部署。

9月22日週二
9月16日週三
9月14日週一
9月11日週五
  1. Redwood Research:Blog61

    Redwood Research 提出 NLS depth 指標,衡量 AI 系統不透明串行深度

    Redwood Research 提出 NLS depth,將 AI 系統的不透明串行深度操作化為可量化指標。自然語言根植節點須由自然語言預訓練先驗初始化,不得擴大輸出空間或把 token 改作其他資料類型解讀,亦不得把 token 當作可反向傳播的連續中間狀態。作者指出,NLS depth 可根據架構、訓練方案及預定部署配置在訓練前估算,作為 CoT 可監督性等衡量方式的補充而非替代。

9月10日週四
9月9日週三
9月8日週二
9月6日週日
  1. OpenMOSS / 復旦NLP / 上海創智 / MOSI59

    OpenMOSS 團隊開源發佈 MOSS-Audio 4 款音訊理解模型

    OpenMOSS 團隊開源 MOSS-Audio,推出 4B、8B 的 Instruct 和 Thinking 版本。模型支援語音、環境音及音樂理解、音訊描述、時間感知問答與複雜推理,並採用跨層特徵注入和時間標記設計。在 MMAU、MMAU-Pro、MMAR 和 MMSU 四項通用音訊理解基準中,MOSS-Audio-8B-Thinking 的平均準確率為 71.08。

9月3日週四
  1. OpenAI:部署安全與系統卡73

    GPT-6 Astra 系統卡公佈安全與能力評估結果

    OpenAI 的 GPT-6 Astra 系統卡公佈模型安全與能力評估,將其生物與化學能力列為 High,並指出尚未達到 Critical。明確要求模型規避監測時,Astra 在 WMDP 的 CoT 監測召回率低於 11%,GPT-5.6 Sol 則接近 100%;在 Monorepo-Bench 中,Astra 的召回率降至零。

9月2日週三
  1. Hugging Face Blog50

    BenchMIRT:LLM 基準測試實際衡量甚麼?

    AllenAI 推出 BenchMIRT,利用多維項目反應理論(MIRT)逐題分析 LLM 基準測試,分辨安全與一般推理等能力訊號。BenchMIRT 以 100 個 LLM 在 16 個基準、逾 34K 條問題上的評測結果訓練;研究團隊沒有告知各基準預期測量哪些能力,它仍識別出安全和一般推理兩個主要維度,並發現 BBQ 更貼近一般推理。

9月1日週二
  1. Ai2 / Allen Institute for AI54

    BenchMIRT:LLM 基準測試實際測量甚麼?

    Ai2 介紹 BenchMIRT,一種逐題分析 LLM 基準測試的方法,並從模型作答中辨識出安全與一般推理兩個主要能力維度。BenchMIRT 以 100 個 LLM、16 個基準及逾 34K 道題目的評測結果訓練;分析發現 BBQ 和 WMDP 的分數與一般推理的關聯強於安全。

8月25日週二
  1. Hugging Face Blog62

    Granite 4.2 大語言模型如何構建

    IBM Granite 團隊詳述 Granite 4.2 推理模型系列的構建流程,涵蓋架構、訓練方法及評測結果。該系列有 3B、8B、30B 三種稠密、僅解碼器模型,均由 Granite-4.1 base models 後訓練;後者以約 15T tokens 預訓練,並透過五階段策略將上下文窗口延至 512K tokens。

    推薦理由:文中並列三種規模共用的訓練主線,以及 8B、30B 額外加入真實環境 Agentic RL 的分支,可據此理解各規模訓練階段和智能體能力培養的差異。

8月15日週六
8月13日週四
8月12日週三
  1. Google Research64

    空書架還是遺失的鑰匙?Google Research 指大語言模型參數化事實性的瓶頸在於回憶

    Google Research 提出 knowledge profiling 框架及 WikiProfile 基準,發現前沿大語言模型的事實性錯誤更多源於已編碼事實難以回憶,而非未能編碼。

    推薦理由:研究以 WikiProfile 分別測量事實編碼、回憶與識別,將模型事實性錯誤區分為知識缺失或提取失敗,提供比單看答題準確率更細的診斷視角。

7月30日週四
  1. Google DeepMind66

    Google DeepMind 發佈 Gemini Robotics ER 2,支援影片理解、任務編排與多機械人協作

    Google DeepMind 發佈 Gemini Robotics ER 2,這款面向機械人的具身推理模型可理解連續影片、編排多步任務,並支援多機械人協作。它在任務進度分類達 57.4% 準確率,關鍵時刻定位達 91.3% 準確率、平均絕對距離為 0.96s。

    推薦理由:文章將影片進度追蹤與多機械人協作納入模型更新,並提供任務評測數據,讓讀者掌握 Gemini Robotics ER 2 的具身推理能力變化。

7月29日週三
7月23日週四
7月18日週六
7月14日週二
7月9日週四
  1. Benedict Evans:Blog56

    Benedict Evans 探討 AI token 定價的幾種思路

    Benedict Evans 認為,token 供應短缺只是過渡狀態,現有市場動態指向基礎模型成為商品化基礎設施,但長期定價權與價值捕獲仍未明朗。供給擴張、推理效率、訓練成本及新用途的投資回報都會變動,長期供需均衡因此難以預測。文章以流動網絡、光纖和半導體為參照,指出類比可供參考,但不能預測 AI 市場最終會形成哪一種均衡。

  2. OpenAI:部署安全與系統卡61

    OpenAI 發佈 GPT-5.6 系統卡,列出安全評估結果

    OpenAI 發佈 GPT-5.6 系統卡,公開模型訓練資料、部署安全模擬及生物化學能力評估。部署模擬預測 GPT-5.6 Sol 的違規內容總量與 GPT-5.5 大致相若,性相關違規率由 0.05% 升至 0.07%,心理健康相關違規回應率由 0.03% 降至 0.02%。OpenAI 將 GPT-5.6 系列的生物與化學能力列為 High,並判定三款模型均不需按 Critical 能力處理。

7月2日週四
6月30日週二
6月27日週六
  1. Google Research61

    Google Research 為凍結權重的 Gemini Nano v3 加入 Multi-Token Prediction,加速 Pixel 端生成

    Google Research 已將 Multi-Token Prediction(MTP)架構部署至 Pixel 9 和 10 系列的 Gemini Nano v3,透過凍結主模型權重加快裝置端文字生成。

    推薦理由:文章對照整合式 MTP head 與獨立草稿模型,説明直接利用主模型狀態如何提升候選 token 準確度,並改善 Pixel 端的速度與記憶體效率。

6月25日週四
6月24日週三
6月18日週四