為何 AI 競賽轉向推理速度
Cerebras 指出,AI 競賽的焦點正由模型智能轉向推理速度,因生成 token 的速度影響模型迭代與軟件開發。
Cerebras 指出,AI 競賽的焦點正由模型智能轉向推理速度,因生成 token 的速度影響模型迭代與軟件開發。
更快的模型推理讓網絡安全公司能在既有工作流程內處理更多上下文、推理及驗證,並維持流暢的用戶體驗。實務上可採分層架構,由規則、傳統模型及小型語言模型先行篩選、分類和分流,再把可疑事件、高風險發現等交由較強的推理模型深入分析,兼顧日常流程速度與重要個案的分析深度。
Jeremy Avigad 指出,AI 已能協助產生過去足以發表的數學成果,數學界面對的核心問題已轉為如何在 AI 時代追求數學理解。他認為,數學作為嚴謹推理與溝通的文化仍然重要,研究者可轉向更難的問題,並思考更宏大的問題。
OpenAI、Anthropic 等 AI 實驗室過去一年宣佈多項長期未解數學難題取得突破,部分成果遠超研究人員對現有系統能力的預期,並包括解決一項著名的千禧年大獎難題。這些成果本應獲得喝采,卻反而引發反彈;AI 實驗室表示正從以往錯誤中汲取教訓,成效仍有待觀察。
Tomer Tunguz 認為,AI 推理市場將超越數據庫市場,成為軟件領域最重要的市場。企業運行 AI 模型的支出由 2025 年約 $25b 增至今年約 $130b,預計 2027 年達 ~$350b,超過數據庫市場的 $190b。推理支出將超過按席位收費或基本訂閲費,令毛利率承壓;較小模型、更佳 harness 和新路由技術可供應用商尋找效率。
文中提出,AI 或可完成證明、計算等數學工作,而研究理由與問題選擇也只能由 AI 完成,數學家則做數學。作者自稱並非數學家,並認為這個論點薄弱而有些怪異。
Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器;用於智能體堆疊的條件分支決策時,模型須兼具良好校準與資訊性。神經網絡輸出 logits 對可約減的認知不確定性屬高度有損壓縮,令校準在實務上難以落實;高概率區域的估計亦會在輕微協變量偏移下不穩,令多步搜尋圖可能走向模型訓練或校準時未見的分支,甚至落在分佈外。
Thore Graepel 認為,當前 LLM 的鏈式推理仍由反覆預測下一個 token 產生,並非獨立的推理機制。AlphaGo 結合神經網絡提供的直覺與棋局樹搜尋;作者指出,聊天機械人缺少可持續檢視的信念狀態,思維鏈也可能在得出答案後才編造。Graepel 主張系統維護明確的認知狀態,僅在證據支持時更新信念,並評估每一步能否降低不確定性。
Redwood Research 分析認為,轉向潛在推理架構可能削弱 CoT 的監督作用,令 AI 模型的推理更難理解和監察。文章區分 CoT 對完成任務的必要性,以及模型以文字表達推理的傾向,指出潛在架構可能削弱前者,並進一步減弱後者。
Sebastian Raschka 分析 GPT-6 Astra 的電腦操作表現與循環式 Transformer 傳聞,指出 Astra 表現突出,但採用該架構尚未獲官方確認。
推薦理由:文章比較循環式 Transformer 的權重共享、計算成本與路由設計,並指出現有資料尚不足以將推理鏈可監控性的變化歸因於這種架構。
Greg Burnham 在 Epoch AI 的 Gradient Updates 中提出九個關於 AI 能力與影響的問題,探討基準評測如何協助回答。問題涵蓋 AI 能否承擔開放式工作、推理擴展是否持續帶來收益、AI 能否參與 AI 研發,以及強化學習能否跨領域泛化。
Benedict Evans 認為,token 供應短缺只是過渡狀態,現有市場動態指向基礎模型成為商品化基礎設施,但長期定價權與價值捕獲仍未明朗。供給擴張、推理效率、訓練成本及新用途的投資回報都會變動,長期供需均衡因此難以預測。文章以流動網絡、光纖和半導體為參照,指出類比可供參考,但不能預測 AI 市場最終會形成哪一種均衡。
Berkeley AI Research 梳理自適應並行推理(Adaptive Parallel Reasoning,APR)的研究進展,將其界定為模型在推理時自行決定何時並行、分配多少執行緒及如何協調控制流的範式。
Arvind Narayanan 指出,Moravec 悖論從未經過實證檢驗,也不能用來預測哪些任務對 AI 容易或困難。他認為,AI 社羣偏重值得研究的任務、忽略對人與 AI 都過易或過難的任務,可能造成任務難度呈現表面上的負相關。由於新能力從突破到商業化和部署往往需要時間,他主張與其預測突破,不如適應已知的技術發展。
Sam Altman提出三項關於AI經濟的觀察,認為模型智能大致隨訓練及推理計算資源的對數增加,智能的社會經濟價值則呈超指數增長。他指出,同等 AI 水平的使用成本約每 12 個月下降 10x;以 GPT-4 於 2023 年初和 GPT-4o 於 2024 年中的每個 token 價格相比,價格約下降 150x。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 認為,現有證據不足以判定 AI 進展放緩或模型擴展已經終結,並指出業界人士的預測會受商業利益與技術視角影響。他們認為,推理時計算擴展短期仍有不少改進空間,但能力提升可能因任務領域而不均,且難以預測。文章指出,AI 對社會和經濟的實際影響更受產品開發及採用速度制約,而非單由能力進展決定。