Anthropic 發佈 Claude Haiku 5.5,定價與 GPT-6 Luna 相同
[AINews] Claude Haiku 5.5 — better than GPT-6 Luna at the same pricing
Anthropic 發佈 Claude Haiku 5.5,這是約一年來首個 Haiku 系列更新,定價與 OpenAI GPT-6 Luna 相同。模型提供 1M-token 上下文,並定位為與 Opus 5.5 或 Sonnet 5.5 配合、處理高用量成本敏感工作的子智能體;輸入和輸出價格按提示長度分級,超過 100K tokens 時價格較高。
這組資料並列每 token 定價、長提示詞加價與高 effort 下的 token 用量,呈現評估 Claude Haiku 5.5 成本定位時需要考慮的差異。
距離 Anthropic 推出 Haiku 4.5大約已經一年。隨着 Sonnet、Opus 和 Fable 相繼推出至 5.5 版本,Haiku 似乎有點被遺忘,尤其 OpenAI 已推出 Luna 6,並同時推出 Astra 和 Sol 6。
不過,它終於來了,而且是一次值得歡迎的更新。詳情請看下方摘要。
2026/10/06-2026/10/7 的 AI 新聞。我們查閲了 12 個 subreddit、544 個 Twitter 帳戶,沒有其他 Discord。AINews 網站讓你搜尋所有過往期刊。提醒一下,AINews 現在是 Latent Space 的一個版塊。你可以選擇接收或不接收不同頻率的電郵
AI Twitter 摘要
頭條:Anthropic 推出 Claude Haiku 5.5
發生了甚麼事
Anthropic 推出 Claude Haiku 5.5,這是 Haiku 系列大約一年來首次更新。其定價與 OpenAI 的 GPT-6 Luna 看齊,而 Anthropic 同日下調 Sonnet 5.5 和訂閲方案的價格。
推出前的跡象。 @scaling01在公告前發文説「Haiku 5.5 日快樂」。@kimmonismus表示,該模型已出現在 Claude Code 更新中,並預測會採用「Luna 式定價」。他其後在官方貼文發布前公佈價格(@kimmonismus),並在正式上線時確認(@kimmonismus)。
正式推出。 @claudeai和@AnthropicAI稱它是「我們迄今推出過最便宜、最快、能力最強的小型模型」,平均執行成本較 Haiku 4.5 低約 75%。
供應情況和目標用途。 它現已在 Claude Platform 和 Claude Code 上線(@ClaudeDevs)。Anthropic 將它定位為與 Opus 5.5 或 Sonnet 5.5 配合使用的子代理,適用於大量且講求成本效益的工作,例如摘要、壓縮處理和資料庫查詢。@mikeyk形容兩者分工為:「Opus 負責繁重的思考工作,Haiku 負責大量工作。」
分級定價(@ClaudeDevs):
提示詞長度 每 1M 個 token 的輸入/輸出 每 1M 個 token 的快取讀取費用 少於 100K 個 token $0.10 / $0.50 $0.01 超過 100K 個 token $0.50 / $2.50 $0.05
Sonnet 5.5 減價。 快取讀取費用減半,由每 1M 個 token $0.20 降至 $0.10。Anthropic 表示,對大部分長時間執行或代理式工作而言,Sonnet 5.5 的成本因此降低約 20%(@claudeai)。
訂閲用戶可獲 API 額度。 每月 Claude Platform API 額度現已包含於 Max 5x($100)、Max 20x($200)和 Team(最高 $500,可共用)方案中。額度適用於任何模型,包括 Haiku 5.5,也可在第三方執行框架中使用(@ClaudeDevs)。
同日 SDK 更新。 電腦操作和瀏覽器操作工具組現已內置於 Python 和 TypeScript 版 Claude SDK。SDK 會執行動作循環,並將點擊和按鍵輸入傳送至 browser_use、Browserbase、E2B 或 Daytona 的驅動程式,因此開發者毋須再自行編寫該循環(@ClaudeDevs、快速入門)。
合作夥伴首日推出:
Cursor:@cursor_ai聲稱,處理較短請求時「成本比 Haiku 4.5 低 10 倍」,並公佈了 CursorBench 比較結果(@cursor_ai)。
VS Code 的 GitHub Copilot:@code表示,該模型在許多編碼任務上的表現媲美 Claude Sonnet 5,同時使用較少 token 和步驟。
Devin:@cognition 表示,Devin 在 FrontierCode 1.1 的得分為 58.4%,表現領先 Sonnet 5,而每項任務的成本約為 Sonnet 5 的八分之一;並建議在 Fusion 中以 Opus 5.5 為主導,將 Devin 作為「副手」。
Arena:已加入 Agent Arena、Code Arena WebDev、Text、Document 及 Vision,評分尚待公佈(@arena)。
OpenDocRouter:同日加入(詳情如下)。
獨立評測:Artificial Analysis
@ArtificialAnlys 發布了目前最詳盡的第三方數據(各項評測細分數據、比較頁面)。
智能指數:43(max effort),較上一代 Haiku 高 26 分。
略高於 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)及 GPT-6 Luna(38)。
表現與 Kimi K3(44)相若;後者是具 2.8T 參數的開放權重模型。
在 max effort 下,落後 Claude Sonnet 5.5(56)13 分。
新增控制選項。這是首款支援 Anthropic 的 effort 設定及自適應思考功能的 Haiku。
Token 用量是主要注意事項。
在 max effort 下,每項 Index 任務約會用上 162k 個輸出 tokens,約為 GPT-6 Luna 在 max 設定下(約 50k)的 3 倍。
由 xhigh 調至 max,分數增加 2 分,但 token 用量約增至 1.8 倍。
即使得分相同,Haiku 的輸出仍較冗長:Haiku 5.5 在 high effort 下以約 55k 個 tokens 得 38 分;Luna 則在 max 設定下以約 50k 個 tokens 得 38 分。降低 effort 設定時,差距會擴大。
成本數字仍屬暫定。Artificial Analysis 尚未把超過 100K tokens 後價格跳升 5 倍的情況納入模型。每項任務的成本數字將於稍後公佈。
AA-Briefcase(私有代理式知識工作評測):1578 Elo。得分高於 Kimi K3 及 GLM-5.3,與 Muse Spark 1.3 在 max 設定下的表現相若。
Terminal-Bench 4.0:33%,高於 Haiku 4.5 的 0%。
與 GLM-5.3 Flash 持平。
高於 Gemini 3.8 Flash(20%)及 GPT-6 Luna(13%)。
知識與幻覺(AA-Omniscience):
模型 準確率 幻覺率 Haiku 5.5 36% 40% Gemini 3.8 Flash 55% 55% GPT-6 Luna 44% 77%
Haiku 準確率較低,部分原因是它較願意表示自己不知道。
AutomationBench-AA:35%,而 Luna、Gemini 3.8 Flash 及 GLM-5.3 Flash 的得分為 53–60%。發布前的一個安全漏洞令模型過度拒答。Anthropic 正在修正問題,Artificial Analysis 將重新進行評測,並預期得分會上升。
規格:
上下文長度為 1M tokens,高於 Haiku 4.5 的 200k。
輸入支援文字及圖像,輸出為文字。
每 1M tokens 的 5 分鐘快取寫入費用為 $0.125(超過 100K tokens 時為 $0.625)。
其他基準測試説法(大多來自供應商或二手資料)
@ShayneRedford 概述了 Anthropic 報告的提升幅度:
OSWorld(電腦操作):15% → 72%。
TerminalBench:0% → 39%。這與 Artificial Analysis 在 Terminal-Bench 4.0 上獨立測得的 33% 不同。
知識工作及推理能力提升 10–50%。
在上述大部分項目中勝過 Luna。
1M 上下文,最高輸出 token 數約為 12k。
@alexalbert__(Anthropic)指出,Haiku 4.5 於 Oct 15, 2025 推出,因此比較涵蓋的時間不足一年。
@TheRundownAI 表示,它「在多項基準測試中」勝過 GPT-6 Luna。
文件解析(基於 ParseBench 的獨立評測):
@LoganMarkewich:整體表現與 Luna 接近,處理表格稍好,理解圖表則較差。
@jerryliu0:每 1,000 頁約 $1.2。以這個價格而言,處理表格及判讀閲讀順序的表現不錯;處理圖表、語義格式及邊界框則較弱。
個別用戶回報:
@simonw 寫了定價筆記,並進行了他的「鵜鶘騎單車」測試。他表示,Haiku 5.5「好得多」,而 Haiku 4.5 的價格貴 10 倍(比較)。
@AI_Screening 表示,Haiku 5.5 在 Three.js 斑馬模擬中「完勝」Luna(使用單一提示詞,並非系統性測試)。
意見與反應
看好
@kimmonismus:「比 GPT-6-Luna 好得多,與 Sonnet 5.5 更接近……便宜又聰明。」
@theo 欣賞階梯式定價:低於 100K tokens 時,收費只有五分之一,「讓人很清楚這個模型的用途」。他也表示,Anthropic 的模型竟然在「成本/智能圖表上遠遠位於左側」,令人印象深刻(@theo),並在直播中談及這次發布(@theo)。
@draecomino:「Haiku 在最高努力程度下的表現媲美前沿模型。」
@kipperrii 認為,既然小型、低價模型現在能做好「大量實用的事情」,它們就更重要了。
@scaling01(「便宜得不得了」)之後又表示(@scaling01):「5.5 系列模型表現不俗。」
@NotTomBrown(「小而強大」)和 @edwinarbus 均來自 Anthropic 陣營,並發布了慶祝留言。
競爭格局
這次發布普遍被視為針對 OpenAI 的 GPT-6 Luna:「GPT-6 Luna 完了」(@dejavucoder)、「是時候擊敗 Luna 了」(@scaling01)。
@kimmonismus 將 Sonnet 下調快取讀取價格解讀為 Anthropic 向 OpenAI 施壓。他談到 API 額度時補充説:「OpenAI:輪到你了」(@kimmonismus)。
@teortaxesTex 表示,Anthropic 現在擁有「所有實驗室中最完整的產品陣容」(Haiku/Sonnet/Opus/Fable 加上 Mythos),相較之下,OpenAI 的陣容是 Luna/Sol/Astra。他仍認為 Anthropic「較不重視產品」,並將此視為 Anthropic 在 2026 年一直擁有很大迴旋空間的表現。
ThursdAI 的 @altryne 質疑中階產品的定位:「Opus 昂貴時,Sonnet 才有意義。」節目計劃談論 Haiku 5.5(@thursdai_pod)。
注意事項(主要來自數據,而非聲量大的批評者)
標題所示價格可能誇大實際節省幅度。
大量使用 tokens(最高努力程度下約為 Luna 的 3 倍)會抵銷部分每 token 折扣。
超過 100K tokens 的提示詞,收費為 5 倍;這對長上下文 Agent 循環尤為重要。
這兩項因素或可解釋為何 Cursor 所稱「短請求便宜 10 倍」,與 Anthropic 所稱「平均便宜 75%」有所不同。
事實回憶能力弱於 Gemini 3.8 Flash 和 Luna。
過度拒絕問題目前拉低了自動化評分。
尚未完成基準測試:Arena 評分仍待公佈,獨立的每項任務成本數據則有待支援階梯式定價後才能提供。
背景
自 2025 年 10 月起,Haiku 4.5 一直是 Anthropic 的小型模型。此後,OpenAI 的 GPT-6 Luna、Gemini 3.8 Flash、GLM-5.3 Flash 和 DeepSeek V4.1 Flash 一直在低成本市場競爭。
Haiku 5.5 的標價與 Luna 完全相同,並新增努力程度控制及 1M context window。
它明確定位為多模型 Agent 執行框架中的低成本工作模型,適用於 Claude Code 子代理、Devin Fusion、Copilot 子代理,以及上下文壓縮或摘要步驟。
Anthropic 同時下調 Sonnet 的快取讀取價格,並提供訂閲方案 API 額度,協同推動 Agent 經濟效益。這項推動正值 token 費用引發更廣泛討論之際(見下文 @theo)。
其他新聞
OpenAI 的 722 份數學手稿:規模、效率與後續影響
來源:Latent Space · latent.space