跳到正文
Artificial Analysis 完整文章·· 2 小時前精選AI 評分78

Anthropic 發佈 Claude Haiku 5.5,Artificial Analysis Intelligence Index 得分 43

Anthropic has released Claude Haiku 5.5

AI 導讀

Anthropic 發佈 Claude Haiku 5.5,Artificial Analysis Intelligence Index 評分為 43,較上一款 Haiku 一年前的評分高 26 分。

推薦理由

文章對照 Haiku 5.5 與多款模型的基準成績,並列不同 effort 設定的 token 用量和分層價格,呈現模型表現與使用開銷的取捨。

正文 · 繁體中文

Anthropic 發佈 Claude Haiku 5.5;它在 Artificial Analysis Intelligence Index 得分 43 分,較一年前發佈的上一款 Haiku 高 26 分

查看模型頁面

Haiku 5.5 是首個具備 Anthropic effort 設定及自適應思考功能的 Haiku 模型;Anthropic 亦推出分級定價。

Haiku 5.5 的價格低於上一代:提示詞不超過 100k tokens 時,每 1M 個輸入/輸出 tokens 的收費為 $0.10/$0.50,與 GPT-6 Luna 相同,亦僅為上一款 Haiku 模型價格的 10%。不過,超過 100k tokens 後,收費會升至原來的 5 倍,即每 1M 個輸入/輸出 tokens 分別為 $0.50/$2.50。網站尚未反映分級定價,因此 Haiku 5.5 的暫定成本數字未計入超過門檻後的加價。我們正著手加入相關支援,並會很快補上 Cost per Task 的數據。

重點摘要:

➤ 小型模型中的領先表現:在 max effort 設定下,Haiku 5.5 的得分略高於 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)及 GPT-6 Luna(38)等模型。它的得分與 Kimi K3(44)相若;Kimi K3 是一款 2.8T 參數的開放權重模型。Haiku 5.5 則比 Claude Sonnet 5.5(max,56)低 13 分

➤ 相較 GPT-6 Luna,token 用量偏高:Haiku 5.5 (max) 每項 Intelligence Index 任務約使用 162k 個輸出 tokens,約為 GPT-6 Luna (max,約 50k) 的 3x。effort 設定由 xhigh 調至 max,分數增加 2 分,token 用量則約為原來的 1.8x。即使 Intelligence Index 分數相若,Haiku 5.5 的 token 用量亦高於 GPT-6 Luna:Haiku 5.5 (high) 每項任務使用約 55k tokens,得分為 38;GPT-6 Luna (max) 每項任務使用約 50k tokens,得分同為 38;在較低 effort 設定下,差距會進一步擴大

➤ 擅長代理式知識工作:在 AA-Briefcase(我們用於評測真實知識工作任務的內部評測)中,Haiku 5.5 (max) 的 Elo 評分達 1578,高於 Kimi K3、GLM-5.3 等模型,並與 Muse Spark 1.3 (max) 相若

➤ 終端機使用能力有所提升:Haiku 5.5 在 Terminal-Bench 4.0 得分 33%,高於 Haiku 4.5 的 0%。這與 GLM-5.3 Flash 持平,並高於 Gemini 3.8 Flash(20%)及 GPT-6 Luna(13%)

➤ 事實知識較弱,但幻覺率相對較低:如較小型模型所預期,Haiku 5.5 的事實知識少於同系列其他型號。AA-Omniscience 的準確率為 36%,低於 Gemini 3.8 Flash 的 55%及 GPT-6 Luna 的 44%;但這在一定程度上是因為它更願意承認自己不知道,因此幻覺率較低,為 40%(Gemini 3.8 Flash 為 55%,GPT-6 Luna 為 77%)

➤ AutomationBench-AA 成績可能被低估:Haiku 5.5 得分 35%,而 GPT-6 Luna、Gemini 3.8 Flash 及 GLM-5.3 Flash 的得分為 53–60%。預發佈測試期間,安全拒答問題令模型過度拒答。Anthropic 正處理此問題;我們會在修正後重新進行這項評測,並預期分數會上升

其他模型資訊:

➤ 上下文視窗:1 million tokens,較 Claude 4.5 Haiku 的 200k 增加

➤ 收費:最多 100k tokens 時,每 1M 個輸入/輸出 tokens 分別為 $0.10/$0.50;超過 100k tokens 則為 $0.50/$2.50。快取讀取費用為 $0.01(超過 100k tokens 為 $0.05);5 分鐘快取寫入費用為 $0.125(超過 100k tokens 為 $0.625)

➤ 多模態能力:輸入支援文字及圖像,輸出為文字

Haiku 5.5 (max) 每項 Intelligence Index 任務約使用 162k 個輸出 tokens,多於 Opus 5.5 (max),亦約為 GPT-6 Luna (max) 的 3x。在不同 effort 設定下,Haiku 5.5 要達到相若的 Intelligence Index 分數,所用的輸出 tokens 亦多於 GPT-6 Luna

Claude Haiku 5.5 (max) 在 AA-Briefcase(我們的內部前沿知識工作評測)中達到 1578 Elo,結果落在 GPT-6 Astra (max) 和 Claude Fable 5.1 (high) 的信賴區間內

Claude Haiku 5.5 在不同推理力度設定下,Artificial Analysis Intelligence Index 各項評測的完整細項結果

來源:Artificial Analysis 完整文章 · artificialanalysis.ai