Anthropic 發佈 Claude Haiku 5.5,平均運行成本較 Haiku 4.5 低約 75%
克劳德·俳句 5.5
Anthropic 發佈 Claude Haiku 5.5,稱其為迄今推出的最便宜、最快且能力最強的小型模型,平均運行成本較 Haiku 4.5 低約 75%。
文章對照 Haiku 5.5 的低成本定位與 Sonnet 5.5、Opus 5.5 在複雜 Agent 編碼任務上的優勢,呈現不同工作負載下的模型取捨。
隆重介紹 Claude Haiku 5.5:我們迄今推出價格最低、速度最快、能力最強的小型模型。
Claude Haiku 5.5 專為高用量、注重成本的任務而設。它能可靠地處理快速而重複的工作(例如摘要、上下文壓縮、資料庫查詢和分類要求)。在程式編寫工作中,它也能與 Opus 5.5 和 Sonnet 5.5 配合,擔任子代理。此外,它亦是我們至今速度最快的模型,因此特別適合對速度有要求的任務,例如即時客戶支援和瀏覽器操作。¹
Haiku 5.5 的價格遠低於 Haiku 4.5,平均運行成本現降低約 75%。²
配合此次推出,我們亦提升了整個模型系列的性價比。我們將 Claude Sonnet 5.5 的快取讀取價格減半,令 Sonnet 5.5 在大部分代理式工作中的運行成本降低約 20%。此外,我們為 Claude Max 和 Team 訂閲用戶推出每月 API 額度,協助用戶建立在 Claude Platform 上運行的新代理和應用程式。
效能
以下是 Claude Haiku 5.5 在多項基準測試中的表現:
| Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5供參考 | |
|---|---|---|---|---|
| 知識工作GDPval-AA v2.1 | 1620 | 735 | 1437 | 1840 |
| 知識工作AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| 電腦操作OSWorld 2.1 | 72.4%離線子集 | 15.7%離線子集 | 48.9%離線子集 | 83.9%離線子集 |
| 多學科推理Humanity’s Last Exam | 45.9%不使用工具 | 10.2%不使用工具 | — | 56.9%不使用工具 |
| 57.4%使用工具 | 18.7%使用工具 | — | 64.5%使用工具 | |
| 代理式編碼Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| 代理式編碼FrontierCode 1.1 (Main) | 46.4% | — | 42.4% | 52.1%Xhigh |
| 視覺推理Chartography | 46.4%不使用工具 | 6.4%不使用工具 | 29.1%不使用工具 | 61.6%不使用工具 |
如欲瞭解我們如何進行評測,請參閲Haiku 5.5 System Card。
Haiku 5.5 是我們首個配備可調整推理力度設定的 Haiku 系列模型。這表示與我們其他模型一樣,用戶可以自行選擇優先考慮成本還是智能。以下圖表顯示 Haiku 5.5 在不同推理力度設定下的三項基準測試表現:
OSWorld 2.1 評估代理操作真實電腦以完成長篇、多步驟任務的能力。
在早期測試中,客戶回報的結果與上方所示的效能和成本改善一致。以下是他們對新模型的評價:
引言
「Claude Haiku 5.5 令我們印象深刻,尤其是它的速度。我們使用 AI Teammates(我們的 AI 代理產品)的評測套件對它進行測試,涵蓋錯誤分流、設定專案,以及搜尋大型專案組合以找出高風險或逾期工作等用途。與我們現時使用的模型相比,完成任務的延遲時間減少超過 30%,每個代理回合的推理速度快至 2.5 倍。整體體驗明顯更快。」
公司Asana
作者Aaron Vinh,資深軟件工程師
定價
下表比較 Claude Haiku 5.5 與我們其他模型的定價。Haiku 5.5 用於提示詞長度不超過 100,000 個 token 的任務時,性價比尤其高;這類任務約佔用戶向我們先前 Haiku 模型提出的請求 90%。
| 每 1 百萬個 token 的價格 | Haiku 5.5 提示詞長度不超過/超過 100k | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| 快取讀取 | $0.01 / $0.05 | $0.10 | $0.10 |
| 快取寫入 | $0.125 / $0.625 | $1.25 | $2.50 |
| 輸入 token | $0.10 / $0.50 | $1.00 | $2.00 |
| 輸出 token | $0.50 / $2.50 | $5.00 | $10.00 |
安全性
對齊。 Claude Haiku 5.5 在我們幾乎所有對齊評估中的表現均較 Haiku 4.5 大幅改善。具體而言,我們發現未對齊行為的情況少得多,而且模型配合濫用的意願亦較低。模型的系統卡更詳細介紹了我們的評估流程和結果。
安全防護。與其能力相稱,Haiku 5.5 的網絡安全防護措施比 Haiku 4.5 更嚴格,但比我們為近期其他模型採取的防護措施稍寬鬆。在網絡安全方面,Haiku 5.5 允許執行的防禦性任務範圍較 Sonnet 5.5 的防護措施更廣,但仍會阻止滲透測試及其他較可能被攻擊者使用的技術。
Haiku 5.5 的生物學防護措施與 Sonnet 5、Sonnet 5.5 及 Opus 5 相同。這些措施允許提出生物學研究問題,但會限制模型處理我們判斷為可能造成傷害的請求。從事範圍較廣的生物學和網絡活動的機構,可申請加入我們的生命科學驗證計劃和網絡安全驗證計劃。
供應情況
Claude Haiku 5.5 現已在所有平台提供,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude Platform 上,開發者可透過 claude-haiku-5-5 開始使用。
詳情請參閲我們的遷移指南。
更多更新
除了為 Claude Haiku 5.5 推出新定價外,我們亦會進一步提升模型和產品的性價比。
首先,由今天起,我們會下調 Claude Sonnet 5.5 的快取讀取價格。快取讀取現時價格下調 50%:每百萬個 token 收費 $0.10,而非 $0.20。由於快取讀取佔模型 token 消耗量很大一部分,因此在大部分 Agent 任務中,Sonnet 5.5 的成本可降低約 20%。
例如,以下展示這次減價對 Sonnet 5.5 在 Terminal-Bench 4.0 上的效能與成本關係有何影響:
Terminal-Bench 4.0 評估模型在命令列介面中完成複雜多步驟專業任務的能力。
這張圖表説明 Haiku 5.5 與我們較大型模型之間的一項重要差異。對於 Terminal-Bench 4.0 所測量的複雜 Agent 編碼任務,Sonnet 5.5 和 Opus 5.5 仍是較佳選擇。相比之下,Haiku 5.5 最適合範圍較窄的任務;若使用 Claude 先前版本,這些任務的成本可能高得令人卻步,例如壓縮、摘要或子 Agent 工作。
其次,本週我們會向所有 Max 及 Team 訂戶推出每月新增的 API 額度,可用於 Claude Platform。Max 5x 用戶每月可獲 $100 額度,Max 20x 用戶可獲 $200,而 Team 訂戶最多可獲 $500,由其用戶共用。這些額度旨在讓用戶試驗建立會呼叫我們 API 的工具、應用程式及 Agent。額度可用於我們任何一款模型。更多資訊請參閲説明中心文章。
對開發人員而言,我們亦會更新 Claude Python 和 TypeScript SDK,以在 beta 階段加入對電腦操作及瀏覽器操作的支援。Haiku 5.5 兼具速度、能力和價格優勢,特別適合執行這些任務。你可以在 Claude Platform 文件中閲讀更多相關資訊。
來源:Hacker News 熱門(buzzing.cc 中文翻譯) · anthropic.com