跳到正文
Hacker News 熱門(buzzing.cc 中文翻譯)·· 2 小時前精選AI 評分77

Anthropic 發佈 Claude Haiku 5.5,平均運行成本較 Haiku 4.5 低約 75%

克劳德·俳句 5.5

AI 導讀

Anthropic 發佈 Claude Haiku 5.5,稱其為迄今推出的最便宜、最快且能力最強的小型模型,平均運行成本較 Haiku 4.5 低約 75%。

推薦理由

文章對照 Haiku 5.5 的低成本定位與 Sonnet 5.5、Opus 5.5 在複雜 Agent 編碼任務上的優勢,呈現不同工作負載下的模型取捨。

正文 · 繁體中文

隆重介紹 Claude Haiku 5.5:我們迄今推出價格最低、速度最快、能力最強的小型模型。

Claude Haiku 5.5 專為高用量、注重成本的任務而設。它能可靠地處理快速而重複的工作(例如摘要、上下文壓縮、資料庫查詢和分類要求)。在程式編寫工作中,它也能與 Opus 5.5 和 Sonnet 5.5 配合,擔任子代理。此外,它亦是我們至今速度最快的模型,因此特別適合對速度有要求的任務,例如即時客戶支援和瀏覽器操作。¹

Haiku 5.5 的價格遠低於 Haiku 4.5,平均運行成本現降低約 75%。²

配合此次推出,我們亦提升了整個模型系列的性價比。我們將 Claude Sonnet 5.5 的快取讀取價格減半,令 Sonnet 5.5 在大部分代理式工作中的運行成本降低約 20%。此外,我們為 Claude Max 和 Team 訂閲用戶推出每月 API 額度,協助用戶建立在 Claude Platform 上運行的新代理和應用程式。

效能

以下是 Claude Haiku 5.5 在多項基準測試中的表現:

Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5供參考
知識工作GDPval-AA v2.1162073514371840
知識工作AA-Briefcase v1.1157861413361824
電腦操作OSWorld 2.172.4%離線子集15.7%離線子集48.9%離線子集83.9%離線子集
多學科推理Humanity’s Last Exam45.9%不使用工具10.2%不使用工具—56.9%不使用工具
57.4%使用工具18.7%使用工具—64.5%使用工具
代理式編碼Terminal-Bench 4.039.2%0.0%16.4%70.6%
代理式編碼FrontierCode 1.1 (Main)46.4%—42.4%52.1%Xhigh
視覺推理Chartography46.4%不使用工具6.4%不使用工具29.1%不使用工具61.6%不使用工具

如欲瞭解我們如何進行評測,請參閲Haiku 5.5 System Card。

Haiku 5.5 是我們首個配備可調整推理力度設定的 Haiku 系列模型。這表示與我們其他模型一樣,用戶可以自行選擇優先考慮成本還是智能。以下圖表顯示 Haiku 5.5 在不同推理力度設定下的三項基準測試表現:

OSWorld 2.1(離線子集)準確度與成本

OSWorld 2.1 評估代理操作真實電腦以完成長篇、多步驟任務的能力。

在早期測試中,客戶回報的結果與上方所示的效能和成本改善一致。以下是他們對新模型的評價:

引言

「Claude Haiku 5.5 令我們印象深刻,尤其是它的速度。我們使用 AI Teammates(我們的 AI 代理產品)的評測套件對它進行測試,涵蓋錯誤分流、設定專案,以及搜尋大型專案組合以找出高風險或逾期工作等用途。與我們現時使用的模型相比,完成任務的延遲時間減少超過 30%,每個代理回合的推理速度快至 2.5 倍。整體體驗明顯更快。」

公司Asana

作者Aaron Vinh,資深軟件工程師

定價

下表比較 Claude Haiku 5.5 與我們其他模型的定價。Haiku 5.5 用於提示詞長度不超過 100,000 個 token 的任務時,性價比尤其高;這類任務約佔用戶向我們先前 Haiku 模型提出的請求 90%。

每 1 百萬個 token 的價格Haiku 5.5
提示詞長度不超過/超過 100k
Haiku 4.5Sonnet 5.5
快取讀取$0.01 / $0.05$0.10$0.10
快取寫入$0.125 / $0.625$1.25$2.50
輸入 token$0.10 / $0.50$1.00$2.00
輸出 token$0.50 / $2.50$5.00$10.00

安全性

對齊。 Claude Haiku 5.5 在我們幾乎所有對齊評估中的表現均較 Haiku 4.5 大幅改善。具體而言,我們發現未對齊行為的情況少得多,而且模型配合濫用的意願亦較低。模型的系統卡更詳細介紹了我們的評估流程和結果。

安全防護。與其能力相稱,Haiku 5.5 的網絡安全防護措施比 Haiku 4.5 更嚴格,但比我們為近期其他模型採取的防護措施稍寬鬆。在網絡安全方面,Haiku 5.5 允許執行的防禦性任務範圍較 Sonnet 5.5 的防護措施更廣,但仍會阻止滲透測試及其他較可能被攻擊者使用的技術。

Haiku 5.5 的生物學防護措施與 Sonnet 5、Sonnet 5.5 及 Opus 5 相同。這些措施允許提出生物學研究問題,但會限制模型處理我們判斷為可能造成傷害的請求。從事範圍較廣的生物學和網絡活動的機構,可申請加入我們的生命科學驗證計劃和網絡安全驗證計劃。

供應情況

Claude Haiku 5.5 現已在所有平台提供,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude Platform 上,開發者可透過 claude-haiku-5-5 開始使用。

詳情請參閲我們的遷移指南。

更多更新

除了為 Claude Haiku 5.5 推出新定價外,我們亦會進一步提升模型和產品的性價比。

首先,由今天起,我們會下調 Claude Sonnet 5.5 的快取讀取價格。快取讀取現時價格下調 50%:每百萬個 token 收費 $0.10,而非 $0.20。由於快取讀取佔模型 token 消耗量很大一部分,因此在大部分 Agent 任務中,Sonnet 5.5 的成本可降低約 20%。

例如,以下展示這次減價對 Sonnet 5.5 在 Terminal-Bench 4.0 上的效能與成本關係有何影響:

Terminal-Bench 4.0準確度與成本

Terminal-Bench 4.0 評估模型在命令列介面中完成複雜多步驟專業任務的能力。

這張圖表説明 Haiku 5.5 與我們較大型模型之間的一項重要差異。對於 Terminal-Bench 4.0 所測量的複雜 Agent 編碼任務,Sonnet 5.5 和 Opus 5.5 仍是較佳選擇。相比之下,Haiku 5.5 最適合範圍較窄的任務;若使用 Claude 先前版本,這些任務的成本可能高得令人卻步,例如壓縮、摘要或子 Agent 工作。

其次,本週我們會向所有 Max 及 Team 訂戶推出每月新增的 API 額度,可用於 Claude Platform。Max 5x 用戶每月可獲 $100 額度,Max 20x 用戶可獲 $200,而 Team 訂戶最多可獲 $500,由其用戶共用。這些額度旨在讓用戶試驗建立會呼叫我們 API 的工具、應用程式及 Agent。額度可用於我們任何一款模型。更多資訊請參閲説明中心文章。

對開發人員而言,我們亦會更新 Claude Python 和 TypeScript SDK,以在 beta 階段加入對電腦操作及瀏覽器操作的支援。Haiku 5.5 兼具速度、能力和價格優勢,特別適合執行這些任務。你可以在 Claude Platform 文件中閲讀更多相關資訊。

來源:Hacker News 熱門(buzzing.cc 中文翻譯) · anthropic.com