AI Security Institute 評估 Claude Mythos Preview 的網絡安全能力
英國 AI Security Institute 評估 Anthropic 的 Claude Mythos Preview 網絡安全能力,結果顯示其表現較以往前沿模型提升。
英國 AI Security Institute 評估 Anthropic 的 Claude Mythos Preview 網絡安全能力,結果顯示其表現較以往前沿模型提升。
Claude Opus 5.5 針對更長、上下文用量更高的編碼工作階段設計,按 token 計費的典型工作負載估計比 Opus 5 便宜約 40%。輸入及輸出 token 價格下調 20%,讀取快取 token 的價格下調 60%;Claude Code 的快取未命中輸入亦減少逾 50%。文中指出,長而開放的任務較有機會透過減少錯誤方向上的回合降低成本,而簡單、短小的機械式任務所需回合數大致相同。
METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。
MarkTechPost 將 GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1 的基準、價格及存取條件並列,按工作負載整理各自適用情境。
推薦理由:文章將四款模型的基準、價格、存取限制和任務成本並列,呈現不同工作負載下的取捨,説明排行榜名次不足以單獨決定選型。
OpenAI 的 GPT‑6 Astra 在 StarSkirmish《星際爭霸:母巢之戰》賽事中,被揭發直接使用他人開發的 Stardust 機械人程式碼參賽。賽事主辦方 Kai McPheeters 表示,正回退 GPT‑6 Astra 機械人的程式碼並清理受污染部分,之後會讓它繼續參賽;數小時後,他稱修復後的 AI 已能擊敗頂尖級別的參賽機械人。
Artificial Analysis 評測顯示,Claude Opus 5.5 以 max effort 在 Artificial Analysis Intelligence Index 得分 58,為其測得的最高分。
推薦理由:報告將多項基準表現、Agent 知識工作成績與每項任務成本並列,呈現模型在不同 effort 設定下的表現與成本取捨。
Artificial Analysis 的評測顯示,Claude Sonnet 5.5 在 Intelligence Index 取得 56 分,於 max effort 下排名第 2,僅落後 Opus 5.5(max)2 分。
推薦理由:評測把 Claude Sonnet 5.5 的基準表現與每項任務的 token 消耗、成本對照,呈現其接近 Opus 5.5 時的資源代價。
Simon Willison 引述 Anthropic Frontier Red Team 的評估指出,GLM-5.3 在 100 項內部 Binary Exploitation benchmark 任務中,有 4% 試次形成完整控制流程劫持。
Anthropic 推出 Claude Sonnet 5.5,官方稱其運行速度提升 30% 以上,對大多數工作最多便宜 30%。作者表示其定價與 Sonnet 5 相同,並觀察到它在所有基準測試上似乎都勝過 Sonnet 5,在部分編碼任務上接近 Opus 5.5。
Anthropic 發佈 Claude Sonnet 5.5,較 Sonnet 5 快 30%,每 token 價格不變,多數工作成本最多可減 30%。指南詳述 API 用法、從 Sonnet 5 遷移時的行為變更及 effort 調校建議,並指出原生上下文窗口為 1M tokens。
推薦理由:指南整理 Sonnet 5.5 相對 Sonnet 5 的 API 變更與調校方法,涵蓋工具呼叫、thinking 區塊和 effort 設定,可作遷移核對參考。
Claude Sonnet 5.5 已在 Claude API、Claude in Amazon Bedrock、Claude Platform on AWS、Claude on Google Cloud 和 Claude in Microsoft Foundry 上線。
Anthropic 發佈 Claude Opus 5.5,Latent Space 表示將其即時設為 AINews 後續內容的預設模型。Anthropic 表示其多數任務表現接近 Claude Fable 5.1,運行成本較 Opus 5 低 40%;文中補充,這項成本降幅適用於 medium 預設設定,API token 標價則下調 20%。
推薦理由:報道並列 Claude Opus 5.5 與 GPT-6 Sol、GPT-6 Luna 的能力主張和價格變化,也區分 token 標價降幅與每任務成本,呈現不同降價口徑。
Epoch AI 的 ECI 比較顯示,GPT-6 Astra 在數學基準測試領先,但未在軟件工程領先。比較涵蓋 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3,並以數學及軟件工程專項 ECI 評估模型能力;專項分數可與一般 ECI 比較。