英國 AI Security Institute 評估 OpenAI GPT-5.5 的網絡安全能力
英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。
推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。
英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。
推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。
Cerebras 宣佈,Z.ai 的 GLM-4.7 現已登陸 Cerebras Inference Cloud,程式碼生成約為 1,000 tokens per second,部分場景最高達 1,700 TPS。
Cerebras 宣佈,由其提供運算支援的 OpenAI GPT-5.3-Codex-Spark 已開放研究預覽,面向即時軟件開發。模型運行速度超過 1,000 tokens/s;在 SWE-Bench Pro 和 Terminal-Bench 2.0 等基準上,其回應較 GPT-5.1-Codex-mini 更有能力,完成任務只需一小部分時間。
Zyphra 發佈 ZAYA1-8B,這款 MoE 模型的活躍參數少於 1 billion。該模型在部分數學和編碼基準中勝過規模大得多的開放權重模型;搭配 Markovian RSA 時,HMMT'25 得分為 89.6,並逐輪只傳送最後 4K tokens 以維持固定上下文長度。
Claude Opus 5.5 針對更長、上下文用量更高的編碼工作階段設計,按 token 計費的典型工作負載估計比 Opus 5 便宜約 40%。輸入及輸出 token 價格下調 20%,讀取快取 token 的價格下調 60%;Claude Code 的快取未命中輸入亦減少逾 50%。文中指出,長而開放的任務較有機會透過減少錯誤方向上的回合降低成本,而簡單、短小的機械式任務所需回合數大致相同。
Cohere 開源發佈 North Mini Code,稱其為首款智能體編碼模型,採用 MoE 架構,總參數 30B、啟用參數 3B,並採用 Apache 2.0 授權。
Fireworks 推出 DeepSeek-V4.1-Flash,其 DeepSWE Pass@1 為 74.34%,每項任務成本 $0.430,與 GPT-6 Astra 的 74.12% 相近。
Fireworks Research 發佈 Ember-1,稱其在維持 Kimi K3 品質的同時,tokens 用量較 Kimi K3 減少 40%。模型以 Kimi K3 為基礎,經訓練縮短不必要的推理;在七項基準及兩家客戶的正式環境流量測試中,推理 token 數可減少 35–50%,準確度未有下降。
Xiaomi 與 TileRT 發佈 MiMo-V2.5-Pro-UltraSpeed,稱其 1T 參數模型生成速度突破 1000 tokens/s。方案結合 FP4 量化、DFlash 推測解碼和 TileRT 系統優化,在單台標準 8-GPU 節點上實現 1000+ tokens/s。
Reflection AI 發佈首款開放權重大模型 Beam,採用稀疏激活架構,總參數量為 5010 億,每次任務啟用 230 億參數。Reflection AI 稱,Beam 的性能可對標智譜 AI(Z.ai)的 GLM‑5.2,在編碼及智能體任務方面逐步逼近千問的 Qwen3.8‑Max。
Reflection AI 發佈首款開放權重 MoE 模型 Beam,總參數 501B、每 token 啟用 23B 參數,面向編碼、推理及智能體工作負載。
Reflection 正式發佈首個前沿開放權重模型 Beam,稱其在進階推理基準上媲美 Z.ai 的 GLM-5.2,並勝過領先西方開放模型。Reflection 稱 Beam 推理算力用量少 3-4x,但相關效能主張尚未經獨立核實。
MarkTechPost 將 GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1 的基準、價格及存取條件並列,按工作負載整理各自適用情境。
推薦理由:文章將四款模型的基準、價格、存取限制和任務成本並列,呈現不同工作負載下的取捨,説明排行榜名次不足以單獨決定選型。
MiniMax 正式開源並推出面向智能體與編碼的 MiniMax M2,同時在中國推出 M2 驅動的 MiniMax Agent,並升級海外版本。
推薦理由:MiniMax M2 公佈 Artificial Analysis 10 項測試成績、API 定價與約 100 TPS 推理速度,並開放權重,呈現智能體模型在表現、速度與部署成本間的取捨。
MiniMax 發佈 M2.1,着重提升多語言編程、Web 和 App 開發,以及真實複雜任務中的可用性。M2.1 在 VIBE 基準五個子集的平均得分為 88.6,並在多語言場景超越 Claude Sonnet 4.5、接近 Claude Opus 4.5。
MiniMax 發佈 M2.5 與 M2.5-Lightning,稱兩款模型在編碼、智能體工具調用、搜索及辦公任務達到 SOTA,M2.5 在 SWE-Bench Verified 得分 80.2%。
推薦理由:文中並列 SWE-Bench Verified 成績、不同腳手架的評測結果、執行時間與定價,方便比較 M2.5 的編碼表現和使用成本。
Microsoft 發佈 MAI-Code-1-Flash,並稱其在同一 production harness 下的 4 項核心編碼評測中均勝過 Claude Haiku 4.5。
Microsoft 在 Build 2026 的 MAI 主題演講中宣佈推出七款涵蓋圖像、語音、轉錄、推理及編碼的新模型。
推薦理由:演講將模型基準、產品整合和權重調校渠道並列,呈現 Microsoft 從模型發布延伸至企業定製的產品路徑。
Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。
推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。
MiniMax 正式發佈 M3,這款開放權重模型整合編碼與智能體能力、最高 1M tokens 上下文,以及原生圖像和影片輸入與桌面操作能力。M3 採用 MiniMax Sparse Attention(MSA),在上下文長度達 1M tokens 時,每 token 計算量為上一代的 1/20,prefilling 提速逾 9×、decoding 提速逾 15×。
Artificial Analysis 的評測指出,GPT-6 Sol 和 Luna 定價約為 GPT-5.6 的一半,Intelligence Index 分數大致持平。
推薦理由:文章並列價格、單項任務成本與多項基準結果,呈現降本幅度與不同能力變化並不一致,並指出 GDPval-AA v2.1 的回退與交付內容縮短相關。
GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,其 Intelligence Index 比 GPT-6 Astra 低 1 分,最高 effort 下的每項 Intelligence Index 任務成本不到後者四分之一。
推薦理由:這篇評測以同一框架對照 GPT-6.1 Sol、GPT-6 Sol 和 GPT-6 Astra 的 Intelligence Index 分數與單項任務成本,為比較新版本接近 Astra 分數時的成本取捨提供具體依據。
Microsoft 發佈 MAI-Code-1.1-Flash,稱其相較 6 月在 Microsoft Build 推出的 1.0,價格降至四分之一,完成任務所用 tokens 減少 25%。
Microsoft AI 發佈 MAI-Thinking-1,一款 35B-active、~1T-total parameters 的 sparse Mixture of Experts 推理模型。
Microsoft 介紹整合於 MDASH 的 MAI-Cyber-1-Flash,稱其可處理最多 90% 的任務,並讓 GPT-5.4 應對最難的 10%。Microsoft 稱,這種多模型配置較 MDASH 現有最佳方案(GPT 5.4 + 5.4 mini + 5.3 codex)節省 50% 成本。
Google 發佈 Gemini 4 Argon,稱其為迄今最強模型,並表示它適用於編碼、研究、寫作等工作,尤其面向防禦性網絡安全。該模型專為防禦性網絡安全工作訓練,Google 稱它可自主發現、驗證並修補關鍵軟件漏洞;目前僅透過 Fairwind Program 向部分網絡安全合作夥伴推出。
Google DeepMind 推出 Gemini 4 Argon,面向編碼、企業知識工作及網絡安全防禦,支援最高 1M output tokens。
Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。
推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。
OpenAI 發佈 GPT-6.1 Sol,稱其面向編碼、電腦操作及專業工作,智能水平接近 Astra。其 API 輸入及輸出 token 價格均為 Astra 標準 API 對應價格的五分之一。
推薦理由:公告把 GPT-6.1 Sol 的工作場景定位與 Astra 標準 API 輸入、輸出 token 價格作比較,便於瞭解其能力主張與定價定位。
Anthropic 推出 Claude Sonnet 5.5,官方稱其運行速度提升 30% 以上,對大多數工作最多便宜 30%。作者表示其定價與 Sonnet 5 相同,並觀察到它在所有基準測試上似乎都勝過 Sonnet 5,在部分編碼任務上接近 Opus 5.5。
Anthropic 發佈 Claude Sonnet 5.5,較 Sonnet 5 快 30%,每 token 價格不變,多數工作成本最多可減 30%。指南詳述 API 用法、從 Sonnet 5 遷移時的行為變更及 effort 調校建議,並指出原生上下文窗口為 1M tokens。
推薦理由:指南整理 Sonnet 5.5 相對 Sonnet 5 的 API 變更與調校方法,涵蓋工具呼叫、thinking 區塊和 effort 設定,可作遷移核對參考。
xAI 發佈 Grok 4.7,現已可在 Cursor、Grok Build、Grok API、第三方編碼 harness、模型路由器及雲平台使用,面向編碼與知識工作。
Epoch AI 的 ECI 比較顯示,GPT-6 Astra 在數學基準測試領先,但未在軟件工程領先。比較涵蓋 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3,並以數學及軟件工程專項 ECI 評估模型能力;專項分數可與一般 ECI 比較。
OpenAI 推出 GPT-6 Astra,稱其為迄今最智能、最符合對齊要求的模型。OpenAI 表示,模型在電腦操作、編碼、網絡安全及科學領域具備最先進能力。
OpenAI 的 GPT-6 Astra 系統卡公佈模型安全與能力評估,將其生物與化學能力列為 High,並指出尚未達到 Critical。明確要求模型規避監測時,Astra 在 WMDP 的 CoT 監測召回率低於 11%,GPT-5.6 Sol 則接近 100%;在 Monorepo-Bench 中,Astra 的召回率降至零。
Google DeepMind 發佈 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber,並稱 Gemini 3.8 Flash 是其迄今推理與編碼能力最強的模型,速度和成本與 3.7 Flash 相同。
推薦理由:兩款模型共享基礎智能,普通版面向長程編碼與智能體任務,Cyber 版則限可信防守者使用,提供漏洞發現與修補能力。
IBM 發佈 Granite 4.2 語言模型,提供 3B、8B 和 30B 參數版本,並加入原生逐步推理與工具調用能力,面向企業智能體工作流程。模型基於 Granite 4.0 foundation models,採多階段強化學習;8B 和 30B 版本另經 agentic RL,並以 1 trillion tokens 的合成程式碼訓練,採 Apache 2.0 授權。
Google DeepMind 發佈 Gemini 3.7 Flash,稱其在編碼、知識工作及網頁開發工作流上較 Gemini 3.6 Flash 有所提升。
推薦理由:文章列出 Gemini 3.7 Flash 在編碼、網頁開發和複雜文件基準上的對比數據,並交代入門價格,便於衡量效能與成本取捨。
Cursor 與 SpaceXAI 共同發佈 Grok 4.6,該模型基於 Grok 4.5,重點面向長時間運行的智能體及更複雜的互動和視覺工作。它在多項智能體編程和知識工作基準測試中展現前沿智能水平,並在由九項基準測試構成的 Artificial Analysis Intelligence Index 上與 GPT-5.6 Sol 持平。
Google DeepMind 發佈 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,涵蓋智能體工作流、低延遲高吞吐任務及網絡安全場景。
推薦理由:文章列出 3.6 Flash 與 3.5 Flash-Lite 的速度及成本指標,並説明 Cyber 模型將透過有限試點提供,呈現不同工作負載的部署差異。