英國 AI Security Institute 評估 OpenAI GPT-5.5 的網絡安全能力
英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。
推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。
讓模型自主規劃、調用工具、完成多步任務的技術方向——從 Claude Code、Manus 到各家 Agent 框架與評測基準的全部動態。
英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。
推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。
MarkTechPost 將 GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1 的基準、價格及存取條件並列,按工作負載整理各自適用情境。
推薦理由:文章將四款模型的基準、價格、存取限制和任務成本並列,呈現不同工作負載下的取捨,説明排行榜名次不足以單獨決定選型。
OpenAI 整理 Realtime API 與 gpt-realtime 語音對語音模型進入 GA 後的介面變更、新功能及整合注意事項。文章建議客户遷移至 GA 介面,並説明 beta 與 GA 在功能支援、temperature 和非同步函式呼叫上的差異。
推薦理由:文章對照 beta 與 GA 的功能支援差異,並説明介面遷移、temperature 設定及長對話截斷的處理方式,方便開發者按整合環節核對需要調整的設定。
OpenAI 分享以 Skills、託管 shell 和服務端 compaction 構建長時間運行智能體的實作模式,涵蓋技能路由、容器復用與網絡配置。Glean 面向 Salesforce 的 skill 將評測準確率由 73% 提升至 85%,並令 time-to-first-token 縮短 18.1%。
推薦理由:文章將 Skills、shell 與服務端 compaction 的分工整理成長流程建構方法,並涵蓋技能路由、產物交接及網絡隔離等可複用設計。
MiniMax 正式開源並推出面向智能體與編碼的 MiniMax M2,同時在中國推出 M2 驅動的 MiniMax Agent,並升級海外版本。
推薦理由:MiniMax M2 公佈 Artificial Analysis 10 項測試成績、API 定價與約 100 TPS 推理速度,並開放權重,呈現智能體模型在表現、速度與部署成本間的取捨。
MiniMax 發佈 M2.5 與 M2.5-Lightning,稱兩款模型在編碼、智能體工具調用、搜索及辦公任務達到 SOTA,M2.5 在 SWE-Bench Verified 得分 80.2%。
推薦理由:文中並列 SWE-Bench Verified 成績、不同腳手架的評測結果、執行時間與定價,方便比較 M2.5 的編碼表現和使用成本。
Microsoft 在 Build 2026 的 MAI 主題演講中宣佈推出七款涵蓋圖像、語音、轉錄、推理及編碼的新模型。
推薦理由:演講將模型基準、產品整合和權重調校渠道並列,呈現 Microsoft 從模型發布延伸至企業定製的產品路徑。
Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。
推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。
Anthropic Institute 指出,AI 已加速 AI 系統研發,但尚未能完全自主設計並開發自身後繼系統,遞迴式自我改進亦非必然。截至 2026 年 5 月,合併至 Anthropic 程式碼庫的程式碼逾 80% 由 Claude 撰寫;2026 年第二季,典型工程師每日合併的程式碼量為 2024 年的 8×。
推薦理由:這篇分析將公開基準與 Anthropic 內部數據並置,呈現 AI 執行工程與研究任務的進展,以及自主選擇研究方向仍存的能力差距。
Artificial Analysis 評測顯示,Claude Opus 5.5 以 max effort 在 Artificial Analysis Intelligence Index 得分 58,為其測得的最高分。
推薦理由:報告將多項基準表現、Agent 知識工作成績與每項任務成本並列,呈現模型在不同 effort 設定下的表現與成本取捨。
Artificial Analysis 的評測顯示,Claude Sonnet 5.5 在 Intelligence Index 取得 56 分,於 max effort 下排名第 2,僅落後 Opus 5.5(max)2 分。
推薦理由:評測把 Claude Sonnet 5.5 的基準表現與每項任務的 token 消耗、成本對照,呈現其接近 Opus 5.5 時的資源代價。
GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,其 Intelligence Index 比 GPT-6 Astra 低 1 分,最高 effort 下的每項 Intelligence Index 任務成本不到後者四分之一。
推薦理由:這篇評測以同一框架對照 GPT-6.1 Sol、GPT-6 Sol 和 GPT-6 Astra 的 Intelligence Index 分數與單項任務成本,為比較新版本接近 Astra 分數時的成本取捨提供具體依據。
Google DeepMind 的 Gemini 4 Argon(高推理設定)在 Artificial Analysis Intelligence Index 得分 53,與 GPT-6 Astra(max)持平。
推薦理由:文章對照 Gemini 4 Argon 與 GPT-6 Astra 的指數分數、任務成本和智能體評測,呈現相近總分下的成本差距及不同基準表現。
AWS 介紹並部署 Adjudicated Query 模式,讓 Amazon Quick 的自然語言合規查詢透過固定 MCP 操作交由確定性規則引擎判定,而非由模型作出決策。
推薦理由:文章把自然語言查詢與合規判定分開,並以完整性收據和逐筆證據鏈展示如何核對大量檢查結果。
Amazon Bedrock AgentCore 的參考實作把 Amazon S3 上傳或排程事件轉成智能體工作,並讓智能體在需要澄清、審批或覆核時暫停等待人員回應。
推薦理由:文章把事件來源、AgentCore 執行與人在迴路處理串成參考架構,並清楚區分樣本內建能力與需自行擴展的訊號來源。
Johann Rehberger 揭示 SQL Server Management Studio(SSMS)中的 SQL Copilot 存在 CVE-2026-65669,攻擊者可繞過唯讀限制,令任意 T/SQL 以受害者的資料庫連線權限執行。
推薦理由:文章拆解間接提示詞注入如何串連唯讀限制繞過與資料庫權限提升,並指出唯讀約束應由權限機制落實。
Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。
推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。
CoreWeave 宣佈在 CoreWeave Cloud 提供 NVIDIA Vera Rubin NVL72,並推出 CoreWeave Forge,推進智能體 AI 從訓練到生產的部署。
推薦理由:文章披露 Cognition 對 Vera Rubin NVL72 與 GB200 NVL72 的 SWE-2 推理測試,列出最高 4.8x 的總 token 吞吐提升,讓兩種平台在智能體編碼工作負載下可作量化比較。
GPT-6.1 Sol 已在 Amazon Bedrock 正式開放使用,面向智能體編碼、電腦操作及專業工作負載。OpenAI 表示,GPT-6.1 Sol 在 DeepSWE v1.1 上匹配 GPT-6 Astra,單項任務成本約為 GPT-6 Astra 的五分之一;其分數亦比 GPT-6 Sol 的最佳結果高 6.4 個百分點,且所用推理力度較低。
推薦理由:文章列出 GPT-6.1 Sol 在 DeepSWE v1.1 上與 GPT-6 Astra 的任務成本對照,並比較其對 GPT-6 Sol 的分數提升。
OpenAI 在 DevDay 2026 發佈 GPT-6.1 Sol、Dots 智能體及多項開發者工具與功能。GPT-6.1 Sol 主打接近 Astra 的智能水平,價格為 Astra 的五分之一;Ultrafast 最高達 300 tokens/second,速度快 8x,先支援 Astra 6。
推薦理由:現場紀錄同時追蹤產品宣佈、示範失誤與後續功能場次,讀者可從發佈內容和實際操作兩方面瞭解 OpenAI DevDay 的產品進展。