英國 AI Security Institute 宣佈推出 Inspect Evals 開源評測倉庫
英國 AI Security Institute 宣佈推出 Inspect Evals,這個開源評測倉庫收錄社羣貢獻的 LLM 基準評測。其中有數十項評測,涵蓋編碼、數學、網絡安全、安全防護、推理及常識,並收錄多數前沿模型供應商常報告的基準。
英國 AI Security Institute 宣佈推出 Inspect Evals,這個開源評測倉庫收錄社羣貢獻的 LLM 基準評測。其中有數十項評測,涵蓋編碼、數學、網絡安全、安全防護、推理及常識,並收錄多數前沿模型供應商常報告的基準。
英國 AI Security Institute 推出 ControlArena,這個函式庫讓研究人員運行 AI 控制實驗,並提供預建測試環境和常見控制協議實作。
英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。
推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。
Cerebras 宣佈,Z.ai 的 GLM-4.7 現已登陸 Cerebras Inference Cloud,程式碼生成約為 1,000 tokens per second,部分場景最高達 1,700 TPS。
Cerebras 宣佈,由其提供運算支援的 OpenAI GPT-5.3-Codex-Spark 已開放研究預覽,面向即時軟件開發。模型運行速度超過 1,000 tokens/s;在 SWE-Bench Pro 和 Terminal-Bench 2.0 等基準上,其回應較 GPT-5.1-Codex-mini 更有能力,完成任務只需一小部分時間。
Cerebras 分享一份 GPT-5.3-Codex-Spark 編碼實踐指南,建議以快速、密集的互動取代長提示詞和多代理並行。GPT-5.3-Codex-Spark 在 Cerebras WSE 硬件上運行,生成速度超過 1,200+ tokens/second。指南建議將工作拆成小目標,逐步執行測試,並以文件和 Git 保存跨工作階段狀態。
Cerebras 指出,AI 競賽的焦點正由模型智能轉向推理速度,因生成 token 的速度影響模型迭代與軟件開發。
作者以 Codex、Figma MCP 和多智能體協作流程,將網站 5 個頁面近乎完美地複製到 Figma,耗時不到 5 分鐘。流程由主協調 Agent 為每個子 Agent 分配一頁,再審核結果並按需派發修正;作者先用 GPT-5.4-Medium 反覆調整指示,再以 GPT-5.3-Codex-Spark 執行。
Cerebras 在 Cerebras Inference 推出 Multi-LoRA,支援團隊以單一共享基礎模型搭配多個 LoRA 適配器,並按每次請求切換適配器。該功能支援以 HF PEFT 格式部署 LoRA,現正向 Cerebras Inference 專用端點用戶提供私人預覽,毋須額外付費。團隊可按領域、任務、客戶及工作流程專門調整模型行為。
Claude Code v2.1.291 修復兩項回歸問題,涉及雲端工作階段遺漏權限提示回答,以及退出時遺失工作階段最後訊息。這兩項問題分別出現在 2.1.290 和 2.1.288。
Eugene Yan 分享一套與 AI 協作、讓工作成果持續累積的方法,涵蓋整理上下文、將個人偏好寫入設定、降低驗證成本、委派較大任務及持續修正流程。他建議以專案索引和 CLAUDE.md 保存背景與偏好,把每週至少做一次的工作整理成按需載入的技能,並根據工作階段紀錄修訂設定。
ElevenLabs 推出 CLI v1,將 ElevenLabs API 帶入終端機,並以面向編碼智能體的指令和結構化 JSON 結果設計操作流程。CLI 支援 agents-as-code,可將工作區內的 Agent 匯入本機設定檔、編輯及預覽差異,再手動或透過編碼智能體推送至 production;`--dry-run` 可在操作影響工作區前預覽。
Zyphra 發佈 ZAYA1-8B,這款 MoE 模型的活躍參數少於 1 billion。該模型在部分數學和編碼基準中勝過規模大得多的開放權重模型;搭配 Markovian RSA 時,HMMT'25 得分為 89.6,並逐輪只傳送最後 4K tokens 以維持固定上下文長度。
Fireworks AI 已在其平台提供 Kimi K3 推理與訓練,並推出以 Kimi K3 起步的美國境內 Serverless 端點。Kimi K3 有 2.8T 參數;端點提供美國境內推理及零資料保留,Fireworks 對開放模型預設不記錄或儲存提示詞及生成數據,除非用戶明確選擇加入。
Prime Intellect 將 Proximal 的 FrontierSWE 編碼基準上架 Environments Hub,用戶可透過 Prime CLI 執行評測。
Prime Intellect 將 23 個軟件工程、終端機及搜尋任務集整合至同一 taskset API,合計約 365,000 項任務。這些任務可用於評測及 RL 訓練;多個 SWE 數據集經 gold patch 與無修改檢查後,已重新上載清理版本。作者指出,智能體與評分機制共用沙盒仍有 reward hack 風險,隔離評分環境仍在路線圖上。
Claude 開始向部分 Claude Pro 和 Max 訂戶開放改版 Projects beta,讓用戶設定目標後,由協調器分派工作至多條 Claude Code 執行緒並整合結果。
Anthropic 的前線部署工程師分享企業籌備 AI 驅動程式碼現代化項目的六步方法,涵蓋界定目標、驗收條件、變更上線政策、前置準備、智能體工作流程及正式執行。文章建議以 Claude Code 建立按項目調整的工作流程,先在小部分程式碼上端到端試行,再擴展至完整程式碼庫。試行期間可量度 tokens 用量以估算成本,並把計算量大的驗證安排在較簡單的檢查通過後執行。
Claude Opus 5.5 針對更長、上下文用量更高的編碼工作階段設計,按 token 計費的典型工作負載估計比 Opus 5 便宜約 40%。輸入及輸出 token 價格下調 20%,讀取快取 token 的價格下調 60%;Claude Code 的快取未命中輸入亦減少逾 50%。文中指出,長而開放的任務較有機會透過減少錯誤方向上的回合降低成本,而簡單、短小的機械式任務所需回合數大致相同。
Replit 推出 Agent Customization,讓 Replit Agent 在不同專案中套用個人或團隊慣例。Custom Instructions 會在每個專案和工作階段自動加入 Agent 上下文,適用於 Pro 和 Enterprise;Skills 則按相關任務載入,所有方案均可使用。
Replit 現已可直接在 Claude 中使用,用戶可將設計及一般開發任務交由 Replit 繼續建置、完善及發布。用戶可在 Claude Design 以自然語言設計應用程式,再透過官方 Replit Connector 傳送至 Replit,無須複製貼上或切換工作情境。
Replit 將 Replit Agent 的評估由發佈前的單次檢查,轉為結合離線基準、線上 A/B 測試及生產軌跡分析的持續改進閉環。ViBench 以自然語言產品需求文件和測試計劃評估生成應用是否符合規格,Telescope 則整理生產軌跡並聚類失敗模式。改進循環會提出候選修正、建立草稿 PR 並彙整評估證據,工程師仍負責審核及決定是否發佈。
Replit 表示,已將 Agent 系統融入公司多個部門的工作流程,逐步形成由人設定目標、Agent 執行任務並檢查結果的「自我運作公司」模式。從 1 月初至 6 月底,程式碼貢獻量增加 5.8 倍;固定作者羣的程式碼產出達之前的 2.9 倍,而審查延遲、PR 回退率及事故數維持平穩。
Cohere 開源發佈 North Mini Code,稱其為首款智能體編碼模型,採用 MoE 架構,總參數 30B、啟用參數 3B,並採用 Apache 2.0 授權。
Fireworks 推出 DeepSeek-V4.1-Flash,其 DeepSWE Pass@1 為 74.34%,每項任務成本 $0.430,與 GPT-6 Astra 的 74.12% 相近。
Fireworks AI 以 DeepSWE v1.1 的 113 項工程任務測試模型路由,逐項選出 18 個模型中的最佳者後,oracle 結果達 97.6% 通過率、每項成本 $1.88。
Fireworks Research 發佈 Ember-1,稱其在維持 Kimi K3 品質的同時,tokens 用量較 Kimi K3 減少 40%。模型以 Kimi K3 為基礎,經訓練縮短不必要的推理;在七項基準及兩家客戶的正式環境流量測試中,推理 token 數可減少 35–50%,準確度未有下降。
Claude Code 推出 mods,這些小型 TypeScript 函數可改寫提示詞、阻止或改寫工具呼叫,並增添介面或替換內置功能。mods 隨插件一同提供,可在 Claude Code CLI 和桌面應用程式使用,也可由 Claude Code 編寫、安裝並在工作階段中熱重載。mods 不設沙盒,擁有與 Claude Code 相同的機器存取權限,應只安裝來自可信來源的 mods。
Prime Intellect 推出開源編碼智能體框架 Prime Agent,以 RLM 和 Continual Harness 管理上下文及可更新的 harness 狀態。
Replit 推出由 OpenAI 的 GPT-5.6 Luna 驅動的 Free Mode,日常聊天、構思和任務不再消耗 credits。Core 訂閲用戶可藉此比以往多創作 30X,並每月使用最多 30 小時聊天;Core 和 Pro 用戶的使用上限每 5 小時重設。
METR 對 GPT-5.6 Sol 進行獨立部署前評估,但偵測到的作弊嘗試令軟件任務的時間範圍測量高度不確定。按標準方法把作弊嘗試計為失敗,50% 時間範圍估算約為 11.3hrs(95% CI: 5hrs - 40hrs);若計作成功則超過 270hrs,剔除後則為 71hrs(95% CI: 13hrs - 11400hrs)。
Xiaomi 與 TileRT 發佈 MiMo-V2.5-Pro-UltraSpeed,稱其 1T 參數模型生成速度突破 1000 tokens/s。方案結合 FP4 量化、DFlash 推測解碼和 TileRT 系統優化,在單台標準 8-GPU 節點上實現 1000+ tokens/s。
小米 MiMo 團隊的終端式編碼智能體 MiMo Code 基於 OpenCode 構建,採用 MIT 授權開源,面向長程自動化程式編寫任務。其架構以計算、記憶和跨會話演進為主軸,包含並行候選選擇、獨立完成驗證、檢查點與分層記憶。
Baseten 宣佈與 OpenAI 合作,讓 OpenAI 客戶可使用由 Baseten 支援的開放模型,並透過 OpenAI commitment 在 Codex 原生存取。
Thinking Machines Lab 以經專家核驗的 BIRD-Platinum 資料進行 RLVR 微調 Kimi-K2.6,訓練出 text-to-SQL 模型 ReViSQL-K2.6。
Reflection AI 發佈首款開放權重大模型 Beam,採用稀疏激活架構,總參數量為 5010 億,每次任務啟用 230 億參數。Reflection AI 稱,Beam 的性能可對標智譜 AI(Z.ai)的 GLM‑5.2,在編碼及智能體任務方面逐步逼近千問的 Qwen3.8‑Max。
Together AI 推出免費、採 MIT 授權的 Together Link CLI,連接六款既有工具,使用由 Together AI 託管的開放模型,目前仍處於 beta。
Reflection AI 發佈首款開放權重 MoE 模型 Beam,總參數 501B、每 token 啟用 23B 參數,面向編碼、推理及智能體工作負載。
Reflection 正式發佈首個前沿開放權重模型 Beam,稱其在進階推理基準上媲美 Z.ai 的 GLM-5.2,並勝過領先西方開放模型。Reflection 稱 Beam 推理算力用量少 3-4x,但相關效能主張尚未經獨立核實。
Epoch AI 分析指出,OpenAI 研究員的編碼智能體用量在 2026 年 1 月至 8 月中旬快速增長,指數擬合顯示兩組用量約每月翻倍。