英國 AI Security Institute 評估 OpenAI GPT-5.5 的網絡安全能力
英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。
推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。
英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。
推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。
G42 旗下 Inception、MBZUAI 基礎模型研究所與 Cerebras Systems 推出 Jais 2 阿拉伯語大型語言模型系列,包含 8B 和 70B 型號。
Cerebras 宣佈,Z.ai 的 GLM-4.7 現已登陸 Cerebras Inference Cloud,程式碼生成約為 1,000 tokens per second,部分場景最高達 1,700 TPS。
Cerebras 宣佈,由其提供運算支援的 OpenAI GPT-5.3-Codex-Spark 已開放研究預覽,面向即時軟件開發。模型運行速度超過 1,000 tokens/s;在 SWE-Bench Pro 和 Terminal-Bench 2.0 等基準上,其回應較 GPT-5.1-Codex-mini 更有能力,完成任務只需一小部分時間。
Aleph Alpha 發佈 Kolibri(Kolibri-1),一款面向英語和德語的開放權重 MoE 語言模型,總參數為 78.1B,每個 token 啟用 3.46B。
Zyphra 發佈 Zamba2-small(2.7B),一款面向裝置端應用的小型語言模型。相較 Phi3-3.8B,其首 token 生成速度快 2x、記憶體開銷減少 27%,生成延遲低 1.29x。模型權重以 Apache 2.0 授權開源。
Zyphra 發佈 Zamba2-VL 視覺語言模型系列,提供 1.2B、2.7B 和 7B 參數版本,採用 Zamba2 混合 SSM–Transformer 骨幹。
Zyphra 預覽 ZAYA1,稱其為首個完全以 AMD 硬件、軟件及網絡堆疊端到端訓練的 AI 模型。ZAYA1-base 使用 Zyphra 內部 AMD 專用訓練堆疊,訓練總量為 14T tokens;訓練叢集由 128 個節點組成,搭載 AMD MI300X GPU,實際訓練效能超過 750 PFLOPs。
Zyphra 發佈 ZAYA1-8B,這款 MoE 模型的活躍參數少於 1 billion。該模型在部分數學和編碼基準中勝過規模大得多的開放權重模型;搭配 Markovian RSA 時,HMMT'25 得分為 89.6,並逐輪只傳送最後 4K tokens 以維持固定上下文長度。
Zyphra 發佈 ZAYA1-8B-Diffusion-Preview,將自回歸訓練的 ZAYA1-8B 轉換為離散擴散模型,並同時草擬 16 個 token。
Prime Intellect 啟動 INTELLECT-2,展開 32B 參數模型的全球分散式強化學習訓練,並開放任何人無需許可地貢獻異構算力。訓練以 QwQ-32B 為基礎,採用 DeepSeek-R1 的 GRPO 方法,聚焦可驗證的數學與編碼任務,並以系統提示詞設定思考 token 預算。
Prime Intellect 發佈 INTELLECT-2,稱這是首個透過全球分散式強化學習訓練的 32B 參數推理語言模型。訓練以跨異構運算節點的全非同步 RL 為核心,並配套推出 PRIME-RL、TOPLOC 和 SHARDCAST;模型、程式碼及數據均已開源,技術報告見 primeintellect.ai/intellect-2。
Prime Intellect 發佈 106B 參數的 INTELLECT-3 MoE 模型,並開源模型權重、訓練框架、數據集、RL 環境及評測。模型以 GLM-4.5-Air 為基礎,經 SFT 和 RL 訓練,使用 512 張 NVIDIA H200 GPU、分佈於 64 個互連節點,歷時兩個月。
Liquid AI 發佈 LFM2,推出 0.35B、0.7B 和 1.2B 三個參數規模的模型,面向裝置端生成式 AI。官方表示,LFM2 在 CPU 上的 prefill 和 decode 速度最高達 Qwen3 的 2 倍,訓練效率較上一代提升 3 倍。
Liquid AI 發佈 LFM2-8B-A1B 早期檢查點,這款端側 MoE 模型共有 8.3B 參數,每個 token 啟用 1.5B 參數。官方公佈 16 項基準測試結果,其中 MMLU-Pro 得分為 37.42,較 LFM2-2.6B 高 11.46 分;模型面向手機、平板及手提電腦的本地推理。頁首註明,該模型已棄用,並由 LFM2.5-8B-A1B 取代。
Liquid AI 發佈面向端側部署的 LFM2.5 模型系列,涵蓋 Base、Instruct、日文、視覺語言及音訊語言型號。LFM2.5-1.2B 的預訓練規模由 10T 增至 28T tokens;LFM2.5-Audio-1.5B 的音訊 detokenizer 在 mobile CPU 上以同等精度較 LFM2 的 Mimi detokenizer 快 8x。
Liquid AI 發佈 LFM2.5-1.2B-Thinking,一款可完全在裝置上運行的推理模型,手機記憶體佔用低於 900 MB。模型有 1.2 billion 個參數,在多數推理基準中匹敵或超越 Qwen3-1.7B(thinking mode),參數量少 40%。現已可透過 Hugging Face、LEAP 和 Playground 使用。
Liquid AI 發佈基於 LFM2 架構的 LFM2.5-350M,這款 350M 參數模型經額外預訓練(由 10T 增至 28T tokens)及大規模強化學習。
Liquid AI 發佈端側模型 LFM2.5-8B-A1B,將上下文窗口擴至 128K,並把預訓練規模由 12T 增至 38T tokens。該模型採用推理專用設計,詞表由 65,536 擴至 128,000,AA-Omniscience Index 由 -78.42 升至 -24.70。
Zyphra 發佈 ZAYA1-74B-Preview,這是一個有 4B 啟用參數、74B 總參數的 MoE 推理基礎 checkpoint,展示其在 AMD 上端到端進行大規模預訓練的能力。
Cohere 開源發佈 Command A+,這款採用 MoE 架構的 LLM 以 Apache 2.0 授權,面向高效能智能體任務。模型有 218B 總參數和 25B 活躍參數,支援 48 種語言,並提供 BF16、FP8 和 W4A4 量化版本。
Fireworks 推出 DeepSeek-V4.1-Flash,其 DeepSWE Pass@1 為 74.34%,每項任務成本 $0.430,與 GPT-6 Astra 的 74.12% 相近。
Fireworks Research 發佈 Ember-1,稱其在維持 Kimi K3 品質的同時,tokens 用量較 Kimi K3 減少 40%。模型以 Kimi K3 為基礎,經訓練縮短不必要的推理;在七項基準及兩家客戶的正式環境流量測試中,推理 token 數可減少 35–50%,準確度未有下降。
Liquid AI 發佈 LFM2.5-230M,這款小型模型可在雲端 GPU 和低成本 CPU 上運行,供開發者微調及部署於智能體工作流。官方列出的解碼速度為 Galaxy S25 Ultra 上 213 tok/s、Raspberry Pi 5 上 42 tok/s;LFM2.5-230M-Base 和 LFM2.5-230M 現已在 Hugging Face 提供。
Liquid AI 發佈 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,兩者均為支援 8,192-token 上下文的雙向編碼器。
Liquid AI 發佈 2.6B 參數的 LFM2.5-2.6B,這款智能體模型可完全在裝置端運行,支援規劃、工具調用及多步任務。基準測試中,它在所有指令遵循基準及幾乎所有工具使用基準領先對照模型,較大型模型則在編碼上佔優。CPU 解碼速度在 M5 Max 達 220 tokens/s、Ryzen AI Max+ 395 達 113 tokens/s,手機上為 30 tokens/s。
Liquid AI 為 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 發佈 DSpark 草稿模型,推理吞吐量在 H100 上最高達基線的 3.18 倍,在裝置端最高達 2.87 倍。
Liquid AI 發佈 LFM2.5-VL-3B 的實驗性視覺 DSpark 草稿模型,GPU 解碼吞吐量最高提升 2.66×,端側最高提升 3.13×。端到端吞吐量在 GPU 和端側分別最高提升 2.27× 和 2.62×;草稿模型約有 280M 參數,令部署模型參數量增加 8.9%,並支援 llama.cpp、SGLang 及 MLX-VLM。
Liquid AI 發佈首個決策模型 d1,現支援文字和圖像輸入,並透過一次前向運算直接輸出各答案的機率,不生成 token。在六項實際應用中,d1 有四項表現匹敵或超越 GPT-6.1 Sol;相較 GPT-6.1 Sol 和 Claude Opus 5.5,成本低 19x 至 200x,且每項任務回應更快。
METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。
Xiaomi 與 TileRT 發佈 MiMo-V2.5-Pro-UltraSpeed,稱其 1T 參數模型生成速度突破 1000 tokens/s。方案結合 FP4 量化、DFlash 推測解碼和 TileRT 系統優化,在單台標準 8-GPU 節點上實現 1000+ tokens/s。
Thinking Machines Lab 發佈從零訓練、提供完整權重的多模態模型 Inkling,採用 Mixture-of-Experts Transformer,總參數量為 975B、啟用參數量為 41B。
Thinking Machines Lab 發佈開放權重模型 Inkling-Small,以 276B 總參數、12B 啟用參數達到與 Inkling 相若的表現,參數規模約為其四分之一。
Reflection AI 發佈首款開放權重 MoE 模型 Beam,總參數 501B、每 token 啟用 23B 參數,面向編碼、推理及智能體工作負載。
Reflection 正式發佈首個前沿開放權重模型 Beam,稱其在進階推理基準上媲美 Z.ai 的 GLM-5.2,並勝過領先西方開放模型。Reflection 稱 Beam 推理算力用量少 3-4x,但相關效能主張尚未經獨立核實。
Aleph Alpha 發佈 Kolibri,這是一款擁有 78 billion 個參數的德英雙語開放權重模型,採用混合專家架構,每個 token 約啟用 3 billion 個參數。
測試者在 RTX pro 6000 配置上試用德國主權 AI 新模型 Kolibri,回報其 3B 活躍參數在 fp8 下約有 170 tkn/s 的速度。測試者表示,模型雖能找到正確做法,仍會因過度思考消耗過多 tokens,但速度表現不錯。
Amazon Strands Agents 團隊推出 Strands Decider 2B 決策模型,並在 GitHub 開源,支援本地 CPU / GPU 執行。
MiniMax 正式開源並推出面向智能體與編碼的 MiniMax M2,同時在中國推出 M2 驅動的 MiniMax Agent,並升級海外版本。
推薦理由:MiniMax M2 公佈 Artificial Analysis 10 項測試成績、API 定價與約 100 TPS 推理速度,並開放權重,呈現智能體模型在表現、速度與部署成本間的取捨。
螞蟻集團發佈面向金融領域的開放權重模型 Ling-3.0-flash-Fin,在 Artificial Analysis Intelligence Index 得分 23、Finance & Accounting Index 得分 24。