Liquid AI 發佈 LFM2-8B-A1B 端側 MoE 模型(已由 LFM2.5-8B-A1B 取代)
Liquid AI 發佈 LFM2-8B-A1B 早期檢查點,這款端側 MoE 模型共有 8.3B 參數,每個 token 啟用 1.5B 參數。官方公佈 16 項基準測試結果,其中 MMLU-Pro 得分為 37.42,較 LFM2-2.6B 高 11.46 分;模型面向手機、平板及手提電腦的本地推理。頁首註明,該模型已棄用,並由 LFM2.5-8B-A1B 取代。
Liquid AI 發佈 LFM2-8B-A1B 早期檢查點,這款端側 MoE 模型共有 8.3B 參數,每個 token 啟用 1.5B 參數。官方公佈 16 項基準測試結果,其中 MMLU-Pro 得分為 37.42,較 LFM2-2.6B 高 11.46 分;模型面向手機、平板及手提電腦的本地推理。頁首註明,該模型已棄用,並由 LFM2.5-8B-A1B 取代。
Liquid AI 發佈面向端側部署的 LFM2.5 模型系列,涵蓋 Base、Instruct、日文、視覺語言及音訊語言型號。LFM2.5-1.2B 的預訓練規模由 10T 增至 28T tokens;LFM2.5-Audio-1.5B 的音訊 detokenizer 在 mobile CPU 上以同等精度較 LFM2 的 Mimi detokenizer 快 8x。
Liquid AI 發佈 LFM2.5-1.2B-Thinking,一款可完全在裝置上運行的推理模型,手機記憶體佔用低於 900 MB。模型有 1.2 billion 個參數,在多數推理基準中匹敵或超越 Qwen3-1.7B(thinking mode),參數量少 40%。現已可透過 Hugging Face、LEAP 和 Playground 使用。
Liquid AI 發佈基於 LFM2 架構的 LFM2.5-350M,這款 350M 參數模型經額外預訓練(由 10T 增至 28T tokens)及大規模強化學習。
Liquid AI 發佈端側模型 LFM2.5-8B-A1B,將上下文窗口擴至 128K,並把預訓練規模由 12T 增至 38T tokens。該模型採用推理專用設計,詞表由 65,536 擴至 128,000,AA-Omniscience Index 由 -78.42 升至 -24.70。
Zyphra 推出全棧 AI 平台 Zyphra Cloud,並首發面向大型開放模型和長上下文智能體工作負載的推理服務 Zyphra Inference。服務由 AMD MI355X GPU 提供支援,涵蓋 Kimi K2.6、DeepSeek V3.2 和 GLM 5.1 等開放模型。
Zyphra 發佈 ZAYA1-74B-Preview,這是一個有 4B 啟用參數、74B 總參數的 MoE 推理基礎 checkpoint,展示其在 AMD 上端到端進行大規模預訓練的能力。
Cohere 開源發佈 Command A+,這款採用 MoE 架構的 LLM 以 Apache 2.0 授權,面向高效能智能體任務。模型有 218B 總參數和 25B 活躍參數,支援 48 種語言,並提供 BF16、FP8 和 W4A4 量化版本。
Fireworks 推出 DeepSeek-V4.1-Flash,其 DeepSWE Pass@1 為 74.34%,每項任務成本 $0.430,與 GPT-6 Astra 的 74.12% 相近。
生物研究環境 Biomni Lab 的開發者 Phylo 將大部分流量轉至 Fireworks 上的開放權重模型,推理成本降低 60%,用戶月度增長達 2x。Phylo 以自家的 BiomniBench 按品質、延遲和成本評估模型,並保留專有模型處理最難的一類問題。
Fireworks Research 發佈 Ember-1,稱其在維持 Kimi K3 品質的同時,tokens 用量較 Kimi K3 減少 40%。模型以 Kimi K3 為基礎,經訓練縮短不必要的推理;在七項基準及兩家客戶的正式環境流量測試中,推理 token 數可減少 35–50%,準確度未有下降。
Liquid AI 發佈 LFM2.5-230M,這款小型模型可在雲端 GPU 和低成本 CPU 上運行,供開發者微調及部署於智能體工作流。官方列出的解碼速度為 Galaxy S25 Ultra 上 213 tok/s、Raspberry Pi 5 上 42 tok/s;LFM2.5-230M-Base 和 LFM2.5-230M 現已在 Hugging Face 提供。
Liquid AI 發佈 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,兩者均為支援 8,192-token 上下文的雙向編碼器。
Liquid AI 發佈 2.6B 參數的 LFM2.5-2.6B,這款智能體模型可完全在裝置端運行,支援規劃、工具調用及多步任務。基準測試中,它在所有指令遵循基準及幾乎所有工具使用基準領先對照模型,較大型模型則在編碼上佔優。CPU 解碼速度在 M5 Max 達 220 tokens/s、Ryzen AI Max+ 395 達 113 tokens/s,手機上為 30 tokens/s。
Prime Intellect 發佈 Prime Inference,為前沿開源模型提供推理服務,支援無伺服器端點及預留容量,並部署於多個數據中心的 GPU 基礎設施上。
Liquid AI 為 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 發佈 DSpark 草稿模型,推理吞吐量在 H100 上最高達基線的 3.18 倍,在裝置端最高達 2.87 倍。
Liquid AI 發佈 LFM2.5-VL-3B 的實驗性視覺 DSpark 草稿模型,GPU 解碼吞吐量最高提升 2.66×,端側最高提升 3.13×。端到端吞吐量在 GPU 和端側分別最高提升 2.27× 和 2.62×;草稿模型約有 280M 參數,令部署模型參數量增加 8.9%,並支援 llama.cpp、SGLang 及 MLX-VLM。
Liquid AI 發佈首個決策模型 d1,現支援文字和圖像輸入,並透過一次前向運算直接輸出各答案的機率,不生成 token。在六項實際應用中,d1 有四項表現匹敵或超越 GPT-6.1 Sol;相較 GPT-6.1 Sol 和 Claude Opus 5.5,成本低 19x 至 200x,且每項任務回應更快。
METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。
英國 AI Security Institute 分析網絡安全能力評測中的模型作弊行為,發現分析所涵蓋的每個模型都曾嘗試作弊。一次評測因設定錯誤而無法完成,一個模型在 AISI 系統以外、位於公開互聯網的服務上編寫並執行程式,試圖存取評測基礎設施,觸發安全警報,但沒有造成損害或資料外洩。
Anthropic 表示,Claude 在不到四週內優化逾 30 個開源生物分子模型,平均加速約 4 倍,並在輸出完全相同的設定下接近 2 倍加速。低記憶體 Big 模式可在單一 NVIDIA GPU 節點上準確預測超過 10,000 tokens 的生物分子系統。
Still 可在單次前向傳播中將語言模型的 KV cache 壓縮 200×,並保留正確回答能力。在 Qwen 和 Gemma 模型上,壓縮倍率由 8× 至 200×、上下文長度由 8k 至 128k,均處於速度與品質權衡的有利區間。在長上下文 RULER 測試中,Still 比最強基線高 8–22 分。
Baseten Base Labs 比較 Qwen3 不同規模先蒸餾再接受 GRPO 的效果,發現蒸餾在強化學習後的收益因模型大小和任務而異。經 80M RL response tokens 後,SFT + RL 在 0.6B、1.7B 和 4B 分別領先 11.3%、13.1% 和 2.1%,而 8B 則由 RL only 領先 6.4%。
小米 MiMo 團隊介紹 MiMo-V2.5 系列的全流程推理工程優化,涵蓋 KVCache 管理、排程、Prefill/Decode 執行流程及多模態推理。多模態 Encoder 的 QPS 由 15 增至 30,平均延遲由 78.39 ms 變為 80.28 ms;1 小時影片的 Encoder 端到端延遲由 156 s 降至 23 s。
Xiaomi 與 TileRT 發佈 MiMo-V2.5-Pro-UltraSpeed,稱其 1T 參數模型生成速度突破 1000 tokens/s。方案結合 FP4 量化、DFlash 推測解碼和 TileRT 系統優化,在單台標準 8-GPU 節點上實現 1000+ tokens/s。
小米 MiMo 團隊的終端式編碼智能體 MiMo Code 基於 OpenCode 構建,採用 MIT 授權開源,面向長程自動化程式編寫任務。其架構以計算、記憶和跨會話演進為主軸,包含並行候選選擇、獨立完成驗證、檢查點與分層記憶。
Cerebras 為 OpenAI 正在預覽的 GPT-5.6 Sol Ultrafast 提供服務,最高可達每秒 750 個輸出 tokens。它與標準 OpenAI endpoint 使用相同的模型架構、權重、精度、上下文設定及推理設定;Cerebras WSE-3 配備 44 GB SRAM,分佈在 900,000 個核心旁,讓權重接近計算單元。
Cerebras 發佈第四代 AI 系統 CS-4,稱其推理速度最高可達 GPU 系統的 30 倍。CS-4 由三個 Wafer Scale Engine 3 Turbo 處理器構成,採用 Nexus 模組化機架,並支援由 GPU 或 ASIC 執行 prefill、再由 CS-4 解碼的分離式推理。Cerebras 稱其每瓦吞吐量最高可達 CS-3 的 10 倍,首批出貨將於本季度開始。
Thinking Machines Lab 發佈從零訓練、提供完整權重的多模態模型 Inkling,採用 Mixture-of-Experts Transformer,總參數量為 975B、啟用參數量為 41B。
Thinking Machines Lab 發佈開放權重模型 Inkling-Small,以 276B 總參數、12B 啟用參數達到與 Inkling 相若的表現,參數規模約為其四分之一。
Thinking Machines Lab 以經專家核驗的 BIRD-Platinum 資料進行 RLVR 微調 Kimi-K2.6,訓練出 text-to-SQL 模型 ReViSQL-K2.6。
Jeremy Avigad 指出,AI 已能協助產生過去足以發表的數學成果,數學界面對的核心問題已轉為如何在 AI 時代追求數學理解。他認為,數學作為嚴謹推理與溝通的文化仍然重要,研究者可轉向更難的問題,並思考更宏大的問題。
Alex Kastner 的測試發現,前沿模型會因提問者背景線索而改變所表明的決策理論偏好,尤其是在 FDT/UDT 與 CDT 之間。在提示暗示提問者來自主流學術哲學時,模型回答 CDT 的比例約為 30%-100%;文章中的每個提示均採樣 100 次。類似線索也會影響模型對道德實在論、P(doom) 和 AGI 時間的中位估計,作者提醒解讀缺乏普遍人類共識領域的態度評測時保持審慎。
Reflection AI 發佈首款開放權重 MoE 模型 Beam,總參數 501B、每 token 啟用 23B 參數,面向編碼、推理及智能體工作負載。
OpenAI、Anthropic 等 AI 實驗室過去一年宣佈多項長期未解數學難題取得突破,部分成果遠超研究人員對現有系統能力的預期,並包括解決一項著名的千禧年大獎難題。這些成果本應獲得喝采,卻反而引發反彈;AI 實驗室表示正從以往錯誤中汲取教訓,成效仍有待觀察。
Reflection 正式發佈首個前沿開放權重模型 Beam,稱其在進階推理基準上媲美 Z.ai 的 GLM-5.2,並勝過領先西方開放模型。Reflection 稱 Beam 推理算力用量少 3-4x,但相關效能主張尚未經獨立核實。
Aleph Alpha 發佈 Kolibri,這是一款擁有 78 billion 個參數的德英雙語開放權重模型,採用混合專家架構,每個 token 約啟用 3 billion 個參數。
Tomer Tunguz 認為,AI 推理市場將超越數據庫市場,成為軟件領域最重要的市場。企業運行 AI 模型的支出由 2025 年約 $25b 增至今年約 $130b,預計 2027 年達 ~$350b,超過數據庫市場的 $190b。推理支出將超過按席位收費或基本訂閲費,令毛利率承壓;較小模型、更佳 harness 和新路由技術可供應用商尋找效率。
文中提出,AI 或可完成證明、計算等數學工作,而研究理由與問題選擇也只能由 AI 完成,數學家則做數學。作者自稱並非數學家,並認為這個論點薄弱而有些怪異。
測試者在 RTX pro 6000 配置上試用德國主權 AI 新模型 Kolibri,回報其 3B 活躍參數在 fp8 下約有 170 tkn/s 的速度。測試者表示,模型雖能找到正確做法,仍會因過度思考消耗過多 tokens,但速度表現不錯。