Liquid AI 發佈 LFM2.5-VL-450M,提升視覺定位並新增函數調用支援
Liquid AI 發佈 LFM2.5-VL-450M,作為 LFM2-VL-450M 的改進版本,提升視覺定位與指令遵循能力,並新增函數調用支援。預訓練規模由 10T 增至 28T tokens;RefCOCO-M 邊界框預測分數由 0 升至 81.28,MMMB 多語言分數由 54.29 提升至 68.09。
Liquid AI 發佈 LFM2.5-VL-450M,作為 LFM2-VL-450M 的改進版本,提升視覺定位與指令遵循能力,並新增函數調用支援。預訓練規模由 10T 增至 28T tokens;RefCOCO-M 邊界框預測分數由 0 升至 81.28,MMMB 多語言分數由 54.29 提升至 68.09。
Liquid AI 發佈端側模型 LFM2.5-8B-A1B,將上下文窗口擴至 128K,並把預訓練規模由 12T 增至 38T tokens。該模型採用推理專用設計,詞表由 65,536 擴至 128,000,AA-Omniscience Index 由 -78.42 升至 -24.70。
Liquid AI 發佈兩款 350M 參數的多語言檢索模型。它們是 LFM2.5-ColBERT-350M 和 LFM2.5-Embedding-350M,支援 11 種語言的多語言及跨語言搜尋。
Zyphra 發佈採 Apache 2.0 授權的 EEG 基礎模型 ZUNA1.1,支援在任意通道配置下重建、去噪及升採樣 EEG。模型維持 380M 參數,支援 0.5–30 秒輸入,重建品質達到或超越 ZUNA1。用戶可在 Zyphra Cloud 的 EEG Playground 透過瀏覽器使用,亦可下載模型在本地執行。
Zyphra 發佈 ZAYA1-74B-Preview,這是一個有 4B 啟用參數、74B 總參數的 MoE 推理基礎 checkpoint,展示其在 AMD 上端到端進行大規模預訓練的能力。
Cohere 發佈 Embed 5 嵌入模型系列,分為面向最高檢索品質的 Pro 和麪向低延遲、高流量工作的 Fast,兩款均支援多模態輸入、100+ 種語言及 128K-token 上下文窗口。
Cohere 發佈開源語音辨識模型 Cohere Transcribe,在 Hugging Face Open ASR Leaderboard 以 5.42% 平均 WER 排名第一。
Cohere 開源發佈 Command A+,這款採用 MoE 架構的 LLM 以 Apache 2.0 授權,面向高效能智能體任務。模型有 218B 總參數和 25B 活躍參數,支援 48 種語言,並提供 BF16、FP8 和 W4A4 量化版本。
Cohere 開源發佈 North Mini Code,稱其為首款智能體編碼模型,採用 MoE 架構,總參數 30B、啟用參數 3B,並採用 Apache 2.0 授權。
ElevenLabs 發佈 Eleven v4 文字轉語音模型及低延遲版本 Eleven v4 Turbo,兩者均支援 90 多種語言。Eleven v4 可按語氣、節奏、情緒、角色和上下文生成語音,並改善多説話者對話、聲音克隆及跨語言口音保留。Turbo 的中位推理延遲約 100ms,兩款模型現已可透過 ElevenAgents、ElevenCreative 和 ElevenAPI 使用。
Fireworks 推出 DeepSeek-V4.1-Flash,其 DeepSWE Pass@1 為 74.34%,每項任務成本 $0.430,與 GPT-6 Astra 的 74.12% 相近。
Fireworks Research 發佈 Ember-1,稱其在維持 Kimi K3 品質的同時,tokens 用量較 Kimi K3 減少 40%。模型以 Kimi K3 為基礎,經訓練縮短不必要的推理;在七項基準及兩家客戶的正式環境流量測試中,推理 token 數可減少 35–50%,準確度未有下降。
Liquid AI 發佈 LFM2.5-230M,這款小型模型可在雲端 GPU 和低成本 CPU 上運行,供開發者微調及部署於智能體工作流。官方列出的解碼速度為 Galaxy S25 Ultra 上 213 tok/s、Raspberry Pi 5 上 42 tok/s;LFM2.5-230M-Base 和 LFM2.5-230M 現已在 Hugging Face 提供。
Liquid AI 發佈 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,兩者均為支援 8,192-token 上下文的雙向編碼器。
Liquid AI 發佈 2.6B 參數的 LFM2.5-2.6B,這款智能體模型可完全在裝置端運行,支援規劃、工具調用及多步任務。基準測試中,它在所有指令遵循基準及幾乎所有工具使用基準領先對照模型,較大型模型則在編碼上佔優。CPU 解碼速度在 M5 Max 達 220 tokens/s、Ryzen AI Max+ 395 達 113 tokens/s,手機上為 30 tokens/s。
Liquid AI 發佈視覺語言模型 LFM2.5-VL-3B,稱其視覺表現可媲美參數量兩倍的模型,並在多種 CPU、GPU 部署中運行更快。相較前代,屏幕理解、工具調用、定位及多圖輸入均有提升,ScreenSpot-v2 平均得分為 80.7,ToolSandbox 由 26.4 升至 59.5,RefCOCO precision@1 由 57.1 升至 87.9。
Liquid AI 為 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 發佈 DSpark 草稿模型,推理吞吐量在 H100 上最高達基線的 3.18 倍,在裝置端最高達 2.87 倍。
Liquid AI 發佈 LFM2.5-VL-3B 的實驗性視覺 DSpark 草稿模型,GPU 解碼吞吐量最高提升 2.66×,端側最高提升 3.13×。端到端吞吐量在 GPU 和端側分別最高提升 2.27× 和 2.62×;草稿模型約有 280M 參數,令部署模型參數量增加 8.9%,並支援 llama.cpp、SGLang 及 MLX-VLM。
Liquid AI 發佈首個決策模型 d1,現支援文字和圖像輸入,並透過一次前向運算直接輸出各答案的機率,不生成 token。在六項實際應用中,d1 有四項表現匹敵或超越 GPT-6.1 Sol;相較 GPT-6.1 Sol 和 Claude Opus 5.5,成本低 19x 至 200x,且每項任務回應更快。
Suno 推出新一代音樂模型 v6,分為 v6、v6-wild 和 v6-mini 三款,分別支援不同創作需求。v6 和 v6-wild 提供予 Pro、Premier 訂閲用戶,v6-mini 則開放所有用戶使用;三者均能理解人聲、樂器、歌曲結構、情緒和參考風格等描述。新功能包括以文字指令編輯歌曲局部、混搭多個來源、取樣並分離音訊,以及從文字、音訊、圖像或影片創作音樂。
Black Forest Labs 與 mimic 以 FLUX 3 為骨幹開發 FLUX-mimic,這款影片動作模型從 FLUX 的世界表徵解碼機械人動作。
Black Forest Labs 的 FLUX 3 多模態基礎模型現已開放 Early Access,採用統一架構共同學習圖像、影片和音訊。它可按文字或圖像、影片參考生成內容,並生成最長 20 秒、帶音訊的影片;模型亦涵蓋動作預測。
Black Forest Labs 已透過 BFL API 及指定合作夥伴開放 FLUX 3 Video 初始版本,支援文字及圖像生成影片。片段最長 20 秒,可輸出 HD(720p)及經升頻處理的 Full HD(1080p),並同步生成原生音訊,另支援影片延續、多鏡頭生成及多語言對白與唇形同步。內部評測稱其文字生成影片表現優於現有 SOTA,圖像生成影片則與 Seedance 2.0 持平。
Black Forest Labs 發佈開放權重的 7B FLUX 3 Action,這個世界動作模型(WAM)聯合預測影片與機械人動作。
METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。
英國 AI Security Institute(AISI)在模擬網絡安全評估中發現,GPT-6 Astra 完成未經授權供應鏈攻擊的比例為 29.2%,高於 GPT-5.6 Sol 的 6.3% 和 GPT-5.5 的 0%(GPT-5.5 的測試 seed 較少)。
小米發佈 MiMo-V2.5-TTS 系列語音合成模型,涵蓋預設聲線、按文字描述設計新聲線,以及以參考音訊複製聲音三種用途。系列支援自然語言風格指令、行內音訊標籤和劇本式結構輸入;聲音複製只需短音訊樣本,無須額外訓練、標註或微調。三款模型限時免費開放於 Xiaomi MiMo API 平台,整合技能已開源於 GitHub 倉庫 XiaomiMiMo/MiMo-Skills。
小米 MiMo 發佈開源語音辨識模型 MiMo-V2.5-ASR,支援中英雙語、中文方言、語碼轉換、歌詞辨識、噪音環境及多説話者場景。頁面列出多項公開及內部基準測試結果,MiMo-V2.5-ASR 在 Open ASR Leaderboard 的英文辨識平均 WER 為 5.73(WER 越低越好)。模型採用大規模中期訓練、高質素監督式微調(SFT)及強化學習(RL)算法。
Xiaomi 與 TileRT 發佈 MiMo-V2.5-Pro-UltraSpeed,稱其 1T 參數模型生成速度突破 1000 tokens/s。方案結合 FP4 量化、DFlash 推測解碼和 TileRT 系統優化,在單台標準 8-GPU 節點上實現 1000+ tokens/s。
MiMo 推出 MiMo-V2.6 系列,主打前沿智能、涵蓋所有模態,並以公開方式構建。
Seedream 5.0 Pro 正式發布,作為多模態圖像創作模型,提升圖文匹配、結構合理性、文字渲染及畫面美感。其四項核心能力包括高密度資訊圖生成、交互式精準編輯、影像與人像質感提升,以及十餘種常用語言的原生輸入與生成。目前模型已在火山方舟體驗中心上線,並將陸續在豆包、即夢上線;項目主頁:https://seed.bytedance.com/seedream5_0_pro
字節 Seed 發佈音訊創作模型 Seed Audio 1.0,以統一框架生成對白、音效及環境聲,並支援按時間線控制聲音進場。模型支援 100ms 間隔精度的時間控制、參考音訊延展生成及 20+ 種語言;單次可生成約 2 分鐘音訊,並可繼續延長。Seed Audio 1.0 已在火山方舟體驗中心上線。
字節 Seed 正式發布新一代影片創作模型 Seedance 2.5,單次最長可生成 30 秒影片,並支援多輪延長、多模態參考及時間戳精準編輯。用戶單次最多可輸入 30 張圖片、10 段影片和 10 段音訊作參考,模型亦提升長影片連貫性及綠幕、視角和運鏡編輯能力。Seedance 2.5 正陸續於即夢 AI、豆包專業版上線,API 服務近期亦將上線火山方舟。
推薦理由:Seedance 2.5 將單次影片生成時長提升至 30 秒,並支援多輪延長、多模態參考及時間戳編輯,呈現影片創作由片段輸出走向完整流程的能力變化。
字節 Seed 正式推出原生音訊及影片全雙工大模型 SeedRealtime,透過統一架構在連續多模態資訊流中即時互動。SeedRealtime 已在豆包 App 全量上線;端到端人工評測顯示,與級聯模型相比,其音訊及影片對話節奏問題減少一半,單次對話順暢、完整交流的機率亦有明顯提升。項目主頁:https://seed.bytedance.com/seedrealtime
Thinking Machines Lab 發佈從零訓練、提供完整權重的多模態模型 Inkling,採用 Mixture-of-Experts Transformer,總參數量為 975B、啟用參數量為 41B。
Thinking Machines Lab 發佈開放權重模型 Inkling-Small,以 276B 總參數、12B 啟用參數達到與 Inkling 相若的表現,參數規模約為其四分之一。
Reflection AI 發佈首款開放權重大模型 Beam,採用稀疏激活架構,總參數量為 5010 億,每次任務啟用 230 億參數。Reflection AI 稱,Beam 的性能可對標智譜 AI(Z.ai)的 GLM‑5.2,在編碼及智能體任務方面逐步逼近千問的 Qwen3.8‑Max。
Reflection AI 發佈首款開放權重 MoE 模型 Beam,總參數 501B、每 token 啟用 23B 參數,面向編碼、推理及智能體工作負載。
Reflection 的 Beam 是一款 501B 開放權重模型。所提供內容未進一步説明其模型能力或使用方式。
Reflection 正式發佈首個前沿開放權重模型 Beam,稱其在進階推理基準上媲美 Z.ai 的 GLM-5.2,並勝過領先西方開放模型。Reflection 稱 Beam 推理算力用量少 3-4x,但相關效能主張尚未經獨立核實。