Prime Intellect 發佈 106B 參數 INTELLECT-3 MoE 模型,開源大規模 RL 訓練資源
Prime Intellect 發佈 106B 參數的 INTELLECT-3 MoE 模型,並開源模型權重、訓練框架、數據集、RL 環境及評測。模型以 GLM-4.5-Air 為基礎,經 SFT 和 RL 訓練,使用 512 張 NVIDIA H200 GPU、分佈於 64 個互連節點,歷時兩個月。
Prime Intellect 發佈 106B 參數的 INTELLECT-3 MoE 模型,並開源模型權重、訓練框架、數據集、RL 環境及評測。模型以 GLM-4.5-Air 為基礎,經 SFT 和 RL 訓練,使用 512 張 NVIDIA H200 GPU、分佈於 64 個互連節點,歷時兩個月。
Suno 發佈首個可製作電台級音樂的模型 v3,用戶可在數秒內生成完整兩分鐘歌曲。v3 現已向所有用戶開放,網址為 https://app.suno.ai。v3 亦改善音質、增加風格與曲風選擇,並提升提示詞遵循度、減少模型幻覺,令歌曲結尾更自然。
推薦理由:v3 可在數秒內生成完整兩分鐘歌曲,並改善音質、風格選擇及提示詞遵循,呈現這次更新在生成速度與創作控制上的具體變化。
Liquid AI 發佈 LFM2,推出 0.35B、0.7B 和 1.2B 三個參數規模的模型,面向裝置端生成式 AI。官方表示,LFM2 在 CPU 上的 prefill 和 decode 速度最高達 Qwen3 的 2 倍,訓練效率較上一代提升 3 倍。
LFM2-VL 推出 LFM2-VL-450M 和 LFM2-VL-1.6B 兩款開放權重視覺語言模型,支援文字及可變解像度圖像輸入。在 GPU 上的推理速度最高達現有 VLM 的 2 倍,並原生處理最高 512×512 解像度的圖像;更大的圖像會切分為 512×512 區塊。兩款模型現已於 Hugging Face 提供,採用基於 Apache 2.0 的開放授權。
Suno 發佈 v5.5,並推出 Voices、Custom models 和 My Taste,加入以用戶聲音、原創音樂及音樂偏好為基礎的個人化功能。
推薦理由:更新把個人化分為歌聲、原創曲目調校和偏好學習三條路徑,也交代各功能面向哪些用戶開放。
Liquid AI 發佈 Liquid Nanos,一系列 350M–2.6B 參數的基礎模型,可在手機、手提電腦及嵌入式裝置上本機運行。首批實驗性模型涵蓋資料抽取、英日雙向翻譯、RAG、工具調用及數學推理,另包括社羣製作的法語微調模型。模型現已在 Liquid Edge AI 平台(LEAP)及 Hugging Face 提供,並以開放授權向學術界、開發者及小型企業開放。
Liquid AI 發佈 LFM2-Audio-1.5B,這款 1.5B 參數模型支援音訊與文字輸入及生成。模型在 VoiceBench 九項音訊互動基準的總分為 56.78,ASR 基準平均詞錯誤率為 7.24。以 4 秒輸入波形測試,平均端到端延遲低於 100 ms;Liquid AI 亦提供 Python 套件及語音對話應用參考實作。
Liquid AI 發佈 LFM2-8B-A1B 早期檢查點,這款端側 MoE 模型共有 8.3B 參數,每個 token 啟用 1.5B 參數。官方公佈 16 項基準測試結果,其中 MMLU-Pro 得分為 37.42,較 LFM2-2.6B 高 11.46 分;模型面向手機、平板及手提電腦的本地推理。頁首註明,該模型已棄用,並由 LFM2.5-8B-A1B 取代。
Liquid AI 發佈 3B 參數的視覺語言模型 LFM2-VL-3B,面向需要更高準確度並保留 LFM2 架構速度優勢的應用。模型以 LFM2-2.6B 為骨幹,整合 SigLIP2 400M NaFlex 編碼器,並可調整每張圖片的視覺 token 數量,以平衡效能與速度;現已可透過 LEAP 及 Hugging Face 取得。
Claude Opus 5.5 針對更長、上下文用量更高的編碼工作階段設計,按 token 計費的典型工作負載估計比 Opus 5 便宜約 40%。輸入及輸出 token 價格下調 20%,讀取快取 token 的價格下調 60%;Claude Code 的快取未命中輸入亦減少逾 50%。文中指出,長而開放的任務較有機會透過減少錯誤方向上的回合降低成本,而簡單、短小的機械式任務所需回合數大致相同。
Liquid AI 發佈面向端側部署的 LFM2.5 模型系列,涵蓋 Base、Instruct、日文、視覺語言及音訊語言型號。LFM2.5-1.2B 的預訓練規模由 10T 增至 28T tokens;LFM2.5-Audio-1.5B 的音訊 detokenizer 在 mobile CPU 上以同等精度較 LFM2 的 Mimi detokenizer 快 8x。
Liquid AI 發佈 LFM2-2.6B-Transcript,支援在 CPU、NPU 和 GPU 上完全本機執行。模型針對 30–60 分鐘會議逐字稿設計,並已在 LEAP 和 Hugging Face 開放下載,可輸出討論要點、決策及標註負責人的行動項目。
Liquid AI 發佈 LFM2.5-1.2B-Thinking,一款可完全在裝置上運行的推理模型,手機記憶體佔用低於 900 MB。模型有 1.2 billion 個參數,在多數推理基準中匹敵或超越 Qwen3-1.7B(thinking mode),參數量少 40%。現已可透過 Hugging Face、LEAP 和 Playground 使用。
Liquid AI 發佈 LFM2-24B-A2B 早期檢查點,這款開放權重 MoE 模型有 24B 總參數,並已在 Hugging Face 提供。
Liquid AI 發佈基於 LFM2 架構的 LFM2.5-350M,這款 350M 參數模型經額外預訓練(由 10T 增至 28T tokens)及大規模強化學習。
Liquid AI 發佈 LFM2.5-VL-450M,作為 LFM2-VL-450M 的改進版本,提升視覺定位與指令遵循能力,並新增函數調用支援。預訓練規模由 10T 增至 28T tokens;RefCOCO-M 邊界框預測分數由 0 升至 81.28,MMMB 多語言分數由 54.29 提升至 68.09。
Liquid AI 發佈端側模型 LFM2.5-8B-A1B,將上下文窗口擴至 128K,並把預訓練規模由 12T 增至 38T tokens。該模型採用推理專用設計,詞表由 65,536 擴至 128,000,AA-Omniscience Index 由 -78.42 升至 -24.70。
Liquid AI 發佈兩款 350M 參數的多語言檢索模型。它們是 LFM2.5-ColBERT-350M 和 LFM2.5-Embedding-350M,支援 11 種語言的多語言及跨語言搜尋。
Black Forest Labs 已公開提供 FLUX VTO,這款虛擬試穿模型的生成時間少於 4 秒,適用於大規模商品目錄。它可為同一人物一次套用最多四件服裝,並保留人物身份及服裝上的標誌、印花、縫線和五金配件。身體及服裝尺碼的精確呈現仍在改進,輸出宜作視覺造型參考;預設政策不支援泳裝和內衣。
Zyphra 發佈採 Apache 2.0 授權的 EEG 基礎模型 ZUNA1.1,支援在任意通道配置下重建、去噪及升採樣 EEG。模型維持 380M 參數,支援 0.5–30 秒輸入,重建品質達到或超越 ZUNA1。用戶可在 Zyphra Cloud 的 EEG Playground 透過瀏覽器使用,亦可下載模型在本地執行。
Zyphra 發佈 ZAYA1-74B-Preview,這是一個有 4B 啟用參數、74B 總參數的 MoE 推理基礎 checkpoint,展示其在 AMD 上端到端進行大規模預訓練的能力。
Cohere 發佈開源語音辨識模型 Cohere Transcribe,在 Hugging Face Open ASR Leaderboard 以 5.42% 平均 WER 排名第一。
Cohere 開源發佈 Command A+,這款採用 MoE 架構的 LLM 以 Apache 2.0 授權,面向高效能智能體任務。模型有 218B 總參數和 25B 活躍參數,支援 48 種語言,並提供 BF16、FP8 和 W4A4 量化版本。
Cohere 開源發佈 North Mini Code,稱其為首款智能體編碼模型,採用 MoE 架構,總參數 30B、啟用參數 3B,並採用 Apache 2.0 授權。
ElevenLabs 發佈 Eleven v4 文字轉語音模型及低延遲版本 Eleven v4 Turbo,兩者均支援 90 多種語言。Eleven v4 可按語氣、節奏、情緒、角色和上下文生成語音,並改善多説話者對話、聲音克隆及跨語言口音保留。Turbo 的中位推理延遲約 100ms,兩款模型現已可透過 ElevenAgents、ElevenCreative 和 ElevenAPI 使用。
Fireworks 推出 DeepSeek-V4.1-Flash,其 DeepSWE Pass@1 為 74.34%,每項任務成本 $0.430,與 GPT-6 Astra 的 74.12% 相近。
Fireworks Research 發佈 Ember-1,稱其在維持 Kimi K3 品質的同時,tokens 用量較 Kimi K3 減少 40%。模型以 Kimi K3 為基礎,經訓練縮短不必要的推理;在七項基準及兩家客戶的正式環境流量測試中,推理 token 數可減少 35–50%,準確度未有下降。
Liquid AI 發佈 LFM2.5-230M,這款小型模型可在雲端 GPU 和低成本 CPU 上運行,供開發者微調及部署於智能體工作流。官方列出的解碼速度為 Galaxy S25 Ultra 上 213 tok/s、Raspberry Pi 5 上 42 tok/s;LFM2.5-230M-Base 和 LFM2.5-230M 現已在 Hugging Face 提供。
Liquid AI 發佈 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,兩者均為支援 8,192-token 上下文的雙向編碼器。
Liquid AI 發佈 2.6B 參數的 LFM2.5-2.6B,這款智能體模型可完全在裝置端運行,支援規劃、工具調用及多步任務。基準測試中,它在所有指令遵循基準及幾乎所有工具使用基準領先對照模型,較大型模型則在編碼上佔優。CPU 解碼速度在 M5 Max 達 220 tokens/s、Ryzen AI Max+ 395 達 113 tokens/s,手機上為 30 tokens/s。
Liquid AI 發佈視覺語言模型 LFM2.5-VL-3B,稱其視覺表現可媲美參數量兩倍的模型,並在多種 CPU、GPU 部署中運行更快。相較前代,屏幕理解、工具調用、定位及多圖輸入均有提升,ScreenSpot-v2 平均得分為 80.7,ToolSandbox 由 26.4 升至 59.5,RefCOCO precision@1 由 57.1 升至 87.9。
Liquid AI 為 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 發佈 DSpark 草稿模型,推理吞吐量在 H100 上最高達基線的 3.18 倍,在裝置端最高達 2.87 倍。
Liquid AI 發佈 LFM2.5-VL-3B 的實驗性視覺 DSpark 草稿模型,GPU 解碼吞吐量最高提升 2.66×,端側最高提升 3.13×。端到端吞吐量在 GPU 和端側分別最高提升 2.27× 和 2.62×;草稿模型約有 280M 參數,令部署模型參數量增加 8.9%,並支援 llama.cpp、SGLang 及 MLX-VLM。
Liquid AI 發佈首個決策模型 d1,現支援文字和圖像輸入,並透過一次前向運算直接輸出各答案的機率,不生成 token。在六項實際應用中,d1 有四項表現匹敵或超越 GPT-6.1 Sol;相較 GPT-6.1 Sol 和 Claude Opus 5.5,成本低 19x 至 200x,且每項任務回應更快。
Suno 推出新一代音樂模型 v6,分為 v6、v6-wild 和 v6-mini 三款,分別支援不同創作需求。v6 和 v6-wild 提供予 Pro、Premier 訂閲用戶,v6-mini 則開放所有用戶使用;三者均能理解人聲、樂器、歌曲結構、情緒和參考風格等描述。新功能包括以文字指令編輯歌曲局部、混搭多個來源、取樣並分離音訊,以及從文字、音訊、圖像或影片創作音樂。
Black Forest Labs 與 mimic 以 FLUX 3 為骨幹開發 FLUX-mimic,這款影片動作模型從 FLUX 的世界表徵解碼機械人動作。
Black Forest Labs 的 FLUX 3 多模態基礎模型現已開放 Early Access,採用統一架構共同學習圖像、影片和音訊。它可按文字或圖像、影片參考生成內容,並生成最長 20 秒、帶音訊的影片;模型亦涵蓋動作預測。
Black Forest Labs 已透過 BFL API 及指定合作夥伴開放 FLUX 3 Video 初始版本,支援文字及圖像生成影片。片段最長 20 秒,可輸出 HD(720p)及經升頻處理的 Full HD(1080p),並同步生成原生音訊,另支援影片延續、多鏡頭生成及多語言對白與唇形同步。內部評測稱其文字生成影片表現優於現有 SOTA,圖像生成影片則與 Seedance 2.0 持平。
Black Forest Labs 發佈開放權重的 7B FLUX 3 Action,這個世界動作模型(WAM)聯合預測影片與機械人動作。
小米發佈 MiMo-V2.5-TTS 系列語音合成模型,涵蓋預設聲線、按文字描述設計新聲線,以及以參考音訊複製聲音三種用途。系列支援自然語言風格指令、行內音訊標籤和劇本式結構輸入;聲音複製只需短音訊樣本,無須額外訓練、標註或微調。三款模型限時免費開放於 Xiaomi MiMo API 平台,整合技能已開源於 GitHub 倉庫 XiaomiMiMo/MiMo-Skills。