Zyphra 發佈 Zamba2-VL 視覺語言模型系列,提供 1.2B、2.7B 和 7B 參數規模
Zyphra 發佈 Zamba2-VL 視覺語言模型系列,提供 1.2B、2.7B 和 7B 參數版本,採用 Zamba2 混合 SSM–Transformer 骨幹。
Zyphra 發佈 Zamba2-VL 視覺語言模型系列,提供 1.2B、2.7B 和 7B 參數版本,採用 Zamba2 混合 SSM–Transformer 骨幹。
LFM2-VL 推出 LFM2-VL-450M 和 LFM2-VL-1.6B 兩款開放權重視覺語言模型,支援文字及可變解像度圖像輸入。在 GPU 上的推理速度最高達現有 VLM 的 2 倍,並原生處理最高 512×512 解像度的圖像;更大的圖像會切分為 512×512 區塊。兩款模型現已於 Hugging Face 提供,採用基於 Apache 2.0 的開放授權。
Liquid AI 發佈 LFM2-Audio-1.5B,這款 1.5B 參數模型支援音訊與文字輸入及生成。模型在 VoiceBench 九項音訊互動基準的總分為 56.78,ASR 基準平均詞錯誤率為 7.24。以 4 秒輸入波形測試,平均端到端延遲低於 100 ms;Liquid AI 亦提供 Python 套件及語音對話應用參考實作。
Liquid AI 發佈 3B 參數的視覺語言模型 LFM2-VL-3B,面向需要更高準確度並保留 LFM2 架構速度優勢的應用。模型以 LFM2-2.6B 為骨幹,整合 SigLIP2 400M NaFlex 編碼器,並可調整每張圖片的視覺 token 數量,以平衡效能與速度;現已可透過 LEAP 及 Hugging Face 取得。
Liquid AI 發佈面向端側部署的 LFM2.5 模型系列,涵蓋 Base、Instruct、日文、視覺語言及音訊語言型號。LFM2.5-1.2B 的預訓練規模由 10T 增至 28T tokens;LFM2.5-Audio-1.5B 的音訊 detokenizer 在 mobile CPU 上以同等精度較 LFM2 的 Mimi detokenizer 快 8x。
Liquid AI 發佈 LFM2.5-VL-450M,作為 LFM2-VL-450M 的改進版本,提升視覺定位與指令遵循能力,並新增函數調用支援。預訓練規模由 10T 增至 28T tokens;RefCOCO-M 邊界框預測分數由 0 升至 81.28,MMMB 多語言分數由 54.29 提升至 68.09。
Cohere 發佈 Embed 5 嵌入模型系列,分為面向最高檢索品質的 Pro 和麪向低延遲、高流量工作的 Fast,兩款均支援多模態輸入、100+ 種語言及 128K-token 上下文窗口。
Cohere 開源發佈 Command A+,這款採用 MoE 架構的 LLM 以 Apache 2.0 授權,面向高效能智能體任務。模型有 218B 總參數和 25B 活躍參數,支援 48 種語言,並提供 BF16、FP8 和 W4A4 量化版本。
Liquid AI 發佈視覺語言模型 LFM2.5-VL-3B,稱其視覺表現可媲美參數量兩倍的模型,並在多種 CPU、GPU 部署中運行更快。相較前代,屏幕理解、工具調用、定位及多圖輸入均有提升,ScreenSpot-v2 平均得分為 80.7,ToolSandbox 由 26.4 升至 59.5,RefCOCO precision@1 由 57.1 升至 87.9。
Liquid AI 發佈 LFM2.5-VL-3B 的實驗性視覺 DSpark 草稿模型,GPU 解碼吞吐量最高提升 2.66×,端側最高提升 3.13×。端到端吞吐量在 GPU 和端側分別最高提升 2.27× 和 2.62×;草稿模型約有 280M 參數,令部署模型參數量增加 8.9%,並支援 llama.cpp、SGLang 及 MLX-VLM。
Liquid AI 發佈首個決策模型 d1,現支援文字和圖像輸入,並透過一次前向運算直接輸出各答案的機率,不生成 token。在六項實際應用中,d1 有四項表現匹敵或超越 GPT-6.1 Sol;相較 GPT-6.1 Sol 和 Claude Opus 5.5,成本低 19x 至 200x,且每項任務回應更快。
Suno 推出新一代音樂模型 v6,分為 v6、v6-wild 和 v6-mini 三款,分別支援不同創作需求。v6 和 v6-wild 提供予 Pro、Premier 訂閲用戶,v6-mini 則開放所有用戶使用;三者均能理解人聲、樂器、歌曲結構、情緒和參考風格等描述。新功能包括以文字指令編輯歌曲局部、混搭多個來源、取樣並分離音訊,以及從文字、音訊、圖像或影片創作音樂。
Black Forest Labs 與 mimic 以 FLUX 3 為骨幹開發 FLUX-mimic,這款影片動作模型從 FLUX 的世界表徵解碼機械人動作。
Black Forest Labs 的 FLUX 3 多模態基礎模型現已開放 Early Access,採用統一架構共同學習圖像、影片和音訊。它可按文字或圖像、影片參考生成內容,並生成最長 20 秒、帶音訊的影片;模型亦涵蓋動作預測。
Black Forest Labs 已透過 BFL API 及指定合作夥伴開放 FLUX 3 Video 初始版本,支援文字及圖像生成影片。片段最長 20 秒,可輸出 HD(720p)及經升頻處理的 Full HD(1080p),並同步生成原生音訊,另支援影片延續、多鏡頭生成及多語言對白與唇形同步。內部評測稱其文字生成影片表現優於現有 SOTA,圖像生成影片則與 Seedance 2.0 持平。
MiMo 推出 MiMo-V2.6 系列,主打前沿智能、涵蓋所有模態,並以公開方式構建。
Seedream 5.0 Pro 正式發布,作為多模態圖像創作模型,提升圖文匹配、結構合理性、文字渲染及畫面美感。其四項核心能力包括高密度資訊圖生成、交互式精準編輯、影像與人像質感提升,以及十餘種常用語言的原生輸入與生成。目前模型已在火山方舟體驗中心上線,並將陸續在豆包、即夢上線;項目主頁:https://seed.bytedance.com/seedream5_0_pro
字節 Seed 正式發布新一代影片創作模型 Seedance 2.5,單次最長可生成 30 秒影片,並支援多輪延長、多模態參考及時間戳精準編輯。用戶單次最多可輸入 30 張圖片、10 段影片和 10 段音訊作參考,模型亦提升長影片連貫性及綠幕、視角和運鏡編輯能力。Seedance 2.5 正陸續於即夢 AI、豆包專業版上線,API 服務近期亦將上線火山方舟。
推薦理由:Seedance 2.5 將單次影片生成時長提升至 30 秒,並支援多輪延長、多模態參考及時間戳編輯,呈現影片創作由片段輸出走向完整流程的能力變化。
字節 Seed 正式推出原生音訊及影片全雙工大模型 SeedRealtime,透過統一架構在連續多模態資訊流中即時互動。SeedRealtime 已在豆包 App 全量上線;端到端人工評測顯示,與級聯模型相比,其音訊及影片對話節奏問題減少一半,單次對話順暢、完整交流的機率亦有明顯提升。項目主頁:https://seed.bytedance.com/seedrealtime
Thinking Machines Lab 發佈從零訓練、提供完整權重的多模態模型 Inkling,採用 Mixture-of-Experts Transformer,總參數量為 975B、啟用參數量為 41B。
Thinking Machines Lab 發佈開放權重模型 Inkling-Small,以 276B 總參數、12B 啟用參數達到與 Inkling 相若的表現,參數規模約為其四分之一。
Reka AI 發佈 Rho-1 研究預覽,這個 19-billion-parameter 全模態模型在單一神經網絡中處理及生成文字、圖像、影片和機械人控制動作。
OpenMOSS 發佈開源影片與同步音訊生成模型 MOVA,模型可在單次推理中生成影片及同步音訊。程式庫提供模型權重、推理、訓練、LoRA 微調及評測流程,並列出不同推理及訓練設定的硬件資源與耗時數據。
NASA 與 IBM Research 發佈開源 NASA-IBM Lunar Foundation Model,使用 17 年月球軌道觀測資料支援月球科學的機器學習任務。
Microsoft 在 Build 2026 的 MAI 主題演講中宣佈推出七款涵蓋圖像、語音、轉錄、推理及編碼的新模型。
推薦理由:演講將模型基準、產品整合和權重調校渠道並列,呈現 Microsoft 從模型發布延伸至企業定製的產品路徑。
Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。
推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。
MiniMax 正式發佈 M3,這款開放權重模型整合編碼與智能體能力、最高 1M tokens 上下文,以及原生圖像和影片輸入與桌面操作能力。M3 採用 MiniMax Sparse Attention(MSA),在上下文長度達 1M tokens 時,每 token 計算量為上一代的 1/20,prefilling 提速逾 9×、decoding 提速逾 15×。
MiniMax 發佈 H3 通用多模態生成模型,可理解文字、圖像、影片與音訊的統一上下文,並生成最長 15 秒、2K 解析度的原生立體聲影片。H3 預設提供 2K 輸出,官方表示其 2K 每秒價格低於主流模型的三分之一,並計劃在未來幾天內於適用法律法規範圍內開放模型權重。模型面向廣告、品牌、電商等創作場景,MiniMax 表示完整技術報告將於稍後分享。
MiniMax 發佈 Music 3.0 音樂生成模型,可依據創意概念及可選歌詞,在一次生成中完成最長 5 分鐘的歌曲。模型採用 8 層 RVQ、由 Qwen3.5-8B 初始化的 8B Global LLM、0.6B Local LLM,並透過 2.4B flow-matching 模組及 123M Flow-VAE 重建音訊。
Google 發佈 Gemini 4 Argon,稱其為迄今最強模型,並表示它適用於編碼、研究、寫作等工作,尤其面向防禦性網絡安全。該模型專為防禦性網絡安全工作訓練,Google 稱它可自主發現、驗證並修補關鍵軟件漏洞;目前僅透過 Fairwind Program 向部分網絡安全合作夥伴推出。
Tavus 發佈 Griffin,稱其為首個「Human Interaction Model」(HIM);其研究中,48% 參與者在一分鐘視像通話後認為 Griffin 是真人。
OpenMOSS 發佈 MOSS-VL 開放權重影片理解模型系列,涵蓋連續影片即時互動、離線理解及後續訓練三類用途。系列包括 MOSS-VL-Realtime、MOSS-VL-Instruct-0708 和 MOSS-VL-Base-0708,分別面向即時互動、離線任務,以及持續預訓練和微調。三款模型均為 11B 參數,支援 256K 上下文窗口;倉庫亦提供即時與離線推理、部署和微調資源。
Sarvam AI 發佈 Sarvam Vision 2.1,強化表格解析、表單鍵值擷取及 Indic 手寫識別。在 olmOCR-Bench 官方集合中,模型得 87.3 分,為表列最高;在 OmniDocBench v1.6 得 94.97 分,低於 PaddleOCR-VL 1.6 的 96.01 分。
小米推出 MiMo-V2.6-Pro,該模型在 Artificial Analysis Intelligence Index 得 46 分,排名開放權重模型首位。
推薦理由:文中並列模型榜單、RL 訓練成本與將開源的環境配方,呈現這次發佈由模型權重延伸至後訓練流程的技術脈絡。
inclusionAI 發佈 Ming-Image-0.1-Design-Layer,可按輸入圖像及圖層規劃,將扁平設計圖像拆分為指定數量的 RGBA 圖層。模型提供六層卡片製作示例,建議工作分辨率為 1024,亦可使用 512 加快分層;採樣步數為 12,驗證配置為一張 CUDA GPU、80 GiB VRAM。
inclusionAI 發佈 Realtime-Venus 全雙工互動系統,提供視聽版 Realtime-Venus-Omni 與音訊版 Realtime-Venus-Audio,兩者均為 9B。
IBM 與 NASA 開源 NASA-IBM Lunar Foundation Model,整合數十年美國及日本月球任務的多模態觀測資料。在冰區識別中,模型的錯誤率比用於冰區探測的 SwinV2 降低 22%;在 100 米/像素撞擊坑檢測中,較以撞擊坑檢測訓練的 Swin 模型高近 19%,並使用一半訓練資料。
DeepSeek-V4.1-Flash 正式發佈,是 DeepSeek 新架構系列中最小的模型,並支援原生多模態視覺理解。
FireRedTeam 發佈 FireRedAudio,一款以共用 9B 參數 LLM 為基礎、涵蓋音訊理解與語音生成的音訊語言模型。Audio Encoder 負責理解、RedAE pathway 負責生成;模型支援 ASR、音訊理解、零樣本及指令式 TTS、語音編輯,並可處理最長一小時的錄音。除 ASR 外,其他功能只支援中文和英文。
NeoMME 推出 260M 和 800M 兩種規模的多語言多模態編碼器,並提供用於視覺文件檢索的 NeoMME-Retriever。模型從零開始以單一雙向 Transformer 處理文字 token 和原始圖像 patch;NeoMME-Retriever 單次前向傳播可輸出密集與 late-interaction 嵌入向量。