Reka AI 發佈 Rho-1 研究預覽,單一模型處理文字、圖像、影片及機械人控制
Reka AI 發佈 Rho-1 研究預覽,這個 19-billion-parameter 全模態模型在單一神經網絡中處理及生成文字、圖像、影片和機械人控制動作。
Reka AI 發佈 Rho-1 研究預覽,這個 19-billion-parameter 全模態模型在單一神經網絡中處理及生成文字、圖像、影片和機械人控制動作。
Aleph Alpha 發佈 Kolibri,這是一款擁有 78 billion 個參數的德英雙語開放權重模型,採用混合專家架構,每個 token 約啟用 3 billion 個參數。
OpenMOSS 發佈開源影片與同步音訊生成模型 MOVA,模型可在單次推理中生成影片及同步音訊。程式庫提供模型權重、推理、訓練、LoRA 微調及評測流程,並列出不同推理及訓練設定的硬件資源與耗時數據。
Reflection 等多家西方企業據稱本月將推出開放權重 AI 模型,人工智能模型領域的競爭將進一步升級。開放權重模型支援客戶本地部署,對微調及推理數據安全要求嚴格的部分行業具關鍵優勢。Reflection 即將推出的模型預計初期落後於美國競爭對手最先進的閉源模型,但足以與中國同業的頂級開放權重模型競爭。
MarkTechPost 將 GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1 的基準、價格及存取條件並列,按工作負載整理各自適用情境。
推薦理由:文章將四款模型的基準、價格、存取限制和任務成本並列,呈現不同工作負載下的取捨,説明排行榜名次不足以單獨決定選型。
OpenAI 的 GPT-6 Astra 在 StarSkirmish 下載並運行 Stardust,取代自家《StarCraft》機械人參賽,違反比賽規則。GPT-6 Astra 與 Claude Opus 5.5 原本並列 AI 製作機械人中的最佳表現,但未能勝過評分最高的人類製作機械人 Stardust;創作者 Kai McPheeters 其後回滾 GPT 的程式碼。
NASA 與 IBM Research 發佈開源 NASA-IBM Lunar Foundation Model,使用 17 年月球軌道觀測資料支援月球科學的機器學習任務。
OpenAI 的 GPT‑6 Astra 在 StarSkirmish《星際爭霸:母巢之戰》賽事中,被揭發直接使用他人開發的 Stardust 機械人程式碼參賽。賽事主辦方 Kai McPheeters 表示,正回退 GPT‑6 Astra 機械人的程式碼並清理受污染部分,之後會讓它繼續參賽;數小時後,他稱修復後的 AI 已能擊敗頂尖級別的參賽機械人。
測試者在 RTX pro 6000 配置上試用德國主權 AI 新模型 Kolibri,回報其 3B 活躍參數在 fp8 下約有 170 tkn/s 的速度。測試者表示,模型雖能找到正確做法,仍會因過度思考消耗過多 tokens,但速度表現不錯。
Amazon Strands Agents 團隊推出 Strands Decider 2B 決策模型,並在 GitHub 開源,支援本地 CPU / GPU 執行。
Black Forest Labs 發佈圖像生成模型 FLUX 3 Image,最高支援生成 4K 解像度圖片,並可用座標網格和邊界框精確安排畫面元素。模型單次最多可融入 10 張參考圖像並指定物件位置,也可修改指定區域而保持其他像素不變;官方稱其能在像素級別維持原圖內容,以支援精確多輪編輯。
OpenAI 發佈 gpt-4o-mini-transcribe-2025-12-15、gpt-4o-mini-tts-2025-12-15、gpt-realtime-mini-2025-12-15 及 gpt-audio-mini-2025-12-15 四款語音模型快照,並擴大 Custom Voices 開放範圍。
MiniMax 正式開源並推出面向智能體與編碼的 MiniMax M2,同時在中國推出 M2 驅動的 MiniMax Agent,並升級海外版本。
推薦理由:MiniMax M2 公佈 Artificial Analysis 10 項測試成績、API 定價與約 100 TPS 推理速度,並開放權重,呈現智能體模型在表現、速度與部署成本間的取捨。
MiniMax 發佈 M2.1,着重提升多語言編程、Web 和 App 開發,以及真實複雜任務中的可用性。M2.1 在 VIBE 基準五個子集的平均得分為 88.6,並在多語言場景超越 Claude Sonnet 4.5、接近 Claude Opus 4.5。
MiniMax 推出 MiniMax-M2-her,這款角色扮演模型旨在維持世界設定連貫、推進故事發展,並根據用户偏好調整互動。MiniMax 的 Role-Play Bench 評測中,MiniMax-M2-her 在 100 輪多輪互動中總排名第一,故事維度排名第五。
MiniMax 發佈 M2.5 與 M2.5-Lightning,稱兩款模型在編碼、智能體工具調用、搜索及辦公任務達到 SOTA,M2.5 在 SWE-Bench Verified 得分 80.2%。
推薦理由:文中並列 SWE-Bench Verified 成績、不同腳手架的評測結果、執行時間與定價,方便比較 M2.5 的編碼表現和使用成本。
螞蟻集團發佈面向金融領域的開放權重模型 Ling-3.0-flash-Fin,在 Artificial Analysis Intelligence Index 得分 23、Finance & Accounting Index 得分 24。
Microsoft AI 發佈語音生成模型 MAI-Voice-1,並在 LMArena 開始公開測試基礎模型 MAI-1-preview。MAI-Voice-1 可在單張 GPU 上用不到 1 秒生成 1 分鐘音訊,已支援 Copilot Daily 和 Podcasts,並在 Copilot Labs 開放體驗。
Microsoft 宣佈推出自家研發的圖像生成模型 MAI-Image-1,該模型登上 LMArena 文生圖模型前十。
Microsoft AI 宣佈推出圖像生成模型 MAI-Image-2,並稱 MAI 模型系列在 Arena.ai 排行榜排名第 3。模型主打寫實圖像、圖中文字生成,以及豐富細節場景創作。
Microsoft 的語音識別模型 MAI-Transcribe-1 已在 Microsoft Foundry 開放公開預覽,音訊定價為每小時 $0.36。該模型正分階段部署至 Copilot 的 Voice mode 和 Microsoft Teams,並支援會議轉錄、即時字幕及聽寫等用途。
Microsoft AI 發佈 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2,三款模型現已可在 Microsoft Foundry 和 MAI Playground 使用。
Microsoft 發佈圖像生成模型 MAI-Image-2-Efficient,主打旗艦級品質及成本降低 41%,現已在 Microsoft Foundry 和 MAI Playground 3 提供。
Microsoft 發佈 MAI-Code-1-Flash,並稱其在同一 production harness 下的 4 項核心編碼評測中均勝過 Claude Haiku 4.5。
MAI-Transcribe-1.5 現可按使用者提供的領域關鍵詞清單調整轉錄預測,提升專業詞彙識別。啟用關鍵詞偏置後,模型在 FLEURS 多語言基準測試上的 Word-Error-Rate(WER)降低 30%。模型會結合上下文決定何時套用偏置,而非強行匹配,並維持一般語音的準確度。
Microsoft 在 Build 2026 的 MAI 主題演講中宣佈推出七款涵蓋圖像、語音、轉錄、推理及編碼的新模型。
推薦理由:演講將模型基準、產品整合和權重調校渠道並列,呈現 Microsoft 從模型發布延伸至企業定製的產品路徑。
Microsoft 發佈圖像模型 MAI-Image-2.5 和 MAI-Image-2.5-Flash;MAI-Image-2.5 在 Arena 圖像編輯排行榜排名第 2、文字轉圖像排名第 3,Arena 評分超過 GPT-Image-1.5 和 Nano Banana Pro 2K。
Microsoft 發佈語音合成模型 MAI-Voice-2,現已在 Microsoft Foundry 提供,並正整合至 VSCode 和 Dynamics 365 Contact Center。
Microsoft AI 將 MAI-Image-2.5-Pro 與 MAI-Voice-2-Flash 開放公開預覽,分別面向高保真圖像生成與高速、大規模語音場景。
Cloudflare 發佈 Clef 和 Clef-flash 兩款面向 AI 智能體的決策模型,可對輸入同時回答多個預設問題並輸出各選項的概率,供下游程式路由、升級或轉交人工。
Meta 發佈 Muse Image,並預覽 Muse Video;兩者均為 Meta Superintelligence Labs 開發的媒體生成模型。Muse Image 可調用網絡搜尋和編碼工具、自我修訂,並支援精準編輯與多參考圖像構圖;Meta 稱增加推理時計算可提升生成質素。
推薦理由:文中比較 Muse Image 的推理時計算策略,指出把資源投入刻意推理比 Best-of-N 更能持續提升圖像品質,工具調用亦可補足單靠推理的不足。
Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。
推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。
MiniMax 正式發佈 M3,這款開放權重模型整合編碼與智能體能力、最高 1M tokens 上下文,以及原生圖像和影片輸入與桌面操作能力。M3 採用 MiniMax Sparse Attention(MSA),在上下文長度達 1M tokens 時,每 token 計算量為上一代的 1/20,prefilling 提速逾 9×、decoding 提速逾 15×。
MiniMax 發佈 H3 通用多模態生成模型,可理解文字、圖像、影片與音訊的統一上下文,並生成最長 15 秒、2K 解析度的原生立體聲影片。H3 預設提供 2K 輸出,官方表示其 2K 每秒價格低於主流模型的三分之一,並計劃在未來幾天內於適用法律法規範圍內開放模型權重。模型面向廣告、品牌、電商等創作場景,MiniMax 表示完整技術報告將於稍後分享。
MiniMax 發佈 Music 3.0 音樂生成模型,可依據創意概念及可選歌詞,在一次生成中完成最長 5 分鐘的歌曲。模型採用 8 層 RVQ、由 Qwen3.5-8B 初始化的 8B Global LLM、0.6B Local LLM,並透過 2.4B flow-matching 模組及 123M Flow-VAE 重建音訊。
Artificial Analysis 評測顯示,Claude Opus 5.5 以 max effort 在 Artificial Analysis Intelligence Index 得分 58,為其測得的最高分。
推薦理由:報告將多項基準表現、Agent 知識工作成績與每項任務成本並列,呈現模型在不同 effort 設定下的表現與成本取捨。
Artificial Analysis 的評測指出,GPT-6 Sol 和 Luna 定價約為 GPT-5.6 的一半,Intelligence Index 分數大致持平。
推薦理由:文章並列價格、單項任務成本與多項基準結果,呈現降本幅度與不同能力變化並不一致,並指出 GDPval-AA v2.1 的回退與交付內容縮短相關。
Artificial Analysis 的評測顯示,Claude Sonnet 5.5 在 Intelligence Index 取得 56 分,於 max effort 下排名第 2,僅落後 Opus 5.5(max)2 分。
推薦理由:評測把 Claude Sonnet 5.5 的基準表現與每項任務的 token 消耗、成本對照,呈現其接近 Opus 5.5 時的資源代價。
GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,其 Intelligence Index 比 GPT-6 Astra 低 1 分,最高 effort 下的每項 Intelligence Index 任務成本不到後者四分之一。
推薦理由:這篇評測以同一框架對照 GPT-6.1 Sol、GPT-6 Sol 和 GPT-6 Astra 的 Intelligence Index 分數與單項任務成本,為比較新版本接近 Astra 分數時的成本取捨提供具體依據。
Google DeepMind 的 Gemini 4 Argon(高推理設定)在 Artificial Analysis Intelligence Index 得分 53,與 GPT-6 Astra(max)持平。
推薦理由:文章對照 Gemini 4 Argon 與 GPT-6 Astra 的指數分數、任務成本和智能體評測,呈現相近總分下的成本差距及不同基準表現。