跳到正文

#模型發佈

今日 20 條
10月6日週二
  1. 小米 MiMo:官網發佈與博客59

    小米 MiMo 發佈開源語音辨識模型 MiMo-V2.5-ASR

    小米 MiMo 發佈開源語音辨識模型 MiMo-V2.5-ASR,支援中英雙語、中文方言、語碼轉換、歌詞辨識、噪音環境及多説話者場景。頁面列出多項公開及內部基準測試結果,MiMo-V2.5-ASR 在 Open ASR Leaderboard 的英文辨識平均 WER 為 5.73(WER 越低越好)。模型採用大規模中期訓練、高質素監督式微調(SFT)及強化學習(RL)算法。

  2. 字節 Seed:Research Feed66

    Seedream 5.0 Pro 發佈,支援資訊圖生成與交互式精準編輯

    Seedream 5.0 Pro 正式發布,作為多模態圖像創作模型,提升圖文匹配、結構合理性、文字渲染及畫面美感。其四項核心能力包括高密度資訊圖生成、交互式精準編輯、影像與人像質感提升,以及十餘種常用語言的原生輸入與生成。目前模型已在火山方舟體驗中心上線,並將陸續在豆包、即夢上線;項目主頁:https://seed.bytedance.com/seedream5_0_pro

  3. 字節 Seed:Research Feed62

    Seed Audio 1.0 音訊創作模型發佈,支援多要素統一生成

    字節 Seed 發佈音訊創作模型 Seed Audio 1.0,以統一框架生成對白、音效及環境聲,並支援按時間線控制聲音進場。模型支援 100ms 間隔精度的時間控制、參考音訊延展生成及 20+ 種語言;單次可生成約 2 分鐘音訊,並可繼續延長。Seed Audio 1.0 已在火山方舟體驗中心上線。

  4. 字節 Seed:Research Feed78

    Seedance 2.5 正式發布,單次最長可生成 30 秒影片並支援多模態參考

    字節 Seed 正式發布新一代影片創作模型 Seedance 2.5,單次最長可生成 30 秒影片,並支援多輪延長、多模態參考及時間戳精準編輯。用戶單次最多可輸入 30 張圖片、10 段影片和 10 段音訊作參考,模型亦提升長影片連貫性及綠幕、視角和運鏡編輯能力。Seedance 2.5 正陸續於即夢 AI、豆包專業版上線,API 服務近期亦將上線火山方舟。

    推薦理由:Seedance 2.5 將單次影片生成時長提升至 30 秒,並支援多輪延長、多模態參考及時間戳編輯,呈現影片創作由片段輸出走向完整流程的能力變化。

  5. 字節 Seed:Research Feed75

    字節 Seed 發佈 SeedRealtime 原生音訊及影片全雙工大模型,邁向全模態自然互動

    字節 Seed 正式推出原生音訊及影片全雙工大模型 SeedRealtime,透過統一架構在連續多模態資訊流中即時互動。SeedRealtime 已在豆包 App 全量上線;端到端人工評測顯示,與級聯模型相比,其音訊及影片對話節奏問題減少一半,單次對話順暢、完整交流的機率亦有明顯提升。項目主頁:https://seed.bytedance.com/seedrealtime

10月5日週一
  1. IT之家37

    消息指 Reflection 等多家西方企業本月將推出開放權重 AI 模型

    Reflection 等多家西方企業據稱本月將推出開放權重 AI 模型,人工智能模型領域的競爭將進一步升級。開放權重模型支援客戶本地部署,對微調及推理數據安全要求嚴格的部分行業具關鍵優勢。Reflection 即將推出的模型預計初期落後於美國競爭對手最先進的閉源模型,但足以與中國同業的頂級開放權重模型競爭。

10月4日週日
10月3日週六
  1. Hacker News:AI 熱帖37

    Show HN:德國主權 AI 新模型 Kolibri

    測試者在 RTX pro 6000 配置上試用德國主權 AI 新模型 Kolibri,回報其 3B 活躍參數在 fp8 下約有 170 tkn/s 的速度。測試者表示,模型雖能找到正確做法,仍會因過度思考消耗過多 tokens,但速度表現不錯。

  2. IT之家64

    Black Forest Labs 發佈 FLUX 3 Image,支援最高 4K 生成及精確排布畫面元素

    Black Forest Labs 發佈圖像生成模型 FLUX 3 Image,最高支援生成 4K 解像度圖片,並可用座標網格和邊界框精確安排畫面元素。模型單次最多可融入 10 張參考圖像並指定物件位置,也可修改指定區域而保持其他像素不變;官方稱其能在像素級別維持原圖內容,以支援精確多輪編輯。

  3. MiniMax:Blog76

    MiniMax M2.5:為真實工作場景生產力而打造

    MiniMax 發佈 M2.5 與 M2.5-Lightning,稱兩款模型在編碼、智能體工具調用、搜索及辦公任務達到 SOTA,M2.5 在 SWE-Bench Verified 得分 80.2%。

    推薦理由:文中並列 SWE-Bench Verified 成績、不同腳手架的評測結果、執行時間與定價,方便比較 M2.5 的編碼表現和使用成本。

  4. Microsoft AI:官方博客48

    MAI-Transcribe-1.5 推出,支援關鍵詞偏置

    MAI-Transcribe-1.5 現可按使用者提供的領域關鍵詞清單調整轉錄預測,提升專業詞彙識別。啟用關鍵詞偏置後,模型在 FLEURS 多語言基準測試上的 Word-Error-Rate(WER)降低 30%。模型會結合上下文決定何時套用偏置,而非強行匹配,並維持一般語音的準確度。

  5. Meta AI:Research Blog76

    Meta 發佈 Muse Image 並預覽 Muse Video

    Meta 發佈 Muse Image,並預覽 Muse Video;兩者均為 Meta Superintelligence Labs 開發的媒體生成模型。Muse Image 可調用網絡搜尋和編碼工具、自我修訂,並支援精準編輯與多參考圖像構圖;Meta 稱增加推理時計算可提升生成質素。

    推薦理由:文中比較 Muse Image 的推理時計算策略,指出把資源投入刻意推理比 Best-of-N 更能持續提升圖像品質,工具調用亦可補足單靠推理的不足。