跳到正文

全部動態

今日 81 條
今天10月6日週二
  1. ElevenLabs:Blog70

    ElevenLabs 發佈 Eleven v4 與 Eleven v4 Turbo 文字轉語音模型

    ElevenLabs 發佈 Eleven v4 文字轉語音模型及低延遲版本 Eleven v4 Turbo,兩者均支援 90 多種語言。Eleven v4 可按語氣、節奏、情緒、角色和上下文生成語音,並改善多説話者對話、聲音克隆及跨語言口音保留。Turbo 的中位推理延遲約 100ms,兩款模型現已可透過 ElevenAgents、ElevenCreative 和 ElevenAPI 使用。

  2. Liquid AI 模型與工程博客69

    Liquid AI 發佈可在裝置端運行的 LFM2.5-2.6B 模型

    Liquid AI 發佈 2.6B 參數的 LFM2.5-2.6B,這款智能體模型可完全在裝置端運行,支援規劃、工具調用及多步任務。基準測試中,它在所有指令遵循基準及幾乎所有工具使用基準領先對照模型,較大型模型則在編碼上佔優。CPU 解碼速度在 M5 Max 達 220 tokens/s、Ryzen AI Max+ 395 達 113 tokens/s,手機上為 30 tokens/s。

  3. Liquid AI 模型與工程博客63

    Liquid AI 發佈 LFM2.5-VL-3B 端側視覺語言模型

    Liquid AI 發佈視覺語言模型 LFM2.5-VL-3B,稱其視覺表現可媲美參數量兩倍的模型,並在多種 CPU、GPU 部署中運行更快。相較前代,屏幕理解、工具調用、定位及多圖輸入均有提升,ScreenSpot-v2 平均得分為 80.7,ToolSandbox 由 26.4 升至 59.5,RefCOCO precision@1 由 57.1 升至 87.9。

  4. Suno:Blog74

    Suno 推出新一代音樂模型 v6,提供三款模型並擴展創作功能

    Suno 推出新一代音樂模型 v6,分為 v6、v6-wild 和 v6-mini 三款,分別支援不同創作需求。v6 和 v6-wild 提供予 Pro、Premier 訂閲用戶,v6-mini 則開放所有用戶使用;三者均能理解人聲、樂器、歌曲結構、情緒和參考風格等描述。新功能包括以文字指令編輯歌曲局部、混搭多個來源、取樣並分離音訊,以及從文字、音訊、圖像或影片創作音樂。

  5. Black Forest Labs:Blog69

    FLUX 3 Video 第一部分:影片生成初始版本開放使用

    Black Forest Labs 已透過 BFL API 及指定合作夥伴開放 FLUX 3 Video 初始版本,支援文字及圖像生成影片。片段最長 20 秒,可輸出 HD(720p)及經升頻處理的 Full HD(1080p),並同步生成原生音訊,另支援影片延續、多鏡頭生成及多語言對白與唇形同步。內部評測稱其文字生成影片表現優於現有 SOTA,圖像生成影片則與 Seedance 2.0 持平。

  6. METR:Blog61

    METR 發佈 Claude Opus 5.5 部署前評估摘要

    METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。

  7. 小米 MiMo:官網發佈與博客58

    小米發佈 MiMo-V2.5-TTS 語音合成模型系列

    小米發佈 MiMo-V2.5-TTS 系列語音合成模型,涵蓋預設聲線、按文字描述設計新聲線,以及以參考音訊複製聲音三種用途。系列支援自然語言風格指令、行內音訊標籤和劇本式結構輸入;聲音複製只需短音訊樣本,無須額外訓練、標註或微調。三款模型限時免費開放於 Xiaomi MiMo API 平台,整合技能已開源於 GitHub 倉庫 XiaomiMiMo/MiMo-Skills。

  8. 小米 MiMo:官網發佈與博客59

    小米 MiMo 發佈開源語音辨識模型 MiMo-V2.5-ASR

    小米 MiMo 發佈開源語音辨識模型 MiMo-V2.5-ASR,支援中英雙語、中文方言、語碼轉換、歌詞辨識、噪音環境及多説話者場景。頁面列出多項公開及內部基準測試結果,MiMo-V2.5-ASR 在 Open ASR Leaderboard 的英文辨識平均 WER 為 5.73(WER 越低越好)。模型採用大規模中期訓練、高質素監督式微調(SFT)及強化學習(RL)算法。

  9. 字節 Seed:Research Feed66

    Seedream 5.0 Pro 發佈,支援資訊圖生成與交互式精準編輯

    Seedream 5.0 Pro 正式發布,作為多模態圖像創作模型,提升圖文匹配、結構合理性、文字渲染及畫面美感。其四項核心能力包括高密度資訊圖生成、交互式精準編輯、影像與人像質感提升,以及十餘種常用語言的原生輸入與生成。目前模型已在火山方舟體驗中心上線,並將陸續在豆包、即夢上線;項目主頁:https://seed.bytedance.com/seedream5_0_pro

  10. 字節 Seed:Research Feed62

    Seed Audio 1.0 音訊創作模型發佈,支援多要素統一生成

    字節 Seed 發佈音訊創作模型 Seed Audio 1.0,以統一框架生成對白、音效及環境聲,並支援按時間線控制聲音進場。模型支援 100ms 間隔精度的時間控制、參考音訊延展生成及 20+ 種語言;單次可生成約 2 分鐘音訊,並可繼續延長。Seed Audio 1.0 已在火山方舟體驗中心上線。

  11. 字節 Seed:Research Feed78

    Seedance 2.5 正式發布,單次最長可生成 30 秒影片並支援多模態參考

    字節 Seed 正式發布新一代影片創作模型 Seedance 2.5,單次最長可生成 30 秒影片,並支援多輪延長、多模態參考及時間戳精準編輯。用戶單次最多可輸入 30 張圖片、10 段影片和 10 段音訊作參考,模型亦提升長影片連貫性及綠幕、視角和運鏡編輯能力。Seedance 2.5 正陸續於即夢 AI、豆包專業版上線,API 服務近期亦將上線火山方舟。

    推薦理由:Seedance 2.5 將單次影片生成時長提升至 30 秒,並支援多輪延長、多模態參考及時間戳編輯,呈現影片創作由片段輸出走向完整流程的能力變化。

  12. 字節 Seed:Research Feed75

    字節 Seed 發佈 SeedRealtime 原生音訊及影片全雙工大模型,邁向全模態自然互動

    字節 Seed 正式推出原生音訊及影片全雙工大模型 SeedRealtime,透過統一架構在連續多模態資訊流中即時互動。SeedRealtime 已在豆包 App 全量上線;端到端人工評測顯示,與級聯模型相比,其音訊及影片對話節奏問題減少一半,單次對話順暢、完整交流的機率亦有明顯提升。項目主頁:https://seed.bytedance.com/seedrealtime