跳到正文

#語音

今日 12 條
今天10月6日週二
  1. Zyphra Research59

    Zyphra 發佈 ZONOS2 即時文字轉語音模型,支援高保真聲音複製

    Zyphra 發佈採用 Apache 2.0 授權的即時文字轉語音模型 ZONOS2,支援高保真聲音複製。模型採用 MoE 架構,規模由前代的 1.6B 增至 8B,即時生成吞吐量較前代提升 4x,並支援最長一分鐘的多語言及語碼轉換語音生成。ZONOS2 提供 stable 和 expressive 兩種模式,分別側重乾淨輸出,以及聲音複製的自然度與保真度。

  2. ElevenLabs:Blog70

    ElevenLabs 發佈 Eleven v4 與 Eleven v4 Turbo 文字轉語音模型

    ElevenLabs 發佈 Eleven v4 文字轉語音模型及低延遲版本 Eleven v4 Turbo,兩者均支援 90 多種語言。Eleven v4 可按語氣、節奏、情緒、角色和上下文生成語音,並改善多説話者對話、聲音克隆及跨語言口音保留。Turbo 的中位推理延遲約 100ms,兩款模型現已可透過 ElevenAgents、ElevenCreative 和 ElevenAPI 使用。

  3. 小米 MiMo:官網發佈與博客58

    小米發佈 MiMo-V2.5-TTS 語音合成模型系列

    小米發佈 MiMo-V2.5-TTS 系列語音合成模型,涵蓋預設聲線、按文字描述設計新聲線,以及以參考音訊複製聲音三種用途。系列支援自然語言風格指令、行內音訊標籤和劇本式結構輸入;聲音複製只需短音訊樣本,無須額外訓練、標註或微調。三款模型限時免費開放於 Xiaomi MiMo API 平台,整合技能已開源於 GitHub 倉庫 XiaomiMiMo/MiMo-Skills。

  4. 小米 MiMo:官網發佈與博客59

    小米 MiMo 發佈開源語音辨識模型 MiMo-V2.5-ASR

    小米 MiMo 發佈開源語音辨識模型 MiMo-V2.5-ASR,支援中英雙語、中文方言、語碼轉換、歌詞辨識、噪音環境及多説話者場景。頁面列出多項公開及內部基準測試結果,MiMo-V2.5-ASR 在 Open ASR Leaderboard 的英文辨識平均 WER 為 5.73(WER 越低越好)。模型採用大規模中期訓練、高質素監督式微調(SFT)及強化學習(RL)算法。

  5. 字節 Seed:Research Feed62

    Seed Audio 1.0 音訊創作模型發佈,支援多要素統一生成

    字節 Seed 發佈音訊創作模型 Seed Audio 1.0,以統一框架生成對白、音效及環境聲,並支援按時間線控制聲音進場。模型支援 100ms 間隔精度的時間控制、參考音訊延展生成及 20+ 種語言;單次可生成約 2 分鐘音訊,並可繼續延長。Seed Audio 1.0 已在火山方舟體驗中心上線。

10月3日週六
  1. Microsoft AI:官方博客48

    MAI-Transcribe-1.5 推出,支援關鍵詞偏置

    MAI-Transcribe-1.5 現可按使用者提供的領域關鍵詞清單調整轉錄預測,提升專業詞彙識別。啟用關鍵詞偏置後,模型在 FLEURS 多語言基準測試上的 Word-Error-Rate(WER)降低 30%。模型會結合上下文決定何時套用偏置,而非強行匹配,並維持一般語音的準確度。

10月2日週五
9月25日週五
  1. Sarvam AI66

    Sarvam AI 發佈 Saaras V4 語音識別模型

    Sarvam AI 發佈 Saaras V4 語音識別模型,稱其在 22 種印度語言達到 SOTA,並支援五種轉寫格式。模型結合音訊編碼器與從零開始訓練的 3B 混合狀態空間 LLM 解碼器,在七個英語基準測試中取得最低平均 WER。Saaras V4 支援低延遲串流,首個 token 延遲低於 150 ms。

9月23日週三
9月16日週三
9月15日週二
  1. OpenMOSS / 復旦NLP / 上海創智 / MOSI61

    OpenMOSS 開源 MOSS-Transcribe-Diarize 0.9B 音訊理解模型

    OpenMOSS 開源 MOSS-Transcribe-Diarize 0.9B,這款端到端音訊理解模型可在單次處理中完成長篇多説話人音訊轉寫、説話人分離及時間戳標註。模型支援 50+ 種語言,亦可選擇輸出聲學事件標註。整體表現更高的 MOSS-Transcribe-Diarize Pro 可透過線上 playground 使用。

9月8日週二
  1. FireRedTeam:原創語音與多模態項目65

    FireRedTeam 發佈 FireRedAudio 通用音訊語言模型及 PyTorch 程式碼

    FireRedTeam 發佈 FireRedAudio,一款以共用 9B 參數 LLM 為基礎、涵蓋音訊理解與語音生成的音訊語言模型。Audio Encoder 負責理解、RedAE pathway 負責生成;模型支援 ASR、音訊理解、零樣本及指令式 TTS、語音編輯,並可處理最長一小時的錄音。除 ASR 外,其他功能只支援中文和英文。

9月6日週日
  1. OpenMOSS / 復旦NLP / 上海創智 / MOSI59

    OpenMOSS 發佈 0.1B 參數多語言語音生成模型 MOSS-TTS-Nano

    OpenMOSS 團隊與 MOSI.AI 發佈開源語音生成模型 MOSS-TTS-Nano,參數量為 0.1B,支援 20 種語言。模型提供聲音複製和串流生成,並採用 Audio Tokenizer + LLM 純自回歸架構。ONNX CPU 版本在團隊測試中處理效率接近原版的 2 倍,並可在 MacBook Air M4 單核流暢運行。

  2. OpenMOSS / 復旦NLP / 上海創智 / MOSI59

    OpenMOSS 團隊開源發佈 MOSS-Audio 4 款音訊理解模型

    OpenMOSS 團隊開源 MOSS-Audio,推出 4B、8B 的 Instruct 和 Thinking 版本。模型支援語音、環境音及音樂理解、音訊描述、時間感知問答與複雜推理,並採用跨層特徵注入和時間標記設計。在 MMAU、MMAU-Pro、MMAR 和 MMSU 四項通用音訊理解基準中,MOSS-Audio-8B-Thinking 的平均準確率為 71.08。

8月27日週四
  1. Google DeepMind69

    Google DeepMind 發佈 Gemini 3.5 Transcribe 語音轉文字模型

    Google DeepMind 發佈 Gemini 3.5 Transcribe,這是一款面向智能語音互動的語音轉文字模型。它可透過 Live API 以低於一秒的延遲進行即時串流,亦可經 Interactions API 處理預錄音訊,提供説話者歸屬及逐字時間戳。

    推薦理由:材料同時提供串流與非串流 WER,以及相較 Chirp 3 的最終轉錄時間改善幅度,讓準確度與延遲兩項表現有具體數據可供對照。

8月25日週二
8月11日週二
7月30日週四
7月14日週二
7月8日週三
6月9日週二