ElevenLabs 發佈 Scribe v2 Realtime 即時語音轉文字模型
ElevenLabs 發佈 Scribe v2 Realtime,即時語音轉文字模型可在低於 150 ms 內轉錄語音,面向語音智能體、會議助理及即時字幕等場景。
ElevenLabs 發佈 Scribe v2 Realtime,即時語音轉文字模型可在低於 150 ms 內轉錄語音,面向語音智能體、會議助理及即時字幕等場景。
ElevenLabs 推出 Scribe v2,面向大規模批量轉錄、字幕製作及字幕生成,並提升對長篇、複雜錄音的處理穩定性與準確度。Scribe v2 在業界標準基準測試中錄得最低詞錯誤率,支援最多 100 個詞語或短語的關鍵詞提示,以及涵蓋最多 56 個類別、附精確時間戳的實體偵測。
ElevenLabs 的 Eleven v3 文字轉語音模型已結束 Alpha 階段,現已在所有平台正式提供。內部基準涵蓋 8 種語言、27 個類別,模型錯誤率由 15.3% 降至 4.9%,減少 68%。測試中,用戶有 72% 的情況偏好新版本;模型處理數字、符號及專門記法的準確度亦有所提升。
Zyphra Research 發佈 Zonos-v0.1 beta,開源兩款採用 Transformer 與 SSM hybrid 架構的 1.6B TTS 模型,授權為 Apache 2.0。
Zyphra 發佈採用 Apache 2.0 授權的即時文字轉語音模型 ZONOS2,支援高保真聲音複製。模型採用 MoE 架構,規模由前代的 1.6B 增至 8B,即時生成吞吐量較前代提升 4x,並支援最長一分鐘的多語言及語碼轉換語音生成。ZONOS2 提供 stable 和 expressive 兩種模式,分別側重乾淨輸出,以及聲音複製的自然度與保真度。
Suno 發佈 v5.5,並推出 Voices、Custom models 和 My Taste,加入以用戶聲音、原創音樂及音樂偏好為基礎的個人化功能。
推薦理由:更新把個人化分為歌聲、原創曲目調校和偏好學習三條路徑,也交代各功能面向哪些用戶開放。
Liquid AI 發佈 LFM2-Audio-1.5B,這款 1.5B 參數模型支援音訊與文字輸入及生成。模型在 VoiceBench 九項音訊互動基準的總分為 56.78,ASR 基準平均詞錯誤率為 7.24。以 4 秒輸入波形測試,平均端到端延遲低於 100 ms;Liquid AI 亦提供 Python 套件及語音對話應用參考實作。
Cohere 發佈開源語音辨識模型 Cohere Transcribe,在 Hugging Face Open ASR Leaderboard 以 5.42% 平均 WER 排名第一。
ElevenLabs 發佈 Eleven v4 文字轉語音模型及低延遲版本 Eleven v4 Turbo,兩者均支援 90 多種語言。Eleven v4 可按語氣、節奏、情緒、角色和上下文生成語音,並改善多説話者對話、聲音克隆及跨語言口音保留。Turbo 的中位推理延遲約 100ms,兩款模型現已可透過 ElevenAgents、ElevenCreative 和 ElevenAPI 使用。
小米發佈 MiMo-V2.5-TTS 系列語音合成模型,涵蓋預設聲線、按文字描述設計新聲線,以及以參考音訊複製聲音三種用途。系列支援自然語言風格指令、行內音訊標籤和劇本式結構輸入;聲音複製只需短音訊樣本,無須額外訓練、標註或微調。三款模型限時免費開放於 Xiaomi MiMo API 平台,整合技能已開源於 GitHub 倉庫 XiaomiMiMo/MiMo-Skills。
小米 MiMo 發佈開源語音辨識模型 MiMo-V2.5-ASR,支援中英雙語、中文方言、語碼轉換、歌詞辨識、噪音環境及多説話者場景。頁面列出多項公開及內部基準測試結果,MiMo-V2.5-ASR 在 Open ASR Leaderboard 的英文辨識平均 WER 為 5.73(WER 越低越好)。模型採用大規模中期訓練、高質素監督式微調(SFT)及強化學習(RL)算法。
字節 Seed 發佈音訊創作模型 Seed Audio 1.0,以統一框架生成對白、音效及環境聲,並支援按時間線控制聲音進場。模型支援 100ms 間隔精度的時間控制、參考音訊延展生成及 20+ 種語言;單次可生成約 2 分鐘音訊,並可繼續延長。Seed Audio 1.0 已在火山方舟體驗中心上線。
OpenAI 發佈 gpt-4o-mini-transcribe-2025-12-15、gpt-4o-mini-tts-2025-12-15、gpt-realtime-mini-2025-12-15 及 gpt-audio-mini-2025-12-15 四款語音模型快照,並擴大 Custom Voices 開放範圍。
Microsoft AI 發佈語音生成模型 MAI-Voice-1,並在 LMArena 開始公開測試基礎模型 MAI-1-preview。MAI-Voice-1 可在單張 GPU 上用不到 1 秒生成 1 分鐘音訊,已支援 Copilot Daily 和 Podcasts,並在 Copilot Labs 開放體驗。
Microsoft 的語音識別模型 MAI-Transcribe-1 已在 Microsoft Foundry 開放公開預覽,音訊定價為每小時 $0.36。該模型正分階段部署至 Copilot 的 Voice mode 和 Microsoft Teams,並支援會議轉錄、即時字幕及聽寫等用途。
Microsoft AI 發佈 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2,三款模型現已可在 Microsoft Foundry 和 MAI Playground 使用。
MAI-Transcribe-1.5 現可按使用者提供的領域關鍵詞清單調整轉錄預測,提升專業詞彙識別。啟用關鍵詞偏置後,模型在 FLEURS 多語言基準測試上的 Word-Error-Rate(WER)降低 30%。模型會結合上下文決定何時套用偏置,而非強行匹配,並維持一般語音的準確度。
Microsoft 發佈語音合成模型 MAI-Voice-2,現已在 Microsoft Foundry 提供,並正整合至 VSCode 和 Dynamics 365 Contact Center。
Microsoft AI 將 MAI-Image-2.5-Pro 與 MAI-Voice-2-Flash 開放公開預覽,分別面向高保真圖像生成與高速、大規模語音場景。
Microsoft AI 發佈語音辨識模型 MAI-Transcribe-2,主打高準確度、低延遲及較低成本。
Microsoft AI 發佈首款串流轉錄模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最終及部分轉錄準確度排名均列第一。
Inception Labs 發佈 Mercury 2.5,稱其相較 Mercury 2 智能提升 40%,並維持低延遲、低成本的服務特性。
Microsoft AI 發佈 MAI-Transcribe-2-Streaming 即時轉錄模型,以及 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 兩款文字轉語音模型。
Tavus 發佈 Griffin,稱其為首個「Human Interaction Model」(HIM);其研究中,48% 參與者在一分鐘視像通話後認為 Griffin 是真人。
Sarvam AI 發佈 Saaras V4 語音識別模型,稱其在 22 種印度語言達到 SOTA,並支援五種轉寫格式。模型結合音訊編碼器與從零開始訓練的 3B 混合狀態空間 LLM 解碼器,在七個英語基準測試中取得最低平均 WER。Saaras V4 支援低延遲串流,首個 token 延遲低於 150 ms。
Google DeepMind 推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,支援自訂聲線、逐句控制表演及雙人對話生成。
推薦理由:兩款 TTS 模型涵蓋逐句演繹與長篇生成,Flash TTS 另可自訂聲線;聲音複製設有同意驗證,生成音訊加入 SynthID 水印,呈現創作控制與防護安排。
inclusionAI 發佈 Realtime-Venus 全雙工互動系統,提供視聽版 Realtime-Venus-Omni 與音訊版 Realtime-Venus-Audio,兩者均為 9B。
Google DeepMind 發佈 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,前者面向規模化與成本效率,後者針對高複雜度任務。
推薦理由:文章區分兩款模型在規模化成本效率與高複雜度任務上的定位,並列出語音代理基準成績,方便比較其應用取向。
OpenMOSS 開源 MOSS-Transcribe-Diarize 0.9B,這款端到端音訊理解模型可在單次處理中完成長篇多説話人音訊轉寫、説話人分離及時間戳標註。模型支援 50+ 種語言,亦可選擇輸出聲學事件標註。整體表現更高的 MOSS-Transcribe-Diarize Pro 可透過線上 playground 使用。
FireRedTeam 公開 FireRedTTS3 語音生成與編輯系統,並提供 FireRedTTS3-Base 和 FireRedTTS3-Instruct 兩個版本的模型與 PyTorch 程式碼。
FireRedTeam 發佈 FireRedAudio,一款以共用 9B 參數 LLM 為基礎、涵蓋音訊理解與語音生成的音訊語言模型。Audio Encoder 負責理解、RedAE pathway 負責生成;模型支援 ASR、音訊理解、零樣本及指令式 TTS、語音編輯,並可處理最長一小時的錄音。除 ASR 外,其他功能只支援中文和英文。
OpenMOSS 團隊與 MOSI.AI 發佈開源語音生成模型 MOSS-TTS-Nano,參數量為 0.1B,支援 20 種語言。模型提供聲音複製和串流生成,並採用 Audio Tokenizer + LLM 純自回歸架構。ONNX CPU 版本在團隊測試中處理效率接近原版的 2 倍,並可在 MacBook Air M4 單核流暢運行。
OpenMOSS 團隊開源 MOSS-Audio,推出 4B、8B 的 Instruct 和 Thinking 版本。模型支援語音、環境音及音樂理解、音訊描述、時間感知問答與複雜推理,並採用跨層特徵注入和時間標記設計。在 MMAU、MMAU-Pro、MMAR 和 MMSU 四項通用音訊理解基準中,MOSS-Audio-8B-Thinking 的平均準確率為 71.08。
Google DeepMind 發佈 Gemini 3.5 Transcribe,這是一款面向智能語音互動的語音轉文字模型。它可透過 Live API 以低於一秒的延遲進行即時串流,亦可經 Interactions API 處理預錄音訊,提供説話者歸屬及逐字時間戳。
推薦理由:材料同時提供串流與非串流 WER,以及相較 Chirp 3 的最終轉錄時間改善幅度,讓準確度與延遲兩項表現有具體數據可供對照。
IBM 發佈 Granite 4.2 語言模型,提供 3B、8B 和 30B 參數版本,並加入原生逐步推理與工具調用能力,面向企業智能體工作流程。模型基於 Granite 4.0 foundation models,採多階段強化學習;8B 和 30B 版本另經 agentic RL,並以 1 trillion tokens 的合成程式碼訓練,採 Apache 2.0 授權。
NVIDIA Magpie Multilingual TTS 最新版本擴展至 12 種語言,是一款 364M 參數、開放權重的語音合成模型,可部署於自有基礎設施並按工作負載調校。
Google DeepMind 今日在 Google Flow Music 推出音樂生成模型 Lyria 3.5,並提升旋律、歌詞及人聲生成品質。它可生成更豐富、複雜且自然的旋律結構,並改善歌詞的提示詞遵循度與結構意識,以及人聲的真實感、情感細膩度和發音。使用者也可更容易控制生成內容的節奏和時長。
Mercury 2 是 Inception Labs 推出的擴散式推理語言模型,官方稱其在標準 NVIDIA GPU 上解碼速度達 1,000+ tokens/second,300-token 推理鏈完成時間不到 300ms。
OpenAI 介紹 GPT-Live,將其定位為面向自然人機互動的新一代語音模型,並稱其現正為 ChatGPT Voice 提供支援。
Google DeepMind 發佈 Gemini 3.5 Live Translate,這款音訊模型可自動識別 70+ 種語言,並進行近乎即時的語音轉語音翻譯。
推薦理由:模型以連續生成譯語音訊取代逐輪等待,並透過 API、Google Meet 和 Google Translate 進入開發、企業會議及日常翻譯場景,呈現其部署路徑。