跳到正文

語音與音頻

AI 語音與音頻的進展:語音合成、實時對話、音樂生成與音頻理解的模型與產品。

28條精選相關主題多模態AI 影片產品更新

最新精選

第 1–20 條 · 共 28 條
今天10月6日週二
9月30日週三
  1. Hugging Face Blog65

    Open TTS Leaderboard 為多語言文字轉語音與聲音複製提供可擴展評估

    Hugging Face 建立 Open TTS Leaderboard,以客觀指標評估開源、多語言 TTS 模型及聲音複製能力。評估涵蓋 WER/CER、批次推理速度(RTFx)、首段音訊延遲(TTFA)及説話者相似度(SIM),可把單個模型的評估時間由數週縮短至數小時。排行榜不取代人工偏好評選,並設有 Listen 頁籤供用户比較生成音訊及投票;其指標不直接衡量自然度、表現力或聽者偏好。

    推薦理由:排行榜以客觀指標並列呈現語音清晰度、説話者相似度與速度表現,並保留聆聽投票,方便比較多語言及聲音複製模型。

9月23日週三
9月16日週三
9月10日週四
8月28日週五
  1. Hugging Face Blog68

    Open ASR Leaderboard 新增 Hindi、Indian English 評測集,首度納入全球南方語言

    Voice Arena 與 Hugging Face 為 Open ASR Leaderboard 加入 Monsoon en-IN 和 Monsoon hi-IN 評測集,涵蓋 Indian English 與 Hindi,令 Hindi 成為其多語言分頁首個 Indic language。

    推薦理由:這批評測集把説話者背景與可接受的拼寫變體納入 ASR 評估,讓總體 WER 之外的區域差異和 Hindi 正字法誤差更容易被辨識。

8月27日週四
  1. Google DeepMind69

    Google DeepMind 發佈 Gemini 3.5 Transcribe 語音轉文字模型

    Google DeepMind 發佈 Gemini 3.5 Transcribe,這是一款面向智能語音互動的語音轉文字模型。它可透過 Live API 以低於一秒的延遲進行即時串流,亦可經 Interactions API 處理預錄音訊,提供説話者歸屬及逐字時間戳。

    推薦理由:材料同時提供串流與非串流 WER,以及相較 Chirp 3 的最終轉錄時間改善幅度,讓準確度與延遲兩項表現有具體數據可供對照。

6月9日週二
4月16日週四
  1. Google DeepMind68

    Google DeepMind 發佈 Gemini 3.1 Flash TTS,加入音訊標籤細調語音表現

    Google DeepMind 發佈 Gemini 3.1 Flash TTS,提升文字轉語音的可控性、表現力與品質,並加入音訊標籤細調語音表現。模型支援 70+ 種語言及原生多説話者對話,在 Artificial Analysis TTS leaderboard 的 Elo 分數為 1,211。

    推薦理由:文章聚焦音訊標籤如何細調語氣、節奏與表達,並列出 Gemini 3.1 Flash TTS 面向開發者、企業及 Workspace 用户的推出渠道。

3月26日週四
  1. Google DeepMind73

    Google DeepMind 推出 Gemini 3.1 Flash Live,提升語音 AI 的自然度與可靠性

    Google DeepMind 推出 Gemini 3.1 Flash Live,提升即時語音對話的精準度並降低延遲。它在 ComplexFuncBench Audio 得分 90.8%,在 Scale AI 的 Audio MultiChallenge 開啟 thinking 時得分 36.1%。

    推薦理由:原文以兩項語音基準呈現多步函數調用與複雜指令跟隨表現,並列出開發者、企業及一般用户的使用入口,可對照其能力與部署場景。

3月24日週二
  1. Mistral AI66

    Mistral AI 發佈 4B 參數語音生成模型 Voxtral TTS

    Mistral AI 發佈 4B 參數的 Voxtral TTS,支援 9 種語言語音生成。在典型的 10 秒語音樣本和 500 characters 輸入下,模型延遲為 70ms;人評顯示其自然度高於 ElevenLabs Flash v2.5,TTFA 相近。

    推薦理由:原文以人評比較 Voxtral TTS 與 ElevenLabs Flash v2.5 的自然度和 TTFA,並列出模型延遲及 API 定價,提供評估語音智能體應用的具體依據。

3月7日週六
  1. Google Research64

    WAXAL 為 27 種撒哈拉以南非洲語言提供大型開放語音資源

    Google Research 推出 WAXAL 開放語音資料集,首批涵蓋 27 種撒哈拉以南非洲語言,這些語言由超過 100 million 人使用。資料包含約 1,846 小時已轉錄的自然語音 ASR 數據,以及超過 565 小時高保真 TTS 錄音,採用 CC-BY-4.0 授權開放。資料收集由非洲學術及社區組織主導,Google 表示計劃持續擴充語言範圍。

    推薦理由:WAXAL 將自然口語 ASR 與高保真 TTS 語料以 CC-BY-4.0 授權開放,呈現支援低資源語言語音技術所需的資料建置基礎。

2月5日週四
1月14日週三
  1. Google Research70

    Google 發佈 MedGemma 1.5 4B,介紹 MedASR 醫療語音轉文字模型

    Google 發佈開放醫療多模態模型 MedGemma 1.5 4B,新增 CT、MRI、病理全切片及胸部 X 光時間序列等醫療影像處理能力。其基準結果較 MedGemma 1 4B 提升,例如 CT 疾病分類準確率為 61%(58%),MRI 為 65%(51%),醫療文本 EHRQA 為 90%(68%)。

    推薦理由:MedGemma 1.5 4B 在多項醫療影像與文本基準上較前代提升,文中列出的具體分數可用來比較不同任務的改進幅度。

12月13日週六
  1. Google DeepMind78

    Google DeepMind 更新 Gemini 2.5 Flash Native Audio,推出即時語音翻譯測試版

    Google DeepMind 更新 Gemini 2.5 Flash Native Audio,提升其處理複雜工作流、遵循指令及進行多輪語音對話的能力。它在 ComplexFuncBench Audio 得分為 71.5%,開發者指令遵循率由 84% 升至 90%;目前已在 Vertex AI 正式提供,並以預覽版開放 Gemini API。

    推薦理由:更新同時改善即時語音 Agent 的函數調用、指令遵循與多輪對話,並以 ComplexFuncBench Audio 的 71.5% 得分呈現多步函數調用表現。

11月19日週三
  1. Google Research75

    Google Research 介紹即時語音到語音翻譯模型,標準延遲為 2 秒

    Google Research 介紹端到端即時語音到語音翻譯模型,以原説話者聲線輸出譯音,標準延遲為 2 秒。模型採用串流架構及時間同步訓練資料,支援英語與西班牙語、德語、法語、意大利語、葡萄牙語之間的雙向翻譯。相關功能已在 Google Meet 伺服器端提供,並作為 Pixel 10 的內置裝置端功能推出;Pixel Voice Translate 採用級聯式流程以擴大語言覆蓋。

    推薦理由:文章説明串流架構如何配合時間同步訓練資料,把語音互譯的標準延遲控制在 2 秒,並以原説話者聲線輸出譯音,可瞭解低延遲與個人化如何結合。

10月28日週二
  1. Hugging Face Blog65

    Hugging Face Blog 介紹語音複製「同意閘門」設計,並提供示例 Space 和程式碼

    Hugging Face Blog 提出語音複製「同意閘門」設計並提供示例 Space 和程式碼,系統需先確認説話者已明確同意才會啟動。示例會為每次同意生成一組新句子,分別表達明確同意及補充語音的音素多樣性,並以語音識別確認同意語句。作者指出,仍可能有人用另一個 TTS 系統生成相符語句,並列出音訊來源驗證、説話者嵌入向量相似度及即時錄音 metadata 作為可探索方向。

    推薦理由:把每次生成的同意語句與語音辨識綁定,並以同一段錄音作複製輸入,展示了將知情同意設為工作流程前置條件的實作思路。

7月17日週四
  1. Mistral AI69

    Mistral AI 為 Le Chat 推出 Deep Research、語音等新功能

    Mistral AI 為 Le Chat 推出 Deep Research、語音、多語言推理、Projects 和圖片編輯等新功能。Deep Research(Preview)可搜尋可信來源並生成附參考資料的結構化報告,語音模式採用 Voxtral,多語言推理由 Magistral 驅動,圖片編輯則與 Black Forest Labs 合作。

    推薦理由:Le Chat 把研究、語音、多語言推理、Projects 與圖片編輯納入同一產品,呈現其如何覆蓋資訊整理、語音互動和圖像修改等不同任務。

7月15日週二
  1. Mistral AI77

    Mistral AI 發佈 Voxtral 語音理解模型

    Mistral AI 發佈 Voxtral 語音理解模型,提供 24B 生產級版本及 3B 本地與邊緣部署版本。兩者均以 Apache 2.0 授權發布,並可透過 API 使用;32k token 上下文支援最長 30 分鐘音訊轉錄或 40 分鐘音訊理解,也可對音訊提問及生成摘要。API 價格由每分鐘 $0.001 起。

    推薦理由:Voxtral 同時提供 24B 與 3B 版本及 API 使用方式,並列出音訊時長上限和起始價格,方便比較本地部署與雲端接入的適用情境。

5月13日週二