跳到正文

#語音

今日 1 條
今天10月6日週二
  1. NAVER / CLOVA 研究57

    NAVER Cloud 介紹 Sommelier 全雙工語音 AI 數據流程

    NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。

8月28日週五
  1. Hugging Face Blog68

    Open ASR Leaderboard 新增 Hindi、Indian English 評測集,首度納入全球南方語言

    Voice Arena 與 Hugging Face 為 Open ASR Leaderboard 加入 Monsoon en-IN 和 Monsoon hi-IN 評測集,涵蓋 Indian English 與 Hindi,令 Hindi 成為其多語言分頁首個 Indic language。

    推薦理由:這批評測集把説話者背景與可接受的拼寫變體納入 ASR 評估,讓總體 WER 之外的區域差異和 Hindi 正字法誤差更容易被辨識。

8月21日週五
  1. Hugging Face Blog54

    研究測量語音辨識模型的基準優化現象

    Hugging Face 的研究提出三項測試衡量語音辨識中的基準優化,並評估 11 個常用開源 ASR 模型,發現多個模型會重現與音訊不符的基準文本。研究在所分析的 VoxPopuli 測試片段中標記出 40% 的潛在參考文本錯誤,涉及約 3% 的參考詞;呈現基準優化行為的模型在相關測試中有 18–30% 的情況會重現錯誤參考文本。

8月11日週二
  1. Sarvam AI55

    Indic DiarBench:面向印度語言的聯合説話人分段與語音識別基準數據集

    Sarvam 與 AI4Bharat 建立 Indic DiarBench,這是一個涵蓋印度憲法列定全部 22 種語言、聯合評估語音識別與説話人分段的開放基準數據集。數據集包含 108 小時自然即興語音,每段錄音有 2–9 名説話者,並涵蓋重疊發言、近場及遠場會議,以及 YouTube 真實對話。轉錄文本和帶説話人歸屬的時間戳均經人工核驗。

7月15日週三
  1. Hugging Face Blog55

    Real World VoiceEQ 推出語音 AI 真人互動品質評測基準

    Real World VoiceEQ 是一套衡量語音 AI 真人互動品質的新基準,評估 40+ 款專有及開源語音模型,涵蓋 15+ 個評測維度和 60+ 項指標。基準以超過 1 million 次人工評分建立,評測範圍包括 ASR、TTS、S2S 和 Speech Understanding。結果顯示,各模型能力各有側重,而傳統基準可能高估模型在真實對話中的表現。

6月24日週三
3月7日週六
  1. Google Research64

    WAXAL 為 27 種撒哈拉以南非洲語言提供大型開放語音資源

    Google Research 推出 WAXAL 開放語音資料集,首批涵蓋 27 種撒哈拉以南非洲語言,這些語言由超過 100 million 人使用。資料包含約 1,846 小時已轉錄的自然語音 ASR 數據,以及超過 565 小時高保真 TTS 錄音,採用 CC-BY-4.0 授權開放。資料收集由非洲學術及社區組織主導,Google 表示計劃持續擴充語言範圍。

    推薦理由:WAXAL 將自然口語 ASR 與高保真 TTS 語料以 CC-BY-4.0 授權開放,呈現支援低資源語言語音技術所需的資料建置基礎。

12月4日週四