NAVER Cloud 介紹 Sommelier 全雙工語音 AI 數據流程
NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。
NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。
Voice Arena 與 Hugging Face 為 Open ASR Leaderboard 加入 Monsoon en-IN 和 Monsoon hi-IN 評測集,涵蓋 Indian English 與 Hindi,令 Hindi 成為其多語言分頁首個 Indic language。
推薦理由:這批評測集把説話者背景與可接受的拼寫變體納入 ASR 評估,讓總體 WER 之外的區域差異和 Hindi 正字法誤差更容易被辨識。
Hugging Face 的研究提出三項測試衡量語音辨識中的基準優化,並評估 11 個常用開源 ASR 模型,發現多個模型會重現與音訊不符的基準文本。研究在所分析的 VoxPopuli 測試片段中標記出 40% 的潛在參考文本錯誤,涉及約 3% 的參考詞;呈現基準優化行為的模型在相關測試中有 18–30% 的情況會重現錯誤參考文本。
Sarvam 與 AI4Bharat 建立 Indic DiarBench,這是一個涵蓋印度憲法列定全部 22 種語言、聯合評估語音識別與説話人分段的開放基準數據集。數據集包含 108 小時自然即興語音,每段錄音有 2–9 名説話者,並涵蓋重疊發言、近場及遠場會議,以及 YouTube 真實對話。轉錄文本和帶説話人歸屬的時間戳均經人工核驗。
Real World VoiceEQ 是一套衡量語音 AI 真人互動品質的新基準,評估 40+ 款專有及開源語音模型,涵蓋 15+ 個評測維度和 60+ 項指標。基準以超過 1 million 次人工評分建立,評測範圍包括 ASR、TTS、S2S 和 Speech Understanding。結果顯示,各模型能力各有側重,而傳統基準可能高估模型在真實對話中的表現。
Hugging Face 與 Treble Technologies 推出並開放提交 FFASR Leaderboard,這是針對真實遠場聲學條件的開放、社羣協作 ASR 評測基準。
Google Research 推出 WAXAL 開放語音資料集,首批涵蓋 27 種撒哈拉以南非洲語言,這些語言由超過 100 million 人使用。資料包含約 1,846 小時已轉錄的自然語音 ASR 數據,以及超過 565 小時高保真 TTS 錄音,採用 CC-BY-4.0 授權開放。資料收集由非洲學術及社區組織主導,Google 表示計劃持續擴充語言範圍。
推薦理由:WAXAL 將自然口語 ASR 與高保真 TTS 語料以 CC-BY-4.0 授權開放,呈現支援低資源語言語音技術所需的資料建置基礎。
Google Research 推出 Massive Sound Embedding Benchmark(MSEB),以統一框架評估八項機器聽覺能力。基準涵蓋語義與聲學任務,並可評估不同類型的模型;初步實驗顯示,現有聲音表徵在八項任務上仍有明顯提升空間。