OpenAI 推出 Realtime API,開發者可在應用程式中構建快速語音到語音體驗
OpenAI 推出 Realtime API,開發者現可在應用程式中構建快速語音到語音體驗。
OpenAI 推出 Realtime API,開發者現可在應用程式中構建快速語音到語音體驗。
OpenAI 進一步説明文字轉語音模型 Voice Engine 的運作方式,並分享相關安全研究。內容聚焦於 Voice Engine 背後的技術。
OpenAI 分享從 Voice Engine 小規模預覽中汲取的經驗。Voice Engine 是一款用於建立自訂語音的模型。
Hugging Face Blog 示範在 Diffusers 中優化 AudioLDM 2 推理,將 10.24 秒音頻樣本的生成時間由約 14 秒縮短至不足 1 秒,音質下降幅度輕微。
OpenAI 推出 iOS 版 ChatGPT app,讓用户可在 iOS 裝置使用 ChatGPT。應用支援對話同步和語音輸入,並帶來 OpenAI 最新模型改進。
推薦理由:公告列出對話同步、語音輸入及最新模型改進,呈現 iOS 版 ChatGPT app 在對話延續與語音使用上的主要變化。
Hugging Face Blog 提供使用 🤗 Transformers 為多語言 ASR 資料集微調 Whisper 的逐步指南,涵蓋資料準備、訓練與評估。
推薦理由:文章將 Whisper 多語言微調拆解為資料準備、特徵處理、訓練評估與示範流程,並以印地語資料展示從預處理到模型分享的可複用實作路徑。
OpenAI 宣佈將其訓練的神經網絡 Whisper 開源。Whisper 在英語語音識別上的穩健性與準確度接近人類水平。
推薦理由:Whisper 的開源安排與英語語音識別表現並列,且以接近人類水平作比較,讓讀者可同時掌握模型發佈範圍與性能定位。
Hugging Face 教學示範如何使用 Transformers 將預訓練的 Wav2Vec2 base 微調為英語自動語音辨識模型。示範使用含 5h 訓練資料的 TIMIT,並在不使用語言模型的情況下以 CTC 訓練。模型在 TIMIT 測試集的 WER 為 0.221(22.1%)。
推薦理由:這篇教學把資料清理、詞彙表與處理器設定、音訊取樣率處理、CTC 訓練及 WER 評估串成完整流程,並以 5h 的 TIMIT 訓練資料示範英語 ASR 微調。