跳到正文

語音與音頻

AI 語音與音頻的進展:語音合成、實時對話、音樂生成與音頻理解的模型與產品。

28條精選相關主題多模態AI 影片產品更新

最新精選

第 21–28 條 · 共 28 條
3月20日週四
  1. OpenAI News64

    OpenAI 在 API 介紹新一代音訊模型

    OpenAI 介紹 API 新一代音訊模型,文字轉語音模型可按開發者指示採用特定説話方式。例如,開發者可要求模型「像富有同理心的客服智能體那樣説話」,為語音智能體提供更多自訂空間。

    推薦理由:開發者可用指示控制文字轉語音模型的説話方式,例如採用富有同理心的客服智能體語氣,讓語音智能體的表達方式有更多自訂空間。

2月25日週二
  1. Hugging Face Blog62

    Hugging Face 推出 FastRTC,支援以 Python 建構即時音訊與影片 AI 應用

    Hugging Face 推出 FastRTC,這是一個讓開發者以 Python 建構即時音訊與影片 AI 應用的通訊程式庫。它內置語音偵測與輪次控制,提供支援 WebRTC 的 Gradio UI,並可將 Stream 掛載至 FastAPI 應用;亦支援 WebSocket。程式庫另提供語音轉文字、文字轉語音等工具,並可接駁不同 LLM、語音 API 或語音到語音模型。

    推薦理由:FastRTC 將語音偵測、輪次控制和即時通訊整合起來,並提供 Gradio 測試介面及 FastAPI 部署方式,展示以 Python 搭建即時語音應用的實作流程。

10月22日週二
10月1日週二
5月18日週四
  1. OpenAI News85

    OpenAI 推出 iOS 版 ChatGPT app

    OpenAI 推出 iOS 版 ChatGPT app,讓用户可在 iOS 裝置使用 ChatGPT。應用支援對話同步和語音輸入,並帶來 OpenAI 最新模型改進。

    推薦理由:公告列出對話同步、語音輸入及最新模型改進,呈現 iOS 版 ChatGPT app 在對話延續與語音使用上的主要變化。

11月3日週四
9月21日週三
  1. OpenAI News66

    OpenAI 開源語音識別神經網絡 Whisper

    OpenAI 宣佈將其訓練的神經網絡 Whisper 開源。Whisper 在英語語音識別上的穩健性與準確度接近人類水平。

    推薦理由:Whisper 的開源安排與英語語音識別表現並列,且以接近人類水平作比較,讓讀者可同時掌握模型發佈範圍與性能定位。

3月12日週五
  1. Hugging Face Blog63

    如何使用 Hugging Face Transformers 微調 Wav2Vec2 英語語音辨識模型

    Hugging Face 教學示範如何使用 Transformers 將預訓練的 Wav2Vec2 base 微調為英語自動語音辨識模型。示範使用含 5h 訓練資料的 TIMIT,並在不使用語言模型的情況下以 CTC 訓練。模型在 TIMIT 測試集的 WER 為 0.221(22.1%)。

    推薦理由:這篇教學把資料清理、詞彙表與處理器設定、音訊取樣率處理、CTC 訓練及 WER 評估串成完整流程,並以 5h 的 TIMIT 訓練資料示範英語 ASR 微調。