OpenAI Realtime API 太陽系示例展示語音互動 3D 場景
OpenAI 的 Realtime solar system 示範專案以語音連接 Realtime API 與 Spline 3D 太陽系場景,並透過 function calling 觸發應用程式操作。
OpenAI 的 Realtime solar system 示範專案以語音連接 Realtime API 與 Spline 3D 太陽系場景,並透過 function calling 觸發應用程式操作。
OpenAI 的語音智能體指南比較 GPT-Live、Realtime API 與分階段語音管線,説明三種架構各自適用的場景。指南涵蓋 GPT-Live 的 Client delegation 和 Responses delegation,以及可逐階段檢視或轉換文字的管線設計。
OpenAI 介紹最新音訊模型的能力,涵蓋語音、轉錄及語音轉文字(STT)。
Mistral AI 為 Le Chat 推出 Deep Research、語音、多語言推理、Projects 和圖片編輯等新功能。Deep Research(Preview)可搜尋可信來源並生成附參考資料的結構化報告,語音模式採用 Voxtral,多語言推理由 Magistral 驅動,圖片編輯則與 Black Forest Labs 合作。
推薦理由:Le Chat 把研究、語音、多語言推理、Projects 與圖片編輯納入同一產品,呈現其如何覆蓋資訊整理、語音互動和圖像修改等不同任務。
Mistral AI 發佈 Voxtral 語音理解模型,提供 24B 生產級版本及 3B 本地與邊緣部署版本。兩者均以 Apache 2.0 授權發布,並可透過 API 使用;32k token 上下文支援最長 30 分鐘音訊轉錄或 40 分鐘音訊理解,也可對音訊提問及生成摘要。API 價格由每分鐘 $0.001 起。
推薦理由:Voxtral 同時提供 24B 與 3B 版本及 API 使用方式,並列出音訊時長上限和起始價格,方便比較本地部署與雲端接入的適用情境。
Hugging Face 為 Inference Endpoints 推出新的 OpenAI Whisper 部署方案,效能較前一版本最高提升 8 倍。
推薦理由:文章比較三款 Whisper 變體與 Transformers 基線的轉錄速度及 WER,呈現 Large V3 接近 8 倍的 RTFx 提升與各款相若的 WER 表現。
OpenAI Developers 的筆記本比較透過 OpenAI API 與 Agents SDK 進行語音轉文字的多種方法,並提供由檔案上載至即時串流的示例。
OpenAI 的 Cookbook 示範以 Realtime API 和 WebSockets 搭建多語言單向語音翻譯流程,讓講者輸入音訊並把不同語言的譯音轉送至聽眾端。
OpenAI 介紹 API 新一代音訊模型,文字轉語音模型可按開發者指示採用特定説話方式。例如,開發者可要求模型「像富有同理心的客服智能體那樣説話」,為語音智能體提供更多自訂空間。
推薦理由:開發者可用指示控制文字轉語音模型的説話方式,例如採用富有同理心的客服智能體語氣,讓語音智能體的表達方式有更多自訂空間。
Hugging Face 推出 FastRTC,這是一個讓開發者以 Python 建構即時音訊與影片 AI 應用的通訊程式庫。它內置語音偵測與輪次控制,提供支援 WebRTC 的 Gradio UI,並可將 Stream 掛載至 FastAPI 應用;亦支援 WebSocket。程式庫另提供語音轉文字、文字轉語音等工具,並可接駁不同 LLM、語音 API 或語音到語音模型。
推薦理由:FastRTC 將語音偵測、輪次控制和即時通訊整合起來,並提供 Gradio 測試介面及 FastAPI 部署方式,展示以 Python 搭建即時語音應用的實作流程。
OpenMOSS 開源端到端語音對話大模型 SpeechGPT 2.0-preview,實測延遲在 200ms 以內,支援實時打斷交互。模型以百萬小時級真實語音數據訓練,目前只使用中文語音數據,尚未具備英文對話能力。
Hugging Face 示範以自訂 Docker 映像,將 Speech-to-Speech(S2S)流程部署至 Hugging Face Inference Endpoints。
推薦理由:文章把多模型語音流程拆解為自訂 Docker 映像、端點設定和 WebSocket 音訊服務等步驟,提供部署複雜推理管線時可參照的實作路徑。
OpenAI 推出 Realtime API,開發者現可在應用程式中構建快速語音到語音體驗。
OpenAI 進一步説明文字轉語音模型 Voice Engine 的運作方式,並分享相關安全研究。內容聚焦於 Voice Engine 背後的技術。
OpenAI 分享從 Voice Engine 小規模預覽中汲取的經驗。Voice Engine 是一款用於建立自訂語音的模型。
Hugging Face Blog 示範在 Diffusers 中優化 AudioLDM 2 推理,將 10.24 秒音頻樣本的生成時間由約 14 秒縮短至不足 1 秒,音質下降幅度輕微。
OpenAI 推出 iOS 版 ChatGPT app,讓用户可在 iOS 裝置使用 ChatGPT。應用支援對話同步和語音輸入,並帶來 OpenAI 最新模型改進。
推薦理由:公告列出對話同步、語音輸入及最新模型改進,呈現 iOS 版 ChatGPT app 在對話延續與語音使用上的主要變化。
Hugging Face Blog 提供使用 🤗 Transformers 為多語言 ASR 資料集微調 Whisper 的逐步指南,涵蓋資料準備、訓練與評估。
推薦理由:文章將 Whisper 多語言微調拆解為資料準備、特徵處理、訓練評估與示範流程,並以印地語資料展示從預處理到模型分享的可複用實作路徑。
OpenAI 宣佈將其訓練的神經網絡 Whisper 開源。Whisper 在英語語音識別上的穩健性與準確度接近人類水平。
推薦理由:Whisper 的開源安排與英語語音識別表現並列,且以接近人類水平作比較,讓讀者可同時掌握模型發佈範圍與性能定位。
Hugging Face 教學示範如何使用 Transformers 將預訓練的 Wav2Vec2 base 微調為英語自動語音辨識模型。示範使用含 5h 訓練資料的 TIMIT,並在不使用語言模型的情況下以 CTC 訓練。模型在 TIMIT 測試集的 WER 為 0.221(22.1%)。
推薦理由:這篇教學把資料清理、詞彙表與處理器設定、音訊取樣率處理、CTC 訓練及 WER 評估串成完整流程,並以 5h 的 TIMIT 訓練資料示範英語 ASR 微調。