跳到正文

#語音

今日 38 條
10月5日週一
  1. IT之家21

    狼蛛 A8 鏤空電競頭戴式耳機上架:重約 235g、配備 40mm 單元,299.2 元起

    狼蛛 A8 鏤空電競頭戴式耳機已在京東上架,首發價由 299.2 元起,機身重約 235g±5g。耳機配備 40mm PET 複合振膜單元、C-Media 聲卡晶片及可插拔 360° 全向 AI 降噪麥克風。耳機支援 2.4GHz、USB-C、藍牙及 USB 聲卡四模連接;關閉氛圍燈並以 30%-50% 音量使用時,內置 500mAh 電池續航約 40 小時。

  2. IT之家31

    圓剛推出 AIClear Mic (A113) AI 降噪麥克風,工作温度範圍達 -25℃ 至 +60℃

    圓剛推出面向工業應用的 AIClear Mic (A113) AI 降噪麥克風,工作温度範圍為 -25℃ 至 +60℃。其降噪功能可清除音訊中的環境噪音,令語音識別準確率提升 60% 以上,亦可提高聲紋認證的身份驗證準確性。麥克風支援免驅動即插即用及 USB-C 一線連,並提供一對 3.5mm 音訊插孔;存放温度範圍為 -40℃ 至 +85℃。

10月3日週六
  1. The Decoder60

    Suno 新增 Speech 功能,可將語音與相配背景音樂合成單一音軌

    Suno 新增 Speech 功能,可將語音與相配背景音樂一併生成為單一音軌。用户可輸入構想或文字,並描述所需聲線及音樂風格;Suno 稱功能可用於詩歌、冥想和睡前故事。測試版仍有問題,例如英國口音有時聽來像澳洲口音;Suno 未説明模型訓練方式,唱片公司已就版權問題起訴 Suno,慕尼黑法院近期亦裁定 Suno 不能以合理使用為由,為使用受版權保護數據辯護。

  2. LlamaIndex:產品、工程與評測44

    LlamaIndex 電子通訊:2025-08-05

    LlamaIndex 本期通訊彙整多項產品與工程更新,包括 Gemini Live 的 TypeScript、Python 語音整合,以及 LlamaParse Indexes 上線託管嵌入向量功能,毋須自備 API key,並提供 10,000 個免費 credits。

  3. Google Developers Blog63

    ADK 如何評估即時語音智能體

    Google 在 ADK 加入原生即時評測功能,可透過模擬使用者以音訊與即時語音智能體對話,評分語音回覆,並沿用文字智能體的評測流程。測試案例可採對話情境或固定對話,並以自然語言評分規準評估整段多輪互動,也可逐輪評分回覆或工具執行。評測可由 CLI 執行,或透過 AgentEvaluator 納入 CI/CD;ADK Web 會呈現轉錄文字及可播放音訊。

  4. Microsoft AI:官方博客48

    MAI-Transcribe-1.5 推出,支援關鍵詞偏置

    MAI-Transcribe-1.5 現可按使用者提供的領域關鍵詞清單調整轉錄預測,提升專業詞彙識別。啟用關鍵詞偏置後,模型在 FLEURS 多語言基準測試上的 Word-Error-Rate(WER)降低 30%。模型會結合上下文決定何時套用偏置,而非強行匹配,並維持一般語音的準確度。

  5. TechCrunch · AI53

    Legato 推出 AI 助聽眼鏡 Legato Frames

    Legato 宣佈 AI 助聽眼鏡 Legato Frames 現已開售,售價 $999 起,適用於有中度或以下聽力損失的成年人。產品把公司的專利助聽技術整合於眼鏡鏡臂,AI 系統會分辨人聲與背景噪音,放大人聲並降低不需要的聲音;公司稱所有處理均在眼鏡上完成,沒有攝影機或錄音。

10月2日週五
  1. The Verge · AI61

    Suno 推出 Speech 公測功能,可生成口語並同步配樂

    Suno 在網頁及手機平台推出 Speech 公測功能,可根據提示描述或自訂稿生成口語,並同步生成配樂。Simple 模式以提示描述生成,Advanced 模式可輸入自訂稿並調整 AI 聲音性別、説話風格及生成多樣性;配樂可關閉,最長時長約 8 分鐘。Suno 表示功能仍在 beta 階段,會根據用户意見持續改進。

9月30日週三
  1. Hugging Face Blog65

    Open TTS Leaderboard 為多語言文字轉語音與聲音複製提供可擴展評估

    Hugging Face 建立 Open TTS Leaderboard,以客觀指標評估開源、多語言 TTS 模型及聲音複製能力。評估涵蓋 WER/CER、批次推理速度(RTFx)、首段音訊延遲(TTFA)及説話者相似度(SIM),可把單個模型的評估時間由數週縮短至數小時。排行榜不取代人工偏好評選,並設有 Listen 頁籤供用户比較生成音訊及投票;其指標不直接衡量自然度、表現力或聽者偏好。

    推薦理由:排行榜以客觀指標並列呈現語音清晰度、説話者相似度與速度表現,並保留聆聽投票,方便比較多語言及聲音複製模型。

9月29日週二
  1. Google AI:DEV 作者專屬58

    如何使用 Gemini Live API 建立即時語音 AI 智能體

    Gemini Live API 可用於建立即時語音 AI 智能體,透過雙向 WebSocket 同時傳送和接收音訊,支援即時回應及用戶插話。建議並行處理麥克風上行音訊與模型下行語音,並在麥克風偵測到用戶説話時立即靜音及清除播放緩衝區;Gemini Live 內置 VAD 負責偵測語音活動。工具操作可非同步執行並即時回傳確認,避免較慢的外部操作令語音生成停頓。

9月25日週五
  1. Sarvam AI66

    Sarvam AI 發佈 Saaras V4 語音識別模型

    Sarvam AI 發佈 Saaras V4 語音識別模型,稱其在 22 種印度語言達到 SOTA,並支援五種轉寫格式。模型結合音訊編碼器與從零開始訓練的 3B 混合狀態空間 LLM 解碼器,在七個英語基準測試中取得最低平均 WER。Saaras V4 支援低延遲串流,首個 token 延遲低於 150 ms。

9月23日週三
9月16日週三
9月15日週二
  1. OpenMOSS / 復旦NLP / 上海創智 / MOSI61

    OpenMOSS 開源 MOSS-Transcribe-Diarize 0.9B 音訊理解模型

    OpenMOSS 開源 MOSS-Transcribe-Diarize 0.9B,這款端到端音訊理解模型可在單次處理中完成長篇多説話人音訊轉寫、説話人分離及時間戳標註。模型支援 50+ 種語言,亦可選擇輸出聲學事件標註。整體表現更高的 MOSS-Transcribe-Diarize Pro 可透過線上 playground 使用。

9月10日週四
9月8日週二
  1. FireRedTeam:原創語音與多模態項目65

    FireRedTeam 發佈 FireRedAudio 通用音訊語言模型及 PyTorch 程式碼

    FireRedTeam 發佈 FireRedAudio,一款以共用 9B 參數 LLM 為基礎、涵蓋音訊理解與語音生成的音訊語言模型。Audio Encoder 負責理解、RedAE pathway 負責生成;模型支援 ASR、音訊理解、零樣本及指令式 TTS、語音編輯,並可處理最長一小時的錄音。除 ASR 外,其他功能只支援中文和英文。

9月6日週日
  1. OpenMOSS / 復旦NLP / 上海創智 / MOSI59

    OpenMOSS 發佈 0.1B 參數多語言語音生成模型 MOSS-TTS-Nano

    OpenMOSS 團隊與 MOSI.AI 發佈開源語音生成模型 MOSS-TTS-Nano,參數量為 0.1B,支援 20 種語言。模型提供聲音複製和串流生成,並採用 Audio Tokenizer + LLM 純自回歸架構。ONNX CPU 版本在團隊測試中處理效率接近原版的 2 倍,並可在 MacBook Air M4 單核流暢運行。

  2. OpenMOSS / 復旦NLP / 上海創智 / MOSI59

    OpenMOSS 團隊開源發佈 MOSS-Audio 4 款音訊理解模型

    OpenMOSS 團隊開源 MOSS-Audio,推出 4B、8B 的 Instruct 和 Thinking 版本。模型支援語音、環境音及音樂理解、音訊描述、時間感知問答與複雜推理,並採用跨層特徵注入和時間標記設計。在 MMAU、MMAU-Pro、MMAR 和 MMSU 四項通用音訊理解基準中,MOSS-Audio-8B-Thinking 的平均準確率為 71.08。

9月5日週六
  1. Sierra:Blog44

    呼叫中心 AI:營運及推行指南

    呼叫中心 AI 的推行應視為營運模式變革,先選定一條客戶旅程,訂立基準及擴展準則,再於真實渠道條件下驗證完整流程。指南聚焦自主語音及由 AI 路由的旅程,涵蓋渠道與系統銜接、路由和佇列安排、人手規劃、品質校準及故障復原,並指出客服代表輔助、預測和品質分析部署須採用不同切換準則。

9月2日週三
  1. Sierra:Blog58

    甚麼是 Voice AI?企業級 AI 語音智能體指南

    Sierra 的企業級 Voice AI 指南説明,AI 語音智能體可結合客戶背景及業務系統,在通話中處理要求並完成工作。企業準備程度須以整通電話作端到端評估,涵蓋延遲、輪流發言、語音辨識、上下文、操作、護欄及轉接七項測試,並納入噪音、打斷、模糊請求和整合失敗等情況。Sierra 的 tau-voice 基準以 278 項客戶服務任務,結合真實音訊及重疊發言,測試對話行為與資料庫狀態是否正確。

8月28日週五
  1. Hugging Face Blog68

    Open ASR Leaderboard 新增 Hindi、Indian English 評測集,首度納入全球南方語言

    Voice Arena 與 Hugging Face 為 Open ASR Leaderboard 加入 Monsoon en-IN 和 Monsoon hi-IN 評測集,涵蓋 Indian English 與 Hindi,令 Hindi 成為其多語言分頁首個 Indic language。

    推薦理由:這批評測集把説話者背景與可接受的拼寫變體納入 ASR 評估,讓總體 WER 之外的區域差異和 Hindi 正字法誤差更容易被辨識。

8月27日週四
  1. Google DeepMind69

    Google DeepMind 發佈 Gemini 3.5 Transcribe 語音轉文字模型

    Google DeepMind 發佈 Gemini 3.5 Transcribe,這是一款面向智能語音互動的語音轉文字模型。它可透過 Live API 以低於一秒的延遲進行即時串流,亦可經 Interactions API 處理預錄音訊,提供説話者歸屬及逐字時間戳。

    推薦理由:材料同時提供串流與非串流 WER,以及相較 Chirp 3 的最終轉錄時間改善幅度,讓準確度與延遲兩項表現有具體數據可供對照。