狼蛛 A8 鏤空電競頭戴式耳機上架:重約 235g、配備 40mm 單元,299.2 元起
狼蛛 A8 鏤空電競頭戴式耳機已在京東上架,首發價由 299.2 元起,機身重約 235g±5g。耳機配備 40mm PET 複合振膜單元、C-Media 聲卡晶片及可插拔 360° 全向 AI 降噪麥克風。耳機支援 2.4GHz、USB-C、藍牙及 USB 聲卡四模連接;關閉氛圍燈並以 30%-50% 音量使用時,內置 500mAh 電池續航約 40 小時。
狼蛛 A8 鏤空電競頭戴式耳機已在京東上架,首發價由 299.2 元起,機身重約 235g±5g。耳機配備 40mm PET 複合振膜單元、C-Media 聲卡晶片及可插拔 360° 全向 AI 降噪麥克風。耳機支援 2.4GHz、USB-C、藍牙及 USB 聲卡四模連接;關閉氛圍燈並以 30%-50% 音量使用時,內置 500mAh 電池續航約 40 小時。
圓剛推出面向工業應用的 AIClear Mic (A113) AI 降噪麥克風,工作温度範圍為 -25℃ 至 +60℃。其降噪功能可清除音訊中的環境噪音,令語音識別準確率提升 60% 以上,亦可提高聲紋認證的身份驗證準確性。麥克風支援免驅動即插即用及 USB-C 一線連,並提供一對 3.5mm 音訊插孔;存放温度範圍為 -40℃ 至 +85℃。
Suno 推出 Speech 語音功能,可端到端單次生成融合語音朗讀與原創 BGM 的完整音軌。該功能已在 Suno 內向所有人開放公測,使用者可輸入靈感、詩或文字,並描述音色與音樂風格。Beta 版可能出現口音漂移,以及語調和情感停頓過於戲劇化、節奏偏慢等問題。
Suno 新增 Speech 功能,可將語音與相配背景音樂一併生成為單一音軌。用户可輸入構想或文字,並描述所需聲線及音樂風格;Suno 稱功能可用於詩歌、冥想和睡前故事。測試版仍有問題,例如英國口音有時聽來像澳洲口音;Suno 未説明模型訓練方式,唱片公司已就版權問題起訴 Suno,慕尼黑法院近期亦裁定 Suno 不能以合理使用為由,為使用受版權保護數據辯護。
LlamaIndex 本期通訊彙整多項產品與工程更新,包括 Gemini Live 的 TypeScript、Python 語音整合,以及 LlamaParse Indexes 上線託管嵌入向量功能,毋須自備 API key,並提供 10,000 個免費 credits。
LlamaIndex 建立了 audio-kb CLI 工具,讓使用者可從終端錄製或上傳音訊筆記,並對筆記進行語義搜尋。工具以 LlamaParse 提取逐字稿,將文本分塊後用 Gemini Embedding 2 產生嵌入向量,再存入帶有 HNSW 索引的本地 SurrealDB。
Google 在 ADK 加入原生即時評測功能,可透過模擬使用者以音訊與即時語音智能體對話,評分語音回覆,並沿用文字智能體的評測流程。測試案例可採對話情境或固定對話,並以自然語言評分規準評估整段多輪互動,也可逐輪評分回覆或工具執行。評測可由 CLI 執行,或透過 AgentEvaluator 納入 CI/CD;ADK Web 會呈現轉錄文字及可播放音訊。
東京法院在津田健次郎起訴 TikTok 案中,首次確認人的聲音受法律保護,並認定未經許可使用其聲音侵犯形象權。案件涉及匿名帳號用 AI 克隆其聲音為影片旁白;因帳號已註銷,法院未支持津田要求 TikTok 下架影片的請求。
OpenAI 發佈 gpt-4o-mini-transcribe-2025-12-15、gpt-4o-mini-tts-2025-12-15、gpt-realtime-mini-2025-12-15 及 gpt-audio-mini-2025-12-15 四款語音模型快照,並擴大 Custom Voices 開放範圍。
OpenAI API 的 Audio & voice 文件聚焦於建立語音及即時語音體驗,並列於 API 開發文件導覽中。頁面其餘內容為開發者文件與資源入口,沒有提供音訊功能細節。
Microsoft AI 發佈語音生成模型 MAI-Voice-1,並在 LMArena 開始公開測試基礎模型 MAI-1-preview。MAI-Voice-1 可在單張 GPU 上用不到 1 秒生成 1 分鐘音訊,已支援 Copilot Daily 和 Podcasts,並在 Copilot Labs 開放體驗。
Microsoft 的語音識別模型 MAI-Transcribe-1 已在 Microsoft Foundry 開放公開預覽,音訊定價為每小時 $0.36。該模型正分階段部署至 Copilot 的 Voice mode 和 Microsoft Teams,並支援會議轉錄、即時字幕及聽寫等用途。
Microsoft AI 發佈 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2,三款模型現已可在 Microsoft Foundry 和 MAI Playground 使用。
MAI-Transcribe-1.5 現可按使用者提供的領域關鍵詞清單調整轉錄預測,提升專業詞彙識別。啟用關鍵詞偏置後,模型在 FLEURS 多語言基準測試上的 Word-Error-Rate(WER)降低 30%。模型會結合上下文決定何時套用偏置,而非強行匹配,並維持一般語音的準確度。
Microsoft 發佈語音合成模型 MAI-Voice-2,現已在 Microsoft Foundry 提供,並正整合至 VSCode 和 Dynamics 365 Contact Center。
Microsoft AI 將 MAI-Image-2.5-Pro 與 MAI-Voice-2-Flash 開放公開預覽,分別面向高保真圖像生成與高速、大規模語音場景。
Microsoft AI 發佈語音辨識模型 MAI-Transcribe-2,主打高準確度、低延遲及較低成本。
Microsoft AI 發佈首款串流轉錄模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最終及部分轉錄準確度排名均列第一。
Inception Labs 發佈 Mercury 2.5,稱其相較 Mercury 2 智能提升 40%,並維持低延遲、低成本的服務特性。
Legato 宣佈 AI 助聽眼鏡 Legato Frames 現已開售,售價 $999 起,適用於有中度或以下聽力損失的成年人。產品把公司的專利助聽技術整合於眼鏡鏡臂,AI 系統會分辨人聲與背景噪音,放大人聲並降低不需要的聲音;公司稱所有處理均在眼鏡上完成,沒有攝影機或錄音。
Suno 在網頁及手機平台推出 Speech 公測功能,可根據提示描述或自訂稿生成口語,並同步生成配樂。Simple 模式以提示描述生成,Advanced 模式可輸入自訂稿並調整 AI 聲音性別、説話風格及生成多樣性;配樂可關閉,最長時長約 8 分鐘。Suno 表示功能仍在 beta 階段,會根據用户意見持續改進。
Microsoft AI 發佈 MAI-Transcribe-2-Streaming 即時轉錄模型,以及 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 兩款文字轉語音模型。
Tavus 發佈 Griffin,稱其為首個「Human Interaction Model」(HIM);其研究中,48% 參與者在一分鐘視像通話後認為 Griffin 是真人。
Hugging Face 建立 Open TTS Leaderboard,以客觀指標評估開源、多語言 TTS 模型及聲音複製能力。評估涵蓋 WER/CER、批次推理速度(RTFx)、首段音訊延遲(TTFA)及説話者相似度(SIM),可把單個模型的評估時間由數週縮短至數小時。排行榜不取代人工偏好評選,並設有 Listen 頁籤供用户比較生成音訊及投票;其指標不直接衡量自然度、表現力或聽者偏好。
推薦理由:排行榜以客觀指標並列呈現語音清晰度、説話者相似度與速度表現,並保留聆聽投票,方便比較多語言及聲音複製模型。
Gemini Live API 可用於建立即時語音 AI 智能體,透過雙向 WebSocket 同時傳送和接收音訊,支援即時回應及用戶插話。建議並行處理麥克風上行音訊與模型下行語音,並在麥克風偵測到用戶説話時立即靜音及清除播放緩衝區;Gemini Live 內置 VAD 負責偵測語音活動。工具操作可非同步執行並即時回傳確認,避免較慢的外部操作令語音生成停頓。
Sarvam AI 發佈 Saaras V4 語音識別模型,稱其在 22 種印度語言達到 SOTA,並支援五種轉寫格式。模型結合音訊編碼器與從零開始訓練的 3B 混合狀態空間 LLM 解碼器,在七個英語基準測試中取得最低平均 WER。Saaras V4 支援低延遲串流,首個 token 延遲低於 150 ms。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,將近乎即時視像生成與語音結合,讓企業智能體以動態虛擬形象進行多模態對話。
Google DeepMind 推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,支援自訂聲線、逐句控制表演及雙人對話生成。
推薦理由:兩款 TTS 模型涵蓋逐句演繹與長篇生成,Flash TTS 另可自訂聲線;聲音複製設有同意驗證,生成音訊加入 SynthID 水印,呈現創作控制與防護安排。
inclusionAI 發佈 Realtime-Venus 全雙工互動系統,提供視聽版 Realtime-Venus-Omni 與音訊版 Realtime-Venus-Audio,兩者均為 9B。
Google DeepMind 發佈 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,前者面向規模化與成本效率,後者針對高複雜度任務。
推薦理由:文章區分兩款模型在規模化成本效率與高複雜度任務上的定位,並列出語音代理基準成績,方便比較其應用取向。
OpenMOSS 開源 MOSS-Transcribe-Diarize 0.9B,這款端到端音訊理解模型可在單次處理中完成長篇多説話人音訊轉寫、説話人分離及時間戳標註。模型支援 50+ 種語言,亦可選擇輸出聲學事件標註。整體表現更高的 MOSS-Transcribe-Diarize Pro 可透過線上 playground 使用。
OpenAI 將 GPT‑Live‑1 引入 API,提供自然的全雙工語音對話及更強的指令遵循能力。它亦支援自訂聲音及電話服務。
推薦理由:原文列出全雙工對話、指令遵循、自訂聲音及電話支援,能讓讀者迅速掌握 GPT‑Live‑1 接入 API 後涵蓋的語音能力。
FireRedTeam 公開 FireRedTTS3 語音生成與編輯系統,並提供 FireRedTTS3-Base 和 FireRedTTS3-Instruct 兩個版本的模型與 PyTorch 程式碼。
FireRedTeam 發佈 FireRedAudio,一款以共用 9B 參數 LLM 為基礎、涵蓋音訊理解與語音生成的音訊語言模型。Audio Encoder 負責理解、RedAE pathway 負責生成;模型支援 ASR、音訊理解、零樣本及指令式 TTS、語音編輯,並可處理最長一小時的錄音。除 ASR 外,其他功能只支援中文和英文。
OpenMOSS 團隊與 MOSI.AI 發佈開源語音生成模型 MOSS-TTS-Nano,參數量為 0.1B,支援 20 種語言。模型提供聲音複製和串流生成,並採用 Audio Tokenizer + LLM 純自回歸架構。ONNX CPU 版本在團隊測試中處理效率接近原版的 2 倍,並可在 MacBook Air M4 單核流暢運行。
OpenMOSS 團隊開源 MOSS-Audio,推出 4B、8B 的 Instruct 和 Thinking 版本。模型支援語音、環境音及音樂理解、音訊描述、時間感知問答與複雜推理,並採用跨層特徵注入和時間標記設計。在 MMAU、MMAU-Pro、MMAR 和 MMSU 四項通用音訊理解基準中,MOSS-Audio-8B-Thinking 的平均準確率為 71.08。
呼叫中心 AI 的推行應視為營運模式變革,先選定一條客戶旅程,訂立基準及擴展準則,再於真實渠道條件下驗證完整流程。指南聚焦自主語音及由 AI 路由的旅程,涵蓋渠道與系統銜接、路由和佇列安排、人手規劃、品質校準及故障復原,並指出客服代表輔助、預測和品質分析部署須採用不同切換準則。
Sierra 的企業級 Voice AI 指南説明,AI 語音智能體可結合客戶背景及業務系統,在通話中處理要求並完成工作。企業準備程度須以整通電話作端到端評估,涵蓋延遲、輪流發言、語音辨識、上下文、操作、護欄及轉接七項測試,並納入噪音、打斷、模糊請求和整合失敗等情況。Sierra 的 tau-voice 基準以 278 項客戶服務任務,結合真實音訊及重疊發言,測試對話行為與資料庫狀態是否正確。
Voice Arena 與 Hugging Face 為 Open ASR Leaderboard 加入 Monsoon en-IN 和 Monsoon hi-IN 評測集,涵蓋 Indian English 與 Hindi,令 Hindi 成為其多語言分頁首個 Indic language。
推薦理由:這批評測集把説話者背景與可接受的拼寫變體納入 ASR 評估,讓總體 WER 之外的區域差異和 Hindi 正字法誤差更容易被辨識。
Google DeepMind 發佈 Gemini 3.5 Transcribe,這是一款面向智能語音互動的語音轉文字模型。它可透過 Live API 以低於一秒的延遲進行即時串流,亦可經 Interactions API 處理預錄音訊,提供説話者歸屬及逐字時間戳。
推薦理由:材料同時提供串流與非串流 WER,以及相較 Chirp 3 的最終轉錄時間改善幅度,讓準確度與延遲兩項表現有具體數據可供對照。