IBM 發佈 Granite 4.2,為企業智能體帶來原生推理能力
IBM 發佈 Granite 4.2 語言模型,提供 3B、8B 和 30B 參數版本,並加入原生逐步推理與工具調用能力,面向企業智能體工作流程。模型基於 Granite 4.0 foundation models,採多階段強化學習;8B 和 30B 版本另經 agentic RL,並以 1 trillion tokens 的合成程式碼訓練,採 Apache 2.0 授權。
IBM 發佈 Granite 4.2 語言模型,提供 3B、8B 和 30B 參數版本,並加入原生逐步推理與工具調用能力,面向企業智能體工作流程。模型基於 Granite 4.0 foundation models,採多階段強化學習;8B 和 30B 版本另經 agentic RL,並以 1 trillion tokens 的合成程式碼訓練,採 Apache 2.0 授權。
Mistral AI 與 HUMAIN 宣佈戰略合作,將在沙特阿拉伯及區域內推進 AI 基礎設施、先進模型開發和 AI 解決方案部署。雙方將開發並本地化先進 AI 模型,初期聚焦網絡安全和語音,並計劃開發阿拉伯語表現出色的前沿模型;合作規模達數億歐元。Mistral AI 將探討使用 HUMAIN 的數據中心基礎設施,雙方亦計劃在沙特制定面向受監管行業的共同市場策略。
Hugging Face 的研究提出三項測試衡量語音辨識中的基準優化,並評估 11 個常用開源 ASR 模型,發現多個模型會重現與音訊不符的基準文本。研究在所分析的 VoxPopuli 測試片段中標記出 40% 的潛在參考文本錯誤,涉及約 3% 的參考詞;呈現基準優化行為的模型在相關測試中有 18–30% 的情況會重現錯誤參考文本。
Sarvam 與 AI4Bharat 建立 Indic DiarBench,這是一個涵蓋印度憲法列定全部 22 種語言、聯合評估語音識別與説話人分段的開放基準數據集。數據集包含 108 小時自然即興語音,每段錄音有 2–9 名説話者,並涵蓋重疊發言、近場及遠場會議,以及 YouTube 真實對話。轉錄文本和帶説話人歸屬的時間戳均經人工核驗。
NVIDIA Magpie Multilingual TTS 最新版本擴展至 12 種語言,是一款 364M 參數、開放權重的語音合成模型,可部署於自有基礎設施並按工作負載調校。
Sarvam AI 在 Sarvam Epoch 公佈 Sarvam 105B 的對話及工作智能體版本,並介紹 Sarvam Vision 2.0、Saaras V4 和研究預覽版 Bulbul V4。
OpenAI 用六個月構建 GPT-Live 即時語音系統,支援與 AI 持續進行語音互動。系統採用無需輪次切換的語音模型和低延遲架構,以實現更快、更自然的對話。
Google DeepMind 今日在 Google Flow Music 推出音樂生成模型 Lyria 3.5,並提升旋律、歌詞及人聲生成品質。它可生成更豐富、複雜且自然的旋律結構,並改善歌詞的提示詞遵循度與結構意識,以及人聲的真實感、情感細膩度和發音。使用者也可更容易控制生成內容的節奏和時長。
Cars24 使用 OpenAI 驅動的語音與聊天智能體,每月處理 1M+ 分鐘對話,並挽回 12% 流失潛在客户。公司亦將智能體工作流程推廣至各團隊,藉助 OpenAI 加快構建。
Real World VoiceEQ 是一套衡量語音 AI 真人互動品質的新基準,評估 40+ 款專有及開源語音模型,涵蓋 15+ 個評測維度和 60+ 項指標。基準以超過 1 million 次人工評分建立,評測範圍包括 ASR、TTS、S2S 和 Speech Understanding。結果顯示,各模型能力各有側重,而傳統基準可能高估模型在真實對話中的表現。
Mercury 2 是 Inception Labs 推出的擴散式推理語言模型,官方稱其在標準 NVIDIA GPU 上解碼速度達 1,000+ tokens/second,300-token 推理鏈完成時間不到 300ms。
OpenAI 介紹 GPT-Live,將其定位為面向自然人機互動的新一代語音模型,並稱其現正為 ChatGPT Voice 提供支援。
Hugging Face 與 Treble Technologies 推出並開放提交 FFASR Leaderboard,這是針對真實遠場聲學條件的開放、社羣協作 ASR 評測基準。
Google DeepMind 發佈 Gemini 3.5 Live Translate,這款音訊模型可自動識別 70+ 種語言,並進行近乎即時的語音轉語音翻譯。
推薦理由:模型以連續生成譯語音訊取代逐輪等待,並透過 API、Google Meet 和 Google Translate 進入開發、企業會議及日常翻譯場景,呈現其部署路徑。
FireRedTeam 發佈 FireRedASR2S,整合語音辨識、語音活動檢測、語言識別和標點預測四個模組。FireRedASR2-LLM 在 4 個普通話測試集的平均 CER 為 2.89%,在 19 個方言及口音測試集為 11.55%。
Parloa 利用 OpenAI 模型驅動可擴展、語音驅動的 AI 客户服務智能體,讓企業能設計、模擬並部署可靠的即時互動。
OpenAI 在 API 推出新的即時語音模型,可對語音進行推理、翻譯和轉錄。這些模型旨在支援更自然、智能的語音體驗。
Uber 藉助 OpenAI 為全球即時市場提供 AI 助手及語音功能,協助司機更精明地賺取收入,並讓乘客更快預訂。
Hugging Face 為 Open ASR Leaderboard 加入 Appen Inc. 和 DataoceanAI 提供的私有英語 ASR 評測資料集,涵蓋多種口音及朗讀式、對話式語音。
OpenAI 重建 WebRTC 技術堆疊,為即時語音 AI 提供低延遲及全球規模支援,並支援流暢的對話輪替。
Google DeepMind 發佈 Gemini 3.1 Flash TTS,提升文字轉語音的可控性、表現力與品質,並加入音訊標籤細調語音表現。模型支援 70+ 種語言及原生多説話者對話,在 Artificial Analysis TTS leaderboard 的 Elo 分數為 1,211。
推薦理由:文章聚焦音訊標籤如何細調語氣、節奏與表達,並列出 Gemini 3.1 Flash TTS 面向開發者、企業及 Workspace 用户的推出渠道。
Sarvam AI 介紹印度語言 ASR 的分層評測方法,涵蓋 WER/CER、LLM-WER/LLM-CER、Intent Score、Entity Preservation Score 和 COMET。文中亦介紹兩個適用於任何 Indic ASR 系統的開源評測框架,均使用經 Google Vertex AI 呼叫的 Gemini 作為 LLM 評審。
Google DeepMind 推出 Gemini 3.1 Flash Live,提升即時語音對話的精準度並降低延遲。它在 ComplexFuncBench Audio 得分 90.8%,在 Scale AI 的 Audio MultiChallenge 開啟 thinking 時得分 36.1%。
推薦理由:原文以兩項語音基準呈現多步函數調用與複雜指令跟隨表現,並列出開發者、企業及一般用户的使用入口,可對照其能力與部署場景。
Mistral AI 發佈 4B 參數的 Voxtral TTS,支援 9 種語言語音生成。在典型的 10 秒語音樣本和 500 characters 輸入下,模型延遲為 70ms;人評顯示其自然度高於 ElevenLabs Flash v2.5,TTFA 相近。
推薦理由:原文以人評比較 Voxtral TTS 與 ElevenLabs Flash v2.5 的自然度和 TTFA,並列出模型延遲及 API 定價,提供評估語音智能體應用的具體依據。
Google Research 推出 WAXAL 開放語音資料集,首批涵蓋 27 種撒哈拉以南非洲語言,這些語言由超過 100 million 人使用。資料包含約 1,846 小時已轉錄的自然語音 ASR 數據,以及超過 565 小時高保真 TTS 錄音,採用 CC-BY-4.0 授權開放。資料收集由非洲學術及社區組織主導,Google 表示計劃持續擴充語言範圍。
推薦理由:WAXAL 將自然口語 ASR 與高保真 TTS 語料以 CC-BY-4.0 授權開放,呈現支援低資源語言語音技術所需的資料建置基礎。
Mistral AI 發佈 Voxtral Transcribe 2,包含用於批次轉寫的 Voxtral Mini Transcribe V2,以及面向即時應用的 Voxtral Realtime。
推薦理由:批次版與即時版的定位和能力差異清晰,文章亦列出即時轉寫的延遲設定、開放權重授權及兩款模型的 API 價格,便於比較部署選項。
ServiceNow 擴大對 OpenAI 前沿模型的存取,藉此支援 ServiceNow Platform 上的 AI 驅動企業功能。支援範圍包括企業工作流程、摘要、搜尋及語音。
Google 發佈開放醫療多模態模型 MedGemma 1.5 4B,新增 CT、MRI、病理全切片及胸部 X 光時間序列等醫療影像處理能力。其基準結果較 MedGemma 1 4B 提升,例如 CT 疾病分類準確率為 61%(58%),MRI 為 65%(51%),醫療文本 EHRQA 為 90%(68%)。
推薦理由:MedGemma 1.5 4B 在多項醫療影像與文本基準上較前代提升,文中列出的具體分數可用來比較不同任務的改進幅度。
Manus 推出 Meeting Minutes,可把面對面會議、訪談或獨白轉成含要點、與會者和待辦事項的結構化筆記。錄音期間會即時轉錄並識別説話者;筆記亦可作為同一任務的上下文,用於製作簡報、網站或社交媒體素材,並邀請他人協作。該功能現已向所有 Manus 用户開放,不適用於線上會議;錄音免費,分析及生成筆記會消耗積分。
Tolan 以 GPT-5.1 打造語音優先的 AI 伴侶,結合低延遲回應、即時情境重建與記憶驅動的人格,帶來自然對話體驗。
Google DeepMind 更新 Gemini 2.5 Flash Native Audio,提升其處理複雜工作流、遵循指令及進行多輪語音對話的能力。它在 ComplexFuncBench Audio 得分為 71.5%,開發者指令遵循率由 84% 升至 90%;目前已在 Vertex AI 正式提供,並以預覽版開放 Gemini API。
推薦理由:更新同時改善即時語音 Agent 的函數調用、指令遵循與多輪對話,並以 ComplexFuncBench Audio 的 71.5% 得分呈現多步函數調用表現。
Google Research 推出 Massive Sound Embedding Benchmark(MSEB),以統一框架評估八項機器聽覺能力。基準涵蓋語義與聲學任務,並可評估不同類型的模型;初步實驗顯示,現有聲音表徵在八項任務上仍有明顯提升空間。
Google Research 介紹端到端即時語音到語音翻譯模型,以原説話者聲線輸出譯音,標準延遲為 2 秒。模型採用串流架構及時間同步訓練資料,支援英語與西班牙語、德語、法語、意大利語、葡萄牙語之間的雙向翻譯。相關功能已在 Google Meet 伺服器端提供,並作為 Pixel 10 的內置裝置端功能推出;Pixel Voice Translate 採用級聯式流程以擴大語言覆蓋。
推薦理由:文章説明串流架構如何配合時間同步訓練資料,把語音互譯的標準延遲控制在 2 秒,並以原説話者聲線輸出譯音,可瞭解低延遲與個人化如何結合。
Hugging Face Blog 提出語音複製「同意閘門」設計並提供示例 Space 和程式碼,系統需先確認説話者已明確同意才會啟動。示例會為每次同意生成一組新句子,分別表達明確同意及補充語音的音素多樣性,並以語音識別確認同意語句。作者指出,仍可能有人用另一個 TTS 系統生成相符語句,並列出音訊來源驗證、説話者嵌入向量相似度及即時錄音 metadata 作為可探索方向。
推薦理由:把每次生成的同意語句與語音辨識綁定,並以同一段錄音作複製輸入,展示了將知情同意設為工作流程前置條件的實作思路。
FireRedTeam 為 FireRedTTS-2 發佈完整微調程式碼及教學,示例以 LJSpeech 數據集為基礎。團隊表示,該系統支援多語言和零樣本聲音克隆,使用對話數據微調可生成與示範相若的播客內容。
OpenAI 語音應用指南介紹三種語音智能體架構:GPT-Live 搭配獨立後端、Realtime API 在單一會話中處理語音、推理與工具使用,以及可逐階段檢視或替換元件的串接式語音管線。指南列出任務與工具結果、對話時序、語音與語言、會話可靠性等評估面向,並建議以 Crawl、Walk、Run 逐步增加測試複雜度。
OpenAI 的音訊與語音指南按應用場景介紹 GPT-Live、Realtime API 及專用音訊 API 的選用方式。
OpenAI Realtime API 的即時轉錄指南説明如何建立即時音訊轉錄工作階段,接收隨語音到達的逐步文本,並在提交每個音訊回合後取得最終轉錄。指南建議使用 gpt-live-transcribe,伺服器端音訊管線可用 WebSocket,瀏覽器音訊可用 WebRTC。較高的 delay 會讓模型取得更多音訊上下文並可能改善詞錯誤率,設定應以具代表性的真實音訊測試。
OpenAI 的 Realtime API 入門指南説明如何經 WebRTC 或 WebSocket 建立有狀態的語音對話,並以事件管理會話。指南涵蓋文字和音訊生成、圖像輸入、function calling、VAD 設定、打斷處理及 push-to-talk;Realtime Session 最長為 60 分鐘。
OpenAI Developers 提供結合 Realtime API 與 Twilio 電話通話能力的 starter app,用於構建 AI 電話助手。示例以 NextJS 前端和 Express WebSocket 後端串接 Twilio 雙向通話串流與 Realtime API,後端亦向前端轉發訊息。