意大利總理梅洛尼申請將自己的聲音註冊為商標,以防範 AI 深度偽造
意大利總理焦爾吉婭·梅洛尼向歐盟知識產權局提交申請,擬將自己的聲音註冊為商標,以防範 AI 生成的深度偽造內容。申請日期為 10 月 5 日,材料附有一段 4 秒錄音,梅洛尼以意大利語重複説出自己的姓名兩次。申請仍在審核;報道指出,即使獲批,商標也不能完全阻止他人製作其 AI 深度偽造音訊,但可增加造假者面對的法律障礙。
意大利總理焦爾吉婭·梅洛尼向歐盟知識產權局提交申請,擬將自己的聲音註冊為商標,以防範 AI 生成的深度偽造內容。申請日期為 10 月 5 日,材料附有一段 4 秒錄音,梅洛尼以意大利語重複説出自己的姓名兩次。申請仍在審核;報道指出,即使獲批,商標也不能完全阻止他人製作其 AI 深度偽造音訊,但可增加造假者面對的法律障礙。
ElevenLabs Blog 第 2 頁收錄 9 月 23 日至 10 月 5 日刊出的文章,涵蓋 Eleven v4、語音智能體、轉錄及 API 等主題。內容亦包括 Eleven v4 Turbo 現已可在 ElevenAgents 使用,以及 ElevenLabs 在荷蘭和比利時推出服務的消息。
ElevenLabs 與烏克蘭政府簽署諒解備忘錄,合作推動 AI 公共服務由概念走向部署。教育部團隊正開發 Mriia 個人化 AI 導師應用程式,經濟部則把智能體整合至 Obriy,醫療領域運用語音技術減少行政工作。烏克蘭數碼轉型部計劃於 2030 年前成為 AI 公共服務應用的領先者,並以 Diia.AI 踏出第一步;該平台是全球首個公共服務智能體應用程式及平台。
Harvey 與 ElevenLabs 合作,為法律界打造全球化多語語音能力,讓 Harvey 能以數十種語言、方言或口音自然溝通。合作以 ElevenLabs 的 Text to Speech 和 Speech to Text 為基礎,首階段讓 Harvey 幾乎可用任何語言或方言以語音提供答案。
ElevenLabs 發佈 Scribe v2 Realtime,即時語音轉文字模型可在低於 150 ms 內轉錄語音,面向語音智能體、會議助理及即時字幕等場景。
Matthew McConaughey 已投資 ElevenLabs 數年,並將以創作者身份把電子通訊 Lyrics of Livin’ 擴展至由 ElevenLabs 支援的西班牙語版本。相關故事和內容將以他的聲音提供西班牙語音訊,觸及更廣泛受眾。
MasterClass 與 ElevenLabs 合作,讓用戶可在 MasterClass On Call 與 Gordon Ramsay、Mark Cuban 等講師的 AI 版本進行即時語音對話。
ElevenLabs 推出 Scribe v2,面向大規模批量轉錄、字幕製作及字幕生成,並提升對長篇、複雜錄音的處理穩定性與準確度。Scribe v2 在業界標準基準測試中錄得最低詞錯誤率,支援最多 100 個詞語或短語的關鍵詞提示,以及涵蓋最多 56 個類別、附精確時間戳的實體偵測。
Audi Revolut F1 Team 與 ElevenLabs 合作探索 AI 音訊及語音生成技術,期望支援車隊溝通和連繫全球車迷。雙方正探討相關技術如何支援賽道上的車隊,並透過數碼平台和體驗,讓世界各地車迷以新形式體驗及連繫這項運動。
ElevenLabs 的 Eleven v3 文字轉語音模型已結束 Alpha 階段,現已在所有平台正式提供。內部基準涵蓋 8 種語言、27 個類別,模型錯誤率由 15.3% 降至 4.9%,減少 68%。測試中,用戶有 72% 的情況偏好新版本;模型處理數字、符號及專門記法的準確度亦有所提升。
Revolut在英國及歐洲部署 ElevenLabs Agents,作為第一線語音客服,服務範圍擴至逾 400 萬名客戶。首階段部署令問題解決時間縮短逾 8 倍,智能體處理的來電中逾 99.7% 成功完成。智能體支援逾 30 種語言並可即時偵測及切換語言,Revolut亦保留編排及業務邏輯控制。
Klarna 在美國推出以 ElevenAgents 建構的語音 AI 智能體,作為電話支援第一線;查詢由智能體處理時,解決速度快至 10x。服務供美國 35 million 名 Klarna 客戶使用,智能體可處理資訊查詢,並在有需要時轉交人工客服。Klarna 計劃將服務擴展至全球,目標涵蓋 114 million 名客戶。
ElevenLabs 完成 $500M D 輪融資,估值達 $11B,並由 Sequoia Capital 領投。公司 2025 年底的 ARR 超過 $330 million;此輪使其自 2022 年成立以來的五輪融資總額達 $781 million。
ElevenLabs 今日在馬德里開設辦事處,並擴大西班牙業務,擴充本地銷售及工程團隊。eDreams ODIGEO(eDO)使用 Eleven Agents,以五種語言處理數以百萬計的客戶支援互動,並在問題解決速度及轉接率方面取得雙位數改善。
ElevenLabs 推出教授語音 AI 使用計劃,並推出以 Einstein 的聲音和作品為基礎的互動學習體驗。教授可免費使用 Pro tier,並可為特定課程和項目向學生提供限時使用權限。重現後的 Einstein 聲音可在 ElevenReader 聆聽;基於 ElevenLabs Agents 的互動體驗則支援用戶即時提問和探索科學概念。
ElevenLabs 宣佈 ARR 在 2026 年首四個月已超過 $500 million,並完成 Series D 第三次交割,迎來 BlackRock、NVIDIA(透過 NVentures)等新投資者。
ElevenLabs 表示,Voice Library 創作者累計收入六個月內由 $11 million 增至逾 $22 million。平台現有 10,400+ 名創作者,Voice Library 收錄 32 種語言的聲音,涵蓋數十種口音和風格。創作者可設定授權用途、價格級別及最長兩年的通知期,收益按使用量和所訂條款計算,亦可更新條款、限制用途或移除聲音。
ElevenLabs 推出 Dubbing v2,直接以原始表演作為條件,將説話者的語調、語氣、節奏和情感意圖延續至 90+ 種語言。其同步感知翻譯系統會自動對齊內容的起始、結束位置和節奏,減少手動調整。
ElevenLabs 與希臘政府建立戰略合作,將探索語音 AI 在公共服務、旅遊及希臘語言文化遺產保存方面的應用。公共服務方向包括政府呼叫中心及 gov.gr,該平台現提供超過 2,200 項服務;旅遊方向涉及官方旅遊網站 Visitgreece.gr 及新的旅遊平台。
ElevenLabs 在 ElevenCreative 推出 Flows Agent,讓用戶以對話描述創作需求,由智能體建立、連接並執行工作流程。它會選擇合適模型、建立及連接節點,並在生成前確認影片長度、語氣和結構;啟用 Assist mode 後,高成本生成須經用戶確認。
ElevenLabs 與英國科學、創新及科技部(DSIT)簽署合作備忘錄,探索以語音 AI 改善公共服務,並深化 AI 安全研究及英國語音與音訊 AI 人才培育。
ElevenLabs 宣佈擴大加州業務,將在全州增聘 173 人,涵蓋研究、工程、銷售等高薪職位,並投入數百萬美元。公司獲 California Competes Tax Credit(CalCompetes)計劃提供獎勵,並計劃與加州政府探索以語音 AI 提升公共服務的可及性;公司亦參與州長打擊科技促成詐騙的專責小組。
ElevenLabs 正式在加拿大開展業務,並加大對當地團隊及實體據點的投資。公司委任 Max Lemmens 為加拿大總經理,計劃今年將團隊擴大至目前規模的兩倍,並在多倫多開設首間加拿大辦公室。ElevenLabs 在加拿大已有 30,000 名用戶。
ElevenLabs 正在 2026 年選舉週期與選舉機構及民間組織合作,以語音 AI 擴大選民取得官方資訊的途徑,並防範技術遭濫用。巴西最高選舉法院(TSE)將為「選舉助理」加入語音介面,讓民眾透過語音查詢其網站、App 和 WhatsApp 頻道資訊;ElevenLabs 亦會培訓 Comprova 合作夥伴使用 AI Speech Classifier 等檢測工具。
Zyphra Research 發佈 Zonos-v0.1 beta,開源兩款採用 Transformer 與 SSM hybrid 架構的 1.6B TTS 模型,授權為 Apache 2.0。
Zyphra 發佈採用 Apache 2.0 授權的即時文字轉語音模型 ZONOS2,支援高保真聲音複製。模型採用 MoE 架構,規模由前代的 1.6B 增至 8B,即時生成吞吐量較前代提升 4x,並支援最長一分鐘的多語言及語碼轉換語音生成。ZONOS2 提供 stable 和 expressive 兩種模式,分別側重乾淨輸出,以及聲音複製的自然度與保真度。
Suno 發佈 v5.5,並推出 Voices、Custom models 和 My Taste,加入以用戶聲音、原創音樂及音樂偏好為基礎的個人化功能。
推薦理由:更新把個人化分為歌聲、原創曲目調校和偏好學習三條路徑,也交代各功能面向哪些用戶開放。
Liquid AI 發佈 LFM2-Audio-1.5B,這款 1.5B 參數模型支援音訊與文字輸入及生成。模型在 VoiceBench 九項音訊互動基準的總分為 56.78,ASR 基準平均詞錯誤率為 7.24。以 4 秒輸入波形測試,平均端到端延遲低於 100 ms;Liquid AI 亦提供 Python 套件及語音對話應用參考實作。
Suno 分享了使用 Voices 製作高質素人聲的 6 個技巧,涵蓋安靜錄音、事前練習及按曲風配搭聲線。可行的話,建議錄製至少一分鐘的人聲參考;較長錄音能讓 Suno 學習更多內容,令整首曲目的人聲結果更一致。Voices 現已可在 Web、iOS 和 Android 使用,並提供免費試用及付費方案。
Cohere 發佈開源語音辨識模型 Cohere Transcribe,在 Hugging Face Open ASR Leaderboard 以 5.42% 平均 WER 排名第一。
ElevenLabs 完成 $300 million 員工股份要約交易,公司估值達 $22 billion,為其 2 月 Series D 時估值的兩倍。公司稱,企業業務現佔收入 55%;ElevenAgents 每週處理逾 15 million 次對話,較 2 月增加 3x,同期 ARR 增長逾 3x。
ElevenLabs 發佈 Eleven v4 文字轉語音模型及低延遲版本 Eleven v4 Turbo,兩者均支援 90 多種語言。Eleven v4 可按語氣、節奏、情緒、角色和上下文生成語音,並改善多説話者對話、聲音克隆及跨語言口音保留。Turbo 的中位推理延遲約 100ms,兩款模型現已可透過 ElevenAgents、ElevenCreative 和 ElevenAPI 使用。
Suno 開放 Speech beta,這款音訊模型可將生成語音與音樂整合為同一音軌。用戶輸入構想、詩作或文字,再描述所需的聲線與音樂風格,即可創作配有原創背景音樂的口述音訊。Speech 過去一個月曾由小羣用戶測試,現向所有人開放 beta;Suno 將繼續根據社羣回饋改進。
小米發佈 MiMo-V2.5-TTS 系列語音合成模型,涵蓋預設聲線、按文字描述設計新聲線,以及以參考音訊複製聲音三種用途。系列支援自然語言風格指令、行內音訊標籤和劇本式結構輸入;聲音複製只需短音訊樣本,無須額外訓練、標註或微調。三款模型限時免費開放於 Xiaomi MiMo API 平台,整合技能已開源於 GitHub 倉庫 XiaomiMiMo/MiMo-Skills。
小米 MiMo 發佈開源語音辨識模型 MiMo-V2.5-ASR,支援中英雙語、中文方言、語碼轉換、歌詞辨識、噪音環境及多説話者場景。頁面列出多項公開及內部基準測試結果,MiMo-V2.5-ASR 在 Open ASR Leaderboard 的英文辨識平均 WER 為 5.73(WER 越低越好)。模型採用大規模中期訓練、高質素監督式微調(SFT)及強化學習(RL)算法。
Baseten 已在 Hugging Face 和 Baseten Model Library 提供 NVIDIA Nemotron 3 Diarization 的批次、串流及即時説話者標記轉錄預設。
NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。
字節 Seed 發佈音訊創作模型 Seed Audio 1.0,以統一框架生成對白、音效及環境聲,並支援按時間線控制聲音進場。模型支援 100ms 間隔精度的時間控制、參考音訊延展生成及 20+ 種語言;單次可生成約 2 分鐘音訊,並可繼續延長。Seed Audio 1.0 已在火山方舟體驗中心上線。
阿里千問 AI 耳夾式耳機已在電商平台上架並開放預約,售價暫未公佈。耳機由 Bose 調音,耳機續航 9 小時,配合充電盒可達 40 小時。它支援 89 種語言 AI 翻譯,並提供錄音即時轉寫、離線本地錄音及 92 種語言轉寫紀要。
倍思旗下 MC2 NC 降噪耳夾耳機已在京東發售,定價 783 元,部分地區國補後低至 598 元。耳機配備 12mm 碳纖維三磁路動圈,降噪深度達 -50dB,配合充電盒續航最高 60 小時(關閉降噪)。另接入豆包、通義千問及 DeepSeek 模型,提供 AI 錄音轉寫、即時助答及同聲傳譯功能。