跳到正文

#語音

今日 38 條
今天10月6日週二
  1. IT之家66

    意大利總理梅洛尼申請將自己的聲音註冊為商標,以防範 AI 深度偽造

    意大利總理焦爾吉婭·梅洛尼向歐盟知識產權局提交申請,擬將自己的聲音註冊為商標,以防範 AI 生成的深度偽造內容。申請日期為 10 月 5 日,材料附有一段 4 秒錄音,梅洛尼以意大利語重複説出自己的姓名兩次。申請仍在審核;報道指出,即使獲批,商標也不能完全阻止他人製作其 AI 深度偽造音訊,但可增加造假者面對的法律障礙。

  2. ElevenLabs:Blog16

    ElevenLabs Blog 第 2 頁文章列表

    ElevenLabs Blog 第 2 頁收錄 9 月 23 日至 10 月 5 日刊出的文章,涵蓋 Eleven v4、語音智能體、轉錄及 API 等主題。內容亦包括 Eleven v4 Turbo 現已可在 ElevenAgents 使用,以及 ElevenLabs 在荷蘭和比利時推出服務的消息。

  3. ElevenLabs:Blog52

    ElevenLabs 與烏克蘭合作建設全球首個智能體政府

    ElevenLabs 與烏克蘭政府簽署諒解備忘錄,合作推動 AI 公共服務由概念走向部署。教育部團隊正開發 Mriia 個人化 AI 導師應用程式,經濟部則把智能體整合至 Obriy,醫療領域運用語音技術減少行政工作。烏克蘭數碼轉型部計劃於 2030 年前成為 AI 公共服務應用的領先者,並以 Diia.AI 踏出第一步;該平台是全球首個公共服務智能體應用程式及平台。

  4. ElevenLabs:Blog47

    Klarna 透過 ElevenAgents 將問題解決時間縮短 10X

    Klarna 在美國推出以 ElevenAgents 建構的語音 AI 智能體,作為電話支援第一線;查詢由智能體處理時,解決速度快至 10x。服務供美國 35 million 名 Klarna 客戶使用,智能體可處理資訊查詢,並在有需要時轉交人工客服。Klarna 計劃將服務擴展至全球,目標涵蓋 114 million 名客戶。

  5. ElevenLabs:Blog37

    ElevenLabs 擴展西班牙業務

    ElevenLabs 今日在馬德里開設辦事處,並擴大西班牙業務,擴充本地銷售及工程團隊。eDreams ODIGEO(eDO)使用 Eleven Agents,以五種語言處理數以百萬計的客戶支援互動,並在問題解決速度及轉接率方面取得雙位數改善。

  6. ElevenLabs:Blog58

    ElevenLabs 推出教授語音 AI 支援計劃及 Einstein 互動學習體驗

    ElevenLabs 推出教授語音 AI 使用計劃,並推出以 Einstein 的聲音和作品為基礎的互動學習體驗。教授可免費使用 Pro tier,並可為特定課程和項目向學生提供限時使用權限。重現後的 Einstein 聲音可在 ElevenReader 聆聽;基於 ElevenLabs Agents 的互動體驗則支援用戶即時提問和探索科學概念。

  7. ElevenLabs:Blog50

    ElevenLabs Voice Library 創作者累計收入逾 $22 million

    ElevenLabs 表示,Voice Library 創作者累計收入六個月內由 $11 million 增至逾 $22 million。平台現有 10,400+ 名創作者,Voice Library 收錄 32 種語言的聲音,涵蓋數十種口音和風格。創作者可設定授權用途、價格級別及最長兩年的通知期,收益按使用量和所訂條款計算,亦可更新條款、限制用途或移除聲音。

  8. ElevenLabs:Blog65

    ElevenLabs 在 ElevenCreative 推出 Flows Agent

    ElevenLabs 在 ElevenCreative 推出 Flows Agent,讓用戶以對話描述創作需求,由智能體建立、連接並執行工作流程。它會選擇合適模型、建立及連接節點,並在生成前確認影片長度、語氣和結構;啟用 Assist mode 後,高成本生成須經用戶確認。

  9. ElevenLabs:Blog51

    ElevenLabs 擴大加州業務,創造 173 個高薪職位

    ElevenLabs 宣佈擴大加州業務,將在全州增聘 173 人,涵蓋研究、工程、銷售等高薪職位,並投入數百萬美元。公司獲 California Competes Tax Credit(CalCompetes)計劃提供獎勵,並計劃與加州政府探索以語音 AI 提升公共服務的可及性;公司亦參與州長打擊科技促成詐騙的專責小組。

  10. ElevenLabs:Blog44

    ElevenLabs 正式在加拿大開展業務

    ElevenLabs 正式在加拿大開展業務,並加大對當地團隊及實體據點的投資。公司委任 Max Lemmens 為加拿大總經理,計劃今年將團隊擴大至目前規模的兩倍,並在多倫多開設首間加拿大辦公室。ElevenLabs 在加拿大已有 30,000 名用戶。

  11. ElevenLabs:Blog60

    ElevenLabs 以語音 AI 支援選舉資訊服務並加強防濫用措施

    ElevenLabs 正在 2026 年選舉週期與選舉機構及民間組織合作,以語音 AI 擴大選民取得官方資訊的途徑,並防範技術遭濫用。巴西最高選舉法院(TSE)將為「選舉助理」加入語音介面,讓民眾透過語音查詢其網站、App 和 WhatsApp 頻道資訊;ElevenLabs 亦會培訓 Comprova 合作夥伴使用 AI Speech Classifier 等檢測工具。

  12. Zyphra Research59

    Zyphra 發佈 ZONOS2 即時文字轉語音模型,支援高保真聲音複製

    Zyphra 發佈採用 Apache 2.0 授權的即時文字轉語音模型 ZONOS2,支援高保真聲音複製。模型採用 MoE 架構,規模由前代的 1.6B 增至 8B,即時生成吞吐量較前代提升 4x,並支援最長一分鐘的多語言及語碼轉換語音生成。ZONOS2 提供 stable 和 expressive 兩種模式,分別側重乾淨輸出,以及聲音複製的自然度與保真度。

  13. Suno:Blog51

    Suno Voices:提升人聲品質的 6 個技巧

    Suno 分享了使用 Voices 製作高質素人聲的 6 個技巧,涵蓋安靜錄音、事前練習及按曲風配搭聲線。可行的話,建議錄製至少一分鐘的人聲參考;較長錄音能讓 Suno 學習更多內容,令整首曲目的人聲結果更一致。Voices 現已可在 Web、iOS 和 Android 使用,並提供免費試用及付費方案。

  14. ElevenLabs:Blog70

    ElevenLabs 發佈 Eleven v4 與 Eleven v4 Turbo 文字轉語音模型

    ElevenLabs 發佈 Eleven v4 文字轉語音模型及低延遲版本 Eleven v4 Turbo,兩者均支援 90 多種語言。Eleven v4 可按語氣、節奏、情緒、角色和上下文生成語音,並改善多説話者對話、聲音克隆及跨語言口音保留。Turbo 的中位推理延遲約 100ms,兩款模型現已可透過 ElevenAgents、ElevenCreative 和 ElevenAPI 使用。

  15. Suno:Blog67

    Suno 開放 Speech beta,生成語音與音樂融合音軌

    Suno 開放 Speech beta,這款音訊模型可將生成語音與音樂整合為同一音軌。用戶輸入構想、詩作或文字,再描述所需的聲線與音樂風格,即可創作配有原創背景音樂的口述音訊。Speech 過去一個月曾由小羣用戶測試,現向所有人開放 beta;Suno 將繼續根據社羣回饋改進。

  16. 小米 MiMo:官網發佈與博客58

    小米發佈 MiMo-V2.5-TTS 語音合成模型系列

    小米發佈 MiMo-V2.5-TTS 系列語音合成模型,涵蓋預設聲線、按文字描述設計新聲線,以及以參考音訊複製聲音三種用途。系列支援自然語言風格指令、行內音訊標籤和劇本式結構輸入;聲音複製只需短音訊樣本,無須額外訓練、標註或微調。三款模型限時免費開放於 Xiaomi MiMo API 平台,整合技能已開源於 GitHub 倉庫 XiaomiMiMo/MiMo-Skills。

  17. 小米 MiMo:官網發佈與博客59

    小米 MiMo 發佈開源語音辨識模型 MiMo-V2.5-ASR

    小米 MiMo 發佈開源語音辨識模型 MiMo-V2.5-ASR,支援中英雙語、中文方言、語碼轉換、歌詞辨識、噪音環境及多説話者場景。頁面列出多項公開及內部基準測試結果,MiMo-V2.5-ASR 在 Open ASR Leaderboard 的英文辨識平均 WER 為 5.73(WER 越低越好)。模型採用大規模中期訓練、高質素監督式微調(SFT)及強化學習(RL)算法。

  18. NAVER / CLOVA 研究57

    NAVER Cloud 介紹 Sommelier 全雙工語音 AI 數據流程

    NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。

  19. 字節 Seed:Research Feed62

    Seed Audio 1.0 音訊創作模型發佈,支援多要素統一生成

    字節 Seed 發佈音訊創作模型 Seed Audio 1.0,以統一框架生成對白、音效及環境聲,並支援按時間線控制聲音進場。模型支援 100ms 間隔精度的時間控制、參考音訊延展生成及 20+ 種語言;單次可生成約 2 分鐘音訊,並可繼續延長。Seed Audio 1.0 已在火山方舟體驗中心上線。

10月5日週一
  1. IT之家27

    倍思 MC2 NC 降噪耳夾耳機發售:12mm 動圈、-50dB 降噪,783 元(國補後 598 元)

    倍思旗下 MC2 NC 降噪耳夾耳機已在京東發售,定價 783 元,部分地區國補後低至 598 元。耳機配備 12mm 碳纖維三磁路動圈,降噪深度達 -50dB,配合充電盒續航最高 60 小時(關閉降噪)。另接入豆包、通義千問及 DeepSeek 模型,提供 AI 錄音轉寫、即時助答及同聲傳譯功能。