Cerebras 為企業客戶提供 Kimi K2.6 1 萬億參數模型試用
Cerebras 正向企業客戶提供 Kimi K2.6 試用,這是該公司首次提供 1 萬億參數開放權重模型推理服務。Artificial Analysis 於 2026 年 5 月 6 日測得其輸出速度為 981 tokens per second,較次快的 GPU 雲端服務快 6.7 倍,較推理服務中位數快 23 倍。
Cerebras 正向企業客戶提供 Kimi K2.6 試用,這是該公司首次提供 1 萬億參數開放權重模型推理服務。Artificial Analysis 於 2026 年 5 月 6 日測得其輸出速度為 981 tokens per second,較次快的 GPU 雲端服務快 6.7 倍,較推理服務中位數快 23 倍。
Cerebras 已在 Cerebras Inference Cloud 限時公開預覽 Gemma 4 31B,支援以圖片輸入進行多模態推理。Artificial Analysis 測得其輸出速度為每秒 1,851 個 token,是典型 GPU 端點的 35 倍;首次回應 token(包括推理)在 1.5 秒內返回。
Cerebras 與 OpenAI 公佈 GPT-5.6 Sol 的 Ultrafast 服務級別,率先於 OpenAI API 推出。服務由 Cerebras 提供支援,輸出速度最高達每秒 750 個 tokens;目前以有限預覽形式向部分客戶開放,並會隨容量增加擴大開放。
Claude Code v2.1.291 修復兩項回歸問題,涉及雲端工作階段遺漏權限提示回答,以及退出時遺失工作階段最後訊息。這兩項問題分別出現在 2.1.290 和 2.1.288。
Baseten 推出 Baseten Hosted Tools,首項工具 Baseten Grounded Inference 在 Baseten Inference Stack 內提供網頁搜尋,讓託管模型取得最新網頁資訊。
DeepSeek 為 DeepSeek Harness 推出 v0.2 預覽版官方桌面應用程式,支援 macOS(Apple silicon)及 Windows(64-bit)。
Thinking Machines Lab 推出 Tinker,一個用於微調語言模型的彈性 API,並以託管服務處理分散式訓練。Tinker 支援多種大、小型開放權重模型,包括 Qwen-235B-A22B;開源 Tinker Cookbook 提供可在 Tinker API 上執行的後訓練方法實作。Tinker 目前處於研究者和開發者私人測試階段,初期免費,並將於未來數週引入按用量收費。
Cohere 推出 Parse,這款文件解析視覺語言模型現已透過 Cohere API、Model Vault、Microsoft Foundry 和 AWS SageMaker 提供。
ElevenLabs Blog 第 2 頁收錄 9 月 23 日至 10 月 5 日刊出的文章,涵蓋 Eleven v4、語音智能體、轉錄及 API 等主題。內容亦包括 Eleven v4 Turbo 現已可在 ElevenAgents 使用,以及 ElevenLabs 在荷蘭和比利時推出服務的消息。
ElevenLabs Agents 推出 Agent Workflows 視覺化編輯器,讓用戶設計對話流程,並將任務轉交專門的 Subagents 或人工處理。
ElevenLabs 推出 Image & Video (Beta),在同一平台整合圖像、影片生成及音訊後製流程。用戶可透過 Nanobanana、Flux Kontext、GPT Image 和 Seedream 生成圖像,並以 Veo、Sora、Kling、Wan 和 Seedance 生成影片,再匯出至 Studio 加入語音、背景音樂及音效。
MasterClass 與 ElevenLabs 合作,讓用戶可在 MasterClass On Call 與 Gordon Ramsay、Mark Cuban 等講師的 AI 版本進行即時語音對話。
ElevenLabs 推出《The Eleven Album》,專輯由多位音樂人與 AI 協作創作,並由 Eleven Music 提供生成技術。Eleven Music 可按簡單提示詞生成完整作品,並支援音樂人調整歌詞、時間安排及配器,以及下載最多六條錄音室級分軌。
ElevenLabs 推出 Scribe v2,面向大規模批量轉錄、字幕製作及字幕生成,並提升對長篇、複雜錄音的處理穩定性與準確度。Scribe v2 在業界標準基準測試中錄得最低詞錯誤率,支援最多 100 個詞語或短語的關鍵詞提示,以及涵蓋最多 56 個類別、附精確時間戳的實體偵測。
Klarna 在美國推出以 ElevenAgents 建構的語音 AI 智能體,作為電話支援第一線;查詢由智能體處理時,解決速度快至 10x。服務供美國 35 million 名 Klarna 客戶使用,智能體可處理資訊查詢,並在有需要時轉交人工客服。Klarna 計劃將服務擴展至全球,目標涵蓋 114 million 名客戶。
ElevenLabs 推出教授語音 AI 使用計劃,並推出以 Einstein 的聲音和作品為基礎的互動學習體驗。教授可免費使用 Pro tier,並可為特定課程和項目向學生提供限時使用權限。重現後的 Einstein 聲音可在 ElevenReader 聆聽;基於 ElevenLabs Agents 的互動體驗則支援用戶即時提問和探索科學概念。
ElevenLabs 推出 AI 音樂探索與創作平台 ElevenMusic,整合聆聽、改編、原創創作、發布及收益功能。平台現已可透過應用程式或網頁使用,已有超過 4,000 名獨立及新興藝人參與,並同步推出收錄 Danger Twins、Justin Love 等藝人曲目的 Eleven Album Vol. 2。
ElevenLabs 推出 Dubbing v2,直接以原始表演作為條件,將説話者的語調、語氣、節奏和情感意圖延續至 90+ 種語言。其同步感知翻譯系統會自動對齊內容的起始、結束位置和節奏,減少手動調整。
ElevenLabs 在 ElevenCreative 推出 Flows Agent,讓用戶以對話描述創作需求,由智能體建立、連接並執行工作流程。它會選擇合適模型、建立及連接節點,並在生成前確認影片長度、語氣和結構;啟用 Assist mode 後,高成本生成須經用戶確認。
ElevenLabs 在 ElevenCreative 推出 Ads Engine,首項功能可把廣告素材本地化並推回 Google、Meta 和 LinkedIn。
ElevenLabs 在 ElevenAgents 推出 Procedures,讓團隊為智能體設定常見情境下的操作指示。Procedures 分為按固定步驟執行的結構化流程,以及可按對話調整並調用工具的自由形式流程。用戶可匯入 docs、PDFs 或 txt 檔案,由 ElevenAgents 草擬 Procedure 供確認或修改;功能目前處於 Alpha。
ElevenLabs 推出 CLI v1,將 ElevenLabs API 帶入終端機,並以面向編碼智能體的指令和結構化 JSON 結果設計操作流程。CLI 支援 agents-as-code,可將工作區內的 Agent 匯入本機設定檔、編輯及預覽差異,再手動或透過編碼智能體推送至 production;`--dry-run` 可在操作影響工作區前預覽。
Prime Intellect 將 Prime Intellect Compute 全面公開,作為聚合及調度全球 GPU 資源的算力交易平台。平台已整合 12 個雲端供應商,用戶可即時按需使用最多 8 張 GPU;H100 按需價格為 $1.5-4/hr。
Fireworks 以私人預覽形式開放 Kimi K3 的 Multi-LoRA 訓練與服務,並透過 Fireworks Serverless Training 提供。
Fireworks AI 已在其平台提供 Kimi K3 推理與訓練,並推出以 Kimi K3 起步的美國境內 Serverless 端點。Kimi K3 有 2.8T 參數;端點提供美國境內推理及零資料保留,Fireworks 對開放模型預設不記錄或儲存提示詞及生成數據,除非用戶明確選擇加入。
Goodfire Research 展示 Paint With Ember,讓用戶透過畫布操控 SDXL-Turbo 的內部表徵,以概念方式生成和編輯圖像。工具使用 BatchTopK SAE 拆解圖像潛在表示,再以 NMF 將相關特徵聚合為概念,支援繪製、拖曳和調整概念。Goodfire Research 提供應用程式公開版本及開源 SAE 解讀器模型。
Prime Intellect 啟動 INTELLECT-2,展開 32B 參數模型的全球分散式強化學習訓練,並開放任何人無需許可地貢獻異構算力。訓練以 QwQ-32B 為基礎,採用 DeepSeek-R1 的 GRPO 方法,聚焦可驗證的數學與編碼任務,並以系統提示詞設定思考 token 預算。
Prime Intellect 預覽面向消費級 GPU、為公共互聯網 100ms 延遲設計的分散式推理堆疊,並開源三個研究程式碼庫。PRIME-IROH 是管線並行通訊後端,PRIME-VLLM 是可在公共網絡運行的 vLLM 管線並行整合,PRIME-PIPELINE 是快速驗證研究構想的精簡研究沙盒;用戶現已可連接私人硬件,透過公共網絡執行推理。
Fireworks AI 宣佈 Training API 與 Fireworks Lab 正式開放,並讓團隊可接入自訂訓練迴圈。API 由 Fireworks 管理分散式訓練與 rollout 基礎設施,用戶可在 Python 中掌控訓練迴圈、損失或獎勵、資料及環境。
Prime Intellect 發佈開放數據集 SYNTHETIC-2,收錄 400 萬條經驗證的推理軌跡,涵蓋複雜強化學習任務。全球共有 1,253 張 GPU 參與生成;TOPLOC v2 的誤報率為 0.000925%,證明驗證中位成本跨模型平均比重新執行原始推理低 25 倍。
Prime Intellect 推出 Lab,將 Environments Hub、Hosted Training 和 Hosted Evaluations 整合為模型後訓練研究的全棧平台。平台現支援基於 prime-rl、使用 LoRA 的智能體強化學習訓練,並可在自建環境中執行。私測期間已完成逾 3,000 次 RL runs,現已向所有人開放。
Prime Intellect 與 Browserbase 合作提供 BrowserEnv,讓用戶可在真實網站互動環境中訓練瀏覽器及電腦操作智能體。團隊以 WebVoyager 基準的 600 項真實網頁任務微調 Qwen3-VL-8B-Instruct,訓練流程和環境均已放在 Hub,並可完整重現。
Prime Intellect 將 Proximal 的 FrontierSWE 編碼基準上架 Environments Hub,用戶可透過 Prime CLI 執行評測。
Prime Intellect 宣佈 Lab 結束 beta 階段並全面開放,平台把自我改進智能體的任務設定、評估、訓練和部署整合為一套流程。Lab 以環境封裝任務、工具、模擬器和獎勵指標;Hosted Training 支援在用戶環境中執行大規模強化學習,並訓練 LoRA adapter。
Prime Intellect 開源獨立 Python 程式庫 renderers,讓開發者以可編程的 Python 物件控制 RL 和多輪推理的對話格式。它在 token ID 層處理訊息渲染、回應解析、loss mask 標記及多輪橋接,以保留已採樣 token 前綴;文章指出,五輪 rollout 若每個邊界都無法合併,計算量約為連續序列的 3x。
Prime Intellect 開源 General Agent 環境首個版本,並以合成器生成任務、按求解模型通過率逐級校準難度。語料目前包含 4,504 項任務、1,040 個領域及 8,159 種獨特工具。
Prime Intellect 推出 Hosted Evaluations,讓用戶能使用可擴展基礎設施,在自己的評測項目上測試模型。用戶可在 Environments Hub 已支援的數百個社羣環境中執行評測,亦可透過 CLI 加上 --hosted 參數啟動。評測結果可發布至相應排行榜;由於環境開源,各模型會在相同設定下受評,而檢視器會顯示採樣參數、其他設定、樣本、執行軌跡、工具呼叫及結果。
Prime Intellect 在 Prime Intellect Lab 開放 NVIDIA Nemotron 3 Ultra 的託管後訓練支援,涵蓋 RL 訓練、評測與推理部署。
Prime Intellect 發佈 prime-rl 0.6.0,支援萬億參數規模模型的智能體強化學習訓練。該團隊表示,可在 28 個 H200 節點上以最高 131k 的序列長度、低於 5 分鐘的單步時間及 256 個 rollouts 的批次大小,訓練 GLM-5 執行 SWE 任務。
Prime Intellect 為 prime-rl 新增演算法層,內建六種演算法並支援按環境選用,讓同一訓練執行可混用不同演算法。六種包括 GRPO、MaxRL、On-Policy Distillation、Self-Distillation、SFT distillation 和 ECHO;自訂演算法可沿用同一抽象實作,而毋須修改 trainer。