基礎模型可藉訓練數據中的線索進行推理
研究顯示,固定基礎模型回答開頭的特定 token 線索,可令其在數學及編碼任務上取得媲美 RL 訓練模型的表現。例如,指定線索令 Olmo-3-7B 在 MATH-500 的 pass@1 準確率由 42% 升至 78%,而 Qwen3-14B 則由 72% 升至 87%。
研究顯示,固定基礎模型回答開頭的特定 token 線索,可令其在數學及編碼任務上取得媲美 RL 訓練模型的表現。例如,指定線索令 Olmo-3-7B 在 MATH-500 的 pass@1 準確率由 42% 升至 78%,而 Qwen3-14B 則由 72% 升至 87%。
RealtimeWAM 透過一步動作生成與非同步推理,提升世界動作模型(WAM)的推理效率。其提出 Teacher-Anchored Consistency Distillation(TACD)及 Cross-Expert Wavefront Pipelining(CEWP),分別減少動作生成的多步迭代與影片、動作專家之間的等待。
研究提出並評估一種以生成器忠實重建能力校準的內容認證方法,用來判斷影像真實性是否可被合理否認。研究測試 20 款深偽檢測器對 10 個近四年推出的生成器,準確率由接近完美的 99.5% 降至 76%;對抗性擾動則令所有基線檢測器的準確率跌至 2% 以下。新方法可校準至生成內容遭錯誤認證的比例不超過 1%,並在所評估的有界擾動攻擊下維持此上限,但不涵蓋任意對抗性轉換。
Rox 採用 Cerebras Inference,為銷售 AI 智能體工作流程的 Fast Path 提供低延遲推理,令 Command 對話、語音及即時研究互動更迅速。Rox 表示,回應速度較先前方案快 10-20x;Cerebras Inference 現可透過 AWS Marketplace 按 token 計費使用,毋須部署基建。
G42 旗下 Inception、MBZUAI 基礎模型研究所與 Cerebras Systems 推出 Jais 2 阿拉伯語大型語言模型系列,包含 8B 和 70B 型號。
Cerebras 宣佈,Z.ai 的 GLM-4.7 現已登陸 Cerebras Inference Cloud,程式碼生成約為 1,000 tokens per second,部分場景最高達 1,700 TPS。
OpenAI 與 Cerebras 簽訂多年協議,將分階段部署 750 megawatts 的 Cerebras 晶圓級系統,為 OpenAI 客戶提供服務。部署將於 2026 年開始;Cerebras 稱這將成為全球最大高速 AI 推理部署。Cerebras 表示,其系統上的大語言模型在編碼智能體或語音聊天場景中,回應速度較基於 GPU 的系統快達 15×。
推薦理由:文章列出 750 megawatts 的部署規模,並引述 Cerebras 稱其推理回應較 GPU 系統快達 15×,呈現合作的規模與方案定位。
Cerebras 宣佈,由其提供運算支援的 OpenAI GPT-5.3-Codex-Spark 已開放研究預覽,面向即時軟件開發。模型運行速度超過 1,000 tokens/s;在 SWE-Bench Pro 和 Terminal-Bench 2.0 等基準上,其回應較 GPT-5.1-Codex-mini 更有能力,完成任務只需一小部分時間。
Cerebras 分享一份 GPT-5.3-Codex-Spark 編碼實踐指南,建議以快速、密集的互動取代長提示詞和多代理並行。GPT-5.3-Codex-Spark 在 Cerebras WSE 硬件上運行,生成速度超過 1,200+ tokens/second。指南建議將工作拆成小目標,逐步執行測試,並以文件和 Git 保存跨工作階段狀態。
Cerebras 指出,AI 競賽的焦點正由模型智能轉向推理速度,因生成 token 的速度影響模型迭代與軟件開發。
作者以 Codex、Figma MCP 和多智能體協作流程,將網站 5 個頁面近乎完美地複製到 Figma,耗時不到 5 分鐘。流程由主協調 Agent 為每個子 Agent 分配一頁,再審核結果並按需派發修正;作者先用 GPT-5.4-Medium 反覆調整指示,再以 GPT-5.3-Codex-Spark 執行。
Cerebras 在 Cerebras Inference 推出 Multi-LoRA,支援團隊以單一共享基礎模型搭配多個 LoRA 適配器,並按每次請求切換適配器。該功能支援以 HF PEFT 格式部署 LoRA,現正向 Cerebras Inference 專用端點用戶提供私人預覽,毋須額外付費。團隊可按領域、任務、客戶及工作流程專門調整模型行為。
Cerebras 正向企業客戶提供 Kimi K2.6 試用,這是該公司首次提供 1 萬億參數開放權重模型推理服務。Artificial Analysis 於 2026 年 5 月 6 日測得其輸出速度為 981 tokens per second,較次快的 GPU 雲端服務快 6.7 倍,較推理服務中位數快 23 倍。
Cerebras 已在 Cerebras Inference Cloud 限時公開預覽 Gemma 4 31B,支援以圖片輸入進行多模態推理。Artificial Analysis 測得其輸出速度為每秒 1,851 個 token,是典型 GPU 端點的 35 倍;首次回應 token(包括推理)在 1.5 秒內返回。
更快的模型推理讓網絡安全公司能在既有工作流程內處理更多上下文、推理及驗證,並維持流暢的用戶體驗。實務上可採分層架構,由規則、傳統模型及小型語言模型先行篩選、分類和分流,再把可疑事件、高風險發現等交由較強的推理模型深入分析,兼顧日常流程速度與重要個案的分析深度。
Cerebras 與 OpenAI 公佈 GPT-5.6 Sol 的 Ultrafast 服務級別,率先於 OpenAI API 推出。服務由 Cerebras 提供支援,輸出速度最高達每秒 750 個 tokens;目前以有限預覽形式向部分客戶開放,並會隨容量增加擴大開放。
Claude Code v2.1.291 修復兩項回歸問題,涉及雲端工作階段遺漏權限提示回答,以及退出時遺失工作階段最後訊息。這兩項問題分別出現在 2.1.290 和 2.1.288。
Baseten 推出 Baseten Hosted Tools,首項工具 Baseten Grounded Inference 在 Baseten Inference Stack 內提供網頁搜尋,讓託管模型取得最新網頁資訊。
NAVER 以人為本推進 AI 安全,並從技術限制、濫用風險及失控風險三方面著手應對。其 Future AI Center 專責 AI 安全研究,紅隊會在包括仇恨言論、暴力及偏頗資訊等 14 個範疇定期測試 AI 模型。NAVER 亦致力確保選舉相關 AI 生成內容附有聲明,並分享研究原始碼及數據集、提供安全使用培訓。
NAVER 的 AI 安全框架以人為本,識別、評估及管理 AI 系統由開發至部署各階段的風險。框架把風險分為失控與濫用兩類,分別採用風險評估尺度及矩陣。NAVER 的目標是每 3 個月評估前沿 AI;效能提升 6x 時則提前評估。
DeepSeek 為 DeepSeek Harness 推出 v0.2 預覽版官方桌面應用程式,支援 macOS(Apple silicon)及 Windows(64-bit)。
Aleph Alpha 發佈 Kolibri(Kolibri-1),一款面向英語和德語的開放權重 MoE 語言模型,總參數為 78.1B,每個 token 啟用 3.46B。
Thinking Machines Lab 推出 Tinker,一個用於微調語言模型的彈性 API,並以託管服務處理分散式訓練。Tinker 支援多種大、小型開放權重模型,包括 Qwen-235B-A22B;開源 Tinker Cookbook 提供可在 Tinker API 上執行的後訓練方法實作。Tinker 目前處於研究者和開發者私人測試階段,初期免費,並將於未來數週引入按用量收費。
Tinker 邀請開發者和研究人員提交社羣項目,並計劃定期在網誌刊出精選成果。徵集涵蓋機器學習研究、微調模型應用、產品原型、數據集及基礎設施;投稿應附研究説明,最好開源程式碼,並展示嚴謹評估和透明結果。
彭博報道指,希捷與東芝正競購 TDK 硬碟磁頭業務,相關談判仍處初步階段,交易價值最高可達數十億美元。東芝今年春季先與 TDK 洽談,希捷則於夏季提出更高報價;三家公司高層上週三在東京討論零件持續供應及成立合資公司的可能性。TDK 是全球唯一獨立生產硬碟磁記錄磁頭的製造商,這項交易不論由哪一方完成,都須接受反壟斷審查。
據報,月之暗面已完成上市前最後一輪私募融資,估值約500億美元,並計劃明年第一季在香港IPO。知情人士稱,IPO募資上限為50億美元,公司ARR目前為10億美元,預計12月升至20億美元。《The Information》稱,監管機構已就深度求索(DeepSeek)與月之暗面啟動數據安全調查;相關調查對估值及IPO進度的影響尚不清楚,IPO時間表仍有變數。
Dynatron 確認 AMD EPYC 9006 LP「Verano」處理器採用 SB1 插槽。該處理器瞄準 AI 加速器頭節點應用,支援 LPDDR5X SOCAMM2,最多配備 72 個 CPU 核心、頻率可達 5GHz,並支援 112Gbps 高頻寬 xGMI 連接,預計 2027 年推出。
Eugene Yan 以 Semantic IDs 微調 Qwen3-8B,訓練出可根據用戶互動及自然語言指令調整推薦的 LLM 推薦系統混合模型。他以 RQ-VAE 將商品嵌入向量編碼為階層式 Semantic IDs,並建立 4.2 million 組涵蓋 ID 與商品描述互轉、下一項預測等任務的對話訓練例子。
Eugene Yan 提出產品評測的三步流程:標註小型數據集、校準 LLM 評估器,並在每次配置變更後執行實驗與評測。他建議採用二元標籤,在 200 個以上樣本中準備 50–100 個失敗案例,並以 75% 樣本校準、25% 留作測試;不同評測維度應使用獨立評估器。
Eugene Yan 分享一套與 AI 協作、讓工作成果持續累積的方法,涵蓋整理上下文、將個人偏好寫入設定、降低驗證成本、委派較大任務及持續修正流程。他建議以專案索引和 CLAUDE.md 保存背景與偏好,把每週至少做一次的工作整理成按需載入的技能,並根據工作階段紀錄修訂設定。
Eugene Yan 梳理多個網絡安全基準,歸納智能體評測的共同設計模式,並比較它們衡量漏洞發現、重現與利用能力的方法。文章將常見設計概括為沙盒目標環境、影響任務難度的資訊、工具和評分器,並介紹 Cybench、CVE-Bench、CyberGym 等基準如何提供部分分數或按攻擊階段分級。
Cohere 與滑鐵盧大學合作開發 AI 轉型及變革管理證書課程,協助學生掌握推動職場 AI 轉型所需的實務技能。課程由該校 Future of Work Institute 主導,屬非學分課程,預計於 2026 年秋季推出,結合課堂學習、職場體驗及協作解難。學生將透過應用項目及有系統的實習機會,與機構合作發掘、排序及落實 AI 用例。
Cohere 分析超過 5.6 million 個涵蓋不同訓練階段的樣本,發現文化多樣性由預訓練進入後訓練時持續收窄。增加語言種類可擴大地理多樣性,但整體文化內容比例會趨於停滯。在 TinyAya base model 微調時加入文化標記後,NormAd、BBQ、GMMLU 分別提升 +8%、+6%、+2.3%,且一般多語能力未受損。
ElevenLabs 網誌第 5 頁列出 2026 年 8 月 3 至 13 日的文章,聚焦 ElevenAgents、語音複製及 AI 配音等產品與應用。其中包括 Dubbing v2 已可經 ElevenAPI 使用,以及 ElevenReader Voice Chat 配合 ElevenAgents 將平均聆聽時間提升 24% 的案例。
Cohere 推出 Parse,這款文件解析視覺語言模型現已透過 Cohere API、Model Vault、Microsoft Foundry 和 AWS SageMaker 提供。
ElevenLabs Blog 第 3 頁列出 2026 年 9 月 9 日至 22 日發布的 AI 資源、產品更新及客戶案例文章。內容包括 Scribe v2 Medical 向所有人開放、ElevenCreative 的 Studio 4.0 和 Music v2.5,以及 Cadence 透過 ElevenAgents 將高風險患者回應時間縮短 97% 的案例。
企業可用生成式 AI 搜尋及整合知識、創作內容、提供對話支援、協助軟件開發與數據分析,並自動化多步工作流程。用得其所可提升生產力和工作質素、擴大個人化體驗,並加快創新。採用時須先確認生成式 AI 能否切合具體業務需要並值得投資,避免在缺乏明確商業理據下增加成本與複雜程度。
ElevenLabs Blog 第 2 頁收錄 9 月 23 日至 10 月 5 日刊出的文章,涵蓋 Eleven v4、語音智能體、轉錄及 API 等主題。內容亦包括 Eleven v4 Turbo 現已可在 ElevenAgents 使用,以及 ElevenLabs 在荷蘭和比利時推出服務的消息。
ElevenLabs Agents 推出 Agent Workflows 視覺化編輯器,讓用戶設計對話流程,並將任務轉交專門的 Subagents 或人工處理。
Cohere Labs 公開 Agentic Task Ecosystem(ATE)數據集,分析智能體工具對職業任務的自動化覆蓋。數據集收錄 696,291 項來自 123,069 個公開 MCP 伺服器的工具;按嚴格標準,僅 2.6% 能端到端執行已記錄的職業任務,923 個職業中有 419 個沒有任何智能體工具活動。