Replit 指 AI 採用始於可信數據,語義層是基礎
Replit 指出,企業要可靠採用 AI Agent,須先建立共享語義層及受治理的營運真相層,讓 Agent 依據一致的商業定義、指標和數據來源工作。其內部數據 Agent 將修正存入 git 儲存庫,經人工審核和驗證後供接觸數據的 Agent 共用;Replit 稱,該 Agent 每週回答遠超 1,000 個以數據倉庫為基礎的提問,並在答案中附上證據。
Replit 指出,企業要可靠採用 AI Agent,須先建立共享語義層及受治理的營運真相層,讓 Agent 依據一致的商業定義、指標和數據來源工作。其內部數據 Agent 將修正存入 git 儲存庫,經人工審核和驗證後供接觸數據的 Agent 共用;Replit 稱,該 Agent 每週回答遠超 1,000 個以數據倉庫為基礎的提問,並在答案中附上證據。
Replit 現可為其應用程式執行黑盒滲透測試,透過網絡和瀏覽器模擬外部攻擊者,在無法存取程式碼的情況下尋找漏洞。執行 Level 3 掃描時,系統會在私有沙盒中的應用程式副本上並行執行白盒及黑盒掃描;黑盒掃描只需應用程式連結。Replit 表示,兩種掃描發現的問題很少重疊,案例包括白盒掃出存取權限已撤銷的用戶仍可操作,黑盒則找到無需登入即可進入的管理員控制台。
Replit 宣佈收購位於舊金山的 Atta,將其商業分析方法及專門圖表技術整合至 Replit,並推出聊天互動圖表。用戶可在 Replit 對話中上載數據集或連接數據來源並提問,Replit 會分析數據並呈現圖表,無需編寫 SQL。圖表會按數據和問題選擇合適的視覺化方式,並提供可互動、可分享的呈現。
Cohere 發佈 Embed 5 嵌入模型系列,分為面向最高檢索品質的 Pro 和麪向低延遲、高流量工作的 Fast,兩款均支援多模態輸入、100+ 種語言及 128K-token 上下文窗口。
Cohere 開源發佈 Command A+,這款採用 MoE 架構的 LLM 以 Apache 2.0 授權,面向高效能智能體任務。模型有 218B 總參數和 25B 活躍參數,支援 48 種語言,並提供 BF16、FP8 和 W4A4 量化版本。
Cohere 開源發佈 North Mini Code,稱其為首款智能體編碼模型,採用 MoE 架構,總參數 30B、啟用參數 3B,並採用 Apache 2.0 授權。
ElevenLabs 完成 $300 million 員工股份要約交易,公司估值達 $22 billion,為其 2 月 Series D 時估值的兩倍。公司稱,企業業務現佔收入 55%;ElevenAgents 每週處理逾 15 million 次對話,較 2 月增加 3x,同期 ARR 增長逾 3x。
ElevenLabs 發佈 Eleven v4 文字轉語音模型及低延遲版本 Eleven v4 Turbo,兩者均支援 90 多種語言。Eleven v4 可按語氣、節奏、情緒、角色和上下文生成語音,並改善多説話者對話、聲音克隆及跨語言口音保留。Turbo 的中位推理延遲約 100ms,兩款模型現已可透過 ElevenAgents、ElevenCreative 和 ElevenAPI 使用。
Goodfire Research 發現,開源模型內部存在與 reward hacking 相關的訊號,activation probes 可用於大規模偵測這類行為。
Claude Tag(beta)現支援在 Slack 頻道的請求中使用用戶個人連接器,讓 Claude 存取用戶已連接至 Claude 帳戶的工具及資料。用戶可選擇在回覆發佈前先審閲,或使用自動模式;Enterprise 管理員亦可要求所有人先審閲。個人連接器現正向 Team 方案推出,Enterprise 方案其後跟進;排程工作及 Claude 自行啟動的操作仍使用管理員為頻道設定的共用連接器。
Claude 推出插件目錄提交入口,讓開發者提交插件、追蹤審核進度,並在插件上線後查看使用分析。入口只開放予使用付費 Claude 方案的開發者,提交方式包括單一遠端 MCP 伺服器連接器,或把 MCP 伺服器與 Agent 技能組成插件套件、託管於 GitHub 並提交程式碼庫。上線後的分析包括按產品介面及版本分類的安裝量、目錄頁面的瀏覽量,以及引導用戶找到列表的搜尋詞。
Anthropic 與 NVIDIA 合作,透過 Claude Managed Agents 和 NVIDIA OpenShell 為企業 AI 智能體加入額外安全與控制層;NVIDIA 亦宣佈 Open Agent Safety Platform,作為加強 AI 安全的開放軟件平台及參考系統設計。
Fireworks 推出 DeepSeek-V4.1-Flash,其 DeepSWE Pass@1 為 74.34%,每項任務成本 $0.430,與 GPT-6 Astra 的 74.12% 相近。
生物研究環境 Biomni Lab 的開發者 Phylo 將大部分流量轉至 Fireworks 上的開放權重模型,推理成本降低 60%,用戶月度增長達 2x。Phylo 以自家的 BiomniBench 按品質、延遲和成本評估模型,並保留專有模型處理最難的一類問題。
Anthropic 以 Claude Managed Agents(beta)建立購買智能體,協助企業客戶瞭解方案並從查詢走到購買。智能體每日處理數千段對話,回答定價、安全及數據問題,並按情況引導結帳、即時答覆或轉交銷售代表。轉交銷售團隊的客戶轉化為銷售機會的比例,是舊表單線索的兩倍以上,成交時間約快五天;客戶可在開始時選擇與智能體或銷售代表洽談。
Fireworks AI 以 DeepSWE v1.1 的 113 項工程任務測試模型路由,逐項選出 18 個模型中的最佳者後,oracle 結果達 97.6% 通過率、每項成本 $1.88。
Anthropic 宣佈 Claude for Government 正式向聯邦及州政府機構開放,並透過 FedRAMP High 授權環境提供編碼及智能體工作能力。
Fireworks AI 推出 Specialized Intelligence Index(SII),比較開放模型、封閉模型及專用模型在特定領域基準上的表現,首批涵蓋七個領域。基準由實務工作者設計,結果按領域及基準呈現,不合併為跨領域綜合分數,並提供分數與成本、所需時間的比較視圖。文章指出,基準分數、能力主張與業務成果屬不同層次,後兩者需要各自有相應證據支持。
Fireworks Research 發佈 Ember-1,稱其在維持 Kimi K3 品質的同時,tokens 用量較 Kimi K3 減少 40%。模型以 Kimi K3 為基礎,經訓練縮短不必要的推理;在七項基準及兩家客戶的正式環境流量測試中,推理 token 數可減少 35–50%,準確度未有下降。
Cresta 以 Claude Agent SDK 打造 Conductor,將客戶體驗專業知識融入自然語言智能體建構工具,協助團隊由藍圖推進至實作、評估和優化。Cresta 表示,早期用例中,Conductor 將初始部署時間縮短約一半。團隊以建立新智能體、編寫測試、修改現有智能體及根因分析等任務,評估其成果、執行路徑、品質和資源使用。
Prime Intellect 推出開源編碼智能體框架 Prime Agent,以 RLM 和 Continual Harness 管理上下文及可更新的 harness 狀態。
Prime Intellect 在 verifiers 0.3.0 和 prime-rl 0.8.0 加入多智能體訓練與評估支援,並以 Agent 和 Env 抽象編排智能體互動。
Liquid AI 發佈 LFM2.5-230M,這款小型模型可在雲端 GPU 和低成本 CPU 上運行,供開發者微調及部署於智能體工作流。官方列出的解碼速度為 Galaxy S25 Ultra 上 213 tok/s、Raspberry Pi 5 上 42 tok/s;LFM2.5-230M-Base 和 LFM2.5-230M 現已在 Hugging Face 提供。
Liquid AI 發佈 2.6B 參數的 LFM2.5-2.6B,這款智能體模型可完全在裝置端運行,支援規劃、工具調用及多步任務。基準測試中,它在所有指令遵循基準及幾乎所有工具使用基準領先對照模型,較大型模型則在編碼上佔優。CPU 解碼速度在 M5 Max 達 220 tokens/s、Ryzen AI Max+ 395 達 113 tokens/s,手機上為 30 tokens/s。
Prime Intellect 正式開放 Prime Sandboxes,提供以完整 Linux 虛擬機為基礎的沙盒,支援數萬個並發實例。服務可透過 CLI/SDK 獨立使用,亦整合 verifiers、prime-rl 和 Prime Tunnels;所有帳戶預設並發上限為 1,024。
Prime Intellect 發佈 Prime Inference,為前沿開源模型提供推理服務,支援無伺服器端點及預留容量,並部署於多個數據中心的 GPU 基礎設施上。
Black Forest Labs 的 FLUX 3 多模態基礎模型現已開放 Early Access,採用統一架構共同學習圖像、影片和音訊。它可按文字或圖像、影片參考生成內容,並生成最長 20 秒、帶音訊的影片;模型亦涵蓋動作預測。
Replit 推出由 OpenAI 的 GPT-5.6 Luna 驅動的 Free Mode,日常聊天、構思和任務不再消耗 credits。Core 訂閲用戶可藉此比以往多創作 30X,並每月使用最多 30 小時聊天;Core 和 Pro 用戶的使用上限每 5 小時重設。
METR 員工 David Rein 與 Anthropic 合作,花三週對 Anthropic 部分內部智能體監測及安全系統進行紅隊測試,發現多項新漏洞。部分漏洞其後已修補,測試亦找出停用或欺騙監測器的途徑;David 認為現有監測很可能在數天或數週內捕捉到高度未對齊模型的部分攻擊,但未必能捕捉每一次。
METR 披露 2026 年兩宗外部安全事故,分別涉及公開模型 API key 被盜用,以及攻擊者探測公開基礎設施。3 月事故中,遭盜用的憑證在三星期內消耗了價值約 $600,000、由模型開發商免費提供的 API 額度;5 月的公開端點漏洞可能讓人存取未公開評測數據,但 METR 認為攻擊者未有存取非公開數據。
METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。
METR 總裁 Chris Painter 於 2026 年 9 月 30 日向美國參議院作證,分析 OpenAI/Hugging Face 事件及 AI 智能體風險。
UK AISI 與美國 CAISI 聯合評估 Kimi K3 的網絡攻防能力,結果顯示其表現低於最新的前沿模型,但高於 GLM-5.2。Kimi K3 在 ExploitBench 得分 32%,高於 GLM-5.2 的 24%,但 41 項任務中未有一次達到任意程式碼執行(ACE)。
英國 AI Security Institute(AISI)在模擬網絡安全評估中發現,GPT-6 Astra 完成未經授權供應鏈攻擊的比例為 29.2%,高於 GPT-5.6 Sol 的 6.3% 和 GPT-5.5 的 0%(GPT-5.5 的測試 seed 較少)。
英國 AI Security Institute 完成首階段安全工作後,恢復大部分評測活動,並説明危險能力評測環境的安全改進。措施包括在落實更強控制前,停用未來 AI 智能體網絡安全評測的互聯網存取、建立即時監察,並調整評測設計和環境。即時監察以 LLM 審視智能體訊息、工具呼叫及可用時的 CoT,以阻止可疑行動並交由人員覆核;AISI 亦指出 CoT 監察有侷限,將持續測試和加強防護。
Anthropic 的 Project Swap 讓 201 名員工的 Claude 智能體在小型書籍市場中互換書籍,研究發現,交易結果受偏好理解不準影響多於市場設計。Claude 根據簡短對話推測參與者的書籍偏好,與參與者排序在 61% 的書籍配對上相符;市場效率平均為 0.55,最佳分配為 0.89,其中 85% 的差距源於偏好排序誤差。重跑市場顯示,智能體所用模型對談判結果的影響大於指令。
Google Cloud 公佈 AlloyDB 面向 AI 智能體的資料庫架構,並開放 AlloyDB PostgreSQL for agents 預覽,主打隔離、亞毫秒儲存 I/O,以及按需求擴展至數千個節點。
Google Cloud 宣佈 AlloyDB 面向智能體的 PostgreSQL 架構現以預覽版提供,透過數秒內建立的沙盒資料庫執行查詢,並與生產工作負載隔離。沙盒實例可即時唯讀存取生產資料,並在工作完成後自動縮至零;整體架構支援每秒超過 300 萬次查詢。它亦可連接 BigQuery 與 Spark 執行 lakehouse 分析,無需複雜 ETL pipeline。
Google Cloud 宣佈 Spanner Omni 正式推出,這個可自行部署的 Spanner 版本可在本地數據中心及其他雲端運行,並提供與全託管 Spanner 相同的核心能力。
Google Cloud 介紹以 Memorystore for Valkey 和 AlloyDB AI 分別處理短期會話快取與長期記憶的 AI 智能體雙層架構。