Prime Intellect 開源 renderers,提供 Agentic RL 的 token 級模板處理工具
Prime Intellect 開源獨立 Python 程式庫 renderers,讓開發者以可編程的 Python 物件控制 RL 和多輪推理的對話格式。它在 token ID 層處理訊息渲染、回應解析、loss mask 標記及多輪橋接,以保留已採樣 token 前綴;文章指出,五輪 rollout 若每個邊界都無法合併,計算量約為連續序列的 3x。
Prime Intellect 開源獨立 Python 程式庫 renderers,讓開發者以可編程的 Python 物件控制 RL 和多輪推理的對話格式。它在 token ID 層處理訊息渲染、回應解析、loss mask 標記及多輪橋接,以保留已採樣 token 前綴;文章指出,五輪 rollout 若每個邊界都無法合併,計算量約為連續序列的 3x。
Prime Intellect 推出 Hosted Evaluations,讓用戶能使用可擴展基礎設施,在自己的評測項目上測試模型。用戶可在 Environments Hub 已支援的數百個社羣環境中執行評測,亦可透過 CLI 加上 --hosted 參數啟動。評測結果可發布至相應排行榜;由於環境開源,各模型會在相同設定下受評,而檢視器會顯示採樣參數、其他設定、樣本、執行軌跡、工具呼叫及結果。
Prime Intellect 在 Prime Intellect Lab 開放 NVIDIA Nemotron 3 Ultra 的託管後訓練支援,涵蓋 RL 訓練、評測與推理部署。
Prime Intellect 發佈 prime-rl 0.6.0,支援萬億參數規模模型的智能體強化學習訓練。該團隊表示,可在 28 個 H200 節點上以最高 131k 的序列長度、低於 5 分鐘的單步時間及 256 個 rollouts 的批次大小,訓練 GLM-5 執行 SWE 任務。
Prime Intellect 推出 verifiers 0.2.0,預覽重寫後的核心架構,將智能體訓練與評測環境拆分為 taskset、harness 及 runtime。
Prime Intellect 將 23 個軟件工程、終端機及搜尋任務集整合至同一 taskset API,合計約 365,000 項任務。這些任務可用於評測及 RL 訓練;多個 SWE 數據集經 gold patch 與無修改檢查後,已重新上載清理版本。作者指出,智能體與評分機制共用沙盒仍有 reward hack 風險,隔離評分環境仍在路線圖上。
Liquid AI 推出 LEAP 端側 AI 開發平台及 Liquid Apollo 手機應用程式,LEAP 讓開發者將小型語言模型部署到 Android 和 iOS 應用程式,Apollo 則可在手機本機試用 LEAP 模型。
Liquid AI 發佈 LFM2-2.6B-Transcript,支援在 CPU、NPU 和 GPU 上完全本機執行。模型針對 30–60 分鐘會議逐字稿設計,並已在 LEAP 和 Hugging Face 開放下載,可輸出討論要點、決策及標註負責人的行動項目。
Liquid AI 發佈 LFM2-24B-A2B 早期檢查點,這款開放權重 MoE 模型有 24B 總參數,並已在 Hugging Face 提供。
Liquid AI 以開源桌面智能體 LocalCowork 測試 LFM2-24B-A2B 在筆電本地執行工具調用的表現,模型、工具和資料均留在裝置上。在 Apple M4 Max、36 GB 統一記憶體的筆電上,工具選擇平均耗時約 385 ms、佔用約 14.5 GB 記憶體,單步準確率為 80%。
Liquid AI 發佈端側模型 LFM2.5-8B-A1B,將上下文窗口擴至 128K,並把預訓練規模由 12T 增至 38T tokens。該模型採用推理專用設計,詞表由 65,536 擴至 128,000,AA-Omniscience Index 由 -78.42 升至 -24.70。
Zyphra Research 介紹 PUFFER,一套為持續增長的訓練語料設計的增量模糊去重系統,可逐批加入數據集而無須重建完整索引。
Zyphra 推出全棧 AI 平台 Zyphra Cloud,並首發面向大型開放模型和長上下文智能體工作負載的推理服務 Zyphra Inference。服務由 AMD MI355X GPU 提供支援,涵蓋 Kimi K2.6、DeepSeek V3.2 和 GLM 5.1 等開放模型。
Replit 將 Replit Agent 的評估由發佈前的單次檢查,轉為結合離線基準、線上 A/B 測試及生產軌跡分析的持續改進閉環。ViBench 以自然語言產品需求文件和測試計劃評估生成應用是否符合規格,Telescope 則整理生產軌跡並聚類失敗模式。改進循環會提出候選修正、建立草稿 PR 並彙整評估證據,工程師仍負責審核及決定是否發佈。
AI 變革管理應把 AI 視為需要融入人類工作流程的協作參與者,而非僅是待部署的軟件工具。這項工作涵蓋企業由準備至日常使用的組織調整,包括角色職責、員工工作方式、流程及監督;人與 AI 的分工須區分可驗證、判斷型及混合型任務,並持續重新評估。
Cohere 發佈 Embed 5 嵌入模型系列,分為面向最高檢索品質的 Pro 和麪向低延遲、高流量工作的 Fast,兩款均支援多模態輸入、100+ 種語言及 128K-token 上下文窗口。
Cohere 開源發佈 Command A+,這款採用 MoE 架構的 LLM 以 Apache 2.0 授權,面向高效能智能體任務。模型有 218B 總參數和 25B 活躍參數,支援 48 種語言,並提供 BF16、FP8 和 W4A4 量化版本。
Anthropic 與 NVIDIA 合作,透過 Claude Managed Agents 和 NVIDIA OpenShell 為企業 AI 智能體加入額外安全與控制層;NVIDIA 亦宣佈 Open Agent Safety Platform,作為加強 AI 安全的開放軟件平台及參考系統設計。
Fireworks 新增 GLOBAL 多區域部署選項,讓單一部署可跨地區調度兼容容量,並以同一端點管理工作負載。排程器預先安排容量,避免每個請求都經過全球路由步驟,並遵守硬件、配額、可靠性及資料駐留限制。
Prime Flash MoE 是一組為 Blackwell 優化的 CUDA kernels,速度最高比 PyTorch grouped GEMM 快 2.4×。在 4k-128k token 範圍內,速度提升約 2.3×,並已整合至 prime-rl,以加速 MoE 模型的前向傳播。
Liquid AI 發佈 LFM2.5-230M,這款小型模型可在雲端 GPU 和低成本 CPU 上運行,供開發者微調及部署於智能體工作流。官方列出的解碼速度為 Galaxy S25 Ultra 上 213 tok/s、Raspberry Pi 5 上 42 tok/s;LFM2.5-230M-Base 和 LFM2.5-230M 現已在 Hugging Face 提供。
Prime Intellect 正式開放 Prime Sandboxes,提供以完整 Linux 虛擬機為基礎的沙盒,支援數萬個並發實例。服務可透過 CLI/SDK 獨立使用,亦整合 verifiers、prime-rl 和 Prime Tunnels;所有帳戶預設並發上限為 1,024。
Prime Intellect 發佈 Prime Inference,為前沿開源模型提供推理服務,支援無伺服器端點及預留容量,並部署於多個數據中心的 GPU 基礎設施上。
Liquid AI 為 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 發佈 DSpark 草稿模型,推理吞吐量在 H100 上最高達基線的 3.18 倍,在裝置端最高達 2.87 倍。
Black Forest Labs 發佈開放權重的 7B FLUX 3 Action,這個世界動作模型(WAM)聯合預測影片與機械人動作。
三菱重工與Preferred Networks(PFN)於2026年8月31日簽訂資本業務合作協議,建立更緊密的合作體制。三菱重工將在完成PFN股東大會批准等必要程序後,透過第三方配售認購股份,向PFN出資總額100億日圓。雙方將加快社會基建及國家安全等關鍵任務領域的機械與系統智能化、自主化共同研發及落地應用。
METR 披露 2026 年兩宗外部安全事故,分別涉及公開模型 API key 被盜用,以及攻擊者探測公開基礎設施。3 月事故中,遭盜用的憑證在三星期內消耗了價值約 $600,000、由模型開發商免費提供的 API 額度;5 月的公開端點漏洞可能讓人存取未公開評測數據,但 METR 認為攻擊者未有存取非公開數據。
英國 AI Security Institute 完成首階段安全工作後,恢復大部分評測活動,並説明危險能力評測環境的安全改進。措施包括在落實更強控制前,停用未來 AI 智能體網絡安全評測的互聯網存取、建立即時監察,並調整評測設計和環境。即時監察以 LLM 審視智能體訊息、工具呼叫及可用時的 CoT,以阻止可疑行動並交由人員覆核;AISI 亦指出 CoT 監察有侷限,將持續測試和加強防護。
Google Cloud 公佈 AlloyDB 面向 AI 智能體的資料庫架構,並開放 AlloyDB PostgreSQL for agents 預覽,主打隔離、亞毫秒儲存 I/O,以及按需求擴展至數千個節點。
Google Cloud 正式推出 Memorystore for Valkey 9.1,較 Memorystore for Redis Cluster 最高可達 3 倍 QPS,延遲達微秒級。
Google Cloud 宣佈 Spanner Omni 正式推出,這個可自行部署的 Spanner 版本可在本地數據中心及其他雲端運行,並提供與全託管 Spanner 相同的核心能力。
Google Cloud 介紹以 Memorystore for Valkey 和 AlloyDB AI 分別處理短期會話快取與長期記憶的 AI 智能體雙層架構。
Anthropic 為 Model Hardware Standard(MHS)啟動研究預覽,向首批科研實驗室及先進製造商提供讓 AI 智能體協調操作多種實體設備的共同規格。
Anthropic 宣佈推出 Enterprise Frontier Safeguards(EFS),結合零數據保留(ZDR)的私隱保障與自動化濫用監測。客戶可選擇將活動數據存放於自有雲端帳戶,並自行管理加密金鑰、存取政策及審計記錄;自動系統會分析滾動時間範圍內的流量,將嚴重濫用訊號直接交予客戶,Anthropic 員工毋須進行人工審查。
Barclays 擴大與 Anthropic 的策略合作,將 Claude 推廣至銀行全球業務,以加快軟件開發、現代化舊有系統及提升營運效率。Barclays 預計 Claude Code 到 2026 年底將覆蓋開發人員總數的 50%,並於 2027 年擴展至多數軟件工程師。
STILL 可在毫秒內將 LLM 的 KV cache 壓縮 8 倍,並在不同領域保留 85% 以上的事實準確度。它以固定的學習型查詢向量對完整 KV cache 執行交叉注意力,在單次前向傳播中生成緊湊快取,並以 KL 蒸餾訓練。
Still 可在單次前向傳播中將語言模型的 KV cache 壓縮 200×,並保留正確回答能力。在 Qwen 和 Gemma 模型上,壓縮倍率由 8× 至 200×、上下文長度由 8k 至 128k,均處於速度與品質權衡的有利區間。在長上下文 RULER 測試中,Still 比最強基線高 8–22 分。
小米 MiMo 團隊介紹 MiMo-V2.5 系列的全流程推理工程優化,涵蓋 KVCache 管理、排程、Prefill/Decode 執行流程及多模態推理。多模態 Encoder 的 QPS 由 15 增至 30,平均延遲由 78.39 ms 變為 80.28 ms;1 小時影片的 Encoder 端到端延遲由 156 s 降至 23 s。
Cerebras 建立內部 console-prompt-tests 框架,讓 LLM 智能體透過真實瀏覽器,以自然語言執行 Cloud Console 端到端測試。框架可從 PDF 測試計劃或 DOM 基線生成測試,並檢查 PR 覆蓋、評估發布風險和分類失敗;自動修復僅用於 UI 漂移,模型提出修改後須經實時重跑驗證,合併仍由人員批准。發布流程亦會生成發布説明,整個流程約需 20 分鐘。
AlphaSense 與 Cerebras 合作,降低 Generative Search 在路由、查詢生成及證據評估等步驟的推理延遲,讓智能體研究保持互動性。系統因此可將規劃、檢索和評估拆成多個專門模型呼叫,在相同回應時間內納入更多推理。