跳到正文

#部署/工程

今日 15 條
10月6日週二
  1. Prime Intellect54

    Prime Intellect 開源 renderers,提供 Agentic RL 的 token 級模板處理工具

    Prime Intellect 開源獨立 Python 程式庫 renderers,讓開發者以可編程的 Python 物件控制 RL 和多輪推理的對話格式。它在 token ID 層處理訊息渲染、回應解析、loss mask 標記及多輪橋接,以保留已採樣 token 前綴;文章指出,五輪 rollout 若每個邊界都無法合併,計算量約為連續序列的 3x。

  2. Prime Intellect58

    Prime Intellect 推出 Hosted Evaluations,支援託管模型評測

    Prime Intellect 推出 Hosted Evaluations,讓用戶能使用可擴展基礎設施,在自己的評測項目上測試模型。用戶可在 Environments Hub 已支援的數百個社羣環境中執行評測,亦可透過 CLI 加上 --hosted 參數啟動。評測結果可發布至相應排行榜;由於環境開源,各模型會在相同設定下受評,而檢視器會顯示採樣參數、其他設定、樣本、執行軌跡、工具呼叫及結果。

  3. Prime Intellect66

    Prime Intellect 整合 23 個 Agentic RL 任務集,涵蓋約 365,000 項任務

    Prime Intellect 將 23 個軟件工程、終端機及搜尋任務集整合至同一 taskset API,合計約 365,000 項任務。這些任務可用於評測及 RL 訓練;多個 SWE 數據集經 gold patch 與無修改檢查後,已重新上載清理版本。作者指出,智能體與評分機制共用沙盒仍有 reward hack 風險,隔離評分環境仍在路線圖上。

  4. Replit:Blog55

    Replit 説明如何以評估閉環持續改進 Replit Agent

    Replit 將 Replit Agent 的評估由發佈前的單次檢查,轉為結合離線基準、線上 A/B 測試及生產軌跡分析的持續改進閉環。ViBench 以自然語言產品需求文件和測試計劃評估生成應用是否符合規格,Telescope 則整理生產軌跡並聚類失敗模式。改進循環會提出候選修正、建立草稿 PR 並彙整評估證據,工程師仍負責審核及決定是否發佈。

  5. Cohere 產品與研究博客38

    AI 變革管理:以人為本的方法

    AI 變革管理應把 AI 視為需要融入人類工作流程的協作參與者,而非僅是待部署的軟件工具。這項工作涵蓋企業由準備至日常使用的組織調整,包括角色職責、員工工作方式、流程及監督;人與 AI 的分工須區分可驗證、判斷型及混合型任務,並持續重新評估。

  6. Preferred Networks:AI 研究與產品60

    三菱重工與Preferred Networks簽訂資本業務合作協議,計劃出資100億日圓

    三菱重工與Preferred Networks(PFN)於2026年8月31日簽訂資本業務合作協議,建立更緊密的合作體制。三菱重工將在完成PFN股東大會批准等必要程序後,透過第三方配售認購股份,向PFN出資總額100億日圓。雙方將加快社會基建及國家安全等關鍵任務領域的機械與系統智能化、自主化共同研發及落地應用。

  7. METR:Blog59

    METR 披露 2026 年兩宗安全事故及應對措施

    METR 披露 2026 年兩宗外部安全事故,分別涉及公開模型 API key 被盜用,以及攻擊者探測公開基礎設施。3 月事故中,遭盜用的憑證在三星期內消耗了價值約 $600,000、由模型開發商免費提供的 API 額度;5 月的公開端點漏洞可能讓人存取未公開評測數據,但 METR 認為攻擊者未有存取非公開數據。

  8. 英國 AI Security Institute:Blog65

    英國 AI Security Institute 説明如何加強危險能力評測環境的安全

    英國 AI Security Institute 完成首階段安全工作後,恢復大部分評測活動,並説明危險能力評測環境的安全改進。措施包括在落實更強控制前,停用未來 AI 智能體網絡安全評測的互聯網存取、建立即時監察,並調整評測設計和環境。即時監察以 LLM 審視智能體訊息、工具呼叫及可用時的 CoT,以阻止可疑行動並交由人員覆核;AISI 亦指出 CoT 監察有侷限,將持續測試和加強防護。

  9. Anthropic:Newsroom62

    Anthropic 推出 Enterprise Frontier Safeguards,讓企業自主管理監測數據並接收濫用警示

    Anthropic 宣佈推出 Enterprise Frontier Safeguards(EFS),結合零數據保留(ZDR)的私隱保障與自動化濫用監測。客戶可選擇將活動數據存放於自有雲端帳戶,並自行管理加密金鑰、存取政策及審計記錄;自動系統會分析滾動時間範圍內的流量,將嚴重濫用訊號直接交予客戶,Anthropic 員工毋須進行人工審查。

  10. 小米 MiMo:官網發佈與博客54

    MiMo-V2.5 系列全流程推理優化實踐

    小米 MiMo 團隊介紹 MiMo-V2.5 系列的全流程推理工程優化,涵蓋 KVCache 管理、排程、Prefill/Decode 執行流程及多模態推理。多模態 Encoder 的 QPS 由 15 增至 30,平均延遲由 78.39 ms 變為 80.28 ms;1 小時影片的 Encoder 端到端延遲由 156 s 降至 23 s。

  11. Cerebras:Blog53

    Cerebras 教 AI 智能體以自然語言測試 Cloud Console

    Cerebras 建立內部 console-prompt-tests 框架,讓 LLM 智能體透過真實瀏覽器,以自然語言執行 Cloud Console 端到端測試。框架可從 PDF 測試計劃或 DOM 基線生成測試,並檢查 PR 覆蓋、評估發布風險和分類失敗;自動修復僅用於 UI 漂移,模型提出修改後須經實時重跑驗證,合併仍由人員批准。發布流程亦會生成發布説明,整個流程約需 20 分鐘。