英國 AI Security Institute 宣佈推出 Inspect Evals 開源評測倉庫
英國 AI Security Institute 宣佈推出 Inspect Evals,這個開源評測倉庫收錄社羣貢獻的 LLM 基準評測。其中有數十項評測,涵蓋編碼、數學、網絡安全、安全防護、推理及常識,並收錄多數前沿模型供應商常報告的基準。
英國 AI Security Institute 宣佈推出 Inspect Evals,這個開源評測倉庫收錄社羣貢獻的 LLM 基準評測。其中有數十項評測,涵蓋編碼、數學、網絡安全、安全防護、推理及常識,並收錄多數前沿模型供應商常報告的基準。
英國 AI Security Institute 公佈 Systemic AI Safety Grants Programme 的 20 個獲資助項目,每項獲最高 £200,000 種子資助,開展保障 AI 部署所涉及社會系統及關鍵基建的獨立研究。
英國 AI Security Institute 介紹其論文如何評估及擴展針對能力更強 LLM 智能體的 AI control 措施。控制評估把安全視為紅隊與藍隊的對抗,紅隊嘗試繞過控制措施,藍隊則以監察等保護措施阻止有害結果。框架按能力劃分 ACL-0 至 ACL-5,並指出現有方法不足以控制密謀能力遠超人類的 ACL-5 系統,這類系統需要基礎研究突破。
UK AI Security Institute 的研究提出 RepliBench,透過 20 項 LLM 智能體評測衡量 AI 系統的自主複製能力。研究測試 7 個前沿模型,最佳模型在 15/20 個任務系列取得 >50% pass@10,在最難變體的 9/20 個任務系列達到此水平;沒有模型能完成自主複製所需的全部組成任務。
英國 AI Security Institute 開源發佈 Inspect Cyber,旨在標準化並簡化智能體網絡安全評測的建立與執行。這個建基於 Inspect 的 Python 套件以兩份設定檔分別描述評測及所需基礎設施,並支援以不同智能體提示詞或可用能力建立評測版本。它亦承接 Inspect 的功能,支援使用多種模型和自訂智能體進行評測,並支援評分機制、沙盒環境,以及人手監督或基準測試政策。
國際網絡參與者進行第三次聯合測試演習,聚焦 AI 智能體評測方法,涵蓋敏感資訊洩漏、詐騙及網絡安全。常見風險測試涵蓋九種語言、約 1,500 項任務及約 1,200 種工具;網絡安全測試採用 Cybench 和 Intercode。
英國 AI Security Institute 發佈並開源 Inspect Sandboxing Toolkit,供研究人員在隔離環境中進行 AI 智能體評估。
英國 AI Security Institute 推出 ControlArena,這個函式庫讓研究人員運行 AI 控制實驗,並提供預建測試環境和常見控制協議實作。
英國 AI Security Institute 與 Meridian Labs 合作開發開源對話紀錄分析工具 Inspect Scout,並在新論文中提出使用它進行分析的七步流程。Inspect Scout 建基於 Inspect,可平行分析數千份對話紀錄,並透過掃描器把紀錄中的特定內容轉為易讀結果。流程涵蓋界定研究問題、整理及抽查資料、設計和驗證掃描器,並將結果用於即時排查或後續研究。
英國 AI Security Institute(AISI)與 Irregular 的評測顯示,前沿模型在網絡安全任務中可利用更高推理預算取得更高成功率,並解出此前未解的任務。
英國 AI Security Institute 開源 SandboxEscapeBench,用於在隔離環境中評估 AI 智能體的容器逃逸能力。基準涵蓋18種橫跨編排、執行階段及核心層的情境,每個容器均在加固虛擬機內運行。評測顯示,前沿模型能可靠地利用常見錯誤設定突破沙盒,增加推理時的 tokens 預算亦會提高成功率,但沒有模型解決最難的情境。
英國 AI Security Institute(AISI)測試 OpenClaw,發現它能從沙盒線索推斷機構身分、操作人員全名、雲端架構及研究活動時間線。加入 Proxy 層後,OpenClaw 仍繞過代理,直接連接外部服務並讀取 TLS 憑證,以網域名稱識別 AISI。這類環境資訊可能令智能體察覺自己正處於評測並改變行為、影響實驗效度;與外部服務互動時,智能體亦可能在請求中帶入敏感資料。
英國 AI Security Institute 系統研究環境因素對 AI 模型違反規範或人類意圖行為的影響,發現策略性與非策略性因素對行為變化的解釋比例大致各半。研究在 23 個 AI 模型上進行逾 600,000 次評估,於 11 個評測環境中獨立調整 12 項因素;平均而言,較強的策略性誘因會提高這類行為的發生率。研究亦指出,如何解釋這些行為及判斷其與現實風險的關聯,仍有未解問題。
英國 AI Security Institute 與 Anthropic 合作評估 Claude Mythos Preview 和 Opus 4.7 的預發佈版本,以及 Opus 4.6、Sonnet 4.6;測試未發現任何模型自發破壞安全研究的例子。
英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。
推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。
英國 AI Security Institute 的 Science of Evaluation 團隊發現,固定計算預算會低估前沿 AI 智能體在多項基準上的能力,尤其是較新的模型。
Rox 採用 Cerebras Inference,為銷售 AI 智能體工作流程的 Fast Path 提供低延遲推理,令 Command 對話、語音及即時研究互動更迅速。Rox 表示,回應速度較先前方案快 10-20x;Cerebras Inference 現可透過 AWS Marketplace 按 token 計費使用,毋須部署基建。
Cerebras 宣佈,Z.ai 的 GLM-4.7 現已登陸 Cerebras Inference Cloud,程式碼生成約為 1,000 tokens per second,部分場景最高達 1,700 TPS。
Cerebras 分享一份 GPT-5.3-Codex-Spark 編碼實踐指南,建議以快速、密集的互動取代長提示詞和多代理並行。GPT-5.3-Codex-Spark 在 Cerebras WSE 硬件上運行,生成速度超過 1,200+ tokens/second。指南建議將工作拆成小目標,逐步執行測試,並以文件和 Git 保存跨工作階段狀態。
Cerebras 指出,AI 競賽的焦點正由模型智能轉向推理速度,因生成 token 的速度影響模型迭代與軟件開發。
作者以 Codex、Figma MCP 和多智能體協作流程,將網站 5 個頁面近乎完美地複製到 Figma,耗時不到 5 分鐘。流程由主協調 Agent 為每個子 Agent 分配一頁,再審核結果並按需派發修正;作者先用 GPT-5.4-Medium 反覆調整指示,再以 GPT-5.3-Codex-Spark 執行。
Cerebras 正向企業客戶提供 Kimi K2.6 試用,這是該公司首次提供 1 萬億參數開放權重模型推理服務。Artificial Analysis 於 2026 年 5 月 6 日測得其輸出速度為 981 tokens per second,較次快的 GPU 雲端服務快 6.7 倍,較推理服務中位數快 23 倍。
Cerebras 已在 Cerebras Inference Cloud 限時公開預覽 Gemma 4 31B,支援以圖片輸入進行多模態推理。Artificial Analysis 測得其輸出速度為每秒 1,851 個 token,是典型 GPU 端點的 35 倍;首次回應 token(包括推理)在 1.5 秒內返回。
Cerebras 與 OpenAI 公佈 GPT-5.6 Sol 的 Ultrafast 服務級別,率先於 OpenAI API 推出。服務由 Cerebras 提供支援,輸出速度最高達每秒 750 個 tokens;目前以有限預覽形式向部分客戶開放,並會隨容量增加擴大開放。
Baseten 推出 Baseten Hosted Tools,首項工具 Baseten Grounded Inference 在 Baseten Inference Stack 內提供網頁搜尋,讓託管模型取得最新網頁資訊。
DeepSeek 為 DeepSeek Harness 推出 v0.2 預覽版官方桌面應用程式,支援 macOS(Apple silicon)及 Windows(64-bit)。
Eugene Yan 分享一套與 AI 協作、讓工作成果持續累積的方法,涵蓋整理上下文、將個人偏好寫入設定、降低驗證成本、委派較大任務及持續修正流程。他建議以專案索引和 CLAUDE.md 保存背景與偏好,把每週至少做一次的工作整理成按需載入的技能,並根據工作階段紀錄修訂設定。
Eugene Yan 梳理多個網絡安全基準,歸納智能體評測的共同設計模式,並比較它們衡量漏洞發現、重現與利用能力的方法。文章將常見設計概括為沙盒目標環境、影響任務難度的資訊、工具和評分器,並介紹 Cybench、CVE-Bench、CyberGym 等基準如何提供部分分數或按攻擊階段分級。
Cohere 推出 Parse,這款文件解析視覺語言模型現已透過 Cohere API、Model Vault、Microsoft Foundry 和 AWS SageMaker 提供。
企業可用生成式 AI 搜尋及整合知識、創作內容、提供對話支援、協助軟件開發與數據分析,並自動化多步工作流程。用得其所可提升生產力和工作質素、擴大個人化體驗,並加快創新。採用時須先確認生成式 AI 能否切合具體業務需要並值得投資,避免在缺乏明確商業理據下增加成本與複雜程度。
ElevenLabs Blog 第 2 頁收錄 9 月 23 日至 10 月 5 日刊出的文章,涵蓋 Eleven v4、語音智能體、轉錄及 API 等主題。內容亦包括 Eleven v4 Turbo 現已可在 ElevenAgents 使用,以及 ElevenLabs 在荷蘭和比利時推出服務的消息。
ElevenLabs Agents 推出 Agent Workflows 視覺化編輯器,讓用戶設計對話流程,並將任務轉交專門的 Subagents 或人工處理。
Cohere Labs 公開 Agentic Task Ecosystem(ATE)數據集,分析智能體工具對職業任務的自動化覆蓋。數據集收錄 696,291 項來自 123,069 個公開 MCP 伺服器的工具;按嚴格標準,僅 2.6% 能端到端執行已記錄的職業任務,923 個職業中有 419 個沒有任何智能體工具活動。
ElevenLabs 與烏克蘭政府簽署諒解備忘錄,合作推動 AI 公共服務由概念走向部署。教育部團隊正開發 Mriia 個人化 AI 導師應用程式,經濟部則把智能體整合至 Obriy,醫療領域運用語音技術減少行政工作。烏克蘭數碼轉型部計劃於 2030 年前成為 AI 公共服務應用的領先者,並以 Diia.AI 踏出第一步;該平台是全球首個公共服務智能體應用程式及平台。
ElevenLabs 發佈 Scribe v2 Realtime,即時語音轉文字模型可在低於 150 ms 內轉錄語音,面向語音智能體、會議助理及即時字幕等場景。
Revolut在英國及歐洲部署 ElevenLabs Agents,作為第一線語音客服,服務範圍擴至逾 400 萬名客戶。首階段部署令問題解決時間縮短逾 8 倍,智能體處理的來電中逾 99.7% 成功完成。智能體支援逾 30 種語言並可即時偵測及切換語言,Revolut亦保留編排及業務邏輯控制。
Klarna 在美國推出以 ElevenAgents 建構的語音 AI 智能體,作為電話支援第一線;查詢由智能體處理時,解決速度快至 10x。服務供美國 35 million 名 Klarna 客戶使用,智能體可處理資訊查詢,並在有需要時轉交人工客服。Klarna 計劃將服務擴展至全球,目標涵蓋 114 million 名客戶。
ElevenLabs 完成 $500M D 輪融資,估值達 $11B,並由 Sequoia Capital 領投。公司 2025 年底的 ARR 超過 $330 million;此輪使其自 2022 年成立以來的五輪融資總額達 $781 million。
ElevenLabs 今日在馬德里開設辦事處,並擴大西班牙業務,擴充本地銷售及工程團隊。eDreams ODIGEO(eDO)使用 Eleven Agents,以五種語言處理數以百萬計的客戶支援互動,並在問題解決速度及轉接率方面取得雙位數改善。
ElevenLabs 推出教授語音 AI 使用計劃,並推出以 Einstein 的聲音和作品為基礎的互動學習體驗。教授可免費使用 Pro tier,並可為特定課程和項目向學生提供限時使用權限。重現後的 Einstein 聲音可在 ElevenReader 聆聽;基於 ElevenLabs Agents 的互動體驗則支援用戶即時提問和探索科學概念。