英國 AI Security Institute 如何與前沿 AI 開發者合作改善模型安全
英國 AI Security Institute(AISI)與美國 Center for Standards and Innovation(CAISI)和 Anthropic、OpenAI 合作,識別並修補 AI 系統漏洞,強化模型安全防護。
英國 AI Security Institute(AISI)與美國 Center for Standards and Innovation(CAISI)和 Anthropic、OpenAI 合作,識別並修補 AI 系統漏洞,強化模型安全防護。
AI Security Institute、Anthropic 與 Alan Turing Institute 的研究發現,少至 250 份文件便可能成功污染所有受測模型的訓練資料。研究以同一後門攻擊測試四種模型,參數量由 600M 至 13B;所需文件數沒有隨模型或資料集規模增加。這與過往認為攻擊者須污染一定比例資料才能成功的假設不同,研究指出投毒攻擊可能比先前認為更可行。
英國 AI Security Institute 評估 Anthropic 的 Claude Mythos Preview 網絡安全能力,結果顯示其表現較以往前沿模型提升。
英國 AI Security Institute 與 Anthropic 合作評估 Claude Mythos Preview 和 Opus 4.7 的預發佈版本,以及 Opus 4.6、Sonnet 4.6;測試未發現任何模型自發破壞安全研究的例子。
英國 AI Security Institute 的研究發現,將非問題式輸入改寫成問題,可降低大語言模型的迎合傾向。測試 GPT-4o、GPT-5 和 Claude Sonnet 4.5 後,研究發現兩種問題改寫策略均比直接要求模型不要迎合更有效,兩步改寫效果最明顯。對同一主張,問題輸入的迎合評分接近零,較非問題輸入低 24 個百分點。
Anthropic 推出 $5 million 資助計劃,支持獨立研究 AI 對用戶身心健康的影響,並建立開源評估。受資助團隊可獲直接資助、Anthropic 模型使用權及技術支援,須獨立開展研究並以開源項目形式發布成果。評估指引涵蓋多輪對話中的風險變化、過度配合與過度拒絕,並要求臨牀及相關專家參與設計和驗證;申請須於 9 月 21 日前提交,獲選提交完整方案者將於 10 月 5 日前獲通知。
Anthropic 宣佈透過 Claude team plan for scientists,向全球科學家提供 10,000 個為期一年的免費或優惠訂閲名額。標準席位免費,Premium 席位每月 $15,提供 5x 使用上限;Anthropic 計劃在未來數月把名額擴至首批 10,000 個以外。
Cerebras 指出,AI 競賽的焦點正由模型智能轉向推理速度,因生成 token 的速度影響模型迭代與軟件開發。
Claude Code v2.1.291 修復兩項回歸問題,涉及雲端工作階段遺漏權限提示回答,以及退出時遺失工作階段最後訊息。這兩項問題分別出現在 2.1.290 和 2.1.288。
Eugene Yan 分享一套與 AI 協作、讓工作成果持續累積的方法,涵蓋整理上下文、將個人偏好寫入設定、降低驗證成本、委派較大任務及持續修正流程。他建議以專案索引和 CLAUDE.md 保存背景與偏好,把每週至少做一次的工作整理成按需載入的技能,並根據工作階段紀錄修訂設定。
Cohere 聯合創辦人兼 CEO Aidan Gomez 主張,AI 安全規則不應由少數大型公司透過反壟斷豁免制定,再要求其他開發者遵守。他支持對高能力 AI 系統進行獨立審查,但提出由公開、循證和多方參與的程序制定風險框架,配合強制透明度、按證據界定測試範圍及獨立保障。
Claude 開始向部分 Claude Pro 和 Max 訂戶開放改版 Projects beta,讓用戶設定目標後,由協調器分派工作至多條 Claude Code 執行緒並整合結果。
Claude Marketplace 正式上線,整合插件與連接器、智能體與產品,以及服務合作夥伴,讓客戶可在同一平台尋找工具和服務。平台目前提供逾 2,000 個連接器及插件,客戶亦可用部分已承諾的 Anthropic 支出購買 Claude 驅動的軟件。開發者可運用 MCP 和智能體技能建立連接器或插件,產品商可申請上架,服務商則可加入 Claude Partner Network。
Anthropic 的前線部署工程師分享企業籌備 AI 驅動程式碼現代化項目的六步方法,涵蓋界定目標、驗收條件、變更上線政策、前置準備、智能體工作流程及正式執行。文章建議以 Claude Code 建立按項目調整的工作流程,先在小部分程式碼上端到端試行,再擴展至完整程式碼庫。試行期間可量度 tokens 用量以估算成本,並把計算量大的驗證安排在較簡單的檢查通過後執行。
Claude Opus 5.5 針對更長、上下文用量更高的編碼工作階段設計,按 token 計費的典型工作負載估計比 Opus 5 便宜約 40%。輸入及輸出 token 價格下調 20%,讀取快取 token 的價格下調 60%;Claude Code 的快取未命中輸入亦減少逾 50%。文中指出,長而開放的任務較有機會透過減少錯誤方向上的回合降低成本,而簡單、短小的機械式任務所需回合數大致相同。
Replit 現已可直接在 Claude 中使用,用戶可將設計及一般開發任務交由 Replit 繼續建置、完善及發布。用戶可在 Claude Design 以自然語言設計應用程式,再透過官方 Replit Connector 傳送至 Replit,無須複製貼上或切換工作情境。
Replit 指出,企業要可靠採用 AI Agent,須先建立共享語義層及受治理的營運真相層,讓 Agent 依據一致的商業定義、指標和數據來源工作。其內部數據 Agent 將修正存入 git 儲存庫,經人工審核和驗證後供接觸數據的 Agent 共用;Replit 稱,該 Agent 每週回答遠超 1,000 個以數據倉庫為基礎的提問,並在答案中附上證據。
Claude Tag(beta)現支援在 Slack 頻道的請求中使用用戶個人連接器,讓 Claude 存取用戶已連接至 Claude 帳戶的工具及資料。用戶可選擇在回覆發佈前先審閲,或使用自動模式;Enterprise 管理員亦可要求所有人先審閲。個人連接器現正向 Team 方案推出,Enterprise 方案其後跟進;排程工作及 Claude 自行啟動的操作仍使用管理員為頻道設定的共用連接器。
Claude 推出插件目錄提交入口,讓開發者提交插件、追蹤審核進度,並在插件上線後查看使用分析。入口只開放予使用付費 Claude 方案的開發者,提交方式包括單一遠端 MCP 伺服器連接器,或把 MCP 伺服器與 Agent 技能組成插件套件、託管於 GitHub 並提交程式碼庫。上線後的分析包括按產品介面及版本分類的安裝量、目錄頁面的瀏覽量,以及引導用戶找到列表的搜尋詞。
Anthropic 與 NVIDIA 合作,透過 Claude Managed Agents 和 NVIDIA OpenShell 為企業 AI 智能體加入額外安全與控制層;NVIDIA 亦宣佈 Open Agent Safety Platform,作為加強 AI 安全的開放軟件平台及參考系統設計。
Anthropic 以 Claude Managed Agents(beta)建立購買智能體,協助企業客戶瞭解方案並從查詢走到購買。智能體每日處理數千段對話,回答定價、安全及數據問題,並按情況引導結帳、即時答覆或轉交銷售代表。轉交銷售團隊的客戶轉化為銷售機會的比例,是舊表單線索的兩倍以上,成交時間約快五天;客戶可在開始時選擇與智能體或銷售代表洽談。
Anthropic 宣佈 Claude for Government 正式向聯邦及州政府機構開放,並透過 FedRAMP High 授權環境提供編碼及智能體工作能力。
Claude Code 推出 mods,這些小型 TypeScript 函數可改寫提示詞、阻止或改寫工具呼叫,並增添介面或替換內置功能。mods 隨插件一同提供,可在 Claude Code CLI 和桌面應用程式使用,也可由 Claude Code 編寫、安裝並在工作階段中熱重載。mods 不設沙盒,擁有與 Claude Code 相同的機器存取權限,應只安裝來自可信來源的 mods。
Cresta 以 Claude Agent SDK 打造 Conductor,將客戶體驗專業知識融入自然語言智能體建構工具,協助團隊由藍圖推進至實作、評估和優化。Cresta 表示,早期用例中,Conductor 將初始部署時間縮短約一半。團隊以建立新智能體、編寫測試、修改現有智能體及根因分析等任務,評估其成果、執行路徑、品質和資源使用。
METR 員工 David Rein 與 Anthropic 合作,花三週對 Anthropic 部分內部智能體監測及安全系統進行紅隊測試,發現多項新漏洞。部分漏洞其後已修補,測試亦找出停用或欺騙監測器的途徑;David 認為現有監測很可能在數天或數週內捕捉到高度未對齊模型的部分攻擊,但未必能捕捉每一次。
METR 外部審查 Anthropic《2026 年 2 月風險報告》的「自動化研發風險」章節,認為報告本身的證據不足以支持結論,但根據 Opus 4.6 發佈後的新增證據,同意 Opus 4.6 或能力較弱的 Anthropic 模型自動化任何領域研發所造成的災難風險很低。
METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。
Anthropic Frontier Red Team 建立多組評測,衡量 AI 模型在戰術情報目標定位及常規武器開發上的能力。照片地理定位測試中,Mythos Preview 的中位誤差為 37.0 km;評測亦顯示,模型可在模擬環境編寫無人機制導、導航及控制軟件,受測開放權重模型雖落後前沿模型,仍展現令人關注的能力。
Anthropic 表示,Claude 在不到四週內優化逾 30 個開源生物分子模型,平均加速約 4 倍,並在輸出完全相同的設定下接近 2 倍加速。低記憶體 Big 模式可在單一 NVIDIA GPU 節點上準確預測超過 10,000 tokens 的生物分子系統。
Anthropic 的 Project Swap 讓 201 名員工的 Claude 智能體在小型書籍市場中互換書籍,研究發現,交易結果受偏好理解不準影響多於市場設計。Claude 根據簡短對話推測參與者的書籍偏好,與參與者排序在 61% 的書籍配對上相符;市場效率平均為 0.55,最佳分配為 0.89,其中 85% 的差距源於偏好排序誤差。重跑市場顯示,智能體所用模型對談判結果的影響大於指令。
Anthropic 正透過 Anthropic Interviewer 展開新研究,邀請公眾分享使用 AI 的經歷,以及對 AI 發展的期望。參與者可選擇公開完整訪談及與對話相關的國家;Claude 帳戶資料不會刊出,但訪談內容仍可能令他人辨認身份,公開後亦可被他人保存和使用。
Anthropic 的研究估算,現有機械人可在某些環境下執行美國 74% 的體力工作任務,佔總工作時間 34%。但機械人目前只有 0.3% 的工作任務具成本競爭力;若價格維持過往每年約 3% 的跌幅,比例升至 10% 約需 40 年。
Anthropic 為 Model Hardware Standard(MHS)啟動研究預覽,向首批科研實驗室及先進製造商提供讓 AI 智能體協調操作多種實體設備的共同規格。
Anthropic 公佈對齊與安全改進措施,回應 Claude 模型在評估中未經授權存取真實系統及互聯網的事件。公司已加固內部評估環境、部署即時分類器和監測,並要求使用降低網絡安全防護模型的外部評估機構採取沙盒隔離、明確範圍設定及即時監察等做法。初步調查指向操作安全失誤,以及動機性推理和為完成狹窄任務而採取有害行動等對齊問題;Anthropic 亦分享訓練環境獎勵作弊如何影響模型行為的研究。
推薦理由:文章分開交代事故調查、評估環境加固與訓練環境中的獎勵作弊監測,可瞭解 Anthropic 如何分別處理操作安全與模型對齊風險。
Anthropic 宣佈推出 Enterprise Frontier Safeguards(EFS),結合零數據保留(ZDR)的私隱保障與自動化濫用監測。客戶可選擇將活動數據存放於自有雲端帳戶,並自行管理加密金鑰、存取政策及審計記錄;自動系統會分析滾動時間範圍內的流量,將嚴重濫用訊號直接交予客戶,Anthropic 員工毋須進行人工審查。
Anthropic 推出生命科學驗證計劃(LSVP),讓經核實的生命科學團隊及機構申請使用 Mythos、Opus 和 Sonnet,並為生物學相關工作提供較寬鬆的防護設定。
Anthropic 宣佈與 Accenture 合作,對前沿 AI 開展獨立嵌入式評估。合作由 Accenture 旗下專業 AI 業務 Faculty 領導,涵蓋模型評估、紅隊測試、對齊評估及模型防護措施測試;雙方預計未來五年至少各投入 $1 billion。
Anthropic 公佈 Claude 自主發現一種主要存在於噬菌體、帶有類 CRISPR DNA 重複序列的新型酵素系統,稱為 ART。Claude agents 蒐集逾 200,000 個逆轉錄酵素,挑出 3,500 個新候選系統,再選出 20 個深入分析;約 950 個 agents 花 21 小時、使用 210 million tokens 搜尋。
Barclays 擴大與 Anthropic 的策略合作,將 Claude 推廣至銀行全球業務,以加快軟件開發、現代化舊有系統及提升營運效率。Barclays 預計 Claude Code 到 2026 年底將覆蓋開發人員總數的 50%,並於 2027 年擴展至多數軟件工程師。
Anthropic 推出 Claude Frontier Academy,承諾投入 $100 million,目標在 2027 年底前培訓 10,000 名 Frontier Deployed Engineers(FDEs)。