英國 AI Security Institute:Blog·· 6 小時前AI 評分65
英國 AI Security Institute 説明如何加強危險能力評測環境的安全
Building a more secure environment for evaluating dangerous capabilities
AI 導讀
英國 AI Security Institute 完成首階段安全工作後,恢復大部分評測活動,並説明危險能力評測環境的安全改進。措施包括在落實更強控制前,停用未來 AI 智能體網絡安全評測的互聯網存取、建立即時監察,並調整評測設計和環境。即時監察以 LLM 審視智能體訊息、工具呼叫及可用時的 CoT,以阻止可疑行動並交由人員覆核;AISI 亦指出 CoT 監察有侷限,將持續測試和加強防護。
來源:英國 AI Security Institute:Blog · aisi.gov.uk