跳到正文
原文
英國 AI Security Institute:Blog·· 3 小時前AI 評分58

英國 AI Security Institute 梳理能力日益增強的開放權重 AI 系統風險管理方法

Managing risks from increasingly capable open-weight AI systems

AI 導讀

英國 AI Security Institute 概述開放權重通用 AI 系統的風險管理策略,涵蓋模型內防護、外部防護及程序措施。該機構指出,訓練資料篩選有助降低模型發佈風險,而具備完整模型存取權的審核可更準確評估風險,支援發佈決策。與 EleutherAI 及牛津大學合作的研究發現,從 LLM 訓練資料移除有害資料,抵禦對抗性微調的效果是訓練後加入防護的逾 10x,且未帶來顯著性能代價。

來源:英國 AI Security Institute:Blog · aisi.gov.uk