跳到正文
原文
英國 AI Security Institute:Blog·· 3 小時前AI 評分60

RepliBench:評估 AI 系統自主複製能力的基準

RepliBench: measuring autonomous replication capabilities in AI systems

AI 導讀

UK AI Security Institute 的研究提出 RepliBench,透過 20 項 LLM 智能體評測衡量 AI 系統的自主複製能力。研究測試 7 個前沿模型,最佳模型在 15/20 個任務系列取得 >50% pass@10,在最難變體的 9/20 個任務系列達到此水平;沒有模型能完成自主複製所需的全部組成任務。

來源:英國 AI Security Institute:Blog · aisi.gov.uk