跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分47

TASTE:AI 模型能否判斷 AI 安全研究提案?

TASTE: Can AI Models Judge AI Safety Research Proposals?

AI 導讀

Anthropic 建立 TASTE 基準,評估模型判斷 AI 安全研究提案的能力;測試顯示,模型表現遜於人類研究人員。基準包含 92 組提案配對,估計人類研究人員的一致率為 77%,Fable 5 得分為 60%。研究者討論分歧後修訂評分,並篩選自評「強」信心的標註,使估計一致率由討論前的 53% 升至 68%。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com