Anthropic:Alignment Science Blog·· 4 天前AI 評分66
Anthropic 發佈 Petri 2.0,新增 70 個場景並更新模型比較及評測意識緩解措施
Petri 2.0: New Scenarios, New Model Comparisons, and Improved Eval-Awareness Mitigations
AI 導讀
Anthropic 發佈 Petri 2.0,為自動化行為審計工具新增 70 個 seed 指令、評測意識緩解改進和較新前沿模型的評測結果。真實感分類器與人工修訂 seed 指令合用時,Claude 模型的評測意識中位相對降幅為 47.3%,但部分模型的未提示主動性亦有下降。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com