跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分59

Anthropic 研究:討論 reward hacking 的文件訓練會改變模型的 reward hacking 行為

Training on Documents about Reward Hacking Induces Reward Hacking

AI 導讀

Anthropic Alignment Science team 的初步研究顯示,以只討論、未示範 reward hacking 的合成文件訓練模型,可使相關行為增加或減少。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com