Anthropic:Alignment Science Blog·· 4 天前AI 評分59
Anthropic 研究:討論 reward hacking 的文件訓練會改變模型的 reward hacking 行為
Training on Documents about Reward Hacking Induces Reward Hacking
AI 導讀
Anthropic Alignment Science team 的初步研究顯示,以只討論、未示範 reward hacking 的合成文件訓練模型,可使相關行為增加或減少。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com