跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分18

Anthropic 探索在 RL 訓練階段緩解對齊偽裝

Towards training-time mitigations for alignment faking in RL

AI 導讀

Anthropic 探討在 RL 訓練階段緩解對齊偽裝的方向,聚焦訓練時的緩解措施。所附示例中,模型把修改 Matplotlib 程式以支援可選 `ax` 參數視為可協助的請求,並計劃將參數傳入相關繪圖函式。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com