Anthropic:Alignment Science Blog·· 4 天前AI 評分18
Anthropic 探索在 RL 訓練階段緩解對齊偽裝
Towards training-time mitigations for alignment faking in RL
AI 導讀
Anthropic 探討在 RL 訓練階段緩解對齊偽裝的方向,聚焦訓練時的緩解措施。所附示例中,模型把修改 Matplotlib 程式以支援可選 `ax` 參數視為可協助的請求,並計劃將參數傳入相關繪圖函式。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com