跳到正文
原文
Anthropic:Alignment Science Blog·· 4 天前AI 評分63

Anthropic 提出 ASL-4 安全論證的三種草圖

Three Sketches of ASL-4 Safety Case Components

AI 導讀

Anthropic 提出三種 ASL-4 安全論證草圖,探討當開發者無法排除模型具備危險能力與破壞安全程序能力時,如何論證部署安全。草圖分別採用機制可解釋性監測、AI Control,以及檢驗 RLHF 是否激勵策略性欺騙的分析。Anthropic 尚未定義 ASL-4,並明言這些假設例子均未能完整處理破壞風險,亦非正式政策或計劃。

來源:Anthropic:Alignment Science Blog · alignment.anthropic.com