Anthropic:Alignment Science Blog·· 4 天前AI 評分63
Anthropic 提出 ASL-4 安全論證的三種草圖
Three Sketches of ASL-4 Safety Case Components
AI 導讀
Anthropic 提出三種 ASL-4 安全論證草圖,探討當開發者無法排除模型具備危險能力與破壞安全程序能力時,如何論證部署安全。草圖分別採用機制可解釋性監測、AI Control,以及檢驗 RLHF 是否激勵策略性欺騙的分析。Anthropic 尚未定義 ASL-4,並明言這些假設例子均未能完整處理破壞風險,亦非正式政策或計劃。
來源:Anthropic:Alignment Science Blog · alignment.anthropic.com