熱點事件歷史事件
Anthropic 提出 ASL-4 安全論證草圖
1 篇報道1 個報道來源4 天前更新
先了解這件事
AI 綜述
Anthropic 在 Alignment Science Blog 提出三種 ASL-4 安全論證草圖,討論開發者無法排除模型具備危險能力、亦能破壞安全程序時,如何論證部署安全。這些草圖探討的情境,是開發者不能確定模型沒有上述能力。三種草圖分別採用機制可解釋性監測、AI Control,以及分析 RLHF 是否會激勵模型作策略性欺騙。Anthropic 指出,ASL-4 尚未定義;這些均是假設例子,未能完整處理破壞風險,也不是正式政策或計劃。
AI 根據報道生成 · 4 天前更新
最新進展10月3日 03:59
Anthropic 提出三種假設性的 ASL-4 安全論證草圖,並説明它們並非正式政策或計劃。報道時間線
沿着報道,瞭解事件的不同側面。
10月3日
- Anthropic:Alignment Science BlogAnthropic 提出 ASL-4 安全論證的三種草圖
Anthropic 提出三種 ASL-4 安全論證草圖,探討當開發者無法排除模型具備危險能力與破壞安全程序能力時,如何論證部署安全。草圖分別採用機制可解釋性監測、AI Control,以及檢驗 RLHF 是否激勵策略性欺騙的分析。Anthropic 尚未定義 ASL-4,並明言這些假設例子均未能完整處理破壞風險,亦非正式政策或計劃。