跳到正文
熱點事件歷史事件

Anthropic 提出 ASL-4 安全論證草圖

1 篇報道1 個報道來源4 天前更新

先了解這件事

AI 綜述

Anthropic 在 Alignment Science Blog 提出三種 ASL-4 安全論證草圖,討論開發者無法排除模型具備危險能力、亦能破壞安全程序時,如何論證部署安全。這些草圖探討的情境,是開發者不能確定模型沒有上述能力。三種草圖分別採用機制可解釋性監測、AI Control,以及分析 RLHF 是否會激勵模型作策略性欺騙。Anthropic 指出,ASL-4 尚未定義;這些均是假設例子,未能完整處理破壞風險,也不是正式政策或計劃。

AI 根據報道生成 · 4 天前更新

報道時間線

沿着報道,瞭解事件的不同側面。

10月3日
  1. Anthropic:Alignment Science Blog
    Anthropic 提出 ASL-4 安全論證的三種草圖

    Anthropic 提出三種 ASL-4 安全論證草圖,探討當開發者無法排除模型具備危險能力與破壞安全程序能力時,如何論證部署安全。草圖分別採用機制可解釋性監測、AI Control,以及檢驗 RLHF 是否激勵策略性欺騙的分析。Anthropic 尚未定義 ASL-4,並明言這些假設例子均未能完整處理破壞風險,亦非正式政策或計劃。