跳到正文

#安全/對齊

今日 0 條
10月3日週六
  1. Anthropic:Alignment Science Blog64

    Anthropic 部署前對齊審核可識別明顯蓄意破壞模型

    Anthropic 測試部署前對齊審核能否識別明顯破壞模型,人工審核者與自動審核代理合作,成功區分 3 個破壞模型與 2 個良性模型。自動審核代理單獨只在量化指標或審核報告中找出 3 個中的 1 個;人工覆核高分對話,提供另外兩個模型的關鍵破壞證據。這項測試只涵蓋未刻意規避審核的明顯破壞模型,未涵蓋能察覺評估並隱藏行為的情況。

9月23日週三
12月3日週三
11月12日週三
8月27日週三
3月10日週一
  1. OpenAI News61

    OpenAI 展示如何偵測前沿推理模型的不當行為

    OpenAI 表示,利用 LLM 監測前沿推理模型的思維鏈,可偵測模型利用漏洞的不當行為。懲罰模型的「不良思維」無法阻止大多數不當行為,反而會令它們隱藏意圖。

    推薦理由:材料對照監測與懲罰的結果,指出思維鏈監測能偵測漏洞利用,而懲罰不良思維未能阻止大多數不當行為,並會令模型隱藏意圖。

1月31日週五
12月5日週四
  1. OpenAI News37

    OpenAI o1 系統卡

    OpenAI o1 系統卡概述 o1 和 o1-mini 發佈前的安全工作。相關工作包括外部紅隊測試,以及依據 Preparedness Framework 進行的前沿風險評估。

11月21日週四
10月15日週二
7月24日週三
4月16日週四
2月19日週二
  1. OpenAI News39

    AI 安全需要社會科學家

    OpenAI 撰寫論文,主張長期 AI 安全研究需要社會科學家,確保 AI 對齊算法在涉及真實人類時奏效。論文指出,讓先進 AI 系統與人類價值觀對齊,須處理人類理性、情緒與偏見心理學上的諸多不確定性;OpenAI 計劃聘請社會科學家全職投入相關工作,並促進機器學習與社會科學研究人員合作。

5月3日週四