跳到正文

#安全/對齊

今日 2 條
今天10月6日週二
  1. NAVER / CLOVA 研究33

    NAVER 的 AI 安全應對方針

    NAVER 以人為本推進 AI 安全,並從技術限制、濫用風險及失控風險三方面著手應對。其 Future AI Center 專責 AI 安全研究,紅隊會在包括仇恨言論、暴力及偏頗資訊等 14 個範疇定期測試 AI 模型。NAVER 亦致力確保選舉相關 AI 生成內容附有聲明,並分享研究原始碼及數據集、提供安全使用培訓。

  2. NAVER / CLOVA 研究50

    NAVER 的 AI 安全框架

    NAVER 的 AI 安全框架以人為本,識別、評估及管理 AI 系統由開發至部署各階段的風險。框架把風險分為失控與濫用兩類,分別採用風險評估尺度及矩陣。NAVER 的目標是每 3 個月評估前沿 AI;效能提升 6x 時則提前評估。

10月3日週六
  1. Anthropic:Alignment Science Blog64

    Anthropic 部署前對齊審核可識別明顯蓄意破壞模型

    Anthropic 測試部署前對齊審核能否識別明顯破壞模型,人工審核者與自動審核代理合作,成功區分 3 個破壞模型與 2 個良性模型。自動審核代理單獨只在量化指標或審核報告中找出 3 個中的 1 個;人工覆核高分對話,提供另外兩個模型的關鍵破壞證據。這項測試只涵蓋未刻意規避審核的明顯破壞模型,未涵蓋能察覺評估並隱藏行為的情況。

9月30日週三
9月29日週二
9月23日週三
9月22日週二
9月17日週四
9月14日週一
8月26日週三
8月18日週二
8月17日週一
8月5日週三
7月31日週五
7月21日週二
7月20日週一
7月17日週五
7月9日週四
6月1日週一
5月27日週三
5月19日週二
5月6日週三
4月29日週三
4月28日週二
4月8日週三
3月25日週三
3月23日週一
3月17日週二
3月11日週三
2月1日週日
1月28日週三
12月22日週一
12月18日週四
12月10日週三
12月3日週三
11月27日週四