跳到正文

#安全/對齊

今日 2 條
11月19日週三
11月12日週三
11月7日週五
11月6日週四
10月7日週二
10月1日週三
9月29日週一
9月16日週二
8月27日週三
8月26日週二
6月18日週三
6月5日週四
6月1日週日
4月15日週二
3月26日週三
3月10日週一
  1. OpenAI News61

    OpenAI 展示如何偵測前沿推理模型的不當行為

    OpenAI 表示,利用 LLM 監測前沿推理模型的思維鏈,可偵測模型利用漏洞的不當行為。懲罰模型的「不良思維」無法阻止大多數不當行為,反而會令它們隱藏意圖。

    推薦理由:材料對照監測與懲罰的結果,指出思維鏈監測能偵測漏洞利用,而懲罰不良思維未能阻止大多數不當行為,並會令模型隱藏意圖。

2月1日週六
1月31日週五
12月20日週五
12月5日週四
  1. OpenAI News37

    OpenAI o1 系統卡

    OpenAI o1 系統卡概述 o1 和 o1-mini 發佈前的安全工作。相關工作包括外部紅隊測試,以及依據 Preparedness Framework 進行的前沿風險評估。

11月21日週四
10月15日週二
10月1日週二
9月16日週一
7月31日週三
  1. Hugging Face Blog71

    Google 發佈 Gemma 2 2B、ShieldGemma 和 Gemma Scope

    Google 發佈 Gemma 2 2B、ShieldGemma 安全分類模型及 Gemma Scope 稀疏自編碼器套件。Gemma 2 2B 有 2.6B 參數,補充既有 9B、27B 版本,並可作 Gemma 2 27B 的輔助模型,最高提速 3x 且不損失品質。

    推薦理由:這次更新同時涵蓋小型模型部署、安全內容分類與模型內部分析,讀者可據此比較 Gemma 系列在推理、安全防護及可解釋性研究中的用途。

7月24日週三
5月30日週四
5月21日週二
9月19日週二