跳到正文
熱點事件觀察中

研究展示擴散語言模型偏見注入攻擊

1 篇報道1 個報道來源2 天前更新

先了解這件事

AI 綜述

2026 年 10 月 5 日,HuggingFace Daily Papers 社區熱門論文介紹一項針對凍結擴散語言模型的定向偏見注入攻擊研究。研究使用比例積分(PI)控制器,在去噪期間追蹤目標答案機率,並動態調節引導向量強度。報道稱,在 BBQ 模糊問題上,LLaDA-8B-Instruct 對目標羣體的偏好提升幅度由 1.8 個百分點升至 16.7 個百分點,超過最強固定強度基線三倍;在 SocialStigmaQA 上,污名化答案選擇率由 17.6% 升至 58.1%。

AI 根據報道生成 · 3 小時前更新

報道時間線

沿着報道,瞭解事件的不同側面。

10月5日
  1. HuggingFace Daily Papers(社區熱門論文)
    擴散語言模型的定向偏見注入:閉環激活引導攻擊

    研究提出一種針對凍結擴散語言模型的定向偏見注入攻擊,透過比例積分(PI)控制器追蹤去噪期間的目標答案機率,動態調節引導向量強度。在 BBQ 模糊問題上,LLaDA-8B-Instruct 對目標羣體的偏好提升幅度由 1.8 個百分點升至 16.7 個百分點,超過最強固定強度基線三倍;在 SocialStigmaQA 上,污名化答案選擇率由 17.6% 升至 58.1%。

本事件熱度走勢

還沒有足夠的連續觀測數據,暫不繪製趨勢。