跳到正文
原文
HuggingFace Daily Papers(社區熱門論文)·· 2 天前AI 評分56

擴散語言模型的定向偏見注入:閉環激活引導攻擊

Noise Out, Bias In: Targeted Bias Injection in Diffusion Language Models via Closed-Loop Activation Steering

AI 導讀

研究提出一種針對凍結擴散語言模型的定向偏見注入攻擊,透過比例積分(PI)控制器追蹤去噪期間的目標答案機率,動態調節引導向量強度。在 BBQ 模糊問題上,LLaDA-8B-Instruct 對目標羣體的偏好提升幅度由 1.8 個百分點升至 16.7 個百分點,超過最強固定強度基線三倍;在 SocialStigmaQA 上,污名化答案選擇率由 17.6% 升至 58.1%。

來源:HuggingFace Daily Papers(社區熱門論文) · huggingface.co