本文研究了大型语言模型(LLM)中知识编辑(Knowledge Editing, KE)方法的可靠性与潜在安全漏洞。KE 旨在无需昂贵重训练即可更新模型中的特定事实,但最新研究发现其效果存在严重局限性。作者从对抗性诱发(adversarial elicitation)的视角出发,通过精心设计的间接提示(indirect prompting)和对抗性攻击,系统性地测试了多种主流 KE 方法(如模型编辑、定位编辑等)在多种模型架构(如 GPT、LLaMA 等)上的表现。实验表明,编辑后的知识并未被真正擦除,而是隐藏在模型内部,仍能通过特定触发条件重新浮现。机制分析揭示,这些 KE 方法本质上不是覆盖原有知识,而是将其重新分布在模型的表示空间中,仅起到针对性抑制(targeted suppression)的作用,即降低输出原始事实的概率,但并未从模型中消除。此外,损失景观分析显示,编辑后的知识位于狭窄的各向异性区域(narrow anisotropic regions),对扰动高度敏感,因此极易被间接提示或对抗攻击所绕过。本文的研究证明了现有 KE 算法具有内在的可绕过性,并呼吁重新评估在 LLM 应用中部署事后更新的整体思路。该工作对 LLM 部署的安全性、隐私保护以及对抗鲁棒性具有重要启示。
💡 推荐理由: 揭示了 LLM 知识编辑的安全幻觉:编辑后的敏感或错误信息仍可通过对抗性提示提取,对模型安全审计和内容控制带来挑战。
🎯 建议动作: 研究跟进