论文提出 NeuronFuzz,一个面向大语言模型(LLM)安全评估的白盒模糊测试框架。现有自动化越狱测试方法主要依赖响应级反馈:每个候选提示都需要目标模型生成完整回复才能评估攻击效果,这不仅计算开销大,而且在强对齐模型上反馈极其稀疏——大多数候选提示都会被拒绝并以相同失败结果结束,导致难以有效指导测试优化。NeuronFuzz 的核心创新是利用模型内部的“安全神经元”作为连续执行反馈,代替传统的响应生成。论文设计了一个 SafetyOracle,将安全神经元的激活值转换为连续的安全报警分数,该分数可在预填充阶段获得,从而将响应生成从模糊测试循环中移除,大幅提升测试效率。为了构建 SafetyOracle,NeuronFuzz 使用模板不变的有害/良性输入以及基于稳定性的选择方法,识别出一组紧凑的安全神经元,其激活模式能够捕捉有害意图识别。此外,由于安全报警分数可微,NeuronFuzz 利用其梯度定位对安全敏感的模板位置,并通过掩码语言模型生成流畅、上下文兼容的突变,同时保留原始有害载荷并避免引入额外优化变量。实验覆盖 21 个文本和多模态模型:在 5 个白盒源模型上,越狱发现率达到 76%–100%,比基线最高提升 48 个百分点;优化后的模板还可零样本迁移到开放权重模型和 6 个专有目标模型,平均攻击成功率(ASR)和 top-5 集成 ASR(EASR)分别达到 69.6%/92.6% 和 44.1%/60.0%。该工作为 LLM 安全评估提供了新的白盒测试思路,适合 LLM 安全研究者、红队工具开发者以及负责模型安全对齐的工程师阅读。
💡 推荐理由: 该研究提出了一种利用安全神经元进行白盒模糊测试的新方法,能显著提升越狱攻击发现效率并降低测试成本,同时可迁移至黑盒模型,为自动化 LLM 安全评估提供了可落地的技术路径,对红队评估和防御加固均有参考价值。
🎯 建议动作: 研究跟进