#pruning

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Yuxi Li, Zhibo Zhang, Kailong Wang, Xingshuo Han, Ling Shi, Haoyu Wang

本文提出了一种针对大型语言模型(LLM)后门攻击的新型防御方法DeCNIP(基于关键神经元隔离剪枝的防御)。现有防御通常分为推理时检测或训练时缓解,但存在两个关键局限:一是它们主要针对基于微调的后门(如PEFT模块),无法应对绕过训练管道的隐蔽模型编辑攻击;二是它们针对简单的分类设置,无法自然扩展到LLM的开放式生成特性。因此,这些方法仅关注表面行为模式,忽略了恶意激活的深层表征原因,导致防御依赖经验启发式,缺乏鲁棒性、通用性和实际应用性。为弥补这一空白,DeCNIP利用表征分析,在统一流程中识别和中和后门。具体地,DeCNIP通过优化有害提示(带有候选token)与良性输入之间的交叉熵损失来识别类似触发器的行为。这种表征发现通过揭示触发器劫持模型权重的机制来暴露潜在威胁。然后,它隔离出后门关键神经元(BCNs),并选择性剪枝以消除恶意影响,同时保持模型效用。在6个开源LLM和两个基准数据集上的广泛评估表明,DeCNIP实现了超过95%的攻击成功率(ASR)相对降低,优于七种最先进的防御方法,且仅需干预0.1%的神经元。同时,它在正常基准上保持了97%的模型性能,展示了其有效性、鲁棒性和可扩展性。本文适合LLM安全研究人员、防御工程师以及关注模型后门防护的从业者阅读。

💡 推荐理由: LLM后门攻击威胁日益严重,现有防御方法存在覆盖不全、依赖表面特征等问题。DeCNIP通过表征分析和关键神经元剪枝,首次统一处理微调后门与模型编辑后门,且仅需极少量神经元干预即达到高防御成功率,为实际部署提供了可落地的解决方案。

🎯 建议动作: 纳入内部评估

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)