推荐 5.5
Conf: 50%
模型量化是降低大语言模型存储和推理开销的关键技术,但最近的研究表明,量化引入的离散化和舍入误差可被攻击者利用,构造量化条件后门攻击。在这种攻击下,恶意行为在全精度阶段保持休眠,仅在量化部署后激活,从而绕过传统的安全审计和检测机制。针对这一威胁,本文提出了一种主动的预量化防御方法 QuantGuard。该方法引入了可微的舍入控制变量,并结合了误差引导的舍入反转约束、输出分布一致性和权重距离正则化,以精细调控关键的舍入行为。关键的是,QuantGuard 仅使用少量校准数据集,且不修改现有量化算法。这种设计打破了攻击者精心构造的权重模式与量化边界之间的精确对齐,有效抑制了量化后的后门激活路径,同时保持了模型的原始功能和性能。作者在六个主流大语言模型(包括 LLaMA-3 和 Qwen2.5-Coder)上,使用三种量化精度(INT8、FP4 和 NF4),在三个代表性场景(易受攻击代码生成、内容注入和过度拒绝)下进行了系统实验。结果表明,QuantGuard 能够持续缓解量化条件后门攻击,将攻击成功率降低到与干净模型相当的水平,同时在通用能力基准测试上基本保持性能。该方法计算开销低,为安全量化部署 LLM 提供了一种有效实用的解决方案。
💡 推荐理由: 量化是LLM部署的关键技术,但量化条件后门攻击可绕过传统安全审计。本文提出的QuantGuard防御方法能在不改变量化算法的前提下有效抑制后门,为实际安全部署提供了重要保障。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)