推荐 5.5
Conf: 50%
本文提出了一种名为 LoRAScan 的新型防御方法,用于检测大型语言模型(LLM)低秩适配器(LoRA)中的后门提示。LoRA 是一种高效的模型微调技术,通过引入小型适配器模块来降低计算成本,但也带来了供应链安全风险:不可信的适配器可能包含后门,使得模型在遇到特定触发词时生成有害内容、恶意代码、政治宣传或隐蔽广告。现有防御方法主要分为两类:一类是适配器无关的防御,将适配器与基础模型合并,这会稀释后门信号并降低检测性能;另一类是适配器感知的方法,但要么训练一个防御性适配器来修复被后门化的基础模型(关注的是对抗问题而非保护适配器本身),要么使用分类器将整个适配器标记为可疑,需要单独处理。这些方法都忽略了后门适配器中触发输入产生的不同潜在空间特征。LoRAScan 是第一个在推理时检测并拒绝触发输入、且不修改适配器参数的适配器感知防御方法。其核心观察是:大约 5% 的 LoRA 插入位点在干净输入下保持稳定,但在触发词存在时,其下投影激活会表现出高度集中的尖峰。LoRAScan 在模型部署前识别这些低方差插入位点,并在推理过程中监控它们。在标准 LLM 后门基准测试中,LoRAScan 能拒绝约 98.49% 的恶意输入,同时在干净输入上保持较低的误报率,在多种评估设置下均优于现有防御方法。
💡 推荐理由: LoRA 适配器的供应链攻击是当前 LLM 安全的重要风险,LoRAScan 提供了首个不修改适配器参数即可在推理时拒绝后门输入的方案,对依赖第三方适配器的企业 LLM 部署具有直接防护意义。
🎯 建议动作: 研究跟进:评估 LoRAScan 在自身 LoRA 适配器场景中的适用性,并关注其误报率与性能开销。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)