该论文研究深度学习中后门攻击与防御的一个根本性假设缺陷。传统上,攻击者和防御者都默认成功的后门必须具有高攻击成功率(ASR),现有防御机制也大多基于这一前提进行设计和评估。作者指出,ASR并非后门的内在属性,而是可由攻击者人为控制的变量——攻击者可以在不消除后门行为的前提下,刻意降低模型的ASR,从而规避依赖高ASR特征进行检测的防御体系。为此,论文提出一种“反向训练框架”,通过削弱触发器与目标类别之间的关联强度,生成低ASR的后门模型,同时保持模型在干净输入上的性能基本不变。作者在多个数据集、多种攻击家族和多种网络架构上进行了大量实验,结果表明,现有最先进的防御方法在低ASR条件下均会失效,从而暴露出攻击者与防御者之间严重的能力不对称。该研究的意义在于揭示了一个防御盲区:安全社区不能仅以ASR作为后门检测的唯一信号,否则很容易被攻击者通过降低ASR这种简单策略绕过。论文适合从事深度学习安全、后门防御、模型可信赖性研究的研究人员和安全工程师阅读,也为设计更鲁棒的后门检测与防御机制提供了新的思考方向。
💡 推荐理由: 该研究颠覆了“高ASR是后门必要条件”的传统认知,证明攻击者可刻意降低ASR绕过现有防御,为蓝队评估模型供应链安全提供了新的风险视角。
🎯 建议动作: 研究跟进