本文提出了一种新颖的干净标签后门攻击框架,其核心特点是后门在训练后保持休眠状态,仅在用户请求删除(机器遗忘)特定训练样本后才被激活,从而有效规避训练后、部署前的行为审查。现有后门攻击通常在植入后立即生效,容易被安全检查发现;而针对休眠后门的研究虽能在遗忘后激活,但难以同时满足低激活前攻击成功率、强激活后攻击效果、干净标签约束以及现实遗忘请求等条件。为此,作者提出基于双生成器学习的统一框架,将后门植入建模为双层优化问题:一方面学习样本特定的触发器,建立持久的触发器-目标类别潜在关联;另一方面生成标签一致的伪装样本,提供可移除的抑制机制。当少量伪装样本被遗忘后,抑制被解除,后门被激活。在CIFAR-10和ImageNet-10数据集上的实验表明,该方法在多种机器遗忘算法下,相比代表性后门基线,能同时实现更低的激活前攻击成功率和更高的激活后攻击成功率,验证了通过协调持久潜在关联与可移除抑制来实现可靠休眠-激活转换的可行性。该研究揭示了机器遗忘作为防御机制可能被攻击者利用的潜在风险,对模型所有者和安全从业者具有警示意义。
💡 推荐理由: 该研究揭示机器遗忘机制可被攻击者利用,使后门在部署后按需激活,逃避现有安全审查。对依赖模型清洗和遗忘接口的防御体系构成新挑战,需关注模型供应链中的隐蔽风险。
🎯 建议动作: 研究跟进