该论文首次系统性地研究了数据集蒸馏(Dataset Distillation)技术面临的后门攻击风险。数据集蒸馏旨在将大规模训练数据压缩成小规模合成数据集,使模型在合成数据上训练后仍能达到与原始数据训练相近的性能,从而提升数据效率。然而,现有研究主要关注资源效率与模型效用之间的权衡,忽视了其潜在的安全隐患。论文提出,在图像域中,攻击者可以在蒸馏过程中而非传统模型训练阶段注入触发器,从而对使用蒸馏数据训练的模型实施后门攻击。作者设计了两种攻击方法:NAIVEATTACK 和 DOORPING。NAIVEATTACK 在蒸馏初始阶段直接向原始数据添加触发器;DOORPING 则在整个蒸馏过程中迭代优化触发器,使其与蒸馏过程深度融合。实验在多种数据集、模型架构和蒸馏技术上进行,结果表明:NAIVEATTACK 在某些情况下能达到可接受的后门攻击成功率(ASR),而 DOORPING 在所有测试场景中均能达到接近 1.0 的极高成功率。此外,论文进行了全面的消融实验,分析了影响攻击效果的关键因素,并评估了多种防御机制,结果显示所提出的攻击方法能够有效绕过这些防御。该研究揭示了数据集蒸馏流程中一个被忽视的攻击面,对机器学习供应链安全提出新的挑战。
💡 推荐理由: 数据集蒸馏正被用于提升训练效率,但该研究首次证明蒸馏过程本身可被植入后门,且能绕过现有防御,威胁下游模型供应链安全,值得所有使用蒸馏数据的团队关注。
🎯 建议动作: 研究跟进