该论文提出了一种面向实际部署的黑盒后门防御方法 TRIM(Trigger Removal by Identifying Manipulated Regions),用于在推理阶段检测并选择性清除深度神经网络图像分类模型中的后门触发器。后门攻击通过隐藏的恶意触发器让模型在保持高干净准确率的同时,对特定输入产生错误分类。现有防御通常依赖模型内部结构、训练数据或干净验证样本,在仅有模型黑盒访问权限的真实场景中难以部署。TRIM 的核心思路是定位导致模型反常行为的图像区域,并在不影响良性内容的前提下仅净化这些区域。其创新由三个关键组件构成:(i) 基于深度特征表示的区域分割;(ii) 通过图像修复与扩散重建实现的自适应触发器发现,不预设触发器的类型、形状或位置;(iii) 选择性区域净化,在保留良性内容的同时清理被污染的区域。此外,TRIM 会缓存已发现触发器的特征嵌入,以便快速识别和避免重复检测。在多种数据集和后门类型(包括混合式、稀疏、不同大小及多个触发器)上的广泛实验中,TRIM 显著优于现有黑盒防御方法,将攻击成功率(ASR)降低至最低 1.16%,同时保持最高 87.87% 的干净准确率。结果表明,即使防御者没有任何辅助数据,也能在推理阶段有效缓解后门攻击。
💡 推荐理由: 该论文提供了一种不依赖模型内部或干净样本的推理时后门防御方案,适用于真实世界中仅能获得黑盒模型访问权的场景,对部署视觉模型的蓝队成员具有直接参考价值,能够在不中断业务的情况下降低后门攻击风险。
🎯 建议动作: 研究跟进:建议安全团队阅读论文并评估 TRIM 在自有模型上的效果,后续可构建原型进行针对性验证。