本文提出了一种面向部署场景的黑盒后门防御方法 TRIM(Trigger Removal by Identifying Manipulated Regions),旨在解决深度神经网络(DNN)在视觉系统中被后门攻击悄然篡改的问题。后门攻击通过恶意触发器使模型在保持高干净准确率的同时,对特定目标进行错误分类。现有防御方法通常依赖模型内部信息、训练数据或干净验证样本,在仅有黑盒访问权限时难以部署。TRIM 的核心思想是在推理阶段识别导致模型异常行为的图像区域,并只对这些区域进行选择性净化,同时保留良性内容。该方法由三个关键组件构成:(i) 基于深度特征表示的图像区域分割;(ii) 通过图像修复和扩散式重建实现自适应触发器发现,将导致误分类的区域隔离出来,且不依赖对触发器类型、形状或位置的假设;(iii) 选择性区域净化,清除被污染区域的同时保留良性内容。为了支持实际部署,TRIM 还缓存了先前识别出的触发器的特征嵌入,从而高效识别并避免重复检测和净化。实验覆盖多种数据集和后门类型(包括混合、稀疏、不同大小及多个触发器),结果表明 TRIM 在攻击成功率(ASR)上可低至 1.16%,同时保持高达 87.87% 的干净准确率,优于现有黑盒防御方法。该研究证实,在防御者无法获取任何辅助数据的情况下,推理时的后门缓解是可行的。适合对 AI 安全、模型鲁棒性、推理时防御感兴趣的研究人员与安全工程师阅读。
💡 推荐理由: 后门攻击威胁现实视觉系统,而现有防御多需内部访问或干净样本。TRIM 提出纯黑盒、无辅助数据的推理时净化方案,为蓝队在无法控制训练流程时提供了可落地的防御思路,值得关注。
🎯 建议动作: 研究跟进