该论文提出了一种名为 PatchCleanser 的认证鲁棒防御方法,旨在抵御针对图像分类模型的对抗性补丁攻击。对抗性补丁攻击通过在输入图像的受限区域内注入精心设计的像素(即补丁),导致模型误分类。这种攻击可在物理世界中通过打印并粘贴补丁到目标物体上实现,对计算机视觉系统构成实际威胁。PatchCleanser 的核心思想是在输入图像上执行两轮像素掩码操作,以消除对抗性补丁的影响。该方法完全基于图像空间的操作,因此与任何现有最先进的图像分类器兼容,且能保持高精度。更重要的是,作者证明了在其威胁模型下,PatchCleanser 能够确保对于某些图像,针对任意自适应白盒攻击者,始终预测正确的类别标签,从而实现认证鲁棒性。论文在 ImageNet、ImageNette、CIFAR-10、CIFAR-100、SVHN 和 Flowers-102 等多个数据集上进行了广泛评估。实验结果表明,PatchCleanser 在保持与最先进分类模型相近的清洁准确率的同时,显著提升了认证鲁棒准确率。例如,在 1000 类 ImageNet 数据集上,面对图像上任意位置的 2% 像素大小的方形补丁,该方法达到了 83.9% 的 top-1 清洁准确率和 62.1% 的 top-1 认证鲁棒准确率。该工作适合计算机视觉安全研究人员、模型部署工程师以及对抗性机器学习领域的研究者阅读。
💡 推荐理由: 该研究提供了一种通用的、可证明鲁棒的防御方案,适用于任意图像分类器,对提升真实世界计算机视觉系统的安全性具有重要意义。
🎯 建议动作: 研究跟进