该论文提出了一种全新的黑盒对抗攻击范式——可认证黑盒攻击(Certifiable Black-Box Attacks),旨在从理论上保证攻击成功率(Attack Success Probability, ASP),而不像传统黑盒攻击那样依赖对目标模型的反复查询或从一个替代模型迁移对抗样本。作者首先指出现有最先进的防御手段(如检测查询模式或给模型输入注入噪声等)能够有效缓解当前黑盒攻击,而他们提出的新攻击能够以可证明的高概率击穿这些防御。核心方法包括:建立随机化对抗样本(Randomized Adversarial Examples)的ASP理论分析框架,从数学上保证攻击的有效性;在此基础上设计多种随机化样本生成算法,通过控制扰动强度来保持隐蔽性;最终在CIFAR-10/100、ImageNet和LibriSpeech等多个数据集上进行实验,与16种主流黑盒攻击和多种SOTA防御(涵盖视觉和语音识别)进行比较。实验证实,基于该算法构造的对抗样本在无需查询目标模型的情况下,即可获得理论保证的高ASP,并且攻击效果相对传统经验攻击更为可靠。该研究首次将“可认证”机制引入攻击侧,揭示了当前防御体系可能存在结构性盲区,为评估机器学习模型在对抗环境下的真实鲁棒性提出了新挑战。
💡 推荐理由: 该研究首次提出可认证黑盒攻击,赋予对抗样本理论上可证明的成功率,使现有依赖经验验证的防御难以有效应对。防御者必须重新审视鲁棒性评估体系,关注这种不受查询限制且具备数学保证的新型威胁。
🎯 建议动作: 研究跟进