推荐 3.5
Conf: 50%
本文针对当前对抗鲁棒性评估方法的局限性,提出了一种新的评估框架。现有方法通常使用预定义的攻击集成(如AutoAttack)在单一扰动预算ε和少量范数下进行评估,存在三个根本问题:1) 模型间的鲁棒性-扰动曲线可能相交或以不同速率衰减,导致单ε排名不稳定;2) 无法证明评估结果的最优性,存在未知的对抗样本漏洞;3) 固定攻击配置无法系统控制攻击强度与评估成本之间的权衡。为解决这些问题,作者提出了一个基于最小范数攻击池的评估框架,涵盖ℓ0、ℓ1、ℓ2和ℓ∞四种攻击范数,并构建鲁棒性-扰动曲线。定义“攻击前沿”为攻击池对模型产生的最差鲁棒性估计,并将评估形式化为前沿逼近问题,通过选择最小范数攻击子集(即优化后的攻击集成)在可控的查询预算下逼近前沿,预算越大估计越紧。此外,定义“防御前沿”为每个扰动大小下模型集合的最优鲁棒性,并提出“防御最优性指数”(Defense Optimality Index)来对防御进行排序,无需选择单一ε。在CIFAR-10和ImageNet上的实验表明,所提攻击集成在固定和可控查询成本下,在大多数防御上匹配或超过AutoAttack。该工作为安全从业者提供了基于曲线和查询控制的替代性评估方法。
💡 推荐理由: 本文提出了一种更全面、鲁棒的对抗鲁棒性评估方法,解决了传统单ε评估的排名不稳定性和最优性问题,有助于安全从业者更准确地衡量模型的真实鲁棒性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)