#black-box-defense

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Hamid Dashtbani, Mehdi Dousti Gandomani, AmirMahdi Sadeghzadeh

该论文针对黑盒场景下基于得分的对抗样本攻击提出了一种新的防御方法。作者首先指出现有基于随机化的防御虽然能够降低攻击成功率,但往往以牺牲模型准确率或导致置信度分数严重失真为代价。为此,他们提出了随机对数缩放(Random Logit Scaling, RLS)方法,这是一种即插即用的后处理防御,可以在不修改原模型的前提下直接部署。RLS的核心思想是在模型输出层对logits进行随机缩放,从而输出混淆后的分数,使攻击者难以基于返回的分数高效构造对抗样本,同时通过精心设计的缩放分布保持模型原本的分类准确率和置信度可靠性。实验表明,RLS在多种最先进的黑盒得分攻击(如基于梯度估计的ZOO、SimBA等)下,能显著降低攻击成功率,且相比其他随机化防御(如随机平滑、随机变换)在准确率和置信度距离上均有明显优势。此外,论文还构造了一种针对现有非随机化黑盒防御AAA的自适应攻击,揭示了该类修改输出logits的防御在自适应攻击下的脆弱性,从而强调了随机化带来的安全增益。该研究适合机器学习安全领域的研究者和工程人员,尤其是需要为已有模型快速添加低成本防御的团队。

💡 推荐理由: 提出一种简单有效的可插拔防御,能显著提升黑盒得分攻击下的模型鲁棒性,无需重新训练,适合工程化落地。

🎯 建议动作: 研究跟进,评估RLS在自身模型上的效果

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)