#randomization

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Hamid Dashtbani, Mehdi Dousti Gandomani, AmirMahdi Sadeghzadeh

该论文针对黑盒场景下基于得分的对抗样本攻击提出了一种新的防御方法。作者首先指出现有基于随机化的防御虽然能够降低攻击成功率,但往往以牺牲模型准确率或导致置信度分数严重失真为代价。为此,他们提出了随机对数缩放(Random Logit Scaling, RLS)方法,这是一种即插即用的后处理防御,可以在不修改原模型的前提下直接部署。RLS的核心思想是在模型输出层对logits进行随机缩放,从而输出混淆后的分数,使攻击者难以基于返回的分数高效构造对抗样本,同时通过精心设计的缩放分布保持模型原本的分类准确率和置信度可靠性。实验表明,RLS在多种最先进的黑盒得分攻击(如基于梯度估计的ZOO、SimBA等)下,能显著降低攻击成功率,且相比其他随机化防御(如随机平滑、随机变换)在准确率和置信度距离上均有明显优势。此外,论文还构造了一种针对现有非随机化黑盒防御AAA的自适应攻击,揭示了该类修改输出logits的防御在自适应攻击下的脆弱性,从而强调了随机化带来的安全增益。该研究适合机器学习安全领域的研究者和工程人员,尤其是需要为已有模型快速添加低成本防御的团队。

💡 推荐理由: 提出一种简单有效的可插拔防御,能显著提升黑盒得分攻击下的模型鲁棒性,无需重新训练,适合工程化落地。

🎯 建议动作: 研究跟进,评估RLS在自身模型上的效果

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jianan Feng, Jiachun Li, Changqing Miao, Jianjun Huang 0001, Wei You 0001, Wenchang Shi, Bin Liang 0002

本文提出一种对抗性补丁攻击的防御方法,核心思想是“以火攻火”,即通过向模型输入注入特制的防御性补丁来主动探测或抵消潜在的攻击补丁。作者设计了两种防御补丁:canary(金丝雀)和woodpecker(啄木鸟)。Canary补丁用于探测输入中是否存在攻击补丁,通过分析模型输出中与canary对应的检测结果是否异常来判断是否遭受攻击;Woodpecker补丁则直接抵消攻击补丁的效果,通过将其放置在可能受攻击的区域来扰乱攻击者的对抗性扰动。方法的关键在于:无需修改目标模型,仅通过预处理输入和后处理输出即可实现防御,因此易于部署且不影响模型效率。针对防御感知的适应性攻击,作者采用随机化的补丁注入模式,每次推理时随机选择补丁的位置和数量,使攻击者难以绕过。实验在多个目标检测模型和攻击方法上进行,结果表明该方法能有效检测和防御多种未知攻击,且引入的时间开销有限。即使在自适应攻击(攻击者知晓防御策略并针对性优化攻击)下,该方法仍表现出足够的鲁棒性。本文的主要贡献包括:提出了一种新颖的对抗式防御框架,设计了两种互补的防御补丁,以及通过随机化提升对适应性攻击的抵抗力。该工作适用于目标检测场景的安全加固,尤其适合需要平衡防护效果与部署成本的工业界应用。

💡 推荐理由: 这是一种新颖的对抗防御思路,不修改模型结构,通过主动注入防御性补丁来对抗攻击,对蓝队成员在目标检测系统防护中有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)