#black-box-defense

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Ahmed Abdelnaby, Mohamed Elmahallawy

本文提出了一种面向部署场景的黑盒后门防御方法 TRIM(Trigger Removal by Identifying Manipulated Regions),旨在解决深度神经网络(DNN)在视觉系统中被后门攻击悄然篡改的问题。后门攻击通过恶意触发器使模型在保持高干净准确率的同时,对特定目标进行错误分类。现有防御方法通常依赖模型内部信息、训练数据或干净验证样本,在仅有黑盒访问权限时难以部署。TRIM 的核心思想是在推理阶段识别导致模型异常行为的图像区域,并只对这些区域进行选择性净化,同时保留良性内容。该方法由三个关键组件构成:(i) 基于深度特征表示的图像区域分割;(ii) 通过图像修复和扩散式重建实现自适应触发器发现,将导致误分类的区域隔离出来,且不依赖对触发器类型、形状或位置的假设;(iii) 选择性区域净化,清除被污染区域的同时保留良性内容。为了支持实际部署,TRIM 还缓存了先前识别出的触发器的特征嵌入,从而高效识别并避免重复检测和净化。实验覆盖多种数据集和后门类型(包括混合、稀疏、不同大小及多个触发器),结果表明 TRIM 在攻击成功率(ASR)上可低至 1.16%,同时保持高达 87.87% 的干净准确率,优于现有黑盒防御方法。该研究证实,在防御者无法获取任何辅助数据的情况下,推理时的后门缓解是可行的。适合对 AI 安全、模型鲁棒性、推理时防御感兴趣的研究人员与安全工程师阅读。

💡 推荐理由: 后门攻击威胁现实视觉系统,而现有防御多需内部访问或干净样本。TRIM 提出纯黑盒、无辅助数据的推理时净化方案,为蓝队在无法控制训练流程时提供了可落地的防御思路,值得关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hamid Dashtbani, Mehdi Dousti Gandomani, AmirMahdi Sadeghzadeh

该论文针对黑盒场景下基于得分的对抗样本攻击提出了一种新的防御方法。作者首先指出现有基于随机化的防御虽然能够降低攻击成功率,但往往以牺牲模型准确率或导致置信度分数严重失真为代价。为此,他们提出了随机对数缩放(Random Logit Scaling, RLS)方法,这是一种即插即用的后处理防御,可以在不修改原模型的前提下直接部署。RLS的核心思想是在模型输出层对logits进行随机缩放,从而输出混淆后的分数,使攻击者难以基于返回的分数高效构造对抗样本,同时通过精心设计的缩放分布保持模型原本的分类准确率和置信度可靠性。实验表明,RLS在多种最先进的黑盒得分攻击(如基于梯度估计的ZOO、SimBA等)下,能显著降低攻击成功率,且相比其他随机化防御(如随机平滑、随机变换)在准确率和置信度距离上均有明显优势。此外,论文还构造了一种针对现有非随机化黑盒防御AAA的自适应攻击,揭示了该类修改输出logits的防御在自适应攻击下的脆弱性,从而强调了随机化带来的安全增益。该研究适合机器学习安全领域的研究者和工程人员,尤其是需要为已有模型快速添加低成本防御的团队。

💡 推荐理由: 提出一种简单有效的可插拔防御,能显著提升黑盒得分攻击下的模型鲁棒性,无需重新训练,适合工程化落地。

🎯 建议动作: 研究跟进,评估RLS在自身模型上的效果

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)