#black-box-attack

共收录 9 条相关安全情报。

← 返回所有主题
👥 作者: Dongsu Song, DaeYun GO, Boseung Seo, Jay Hoon Jung

本文聚焦于语义分割任务中的决策黑盒稀疏攻击问题。尽管稀疏决策黑盒攻击在分类领域已有研究,但在语义分割中尚缺乏系统性探索。作者首先将分类域中最具代表性的决策黑盒稀疏攻击方法改编至语义分割场景,构建了该未充分研究区域的基准测试。通过基准分析,发现现有基于图像中心像素累积的方法在语义分割的广阔像素空间中会导致查询预算迅速耗尽,严重降低查询效率。为克服这一瓶颈,作者提出 SegPAR 框架,将攻击的探索范式从图像中心转向类别中心,即针对每个语义类别或其局部区域进行独立优化,从而更高效地分配查询资源。同时,为消除像素累积过程中标准决策奖励产生的误导性反馈,设计了一种新颖的差异奖励机制,该机制能够更精确地评估不同类别对攻击效果的贡献,降低无效查询。大量实验表明,SegPAR 在稀疏度效率和平均交并比(MIoU)降低幅度上显著优于所有黑盒基线,甚至与白盒稀疏攻击相比也展现出竞争力。代码已公开。该工作揭示了语义分割模型在决策黑盒威胁下的新攻击面,为鲁棒性评估和防御研究提供了重要参考。

💡 推荐理由: 语义分割是自动驾驶、医学影像等安全关键应用的核心技术。该研究表明,攻击者无需模型内部信息即可通过稀疏像素扰动显著降低分割性能,提示防御者需重新评估黑盒场景下的模型鲁棒性,并采取针对性防护措施。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Benjamin Bichsel, Samuel Steffen, Ilija Bogunovic, Martin T. Vechev

DP-Sniper 是一种实用的黑盒方法,用于自动发现差分隐私(Differential Privacy, DP)实现中的违规行为。差分隐私是保护数据隐私的严格数学定义,但实际实现常因浮点误差、算法简化或实现缺陷而违背其保证。DP-Sniper 的核心创新包括两个关键思想:(i) 训练一个分类器,用于判断某个观测到的输出更可能来自两个候选输入中的哪一个;(ii) 将该分类器转化为近似最优的差分隐私攻击。这种方法能够在无需访问算法内部机制或随机种子(即黑盒)的情况下,自动检测差分隐私是否被违反。实验评估表明,DP-Sniper 相比现有最先进技术,能获得高达 12.4 倍更强的隐私违规保证,同时速度快 15.5 倍。此外,DP-Sniper 能有效利用朴素实现中的浮点漏洞:例如,它检测到一个声称满足 0.1-差分隐私的拉普拉斯机制实现,实际上连 0.25-差分隐私都无法满足。该研究为安全审计和隐私验证提供了自动化工具,适合关注差分隐私实现正确性、机器学习隐私保护以及隐私验证技术的安全从业者。

💡 推荐理由: 差分隐私实现易因浮点漏洞等细节失效,DP-Sniper提供自动化黑盒检测手段,帮助审计真实系统隐私承诺,避免因实现缺陷导致的数据泄露风险。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Hanbin Hong, Xinyu Zhang 0016, Binghui Wang, Zhongjie Ba, Yuan Hong 0001

该论文提出了一种全新的黑盒对抗攻击范式——可认证黑盒攻击(Certifiable Black-Box Attacks),旨在从理论上保证攻击成功率(Attack Success Probability, ASP),而不像传统黑盒攻击那样依赖对目标模型的反复查询或从一个替代模型迁移对抗样本。作者首先指出现有最先进的防御手段(如检测查询模式或给模型输入注入噪声等)能够有效缓解当前黑盒攻击,而他们提出的新攻击能够以可证明的高概率击穿这些防御。核心方法包括:建立随机化对抗样本(Randomized Adversarial Examples)的ASP理论分析框架,从数学上保证攻击的有效性;在此基础上设计多种随机化样本生成算法,通过控制扰动强度来保持隐蔽性;最终在CIFAR-10/100、ImageNet和LibriSpeech等多个数据集上进行实验,与16种主流黑盒攻击和多种SOTA防御(涵盖视觉和语音识别)进行比较。实验证实,基于该算法构造的对抗样本在无需查询目标模型的情况下,即可获得理论保证的高ASP,并且攻击效果相对传统经验攻击更为可靠。该研究首次将“可认证”机制引入攻击侧,揭示了当前防御体系可能存在结构性盲区,为评估机器学习模型在对抗环境下的真实鲁棒性提出了新挑战。

💡 推荐理由: 该研究首次提出可认证黑盒攻击,赋予对抗样本理论上可证明的成功率,使现有依赖经验验证的防御难以有效应对。防御者必须重新审视鲁棒性评估体系,关注这种不受查询限制且具备数学保证的新型威胁。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Peichun Hua, Haoxuan Xu, Mengyuan Li

该论文提出了“行为技能重建”(Behavioral Skill Reconstruction, BSR)问题,聚焦于闭源 LLM Agent 技能(skill)的功能泄露风险。此前研究主要关注提示注入攻击,试图直接披露技能中隐藏的指令、脚本、常量或数据;相应的防御也集中于防止此类文件或内容的直接泄露。然而,作者指出,即使阻止了文件泄露,用户仍可能通过正常使用技能的行为观察来还原其功能,即“文件保密并不等于功能保密”。为此,论文提出一种黑盒攻击方法 SkillClone,其核心思路是:首先根据技能公开广告(如描述、示例)形成接口假设,然后向目标技能发送结构化的良性探测请求,收集合法的输入-输出对,再据此合成一个可执行的复刻版本,最后通过差分验证(differential validation)反复迭代修复该复刻版本,使其在更多测试输入上逼近原技能的行为。作者在 30 个覆盖规则、表格、流程和算法类技能上进行了评估,结果显示 SkillClone 对多个目标在留出测试输入上实现了完全或部分的功能恢复;迭代查询可以弥补单轮重建中的遗漏。实验还表明,仅依赖“防止内容泄露”的现有防御对这类攻击的覆盖有限,而更简略的技能描述也无法有效阻止行为层面的泄露。论文的核心贡献在于揭示了一种新型攻击面:攻击者仅通过合法交互即可克隆隐藏技能的功能,从而绕过传统披露型防护。该研究面向 LLM Agent 安全、AI 系统隐私保护、以及 AI 服务提供者,提醒防御方必须将“行为侧信道”纳入威胁模型,并设计限制累积信息泄露的机制。

💡 推荐理由: 该研究揭示了 LLM Agent 技能防护的新盲区:即使隐藏了底层实现,攻击者仍可通过正常的黑盒交互重建功能。这对依赖‘文件保密’的 AI 服务提供商构成实际威胁,也影响 Agent 生态中知识产权与敏感逻辑的保护设计。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: A. Krylov, D. Rakhov, V. Veselova, D. Bolokhov, Oleg Y. Rogov

该论文提出了一种基于大语言模型引导的演化框架(结合GigaEvo和OpenEvolve),用于对感知哈希算法(PHA)实施有针对性的黑盒第二图像攻击。感知哈希算法广泛应用于图像篡改检测,但对抗性扰动的鲁棒性研究不足。作者设计了一个复合评分函数,综合考虑攻击成功率(归一化汉明距离低于阈值的对抗样本比例)、对哈希函数的查询次数以及相对于原始图像的L2失真度。在pHash、PDQ、PhotoDNA和NeuralHash四种部署的PHA上,使用30对ImageNet图像进行实验,结果表明:与现有黑盒基线相比,该方法能以更少的查询次数达到相当或更高的攻击成功率,同时产生更低的L2失真。最佳演化程序将预定义的复合攻击评分降低了:NeuralHash 41.2%、PDQ 38.3%、pHash 34.0%、PhotoDNA 8.1%。该方法不需要PHA内部知识,能自然处理哈希输出的不可微离散性。这些结果揭示了广泛部署的内容审核流水线中此前未被报告的安全漏洞,并激励开发可证明鲁棒的感知哈希方案。适合安全研究员、内容审核系统开发者以及对抗性机器学习研究者阅读。

💡 推荐理由: 揭示了广泛部署的感知哈希算法(PhotoDNA、pHash、PDQ、NeuralHash)在黑盒攻击下的脆弱性,威胁内容审核和图像取证的安全性。

🎯 建议动作: 研究跟进并评估自身内容审核流水线中使用的哈希算法的鲁棒性

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yan Pang, Tianhao Wang 0001

本文针对近年流行的扩散模型(diffusion models)提出了一种新的黑盒成员推理攻击(Membership Inference Attack, MIA)框架。随着预训练扩散模型的高质量发布,越来越多的用户下载这些模型并使用下游数据集进行微调,这带来了显著的隐私泄露风险。作者首次基于分数(scores-based)设计了适用于扩散模型的成员推理攻击,并在更严格的黑盒访问设置下进行。该框架考虑了四种不同的攻击场景和三种攻击类型,能够针对任何流行的条件生成器模型,实现了高达0.95的AUC(Area Under Curve)精度。代码已开源。研究揭示了扩散模型在下游任务微调中的隐私脆弱性,为后续防御研究提供了基准。

💡 推荐理由: 首次系统性地针对扩散模型提出黑盒成员推理攻击,展示了微调下游任务中严重的隐私泄露风险,对模型安全部署和隐私保护研究具有重要警示意义。

🎯 建议动作: 研究跟进:将该攻击作为隐私风险评估的基线,开发相应的防御机制。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Cheng-Yi Lee, Yichi Zhang, Yuchen Yang, Chun-Shien Lu, Jun-Cheng Chen

本论文针对潜在扩散模型(LDM)中语义水印的黑盒伪造攻击进行了重新思考。此类水印通过将信息嵌入到LDM的初始噪声中,但现有研究显示其在黑盒场景下易受伪造攻击,且缺乏对攻击成功条件的严格理论理解。为弥补这一空白,作者从潜在空间中的率失真理论视角出发,分析了伪造攻击的本质。研究发现,由于代理模型与目标模型之间存在结构不匹配,会产生一个不可约的失真下限,这从根本上限制了伪造水印的保真度。进一步,作者将这种失真表征为潜在流形上的结构化几何偏差,包括全局漂移和局部变形,而非随机噪声。基于这些洞察,作者提出了一种与具体方案无关的检测方法,能够在执行水印验证之前区分伪造样本。大量实验表明,该方法在多种黑盒场景下均有效,同时对常见失真保持鲁棒性。该工作为理解语义水印的安全性与设计可泛化的防御机制提供了理论依据。

💡 推荐理由: 语义水印是保护LDM生成内容版权的关键技术,但黑盒伪造攻击威胁其可靠性。本文提出的检测方法能有效识别伪造,对数字水印安全防御具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Pedram MohajerAnsari, Amir Salarpour, David Fernandez, Mert D. Pesé

本文提出了一种名为BAAA(Budget-Aware Adaptive Adversarial Patches)的新型黑盒对抗性补丁攻击方法,针对现代目标检测器(如YOLOv5、Faster R-CNN、YOLOS)。现有对抗性补丁攻击存在三个主要不足:1)在严格查询预算下,联合优化补丁位置、纹理和大小的基于评分的黑盒攻击较少;2)攻击成功与否很少与补丁的视觉占用面积(footprint)关联;3)评估常混淆EOT(期望变换)鲁棒性与纯图像抑制。BAAA结合了上下文Thompson采样定位器(Contextual Thompson-Sampling placer)和NES风格像素更新,并自适应地扩大补丁大小(仅在优化停滞时增长)。评估采用严格的纯图像抑制测试,EOT仅用于审计而非成功标准,并引入可选的外观/可打印性权重以揭示强度-可见性权衡。实验表明,BAAA在CNN-based检测器上实现强抑制,在transformer-based检测器上实现显著抑制,且相比固定尺寸和启发式基线,清晰展示了查询-占用面积权衡。物理打印-拍摄实验进一步验证了跨未见物理对象和视角的迁移性。本文适合AI安全研究者、对抗性攻击防御者及目标检测系统开发者阅读。

💡 推荐理由: 揭示了黑盒场景下对抗性补丁在有限查询预算内的可操作性,强调了补丁占用面积与攻击效果的关系,为设计更鲁棒的目标检测防御提供了新视角。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yingzhe He, Guozhu Meng, Kai Chen 0012, Xingbo Hu, Jinwen He

本文提出了一种名为DRMI(基于互信息的数据集缩减技术)的方法,旨在优化黑盒攻击中的数据集使用效率。在黑盒攻击场景下,攻击者需要频繁查询目标模型以生成对抗样本,而数据集规模直接影响查询开销和攻击速度。DRMI通过计算样本与标签之间的互信息,量化每个样本对攻击成功率的贡献,从而筛选出最具代表性的子集,有效压缩训练数据集的大小。实验采用多种黑盒攻击算法(如遗传算法、基于梯度的替代方法)在CIFAR-10、ImageNet等标准数据集上进行验证,结果显示DRMI在缩减数据集至原规模的10%-30%时,仍能保持相近的攻击成功率(平均下降不超过2%),同时显著降低查询次数和时间成本。该方法的核心优势在于无需访问模型内部结构,适用于任意黑盒攻击流水线,并可作为预处理步骤集成到现有工具中。论文还探讨了不同互信息估计器的选择对结果的影响,并与随机采样、基于梯度的重要性采样等方法进行了对比,证明了DRMI在保持攻击效果方面的优越性。

💡 推荐理由: 研究揭示了攻击者如何通过数据筛选降低攻击成本,帮助蓝队理解黑盒攻击的经济性,从而针对性优化防御策略。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)