#adversarial-examples

共收录 12 条相关安全情报。

← 返回所有主题
👥 作者: Ziming Zhao 0008, Zhaoxuan Li, Tingting Li 0004, Zhuoxue Song, Fan Zhang 0010, Rui Zhang 0016

本论文探讨图像水印扰动作为对抗性噪声时,对深度学习模型产生的欺骗威胁。传统对抗样本 (AE) 检测方法通常假设噪声为典型的扰动模式(如 Lp 范数约束),因此面对嵌入水印标志这类结构化噪声时往往失效,即水印扰动 AE 可绕过现有检测。文章提出 Themis,一种无需修改受保护分类器、也不依赖 AE 生成过程的检测方法。Themis 基于可用信息论(Usable Information Theory)计算每个样本的点级得分(pointwise score),利用该得分识别出可能经过水印扰动的异常实例。实验涵盖 5 种不同标志的水印扰动,在图像分类任务上,Themis 的检测准确率比五种 SOTA 检测方法平均提升超过 15%;可视化表明其得分在 AE 与非 AE 之间具有明显可分离性;并且 Themis 在广泛阈值下实现更大的 ROC 曲线下面积 (AUC),显示了良好的阈值鲁棒性。计算开销仅约 0.04 秒,适合近实时应用。由于 Themis 不干扰原分类器,可作为一种外挂式防御组件。本文对该领域的主要贡献在于把可用信息论引入水印对抗样本检测,解决了水印噪声结构化与异质性的难点,并通过对比实验证实了有效性。

💡 推荐理由: 针对水印扰动的 AE 检测是当前防御盲区;Themis 采用可用信息论方法,无需修改模型,检测精度显著优于现有方案,为版权水印场景下的模型安全提供了新工具,值得防御方关注。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Heng Li 0008, Zhang Cheng, Bang Wu 0002, Liheng Yuan, Cuiying Gao, Wei Yuan 0001, Xiapu Luo

本文研究基于函数调用图(FCG)的Android恶意软件检测方法在面对对抗样本时的脆弱性,并提出了一种名为BagAmmo的新型黑盒对抗攻击方法。现有FCG检测方法(如MaMaDroid、APIGraph、GCN)虽性能优异,但攻击者可通过向恶意代码中插入“永不执行”的函数调用来扰动FCG特征,从而绕过检测。攻击面临两大挑战:一是保证恶意软件原始功能不受扰动影响,二是在完全未知目标系统内部信息(如图特征粒度和输出概率)的条件下实施攻击。为解决功能保持问题,BagAmmo采用try-catch陷阱机制插入函数调用,使注入的调用在运行时不会真正执行,从而不改变恶意行为。为解决信息缺失问题,BagAmmo借鉴生成对抗网络(GAN)架构,利用多种群协同进化算法(Apoem)生成期望的扰动;每个种群代表一种可能的特征粒度,当算法收敛时即可逼近真实特征粒度。作者在超过44k个Android应用和32个目标模型上进行了大量实验,评估了攻击的有效性、效率和鲁棒性。结果表明,BagAmmo在MaMaDroid、APIGraph和GCN上平均攻击成功率超过99.9%,并且在概念漂移和数据不平衡场景下仍表现良好;同时,BagAmmo在攻击成功率上优于当前最先进的攻击方法SRL。该研究揭示了FCG检测系统的安全隐患,为提升检测器的鲁棒性提供了新的对抗视角。

💡 推荐理由: 该研究揭示了主流FCG恶意软件检测模型的严重脆弱性,攻击者可在完全黑盒条件下以极高成功率绕过检测,对Android安全防御体系构成实际威胁。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xinfeng Li, Chen Yan 0001, Xuancun Lu, Zihan Zeng, Xiaoyu Ji 0001, Wenyuan Xu 0001

自动语音识别(ASR)系统已广泛应用于智能助手、语音控制、电话客服、会议转写等场景,其安全性直接关系到用户隐私和设备控制权。已有研究表明,ASR系统容易受到对抗样本(Adversarial Examples, AEs)的攻击,通过引入精心设计的微小扰动,可以诱导识别系统输出攻击者指定的错误文本。然而,许多既有对抗样本在物理世界中可能具有可听性,容易被用户察觉,从而降低攻击的隐蔽性和实用性。针对这一局限,本论文(标题为“Inaudible Adversarial Perturbation: Manipulating the Recognition of User Speech in Real Time”)提出了一种不可听的对抗扰动方法,目标是在实时场景下操纵用户语音的识别结果。该扰动的核心特点是人类听觉上难以察觉,但能够被ASR系统感知并导致误识别。论文可能利用人耳听觉系统的掩蔽效应或超声波等机制来生成此类不可听扰动,但具体的生成算法和架构细节在摘要中未明确给出。研究的主要贡献在于揭示了一种更为隐蔽的ASR攻击途径,使攻击者可以在用户无感的情况下控制语音识别结果,从而对智能设备或语音交互系统构成切实威胁。本篇摘要仅包含一句关于ASR系统易受对抗样本攻击的陈述,未提供实验数据、技术细节或评估结果,因此所有内容仅基于标题和该抽象句进行合理归纳。该研究适合语音安全研究者、ASR系统开发者以及关注对抗机器学习的安全从业者阅读,有助于理解下一代语音攻击的潜在形态。

💡 推荐理由: 语音助手和声控设备日益普及,如果攻击者能在用户无感知的情况下篡改语音识别结果,可能导致设备执行恶意指令、泄露隐私或造成安全事件。防御者需提前了解此类不可听攻击的存在,并评估自身系统的抗性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Hanbin Hong, Xinyu Zhang 0016, Binghui Wang, Zhongjie Ba, Yuan Hong 0001

该论文提出了一种全新的黑盒对抗攻击范式——可认证黑盒攻击(Certifiable Black-Box Attacks),旨在从理论上保证攻击成功率(Attack Success Probability, ASP),而不像传统黑盒攻击那样依赖对目标模型的反复查询或从一个替代模型迁移对抗样本。作者首先指出现有最先进的防御手段(如检测查询模式或给模型输入注入噪声等)能够有效缓解当前黑盒攻击,而他们提出的新攻击能够以可证明的高概率击穿这些防御。核心方法包括:建立随机化对抗样本(Randomized Adversarial Examples)的ASP理论分析框架,从数学上保证攻击的有效性;在此基础上设计多种随机化样本生成算法,通过控制扰动强度来保持隐蔽性;最终在CIFAR-10/100、ImageNet和LibriSpeech等多个数据集上进行实验,与16种主流黑盒攻击和多种SOTA防御(涵盖视觉和语音识别)进行比较。实验证实,基于该算法构造的对抗样本在无需查询目标模型的情况下,即可获得理论保证的高ASP,并且攻击效果相对传统经验攻击更为可靠。该研究首次将“可认证”机制引入攻击侧,揭示了当前防御体系可能存在结构性盲区,为评估机器学习模型在对抗环境下的真实鲁棒性提出了新挑战。

💡 推荐理由: 该研究首次提出可认证黑盒攻击,赋予对抗样本理论上可证明的成功率,使现有依赖经验验证的防御难以有效应对。防御者必须重新审视鲁棒性评估体系,关注这种不受查询限制且具备数学保证的新型威胁。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Hamid Dashtbani, Mehdi Dousti Gandomani, AmirMahdi Sadeghzadeh

该论文针对黑盒场景下基于得分的对抗样本攻击提出了一种新的防御方法。作者首先指出现有基于随机化的防御虽然能够降低攻击成功率,但往往以牺牲模型准确率或导致置信度分数严重失真为代价。为此,他们提出了随机对数缩放(Random Logit Scaling, RLS)方法,这是一种即插即用的后处理防御,可以在不修改原模型的前提下直接部署。RLS的核心思想是在模型输出层对logits进行随机缩放,从而输出混淆后的分数,使攻击者难以基于返回的分数高效构造对抗样本,同时通过精心设计的缩放分布保持模型原本的分类准确率和置信度可靠性。实验表明,RLS在多种最先进的黑盒得分攻击(如基于梯度估计的ZOO、SimBA等)下,能显著降低攻击成功率,且相比其他随机化防御(如随机平滑、随机变换)在准确率和置信度距离上均有明显优势。此外,论文还构造了一种针对现有非随机化黑盒防御AAA的自适应攻击,揭示了该类修改输出logits的防御在自适应攻击下的脆弱性,从而强调了随机化带来的安全增益。该研究适合机器学习安全领域的研究者和工程人员,尤其是需要为已有模型快速添加低成本防御的团队。

💡 推荐理由: 提出一种简单有效的可插拔防御,能显著提升黑盒得分攻击下的模型鲁棒性,无需重新训练,适合工程化落地。

🎯 建议动作: 研究跟进,评估RLS在自身模型上的效果

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhenpeng Li

本文研究大型语言模型(LLM)作为网络入侵检测分类器时的对抗鲁棒性,重点关注现实攻击者约束下的脆弱性。作者提出了一种可控制性感知的黑盒迁移攻击框架,针对基于LLM的网络流量分类器。该框架根据网络通信语义将流特征划分为直接可控(DC)、间接可控(IC)和不可控(UC)三组,仅对DC特征施加扰动,同时冻结IC/UC特征,以确保生成的对抗样本符合网络协议约束。通过共享XGBoost替代模型,作者实现了有限差分PGD、贪心坐标扰动和NES三种对抗样本生成方法,并将这些样本迁移到七个LLM目标(包括不同架构和规模)以及两个传统机器学习目标(LightGBM等)。实验覆盖了从1999年至2022年的五个入侵检测基准数据集(NSL-KDD、UNSW-NB15、CIC-IDS-2018、RT-IoT2022、HIKARI-2021),共生成超过50万个对抗样本。主要发现包括:LLM的迁移脆弱性显著,但高度依赖于数据集和比较对象;与LightGBM相比,LLM在RT-IoT2022和CIC-IDS-2018上更脆弱,在NSL-KDD和UNSW-NB15上相当,在HIKARI-2021上反而更鲁棒;与平均ML基线相比,LLM在所有五个数据集上均表现出更高的攻击成功率(ASR)。进一步观察到了跨架构一致的迁移层次:基于梯度和评分的扰动(PGD、NES)比贪心扰动具有更强的跨模型迁移能力,该现象在全部27个LLM配置和9/10个ML配置中成立。交叉替代模型验证(使用决策树、神经网络和线性替代模型)得到了相似的LLM攻击成功率,排除了XGBoost特有偏差。由于框架设计保证了扰动仅限于DC特征,约束违反率严格为零。本文系统揭示了LLM在流量分类任务中的对抗脆弱性特征,为后续防御研究提供了基础。

💡 推荐理由: 首次系统性评估LLM作为网络入侵检测分类器在真实约束下的对抗鲁棒性,揭示其迁移脆弱性显著且因数据集而异,为部署LLM的IDS系统提供关键安全预警。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Christian Scano, Diego Soi, Angelo Sotgiu, Luca Demetrio, Davide Maiorca, Giorgio Giacinto, Fabio Roli, Battista Biggio

本文关注机器学习驱动的安卓恶意软件检测器在问题空间(problem space)中的对抗性攻击。现有攻击方法存在诸多不足:大多数技术通过软件移植注入完整良性模块,引入大量副作用特征,且常导致构建失败;细粒度方法仅注入少量组件,效果有限;使用混淆的方法依赖脆弱的字节码重写,生成的APK虽然在语法上有效,但语义上不可用。此外,先前研究仅通过安装和基本执行的冒烟测试评估攻击成功率,忽略了修改后的APK是否仍保持原始功能。为解决这些问题,作者提出DROIDBREAKER框架,它是一个实用且功能完整的问题空间攻击框架,提供以下能力:(i) 仅操纵对目标模型最具影响力的APK组件,实现查询高效的白盒和黑盒攻击;(ii) 一组细粒度、构建安全(build-safe)的操作(包括注入和混淆API调用、应用模块、权限和URL),副作用最小;(iii) 语义保持的功能测试,通过比较原始APK与修改后APK的执行日志和API级轨迹来强制执行运行时等价性。在最新版安卓应用数据集上的实验表明,DROIDBREAKER在白盒和黑盒设置下均能以少量查询实现高逃避率,并显著降低VirusTotal上商业恶意软件扫描器的检测率。该工作揭示了当前安卓恶意软件检测器在面对刻意构造的对抗性样本时的脆弱性。

💡 推荐理由: 该研究展示了现有安卓恶意软件检测器在面对实用性对抗样本时的严重缺陷,对安全从业者理解检测模型鲁棒性、改进防御策略具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Nasrin Malekzadeh Goradel, Niccolo Pancino, Yaser Gholizade Atani, Benedetta Tondi, Giovanni Bellettini, Mauro Barni

这篇论文系统研究了输入维度(input dimensionality)在深度神经网络对抗样本产生和定向控制中的作用。作者首先分析了现有基于测度集中(concentration of measure)的理论框架的适用范围与局限性,发现真实图像类别表现出强烈的经验局部化(empirical localization),超出了这些理论的典型假设。随后,他们利用涵盖不同输入维度范围的层级图像数据集和多种神经网络架构进行了大规模实证评估。结果表明,随着输入维度的增加,构造对抗样本(包括无目标和有目标攻击)变得更加容易。针对有目标攻击的额外难度,作者通过理论论证指出,高维几何特性使得强制攻击者指定特定目标标签所需的额外扰动相对于无目标攻击非常有限,并且这一差距随着维度升高而进一步缩小。实验也证实了这一点。总体而言,这项研究确立了高输入维度是对抗样本出现及其定向控制的一个基本因素,但该现象究竟源于高维几何与数据分布的相互作用,还是深度神经网络架构本身的特性,仍有待进一步探索。本文对理解对抗攻击的机理和设计更鲁棒的模型具有重要参考价值。

💡 推荐理由: 揭示输入维度是影响对抗样本易生成性的关键因素,有助于安全从业者从根源上理解对抗脆弱性,并为开发更有效的防御策略提供理论基础。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yijun Yang, Ruiyuan Gao 0001, Yu Li 0007, Qiuxia Lai, Qiang Xu 0001

该论文聚焦于深度神经网络(DNN)在安全关键领域(如自动驾驶)中面临的对抗性样本威胁。现有防御方法存在诸多局限:只能防御部分对抗性样本,或导致正常输入的高精度损失,且多数无法抵御自适应攻击(即攻击者了解防御机制后针对性构造的样本)。作者观察到一种语义矛盾现象:人类对图像的感知与网络内部表征之间存在差异。基于此,提出一种新的检测方法,通过比较网络输出与人类可理解的语义标签是否一致来识别对抗性样本。具体地,该方法利用一个额外的语义一致性校验模块,该模块从网络中间层提取特征,并与输入的语义标签进行对比,若不一致则判定为对抗性样本。实验在多个基准数据集(如ImageNet、CIFAR-10)和多种攻击手段(FGSM、PGD、CW等)下进行,结果表明该方法能有效检测多种对抗性样本,同时对正常输入的精度损失极小。此外,该方法在自适应攻击下仍能保持较高检测率,展现了较好的鲁棒性。主要贡献包括:首次系统性地利用语义矛盾检测对抗性样本;提出一种轻量级、可插拔的检测模块,降低部署成本;通过大量实验验证了方法的有效性。该研究适合计算机视觉安全、DNN鲁棒性领域的研究人员及安全工程师阅读。

💡 推荐理由: 针对对抗性样本的现有防御普遍存在覆盖不全或影响正常性能的问题,该论文提出的基于语义矛盾的检测方法在保持高检测率的同时几乎不损失正常输入精度,且能抵抗自适应攻击,为实际部署提供了更实用的解决方案。

🎯 建议动作: 研究跟进:评估该方法在自身业务场景中的适用性,并考虑集成到现有防御体系中。

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Matan Ben-Tov, Daniel Deutch, Nave Frost, Mahmood Sharif

该论文提出了CaFA(Cost-aware Feasible Attacks)系统,旨在评估神经网络表格分类器在实际应用中对抗攻击的鲁棒性。表格数据具有结构化特征和复杂的相互关系,现有对抗攻击方法往往忽略攻击的可行性(即对抗样本在问题空间中是否可实现)以及攻击者的成本(如扰动特征数量和幅度)。CaFA通过两个核心组件解决这些问题:(1)TabPGD算法,一种针对表格数据定制的投影梯度下降变体,能够生成特征空间中的对抗扰动,同时考虑表格特征的异质性(如分类和连续特征);(2)利用数据库技术中自动挖掘的完整性约束(如函数依赖、否定约束等)将特征空间的对抗样本投影到满足这些约束的可行区域,从而确保生成的对抗样本在现实世界中可实现。在三个数据集(如信用卡欺诈检测、贷款审批等)和两种神经网络架构上的实验表明,CaFA相比基线方法(如FGSM、PGD等)具有更高的可行成功率(即被误分类且满足约束的样本比例),同时扰动的特征数量更少、幅度更低,使得攻击更隐蔽且成本更低。此外,CaFA挖掘的约束在声音性和完备性方面优于先前工作。论文还开源了CaFA系统,希望为机器学习工程师提供通用工具,评估模型对可实现攻击的鲁棒性,从而提升部署模型的信任度。

💡 推荐理由: 表格数据在金融、医疗等领域广泛使用,但现有对抗攻击方法常忽视现实可行性。CaFA通过数据库约束确保攻击可实现,为评估表格分类器真实鲁棒性提供了更严格的方法,对构建可信AI具有直接价值。

🎯 建议动作: 研究跟进:评估CaFA对自身表格模型的测试效果,并考虑将其纳入鲁棒性评估流程。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Giulio Lovisotto, Henry Turner, Ivo Sluganovic, Martin Strohmeier, Ivan Martinovic

本文提出一种新型物理对抗性样本生成技术——短时对抗性扰动(SLAP)。传统静态对抗性补丁存在明显、半永久、无法修改等缺点,而SLAP利用投影仪将精心设计的对抗性扰动实时投射到真实物体上,使其转化为对抗性样本。攻击者可以动态开关或修改投影,且不受空间限制,更难被察觉。作者以自动驾驶场景为测试对象,针对车辆检测器和交通标志识别系统(特别是停止标志检测)进行实验。在多种环境光照条件(包括室外)下,SLAP在非明亮环境中表现出极高鲁棒性,对最先进的神经网络(如YOLOv2)在多种角度和距离下实现高达99%的误分类成功率。此外,SLAP生成的对抗性样本不会表现出传统对抗性补丁的可检测特征,从而绕过了SentiNet等物理对抗性检测方法。作者还评估了包括对抗性训练在内的自适应防御措施,即使在有利的攻击条件下,对抗性训练也能将攻击成功率降低80%。该研究揭示了物理对抗性攻击的新途径,对自动驾驶安全具有重要意义。

💡 推荐理由: SLAP引入了一种隐蔽且动态的物理对抗攻击方法,能绕过现有检测机制,对自动驾驶等物理安全关键系统构成新威胁。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Jie Zhang, Pura Peetathawatchai, Florian Tramèr, Avital Shafran

本论文研究视觉语言模型(VLM)作为可信权威时面临的安全威胁。作者提出了一种新型攻击范式——AI权威洗钱(AI authority laundering):攻击者通过对图像施加人眼几乎不可察觉的对抗性扰动,诱导VLM对错误的视觉输入产生自信且权威的回应。与越狱攻击或提示注入不同,该攻击不破坏模型的对齐(alignment),而是完全作用于感知层面,因此传统安全防护措施难以检测。作者利用公开可用的CLIP模型生成对抗性样本,成功迁移至多个商业生产级VLM,包括GPT-5.4、Claude Opus 4.6、Gemini 3和Grok 4.2。实验覆盖四个攻击面:放大错误信息、贬低个人、逃避内容审核以及操纵产品推荐。在身份操纵和NSFW(不适宜工作场所)内容规避的数百次攻击中,六种模型的成功率在22%至100%之间。值得注意的是,攻击并未使用新颖算法,而是采用十余年前已知的基本对抗性技术,这表明攻击者的能力下限已经足以构成实际威胁。作者认为,视觉对抗鲁棒性现在是一个实际且尚未解决的安全问题。该研究适合VLM开发者、安全工程师及AI政策制定者阅读。

💡 推荐理由: 揭示VLM在实际部署中因感知层攻击导致的权威滥用风险,可能被用于传播误导信息、操纵内容审核和产品推荐,而传统基于对齐的防御措施无效。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)