#adversarial attack

共收录 17 条相关安全情报。

← 返回所有主题
👥 作者: Zhihao Wu, Yushi Cheng, Shibo Zhang, Xiaoyu Ji 0001, Wenyuan Xu 0001

人脸认证系统广泛应用于门禁等安全场景,但已有研究证明其易受对抗性攻击。然而,现有攻击通常要求攻击者在每次认证时佩戴眼镜或帽子等伪装,易引起怀疑且攻击效果有限。本文提出UniID攻击,允许内鬼通过佩戴对抗性补丁注册一个“通用身份”到人脸认证数据库,随后多个攻击者无需任何伪装即可实施人脸欺骗攻击。具体地,作者首先通过特征工程选择合适的攻击者,然后采用多目标联合优化方法生成所需的对抗性补丁,最后解决实际挑战,如提高对抗性补丁在黑盒系统中的迁移性以及在物理世界中的鲁棒性。在实验室环境中,使用六个人脸识别模型(FaceNet、Mobile-FaceNet、ArcFace-18/50、MagFace-18/50)和两个商业人脸认证系统(ArcSoft、Face++)进行评估。仿真和真实世界实验结果表明,在3用户场景下,白盒设置中攻击成功率可达100%,黑盒设置中为79%,且可扩展至8个以上用户。

💡 推荐理由: 该研究揭示了一种更隐蔽的人脸认证攻击方式:通过一次注册即可实现后续多用户无伪装欺骗,对依赖人脸识别的门禁、支付等系统构成严重威胁,需引起安全从业者重视。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiale Zhao, Jiajun Wan, Lei Tang, Ye Qin, Kebing Jin, Jinghui Qin

本文揭示了当前深度伪造检测器的一个根本盲点:现有检测器擅长捕获数字合成伪影,但当AI生成的内容被伪装成具有真实物理成像特征时,其有效性会大幅下降。作者指出,真实照片固有硬件相关的统计签名,这些签名由光学传感器和图像信号处理(ISP)流水线印刻,是难以察觉的足迹,而纯数据驱动的生成模型根本缺乏这些特征。基于这一洞察,提出ISPCloak——一种无需优化的对抗性攻击框架,通过武器化ISP流水线来误导深度伪造检测器的判断。该方法首先使用可逆ISP网络将图像投影到RAW域,然后通过注入真实的泊松-高斯传感器噪声并执行前向ISP重建,将真实相机的复杂统计先验无缝嵌入到AI生成的图像中。结合生成伪影抑制和自适应掩码,这种简化的物理仿真能够超快生成对抗样本。大量实验表明,嵌入真实的物理扰动从根本上破坏了大量现有检测机制,能以几乎不可见的视觉变化生成普遍具有逃避性的对抗样本。该工作主要贡献在于提出了一种新颖的物理对抗攻击方法,揭示了当前检测范式的脆弱性。适合从事深度伪造检测、对抗性机器学习、以及数字取证领域的研究人员和工程师阅读。

💡 推荐理由: 本文揭示了现有深度伪造检测器忽视物理成像特征盲点,提出一种高效、无需优化的物理对抗攻击,可能使主流检测方法失效,对AI安全防御提出新挑战。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Pankaj Kumar, Subhankar Mishra

该论文首次系统性地研究了图基础模型(Graph Foundation Models, GFMs)中“对齐层”(alignment layer)这一独特攻击面。图基础模型通过将不同领域的图输入映射到一个共享表示空间,然后进行任务推理,这一映射层是对齐层,它将GFM与普通图神经网络区分开来。作者在推理时(无训练访问权限)攻击六个公开的GFM,包括基于谱分词器、文本嵌入空间和离散码本的模型。在表示空间中进行定向扰动,所有模型均会崩溃,但预算与普通图网络表示范数相当;例外是OpenGraph,其谱分词器在五分之一的预算下即崩溃,表明对齐层特有的脆弱性,而普通图网络不共享此脆弱性。通过控制表示层解码器部分的相同表示进行归因分析,确认脆弱性来自分词器而非解码器。此外,可实现的输入空间攻击(编辑边、特征或文本)在六个模型中的三个上使至少一半的正确预测失效。攻击者利用输入访问实现脆弱性的程度与解码器直接读取表示的程度正相关,而非与任务准确率正相关。作者通过解码器局部Lipschitz敏感性结构性地测量了这种“传播增益”,并指出干净准确率裕度作为模型内排序启发式在实际攻击中不成立。该研究揭示了GFM对齐层是一个重要的新攻击面,对AI安全社区具有参考价值。

💡 推荐理由: 图基础模型是AI前沿,本文首次揭示其对齐层是独特攻击面,与普通图神经网络不同,为防御者提供了新的安全考量。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xingkai Peng, Jun Jiang, Jiayang Liu, Kejiang Chen, Weiming Zhang

本文针对文本到视频(T2V)生成模型的越狱攻击问题展开研究。现有越狱方法多从文本到图像攻击迁移而来,但未能充分利用视频生成固有的时间一致性特性,且需要大量视频查询优化,不适用于实际黑盒场景,其对抗性提示搜索也依赖启发式局部信号,缺乏结构化探索策略。为此,作者提出BSB(Between Safe Boundaries)框架,这是一种结构化、查询高效的越狱方法。BSB的核心思想是利用时间一致性,将有害意图编码为两个看似无害的边界状态之间的过渡,使得在视频生成过程中,插值这些边界状态会产生不安全的中间帧。攻击目标即找到这样的边界状态对。为降低计算开销,BSB在廉价的文本代理空间中使用蒙特卡洛树搜索(MCTS)进行探索,并定期用稀疏的视频级评估校准搜索结果。实验在Veo 3.1、Sora 2、Seedance和Kling v1等主流商业T2V模型上进行,结果显示BSB在攻击成功率上平均超越现有最强基线18.6%。该工作揭示了时间一致性是T2V模型中一个被忽视但重要的攻击面,并验证了结构化搜索在有限查询预算下有效发现漏洞。

💡 推荐理由: 首次系统研究T2V模型的时间一致性攻击面,提出的BSB框架在限查询黑盒场景下高效发现漏洞,对评估和提升多模态生成模型安全性具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiarui Li, Joseph Brewington, Qingzhao Zhang, Z. Morley Mao

该论文提出了 Banshee,一种针对无人机(UAV)中基于云台稳定视觉跟踪系统的物理可实现攻击方法,通过声学注入诱导目标切换。现有研究表明声学信号可以干扰云台内部工作,但尚未充分探索对实际应用(如无人机跟踪与跟随)的影响。Banshee 利用云台-相机系统的声学漏洞,精心设计声学波形以产生优化对抗性云台振荡,从而引起方向性偏置的相机视角漂移,破坏帧间目标关联,使得机载跟踪器以高概率从原始目标切换到攻击者选定的对象,并偶尔导致目标丢失。在仿真中,针对两个商用云台系统和五个跟踪器,Banshee 实现了 93.6% 的成功率;在真实桌面和飞行黑盒攻击测试中,针对商用无人机在多种场景下总体攻击成功率达 95.5%。该研究揭示了声学与视觉之间的跨域漏洞,强调了云台系统和应用鲁棒性设计的必要性。代码已在 GitHub 开源。

💡 推荐理由: 首次展示了对真实无人机视觉跟踪系统的物理可实现目标切换攻击,揭示了声学注入对云台稳定系统的实际威胁,对无人机安全、对抗性机器学习及物理世界攻防有重要启示。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhangheng LI, Jianing Zhu, Junyuan Hong, Sungmin Eum, Shuowen Hu, Suya You, Zhangyang Wang

该研究针对多模态大语言模型(MLLM)中的机器遗忘(Machine Unlearning)机制的安全性提出质疑。MLLM在训练时可能无意中编码了隐私敏感数据,因此多模态机器遗忘(MMU)被用于强制模型遗忘这些信息。但作者发现,当模型公开后,恶意用户可通过一种名为“提示优化参数抖动”(POPS)的对抗策略,近乎完整地恢复出本应被遗忘的知识。POPS方法包含两个阶段:首先通过后缀优化(prompt-suffix optimization)诱导受害者模型生成潜在的隐私样本;然后利用这些合成输出对模型进行微调,从而揭露真实的隐私信息。实验在多个MMU基准测试上进行,结果表明现有MMU算法存在严重缺陷,POPS能够实现近乎完全的知识恢复,揭示了基于MMU的隐私保护存在根本性漏洞。该论文对MLLM隐私保护领域提出了严峻挑战,提示安全从业者需要重新审视和加强遗忘机制的鲁棒性。

💡 推荐理由: 该研究暴露了多模态大模型机器遗忘机制的根本性脆弱性,证明即使模型执行了遗忘操作,攻击者仍可通过对抗方法恢复隐私信息,威胁到数据隐私保护的有效性。

🎯 建议动作: 研究跟进,评估自身模型的机器遗忘机制是否易被类似POPS方法攻破,并部署对抗测试流程。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuefang Lian, Longkun Guo, Zhongrui Zhao, Zhigang Lu, Yanan Cai, Shuchao Pang, Dachuan Xu, Jason Xue

本论文聚焦于可信AI中数据摘要环节的对抗鲁棒性问题。数据摘要作为上游组件,决定哪些信息被保留并传递给下游学习或决策模块,因此针对摘要过程的对抗扰动可能以“上游”方式破坏可信AI:它们可能改变选定的摘要、降低其代表性,并进一步损害后续学习任务的效果。本文在相似度层级扰动下,通过DR-子模优化研究连续数据摘要的对抗攻击。首先,作者证明一类多分辨率图像摘要目标可被建模为非负子模集合函数的多线性扩展,并满足具有m-弱单调性的DR-子模性质。然后,他们将多目标攻击生成形式化为一个极小极大问题,在该问题中优化一个相似度结构的可容许扰动,以同时破坏多个目标摘要模型。为了缓解此类扰动,他们将针对混合攻击类型的鲁棒防御形式化为一个正则化的极大极小问题。对这两个问题,作者均开发了具有理论保证的近似算法。在真实数据和受控聚类基准上的实验表明,所提出的攻击在具有代表性的低到中等预算范围内是有效的,并能导致下游任务性能下降。所提出的防御在结构化设置中改善了鲁棒性与缓解效果之间的权衡,同时也揭示了真实数据上鲁棒保护的参数敏感性。本文主要面向AI安全、对抗机器学习、以及数据摘要领域的研究者和工程师。

💡 推荐理由: 揭示了数据摘要环节作为AI管道上游组件的脆弱性,攻击可间接损害下游任务,为构建端到端可信AI系统提供了新的防御视角。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Omid Ahmadieh, Nima Karimian

本文提出了一种名为 Adv-TGD 的生成式对抗攻击框架,用于对人脸识别系统实施身份冒充攻击。该框架基于 Stable Diffusion,通过对每个源-目标身份对进行轻量级 LoRA 微调,生成逼真的人脸图像,能够欺骗主流人脸识别模型。与传统方法不同,Adv-TGD 在单步去噪过程中优化交叉注意力适配器,并通过人脸局部热图掩码约束潜在空间混合,确保身份操纵的精确性和非敏感区域的保真度。损失函数结合了掩码 MSE 重建、身份嵌入空间的阈值化差异、方向特征对齐以及源相似度抑制,以平衡攻击效果与视觉真实性。此外,可选的 LLaVA 生成属性提示可增强细粒度语义细节而不引入身份线索。在黑盒评估协议下,Adv-TGD 在 IR152、IRSE50、MobileFace 和 FaceNet 等模型上平均攻击成功率达 85.90%,优于现有语义基线 Adv-CPG(+6.25%)、扩散方法 DiffAIM(+3%)和噪声方法 P3-Mask(+16%),同时保持高视觉保真度(PSNR=27.15 dB,SSIM=0.981)。实验还展示了框架在野外数据集 LADN、通用物体分类(ImageNet)以及 Transformer 扩散模型(FLUX.1)上的可扩展性。该研究揭示了扩散模型在生成对抗性人脸图像方面的潜力,并对人脸识别系统的安全性提出了新挑战。

💡 推荐理由: 本文展示了一种基于扩散模型的高成功率身份冒充攻击方法,可能被用于绕过人脸识别系统,对生物识别安全构成威胁。安全从业者需关注此类攻击向量,以提前部署防御措施。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Maxime Schwarzer, Johannes F. Loevenich, Gustavo Sánchez, Laurin Holz, Thies Möhlenhof, Tobias Hürten, Roberto Rigolin F. Lopes, Veit Hagenmeyer

该论文针对AI模型提取攻击(MEA)中防御策略普遍依赖的“单客户端假设”(Single Client Assumption, SCA)进行了系统性批判。SCA隐含假设攻击源自单一孤立身份,但论文指出,在高级持续性威胁(APT)等协同攻击者面前,该假设根本无效。作者提出了一个模块化、开源的模型窃取研究框架CerberusAI,并利用它模拟分布式攻击场景。实验评估表明,主流防御机制(如PRADA,Protecting Against Deep Neural Network Model Stealing Attacks)在面对简单的轮询查询分发策略时,检测性能显著下降;甚至全局聚合方法也可通过自适应流量混合被绕过。这些结果揭示了模型提取攻击防御领域需要向有状态、身份无关的防御架构进行范式转移。该论文最初发表于2026年ICMCIS会议,并获得最佳论文奖。对于安全从业者而言,该研究挑战了现有防御体系的根基,提示需要重新设计能够抵御分布式攻击的模型保护方案。

💡 推荐理由: 揭示了当前AI模型提取防御依赖的单客户端假设在协同攻击(如APT)下完全失效,可能误导安全团队对防御效果的评估,亟需转向更鲁棒的防御架构。

🎯 建议动作: 研究跟进,评估现有防御系统对分布式攻击的脆弱性,并探索基于有状态的身份无关防御方案。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Matteo Gioele Collu, Riccardo Conte, Alberto Giaretta, Denis Kleyko, Mauro Conti, Matteo Zavatteri, Roberto Confalonieri

本文研究了大语言模型(LLM)在解码前中间激活层中拒绝行为(refusal)的可预测性。作者通过在每个Transformer块的残差流激活上训练线性探针(linear probes),发现拒绝行为在最终层之前即可被线性解码,表明安全相关行为在输出生成前已编码于中间激活中。为了测试该信号的可操作性,他们提出了Mechanistic AutoDAN,一种探针引导的AutoDAN变体,在遗传提示搜索循环中用部分前向传播和基于探针的评分替代完整模型适应度评估。在多个模型上的评估显示,该方法在攻击成功率上与原始AutoDAN相当,同时将每次迭代搜索时间减少高达72%,且探针引导的提示在多种配置下匹配或超越AutoDAN的跨模型迁移性。进一步发现,探针引导的有效性随模型规模增大而提升。结果表明,拒绝行为不仅在输出层可观察,而且作为结构化、可操作的信号编码在LLM的中间激活中。本文适合对LLM安全、对抗攻击及可解释性研究感兴趣的读者。

💡 推荐理由: 揭示了LLM拒绝行为在中间层即可被检测,从而可能被用于高效生成绕过安全的对抗提示,对LLM安全部署构成潜在威胁。

🎯 建议动作: 研究跟进,评估自身LLM部署是否易受此类中间层信号攻击,并考虑加强中间层监控或防御。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Emily Wenger, Max Bronckers, Christian Cianfarani, Jenna Cryan, Angela Sha, Haitao Zheng 0001, Ben Y. Zhao

该论文研究了深度学习语音合成技术对现实世界中语音认证系统构成的真实威胁。作者提出并演示了两种具体的攻击方法:一是语音DNA克隆攻击,攻击者只需目标说话人几秒钟的公开语音样本,就能合成出足够逼真的语音,以绕过基于声纹的认证系统(如银行电话语音认证);二是实时全双工语音伪装攻击,攻击者在与受害者的实时通话中,利用合成语音伪装成其他人,实现实时语音操纵。两种攻击均采用低资源迁移学习技术,仅需少量目标样本即可完成模型微调,大大降低了攻击门槛。作者在多个商业语音认证系统上进行了实验,验证了攻击的有效性,并讨论了现有防御机制的不足。该研究揭示了语音合成技术带来的安全挑战,提醒语音认证系统需要更强大的反欺骗机制。

💡 推荐理由: 随着语音助手和电话银行等语音认证广泛使用,本文展示的两种低门槛合成攻击可直接威胁用户账户安全,促使安全社区重新评估现有语音生物识别系统的可靠性。

🎯 建议动作: 关注后续防御研究,评估自身语音认证系统对抗合成语音攻击的能力,考虑引入活体检测等多因子认证。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xianglin Yang, Bryan Hooi, Gelei Deng, Tianwei Zhang, Jin Song Dong

本文针对LLM作为评判者(LLM-as-a-judge)模式中存在的文体偏见问题,提出了一种名为BITE(BIas exploraTion and Exploitation)的黑盒对抗攻击框架。研究背景是:LLM评判器在评估文本时,会表现出对特定文体特征(如冗长性、句子结构)的偏好,这构成了一个被忽视的安全漏洞。BITE框架通过语义保持的文本编辑来误导LLM评判器,人为地提高评分。该方法将文体编辑的选择建模为上下文bandit问题,并采用LinUCB策略自适应地选择能最大化评判器得分的编辑方式,无需访问模型参数或梯度。实验在多种LLM评判器和任务上进行,包括聊天机器人排行榜的点对点比较和AI评审基准测试。BITE实现了超过65%的攻击成功率,并在9分量表上将评分提升1-2分,同时保持语义等价。此外,论文评估了攻击的隐蔽性,显示BITE能够规避标准的风格控制方法和多种检测基线。该研究揭示了LLM-as-a-judge范式的根本弱点,并推动了鲁棒的、对抗感知的评估方法。

💡 推荐理由: 该研究揭示了LLM评判器因文体偏见而存在的安全漏洞,可能被攻击者利用来操纵AI评估结果,影响排名、评审等关键任务。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Qiuchi Xiang, Haoxuan Qu, Hossein Rahmani, Jun Liu

该论文旨在探索一种被忽视的越狱攻击场景——宽网投射(wide-net-casting),即攻击者并非只针对单个大语言模型,而是同时查询一组模型来诱导有害输出。作者指出,现有越狱研究大多聚焦于单模型场景,而实践中攻击者往往能并行访问多个模型(例如通过API调用多个服务)。为验证这一假设,论文首先从形式化定义宽网投射场景,并系统分析了其带来的额外安全风险:由于不同模型可能存在互补的漏洞或对同一提示的不同反应,攻击者可以利用输出间的统计特性或集成策略来提高越狱成功率。进一步,作者设计了一种专为宽网投射场景定制的越狱方法,该方法可能通过构造一组具有关联性的提示,使得在单一模型上难以成功,但跨模型集成后却能产生有害内容。实验在多个主流大模型(如GPT系列、LLaMA等)上进行,结果显示,当模型未添加额外安全防护时,该方法的越狱成功率最高可达100%。即使在有基础安全对齐的模型上,成功率也有显著提升。论文的主要贡献包括:1)首次系统性地提出宽网投射越狱场景;2)设计并验证了针对该场景的高效攻击方法;3)揭示了多模型并行服务架构中存在的隐蔽安全风险,为未来的防御研究(如跨模型一致性过滤、输入多样性检测等)提供了方向和基准。该研究适合大模型安全研究员、AI红队工程师以及提供多模型API服务的厂商阅读,以重新评估其安全部署策略。

💡 推荐理由: 揭示了一种实际且高风险的越狱新场景——宽网投射,攻击者可同时利用多个模型的弱点,突破单个模型的防御,对多模型API服务构成重大威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Maria Bulychev, Neil G. Marchant, Benjamin I. P. Rubinstein

本文提出了一种新颖且通用的数字水印移除攻击方法。核心观察是:攻击水印的过程本质上与水印嵌入过程相似——两者都在寻找对图像不可察觉的修改以触发特定检测器。基于此类比,作者假设可以用水印去攻击水印,即对已加水印的图像再次施加另一个水印(称为重水印),从而抑制原始水印信号。通过在96种不同数据集、受害者水印和攻击水印组合上的严格实验,作者验证了这一假设,表明重水印能可靠地抑制原始信号,且无需梯度、代理模型或检测密钥。此外,作者还设计了一个简单分类器用于检测图像中是否存在水印及其身份,实验显示准确率高达0.878-0.953。该分类器独立具有安全意义:它揭示了水印识别可被利用来实施更强力的移除(比黑盒攻击显著更强)。结合水印识别与重水印,攻击流水线能将比特准确率降低至少25%,最高达48%。这项工作构成了一种廉价、通用且高效的攻击管道,质疑了当前水印方案在面对如此简单攻击时的可靠性,也挑战了现有复杂攻击的价值。该研究适用于对数字水印安全感兴趣的研究者和安全从业者。

💡 推荐理由: 本文揭示了数字水印存在一个根本性漏洞:重水印这种简单操作即可有效移除原始水印,且无需特殊知识。这威胁到版权保护、深度伪造检测等依赖水印可靠性的应用,提醒社区需重新评估水印方案的安全性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yingkai Dong, Xiangtao Meng, Ning Yu 0006, Zheng Li 0023, Shanqing Guo

本文提出 JailFuzzer,一种基于大语言模型(LLM)代理的自动化模糊测试框架,用于黑盒环境下对文本到图像(T2I)生成模型进行越狱攻击。现有越狱方法存在访问需求不切实际、提示语不自然易被检测、搜索空间受限以及查询开销高等问题。JailFuzzer 结合模糊测试原理与 LLM 代理,包含三个核心组件:种子池(存储初始及越狱提示)、引导变异引擎(利用 LLM 代理生成语义有意义的变异)、以及 oracle 函数(评估越狱是否成功)。通过 LLM 代理构建引导变异引擎和 oracle 函数,使得框架在黑盒环境下保持高效性和适应性。大量实验表明,JailFuzzer 在越狱 T2I 模型方面具有显著优势:生成的提示自然且语义连贯,降低了被传统防御机制检测的概率;同时以极少的查询开销实现高成功率,在所有关键指标上优于现有方法。该研究揭示了 T2I 模型面临的新型越狱威胁,为强化生成模型的安全机制提供了重要参考。JailFuzzer 已开源,代码可在 https://github.com/YingkaiD/JailFuzzer 获取。

💡 推荐理由: 该研究展示了一种高效、自动化的黑盒越狱攻击方法,对 T2I 模型构成真实威胁,安全团队需关注并防范此类利用 LLM 代理的模糊测试攻击。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shaoyuan Xie, Mohamad Habib Fakih, Junchi Lu, Fayzah Alshammari, Ningfei Wang, Takami Sato, Halima Bouzidi, Mohammad Abdullah Al Faruque, Qi Alfred Chen

本文提出了一种针对基于摄像头的自主目标跟踪系统(如无人机、机器人等)的新型物理攻击方法——FlyTrap。该类系统通常依赖视觉目标跟踪算法(如SiamRPN、DiMP等)来锁定并跟随目标。攻击者通过精心设计物理世界中的对抗性图案(例如在衣服上打印特定纹理),使得跟踪算法将攻击者误判为原始目标,从而诱使受害者系统远离原始目标并跟随攻击者移动,实现“距离拉取”效果。论文作者系统性地分析了主流目标跟踪模型在物理对抗样本下的脆弱性,并提出了一个可转移的攻击框架,该框架不依赖攻击者对受害系统内部知识的完全掌握。实验部分在真实无人机平台和仿真环境中验证了攻击的有效性,展示了高成功率(超过80%)和对不同跟踪模型的迁移性。此外,论文还讨论了潜在的防御措施,如基于运动一致性的异常检测和输入预处理。该研究揭示了自主跟踪系统在物理世界中的安全盲区,对无人机、自动驾驶、安防监控等领域具有重要警示意义。

💡 推荐理由: 该攻击直接威胁基于视觉的自主跟踪系统安全,如无人机跟随、机器人导航等,可能导致设备被劫持或引发碰撞事故。首次系统性探索物理距离拉取攻击,为防御研究提供基础。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 9.5
Conf: 50%
👥 作者: Pascal Zimmer, Simon Lachnit, Alexander Jan Zielinski, Ghassan Karame

本文提出了一种针对近红外域的新型物理规避攻击方法。现有红外攻击大多只能实现非定向攻击,且受限于位置、形状等因素需要大量优化。作者通过将红外扰动预先打印在透明胶片上,然后使用商用红外手电筒投射到目标物体(如交通标志)表面,首次实现了低成本、隐蔽的定向红外对抗攻击。该攻击无需激光设备,部署成本低于50美元,耗时仅数十秒。在数字和物理域对交通标志的实验中,该方法在不同光照、距离和角度条件下均取得了比以往工作更高的攻击成功率。同时,作者提出了一种基于分割的检测方法,通过分析红外反射模式来识别攻击,F1分数高达99%。本文研究揭示了物理世界AI系统在红外频谱下的新脆弱性,并为防御提供了可行的检测方案。

💡 推荐理由: 该攻击以极低成本实现红外域定向物理规避,可威胁自动驾驶、安防监控等场景的视觉系统,同时其检测方法对蓝队有直接防御价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)