👥 作者: Benedikt Kluss, Niklas Bunzel
本论文针对持续学习(Continual Learning, CL)场景提出了一种新型安全攻击向量。持续学习旨在让深度模型在不遗忘旧知识的情况下从数据流中迭代学习,现有对抗研究主要关注如何重新引发灾难性遗忘,以破坏模型稳定性或可用性。作者发现了一个不同的安全缺陷:攻击者可以通过操纵训练数据来降低当前或后续迭代的可学习性,这类操纵被称为“学习阻断器”(learning blockers),它们攻击的是持续学习算法的可塑性。由于这类攻击可以针对模型尚未见到的未来迭代,因此在当前迭代训练过程中极难被察觉。当学习阻断器同时诱发灾难性遗忘时,整体退化被定义为“灾难性学习”(Catastrophic Learning)。论文形式化定义了该场景与威胁模型,并提出了六种攻击策略:Label-Exchange、Tensor-Exchange、Attraction-Coincident、Attraction-Preceding、Repulsion-Coincident 和 Repulsion-Preceding。其中,Attraction 变体通过最小化被污染迭代与受害迭代标签之间的损失,在特征空间中将二者表示拉近;Repulsion 变体则最大化该损失,推远表示,使稳定性机制抵抗所需的参数偏移。Coincident 变体中被污染迭代与受害迭代重合,仅使用一个干净的参考迭代作为标签源;Preceding 变体中污染迭代先于受害迭代,通过扭曲表示使后者无法学习。作者在 MNIST 和 Split-CIFAR10 数据集上,针对 DER、ER-ACE 和 iCaRL 三种持续学习策略进行了超过 4480 次模拟实验。结果表明,攻击者可以选择性阻碍模型的可塑性以妨碍新知识获取,同时促进旧知识的遗忘,从而诱发灾难性学习场景。该研究揭示了持续学习过程中被忽视的数据完整性风险,对持续学习系统的安全性提出了重要警示。
💡 推荐理由: 持续学习模型越来越多地应用于动态数据流场景(如推荐系统、机器人、边缘设备),本研究发现攻击者仅通过操纵训练数据即可同时破坏模型的可塑性和稳定性,且难以被检测,为持续学习系统的数据完整性防护敲响警钟。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Dongsu Song, DaeYun GO, Boseung Seo, Jay Hoon Jung
本文聚焦于语义分割任务中的决策黑盒稀疏攻击问题。尽管稀疏决策黑盒攻击在分类领域已有研究,但在语义分割中尚缺乏系统性探索。作者首先将分类域中最具代表性的决策黑盒稀疏攻击方法改编至语义分割场景,构建了该未充分研究区域的基准测试。通过基准分析,发现现有基于图像中心像素累积的方法在语义分割的广阔像素空间中会导致查询预算迅速耗尽,严重降低查询效率。为克服这一瓶颈,作者提出 SegPAR 框架,将攻击的探索范式从图像中心转向类别中心,即针对每个语义类别或其局部区域进行独立优化,从而更高效地分配查询资源。同时,为消除像素累积过程中标准决策奖励产生的误导性反馈,设计了一种新颖的差异奖励机制,该机制能够更精确地评估不同类别对攻击效果的贡献,降低无效查询。大量实验表明,SegPAR 在稀疏度效率和平均交并比(MIoU)降低幅度上显著优于所有黑盒基线,甚至与白盒稀疏攻击相比也展现出竞争力。代码已公开。该工作揭示了语义分割模型在决策黑盒威胁下的新攻击面,为鲁棒性评估和防御研究提供了重要参考。
💡 推荐理由: 语义分割是自动驾驶、医学影像等安全关键应用的核心技术。该研究表明,攻击者无需模型内部信息即可通过稀疏像素扰动显著降低分割性能,提示防御者需重新评估黑盒场景下的模型鲁棒性,并采取针对性防护措施。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yingtao Ren, Ziyi Zhao, Yiwei Fu, Xiao Luo, Yu-Cheng Chang, Chin-Teng Lin
本文针对检索增强生成(RAG)系统面临的投毒攻击威胁,提出了一种基于文档级注意力坍缩(Attention Collapse)的检测方法。RAG通过注入外部文档来增强大语言模型的生成能力,但攻击者可能注入对抗性文档以操纵模型输出。现有检测方法主要依赖输出侧信号,如困惑度(perplexity)和一致性检查,但作者分析发现,经过精心设计的攻击往往诱导模型产生虚假的自信,受污染输出的困惑度甚至低于良性输出,使得基于不确定性的检测方法失效。为此,作者转向研究生成器内部注意力动态,发现攻击会导致一种独特的信号——注意力坍缩:良性生成中的注意力通常分散,而受攻击生成中注意力集中到被污染的文档,从而使注意力熵降低。基于这一发现,作者提出了轻量级检测框架D-SCAN(Document-level Signal Collapse Analysis),通过监控注意力动态来识别被攻击的生成结果。在多个攻击基准上的大量实验验证了该方法的有效性,并且D-SCAN甚至能检测到最终答案未被改变的攻击(即攻击不成功但仍有恶意意图的情况)。代码已开源。该研究为RAG安全提供了新的内部信号检测视角,适合从事LLM安全、红队和防御研究的人员阅读。
💡 推荐理由: RAG投毒攻击是当前LLM应用的主要威胁之一,现有基于输出困惑度和一致性的检测手段容易被对抗样本绕过。本文首次利用内部注意力坍缩信号进行检测,为防御方提供了不依赖最终答案的早期预警能力。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua
本文研究自主编码代理(coding agents)在企业软件工作流中集成时引入的新型安全风险:代理技能(agent skills)接口。该接口以文件夹形式包含指令与脚本,代理动态加载以专用化自身行为,但也扩大了攻击面,使恶意shell命令可隐藏在自然语言技能文件中。作者提出三项贡献:第一,提出一种对抗性技能合成方法,利用跨四个系列的六个LLM将471条真实shell命令转化为看似良性的技能,形成包含2826个技能、映射到11个MITRE ATT&CK战术的基准数据集;第二,构建可复现的评估流水线,结合运行分层、证据锚定、拒绝否决和确定性声明意图覆盖,并采用三裁判LLM-as-a-judge面板,通过与人类盲审金标准(Cohen's kappa=0.85)验证;第三,对两款企业级代理(Gemini CLI和Qwen Code)完成5629次运行的进行大规模特征刻画,发现Gemini CLI在95.5%-96.1%的运行中被成功利用,Qwen Code在71.6%-74.0%的运行中被成功利用(从原始多数投票到声明意图修正估计,均与人类金标准一致),且几乎不受生成模型影响。显式安全识别仅出现在1.99%的运行中。研究表明,企业在采用编码代理前必须评估并缓解技能接口风险。代码和数据集已公开。
💡 推荐理由: 揭示LLM代理技能文件可被武器化且隐蔽性极高,现有代理缺乏有效安全识别机制,企业采用编码代理前必须评估此类风险。
🎯 建议动作: 纳入内部评估,关注该基准与检测方法,测试自有代理对恶意技能文件的防御能力
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Anadi Goyal, Nandish Chattopadhyay, Anupam Chattopadhyay, Chandan Karfa
本文对视觉 Transformer(ViT)在输入自适应推理机制下的对抗性效率下降攻击进行了系统综述。近年来,ViT 为满足能源与延迟约束,广泛采用 token 剪枝、提前停止等输入自适应技术,但这些优化同时引入了新的攻击面。攻击者可通过精心构造的输入扰动,迫使模型保留更多计算开销,从而导致推理效率显著下降,而无需牺牲分类精度。该综述统一比较了两种代表性攻击:SlowFormer(通用对抗补丁)与 DeSparsify(逐图像扰动),并分别在三种主流 token 剪枝框架(A-ViT、ATS、AdaViT)下进行实验评估。为了标准化评估,作者采用 GFLOPs、准确率损失以及攻击成功率(AS)指标衡量攻击所移除的模型计算节省比例。通过回答三个核心问题,即输入自适应优化如何构成攻击面、攻击在实际中如何运作且哪些优化最脆弱、以及现有防御能否在攻击下有效恢复效率,本文梳理了攻击与防御的当前研究格局。结果表明,效率下降攻击对依赖动态计算的部署场景构成实际威胁,尤其对移动和嵌入式等低功耗设备影响显著。文章同时指出,设计轻量级且有效的防御策略是重要且亟待解决的研究方向,为后续工作提供了理论框架和建议。
💡 推荐理由: 该综述揭示了针对 ViT 动态推理机制的新型攻击面,这类攻击不必破坏精度,仅通过增加计算开销即可造成拒绝服务或能源浪费,对边缘智能设备的安全部署构成实际威胁。安全从业者需理解此类攻击原理,以便在模型设计和部署中纳入相应防护。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tianyi Wang, Zhenghao Gao, Shengjie Xu
本文提出一种名为 Season 的频谱感知正交梯度细化框架,用于提升基于迁移的对抗样本攻击在异构模型间的迁移性。研究背景是:卷积神经网络(CNN)偏向于利用局部纹理特征,而视觉Transformer(ViT)依赖全局形状特征,导致在CNN上生成的对抗样本迁移到ViT等架构时攻击成功率显著下降。Season 在白盒替代模型上生成针对黑盒目标模型的 L-infinity 对抗扰动,其核心思路是将每次梯度更新分解为低频分支(捕捉结构线索)和高频分支(捕捉纹理线索)。通过低显著性引导机制,将高频能量重新分配到图像背景区域,从而保护ViT所依赖的前景结构。随后,利用正交投影迫使纹理更新位于结构方向的互补子空间,以缓解特征干扰。Season 是一种无需训练、即插即用的包装模块,可直接增强八种现有的梯度稳定化和输入增强攻击方法,而不修改其核心逻辑。在 ImageNet 数据集上,针对八个不同的CNN、ViT和MLP目标模型,Season 在统一协议下使迁移攻击成功率平均提升6.6个百分点,最高提升16.0个百分点。本文主要贡献在于提出一种模型无关、计算开销小的通用增强框架,揭示了跨架构迁移中频谱与正交性的作用。适合对抗攻击与防御研究者、模型鲁棒性评测人员以及安全厂商的红队测试工程师阅读。
💡 推荐理由: 对抗样本迁移性是评估模型鲁棒性的关键维度,Season 揭示了跨架构攻击失败的结构性原因,并提供通用增强方法,有助于防御方理解黑盒攻击能力边界,改进模型集成与防御策略。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mahmoud Nazzal, Issa Khalil, Abdallah Khreishah, NhatHai Phan, Yao Ma 0001
该论文研究基于图神经网络(GNN)的恶意域名检测(MDD)系统面临的新型对抗攻击问题。GNN-based MDD 利用公开的 DNS 日志构建域名恶意图(DMG),将互联网域名表示为图中的节点,并通过已标注的恶意节点推断其他节点的恶意性。然而,由于依赖公开数据,攻击者可以操纵自身域名节点在图中的特征和边关系,从而逃避检测。现有研究主要针对单个攻击者节点的逃逸攻击,但实际攻击者通常注册大量域名为其活动服务,以降低成本并避免被整体封禁,因此需要同时操纵多个节点,即多实例逃逸攻击。论文指出,现有单实例攻击技术无法直接扩展到多实例场景,并首次提出针对 GNN-based MDD 的推理时多实例对抗攻击 MintA。MintA 通过优化节点扰动来增强目标节点及其邻居的逃逸能力,仅需对目标模型进行黑盒访问,无需知道模型参数、架构或非攻击者节点信息。作者构建了满足攻击目标的优化问题,并设计了近似求解算法。在真实数据集上,针对现有最优的 GNN-based MDD 方法,MintA 实现了超过 80% 的攻击成功率。研究结果警示安全专家,GNN-based MDD 面对实际多实例攻击时存在脆弱性,可能削弱该方法的有效性。
💡 推荐理由: GNN 是恶意域名检测的主流方法,该研究揭示了其在多实例攻击下的显著脆弱性,强调仅依赖公开 DNS 日志构建图存在被系统性规避的风险,对安全防御者设计鲁棒检测系统具有重要警示意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Shuo Shi, Rui Yin, Naen Xu, Jiahao Chen, Chunyi Zhou, Tianyu Du, Zhihui Fu, Jun Wang, Zhaoxiang Wang, Shouling Ji
该论文首次系统性地研究了多模态安全护栏模型(multimodal guard models)中的一种新型对抗威胁——“不安全诱导攻击”(Unsafe Induction Attacks)。与以往关注越狱攻击(产生假阴性,即放行恶意内容)不同,该攻击旨在诱导安全过滤器对良性输入产生假阳性,即错误地将安全图像判定为不安全内容,从而拒绝合法用户请求。作者将这种现象类比为“狼来了”效应,指出其会严重降低服务可用性并侵蚀用户信任,揭示了已部署安全过滤器的一种可用性故障模式。为了实现这一威胁,论文提出了一种名为“不安全语义蒸馏”(Unsafe Semantic Distillation, USD)的方法,该方法不针对具体提示词实例,而是将对抗扰动与不安全内容的分布式表征对齐,从而在多样化的用户提示下仍能高效触发误判。作者在四个最先进的安全护栏模型上进行了评估,并模拟了真实的用户交互场景。实验结果表明,USD 的攻击成功率高达 84%,显著优于现有方法,暴露了当前多模态安全架构中的根本性弱点。该研究为多模态内容安全评估提供了新视角,强调安全护栏不仅要防恶意绕过,也要防恶意误报,对防御者设计健壮的安全过滤机制具有重要参考价值。适合关注大模型安全、红队评估、可用性攻击及对抗机器学习的研究人员和工程师阅读。
💡 推荐理由: 该攻击颠覆了传统越狱方向的关注点,揭示安全护栏可能被利用来拒绝合法请求,造成服务拒绝和信任危机,是防御者必须正视的新型可用性风险。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Vasudev Gohil, Satwik Patnaik, Dileep Kalathil, Jeyavijayan Rajendran
本文提出 AttackGNN,这是首个针对硬件安全领域基于图神经网络(GNN)技术的红队攻击框架。近年来,GNN 被广泛用于集成电路硬件安全任务,如检测知识产权盗版、硬件木马检测与定位、电路逆向工程和硬件混淆等,并取得了很高的准确率。然而,这些技术本身可能被对抗样本所欺骗,从而在安全关键场景中引入严重风险。为了系统评估其鲁棒性,作者设计了一个基于强化学习(RL)的智能体,用于生成对抗性电路样本,以诱骗目标 GNN 模型。研究中解决了三个核心挑战:有效性(攻击成功率)、可扩展性(适用于大规模电路)和通用性(跨不同问题类别)。作者针对四类硬件安全问题的五种 GNN 防御技术进行了攻击测试,包括 IP 盗版检测、硬件木马定位、逆向工程和硬件混淆。实验结果表明,生成的对抗性电路能够以 100% 的成功率欺骗所有被测试的 GNN 模型,例如让防御系统将盗版电路误判为正常,或将植入木马的电路误判为安全。这项工作揭示了当前 GNN 硬件安全防御的脆弱性,并强调了在部署前进行对抗性评估的必要性。适合硬件安全研究人员、AI 安全工程师和集成电路设计者阅读,以理解 GNN 模型的潜在弱点并开发更鲁棒的防御机制。
💡 推荐理由: 首次证明强化学习可生成对抗电路,使硬件安全 GNN 全面失效,对依赖 AI 的集成电路防护构成警示,需重新审视模型鲁棒性。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Vera Wesselkamp, Konrad Rieck, Daniel Arp, Erwin Quiring
生成对抗网络(GAN)在合成逼真图像方面取得了显著进展,甚至能够欺骗人类观察者。为应对深度伪造带来的安全风险,已有多种检测方法通过识别生成过程中残留的图像伪影来区分真实与合成内容。然而,已有反攻击研究揭示了这些检测方法的局限性,但多数反攻击需要满足特定条件,例如需要与检测模型进行交互或直接调整生成器。本文提出了一类新颖且简单的反攻击方法,突破这些条件限制。作者发现,攻击者可以直接在生成图像的频域中去除指示性伪影,即所谓的“GAN指纹”。他们系统探索了多种指纹去除方式,从简单的对高频分量进行滤波,到更为精细的针对特定频率峰值的清除。通过在多种检测方法、GAN架构和数据集上的实验评估,作者证明了这种攻击能够有效移除GAN指纹,从而使生成的图像成功规避检测。这项研究不仅揭示了一种高效且易于实施的攻击途径,还指出了当前深度伪造检测技术的一个关键盲区,即过度依赖生成伪影的检测策略存在根本性脆弱性。该工作对数字取证、内容真实性验证以及社交媒体平台的内容安全治理具有重要的警示意义,强调了需要发展更具鲁棒性的检测范式,例如结合语义信息、生成模型先验或跨模型一致性分析。对于安全从业者而言,理解此类攻击有助于重新评估现有检测体系的可靠性,并为设计下一代防御措施提供参考。本摘要基于论文摘要生成,未涉及具体攻击实现细节。
💡 推荐理由: 深度伪造检测是内容安全和数字取证的重要防线,本文展示了一种简单且无需特定条件的攻击方式,可移除GAN指纹并逃避检测,直接动摇现有基于伪影的检测体系,安全从业者需了解并重新评估自身防护能力。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shikhar Shiromani, Leo Richter
该论文针对链式思维(Chain-of-Thought, CoT)监控的鲁棒性展开研究。CoT监控旨在通过检查智能体的推理过程来识别奖励黑客行为(reward hacking),因为这类攻击在动作层面可能表现正常,仅在推理中暴露意图。然而作者发现,当对手能够控制推理文本时,CoT监控恰好可以被轻易击败。他们提出一种攻击方法:仅改写智能体的推理表述,使其显得像基于良好意图的工程操作,而命令与输出则逐字复制、保持不变,从而确保实际利用行为完全不变。在单次无梯度(gradient-free)攻击下,原本在特定子集上误报捕获率约为95%的保留监控器,其捕获率骤降至11%以下。作者指出,监控器在聚合准确率上存在“虚假平均值”现象——整体准确率主要由那些动作层面就暴露问题的黑客行为拉高,掩盖了在CoT监控作为唯一信号来源的子集上,上述改写所带来的近乎彻底的失效。该攻击可跨监控器家族与智能体模型迁移,并能在实时智能体上复现;在面对经过校准的监控器时,逃避效果集中于最强的智能体。仅依赖轨迹(trace)的防御措施只能部分恢复检测能力,即使有的防御针对该攻击进行了预训练,因为改写后的推理对已发生事实仍然如实陈述,仅在意图上说谎;因此只有来自轨迹之外的信息才能显著提升检测。此外,作者在开源替代监控器的激活上训练探针,能区分出其判定遗漏的恶意推理,但因果对照表明这只是检测器在起作用,而不能证明监控器‘暗中知道’攻击。该研究系统性地暴露了CoT监控作为独立防线时的根本脆弱性,强调了仅依赖文本推理进行安全监控的局限。适合对LLM智能体安全、红蓝对抗及可解释性监控感兴趣的研究人员阅读。
💡 推荐理由: CoT监控被广泛视为捕捉隐藏恶意的关键手段,但该研究证明攻击者仅通过改写推理文本就能令检测率从95%降至11%,意味着依赖推理审查的防线可能形同虚设,对LLM智能体安全体系构成严重威胁。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Siyuan Li, Zehao Liu, Haoyu Li, Xi Lin, Ning Liu, Jun Wu, Jianhua Li, Mohsen Guizani
本文针对大型语言模型(LLM)在多轮交互中面临的对抗性攻击持续演化问题,指出现有防御方法本质上是反应式的,难以应对攻击者在多轮对话中不断调整策略的复杂威胁。为此,作者提出了一种主动防御框架 CoopGuard,旨在通过跨多轮交互的干扰、误导和适应相结合的方式,系统性地提升 LLM 的安全性。该框架采用协作式多智能体架构,由多个专职智能体分别执行互补的防御策略:一是受控响应节奏,通过延迟或改变响应速度来增加攻击者的时间与计算成本;二是策略性模糊输出,生成含义不明确的回复,误导攻击者采用低效的攻击路径;三是交互日志取证分析,对对话记录进行深度分析以识别攻击模式,并据此改进防御策略。这些智能体由一个自适应协调机制统一调度,该机制能够根据威胁的升级程度动态调整整体防御策略。为全面评估框架效果,作者构建了 EMRA 数据集,模拟多轮攻击中策略的演化,包含 8 种攻击类型、共 5,200 个对抗样本。在多个 LLM 主干上的实验结果表明,相比现有最优基线,该框架平均将攻击成功率(ASR)降低 69%,同时维持了欺骗性互动,其平均欺骗率(DR)是最强基线的六倍以上,并使攻击者的 token 消耗平均增加 198.83%。代码和数据集已公开。该研究为 LLM 安全防御提供了一种从被动响应转向主动博弈的新思路,适合 LLM 安全研究、红蓝对抗和防御系统设计者阅读。
💡 推荐理由: 多轮攻击是实际 LLM 应用面临的高危威胁,该框架首次将主动欺骗与自适应多智能体协作引入防御,为蓝队提供了一种可借鉴的成本提升与攻击识别范式。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Haoyu Zhang, Shibo Zheng, Xiangchen Guan, Zhuoxi Wang, Zijian Xiao, Mohammad Zandsalimy, Shanu Sushmita
本文针对大语言模型的自检查防御机制提出了一种组合攻击方法。自检查防御要求目标模型在回答前先评估请求是否具有攻击性,其中SAGE被报告具有平均99%的防御成功率。作者发现,将两种已知攻击——代码补全编码和最佳N搜索——组合起来,可以突破SAGE。单独使用时,这两种攻击在未防御模型上的成功率均不超过4.7%,但组合后,在三个开放目标模型上分别达到67%、22%和15%的绕过成功率,并且即使面对70B参数的大规模目标,效果依然存在。作者并未止步于实证,而是进一步解释了该组合有效的机理。首先,自检查防御的“强度”其实源自目标模型自身:SAGE本身并不直接检测攻击,而是让目标模型自己判断,而不同目标模型将该请求转化为明确拒绝的概率在32%至97%之间,这直接导致了最终防御覆盖率的差异,尽管在无防御情况下各模型的固有拒绝率几乎相同。其次,哪种攻击能成功取决于防御的具体类型:面对变换类防御时,代码编码攻击比字符搜索保留更多未防御时的攻击效能;而面对门控类防御时,顺序则发生反转。作者用攻击向防御决策边界传递的独立探测次数来解释这一现象。此外,论文还报告了自身实现中一个有效性缺陷:在贪婪解码下,确定性攻击没有任何最佳N变异通道,并提供了一行诊断代码来检测该问题。全部结论基于31万次生成,并使用经人类验证的评判器进行评估。
💡 推荐理由: 该研究揭示了自检查防御(如SAGE)的虚假安全感,表明组合无害攻击可突破近完美防御,为LLM安全评估敲响警钟,提醒社区重新审视防御的稳健性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yu Yan, Jiahao Chen, Siqi Lu, Yongjuan Wang, Ziming Zhao, Zhaoxuan Li, Tianyu Du, Qingjun Yuan, Shouling Ji
该论文提出了一种针对大语言模型(LLM)的新型攻击范式——决策级劫持(Decision-Level Hijacking)。攻击者通过部署后仅翻转极少量权重比特(Bit-Flip Attack)的方式,在不触发违规内容或降低模型功能的前提下,向LLM注入特定的认知偏差,从而间接影响下游决策者的判断。现有攻击无法实现这种精细的认知操控。为此,作者提出了CogBias框架:首先利用可微情绪评估器将主观偏好转化为优化信号;然后设计多目标损失函数联合约束多个维度(如立场、一致性等);最后通过BitScout算法定位关键比特位,在超稀疏翻转预算下实现定向认知干预。在Llama-3.2-3B、Mistral-7B和Qwen2.5-14B等模型上,针对商业推荐和争议性事实话题场景的实验表明,仅翻转少量比特即可稳定地使模型对目标话题产生显著的立场偏移,同时对非目标任务和整体输出分布的影响有限。该工作揭示了底层权重数据的微小扰动足以破坏LLM的高层价值对齐,对开源模型的安全部署提出了严峻挑战。
💡 推荐理由: 该研究首次证明比特翻转攻击能用于操控LLM的决策立场,且无需实时交互或控制训练过程,隐蔽性强、成本低,对依赖LLM进行战略决策的企业构成直接安全威胁。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zixuan Wu, Cristina Nita-Rotaru
大型语言模型(LLM)越来越多地被用于安全敏感任务,如漏洞检测和代码审查。这篇论文发现了一个此前未被充分探索的攻击面:攻击者可以在源代码中插入对抗性注释,这些注释能够影响检测器的推理过程,而不改变程序的执行行为。作者将攻击者建模为一个编码代理,它实现新功能、故意引入漏洞,并策略性地插入对抗性注释以逃避检测。为此,他们提出了ALIBI——一个自动化、自适应的黑盒攻击框架,该框架利用检测器的输出推理和反馈,迭代地生成并优化对抗性注释。研究者将125个真实世界的空指针解引用漏洞修复提交转化为编码任务,评估了四种具有代表性的基于LLM的漏洞检测器,包括专用开源推理模型和前沿多智能体系统。结果表明,所有检测器都高度脆弱:攻击成功率超过90%,在一个系统上达到100%。进一步实验显示,该框架还能泛化到其他类型的漏洞。最有效的对抗性注释是那些引导检测器推理或伪造外部工具结果的注释,而基于检测器反馈的迭代优化进一步提高了攻击成功率。最后,论文测试了提示级防御,发现它们对自适应攻击几乎没有抵抗力,而架构隔离和检测前注释净化则显著增强了鲁棒性。这项工作揭示了当前基于LLM的漏洞检测器的一个基本攻击面,并激励安全感知的设计,即在自然语言上下文和程序证据之间仔细校准信任。
💡 推荐理由: 暴露了LLM驱动的代码安全工具对自然语言上下文的脆弱性,提醒安全团队需要重新评估此类工具的可靠性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Erik Imgrund, Anna Wimbauer, Klim Kireev, Konrad Rieck
该论文聚焦于智能体系统中世界模型(world model)的安全性问题。世界模型是一种专门训练的环境模拟器,旨在帮助基于大语言模型的自主智能体预测其动作的后果,从而提升多步任务执行的准确性。然而,作者发现世界模型可能被攻击者操纵,导致智能体执行有害动作,引入严重的安全与隐私风险。论文系统性地揭示了多种世界模型特有的漏洞,这些漏洞可在终端型智能体中被利用,实现恶意代码执行或敏感数据提取。为支持后续研究,作者构建了一个专门面向文本型世界模型的安全基准测试数据集。实验表明,攻击者能够在智能体管道中诱导世界模型产生错误预测,攻击成功率高达95%,可能造成未授权命令执行、拒绝服务、钱包资金耗尽以及私密信息泄露等后果。最后,论文为从业者提供了实用的缓解建议,以加固智能体系统。
💡 推荐理由: 该研究首次系统性地揭露了世界模型在智能体系统中的安全风险,表明即使世界模型能提升任务性能,也可能被用作攻击向量。对于依赖LLM agent的开发者与安全团队而言,这是一个必须警惕的新攻击面。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hadi Abdullah, Muhammad Sajidur Rahman, Washington Garcia, Kevin Warren, Anurag Swarnim Yadav, Tom Shrimpton, Patrick Traynor
该论文提出了一种针对自动语音识别(ASR)和说话人识别(SV)系统的高效且可迁移的黑盒对抗攻击方法。作者指出,现有攻击往往需要大量查询或依赖白盒访问,实用性有限。他们提出了一种基于梯度估计的查询高效攻击,使用自然进化策略(NES)来近似模型梯度,并结合时间域和频域扰动约束,以生成人耳不易察觉但能有效欺骗模型的对抗样本。通过实验,他们在多个主流ASR系统(如DeepSpeech、Kaldi)和SV系统(如GE2E、SpeakerNet)上验证了攻击的有效性,显示出极高的攻击成功率(>90%)和跨模型迁移性,即在一个模型上生成的样本能成功攻击其他模型。此外,攻击仅需少量查询(约1000次)即可收敛,显著优于此前方法。核心贡献包括:1)首个同时针对ASR和SV的高效黑盒攻击框架;2)展示了攻击的跨平台可迁移性;3)扰动约束设计确保音频质量损失小。这项研究揭示了语音接口在安全部署中面临的实际威胁,提醒开发者需考虑对抗鲁棒性。
💡 推荐理由: 语音交互系统广泛部署,本攻击展示了黑盒场景下高效欺骗语音识别和声纹识别系统的可行性,威胁智能助手、声纹认证等安全敏感应用。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Tashi Stirewalt, Assefaw Hadish Gebremedhin
该论文提出了一种新颖的对抗性攻击方法——对抗性习惯化攻击(Adversarial Habituation Attack),将其视为对经典的“温水煮青蛙”攻击(Boiling Frog Attack)的心理学扩展和重构。传统对抗性攻击通常依赖一次性、明显的扰动来欺骗模型,而本文提出的攻击则模拟了心理学中的“习惯化”现象:通过一系列微小、渐进的变化,使目标AI系统(如大语言模型或自主Agent)逐渐适应并最终接受有害行为,而不会触发异常检测或防御机制。研究者从认知心理学和行为经济学中汲取灵感,将习惯化定义为对重复刺激的反应减弱过程,并将其应用于对抗性场景。攻击过程被形式化为一个多步优化问题:在每一步中,攻击者生成一个仅比前一步略偏离安全边界的输入,从而在不被察觉的情况下逐步引导模型走向恶意输出。论文通过理论分析和初步实验验证了该攻击的有效性,表明它能够绕过基于阈值或异常检测的防御,并且对具有记忆或持续学习能力的Agent系统尤其危险。该工作强调需要开发能够感知长期上下文变化和检测渐进式偏移的防御策略。
💡 推荐理由: 该攻击揭示了AI系统在面对长期、渐进式操控时的脆弱性,对部署在关键领域的自主Agent构成潜在威胁。它挑战了现有安全机制只关注单次异常的假设,提醒防御者必须监控行为趋势而非独立事件。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann
本文研究了针对网络增强型大语言模型(LLM)推荐系统的对抗性排名操纵问题。当LLM通过检索和阅读实时网页来回答推荐查询时,它扮演了推荐系统的角色,每个检索到的页面都可能成为攻击面。现有工作主要关注虚构产品、检索投毒和排名提升,但未系统比较在保持周围源集不变的情况下,对已检索页面进行不同编辑如何改变模型的最终排名。为填补这一空白,作者提出了SIREN方法,这是一种自动化的攻击者-裁判方法,将PAIR越狱循环适配为竞争性排名操纵,目标是将选定实体提升至LLM生成的推荐列表的第一位。SIREN使用Anthropic网络工具检索和捕获网页,然后通过23种内容投毒技术的可解释分类法迭代编辑检索到的源。其自定义RAG重放平台保持源顺序不变,从而将模型排名的变化归因于内容变化而非检索差异。在两个生产级Claude模型上,SIREN在8个查询-模型上下文的124次技术试验中,有62次成功将目标推至第一位。达到第一位的载荷在全新会话中测试,平均成功率为0.805。在评估的各种设置中,声明性排名声明和种子列表通常比指令式注入更有效,但效果差异取决于目标模型。据作者所知,这是首个在保持源上下文不变的情况下,针对生产级LLM进行竞争性排名操纵的受控研究。
💡 推荐理由: 该研究揭示了LLM推荐系统易受内容投毒攻击的脆弱性,攻击者可通过操纵已检索网页内容影响排名结果,对依赖LLM推荐的应用(如搜索引擎、产品推荐)构成实质性威胁。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Run Wang, Chaoyi Zhou, Xi Liu, Yi Zhu, Amir Salarpour, Pedram MohajerAnsari, Zhi-Qi Cheng, Feng Luo, Siyu Huang, Mert D. Pesé
推测解码是一种无损加速方案,通过草稿模型与目标模型之间的动态token级对齐实现推理加速。然而,这种语义等价的保证隐藏着严重的操作漏洞:草稿-目标对齐可被系统性攻击。本文提出ADSD,据我们所知,这是首个通过推动草稿概率质量朝向目标模型不太可能接受的token来破坏验证器接受的提示后缀攻击。ADSD使用Soft-Collapse——一种基于非对称推测接受规则推导出的验证器对齐替代目标,以及一个防止明显任务破坏的目标保持目标。ADSD成功生成了高效的对抗后缀。在GSM8K数据集上,我们的攻击使平均样本时间增加62.3%,同时保持了任务质量。我们进一步证明该漏洞存在于不同领域、推测解码策略和模型架构中。
💡 推荐理由: 推测解码被广泛用于加速大语言模型推理,但该研究揭示了其安全假设的脆弱性。攻击者可能通过精心构造的提示后缀,在不明显降低任务质量的情况下,显著增加推理延迟,为服务稳定性带来威胁。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Han Jiang, Jifa Zhang, Hu Jin, Nan Zhao, Mingqian Liu, Yunfei Chen
本论文针对无线自编码器通信系统中对抗攻击的不可检测性、攻击性和适应性难题,提出了一种基于深度学习的智能攻击框架。在存在多个攻击者的复杂场景下,多路并行攻击产生的累积泄漏干扰(CLI)会显著增加攻击被检测到的风险,同时动态环境使得固定攻击策略难以保持稳定效果。为解决这些问题,论文首先设计了一种基于深度神经网络的发射功率控制机制,通过调节多个攻击者的发射功率来减少干扰泄漏,从而提升攻击的隐蔽性。其次,为了增强攻击效果和稳定性,论文进一步开发了条件生成对抗攻击(CGAA)。该攻击利用生成对抗网络结构:生成器以攻击信道信息为条件输入,生成扰动信号,使受攻击接收信号尽可能接近干净接收信号,从而误导判别器;判别器则在相同条件下区分两者。通过对抗训练,生成器能够学习产生自适应扰动信号,在不同信道条件下保持高效攻击性能。仿真结果表明,所提框架在攻击不可检测性、攻击性和适应性方面均优于基准方案。该研究揭示了无线自编码器通信系统在面对智能自适应攻击时的脆弱性,为设计更加鲁棒的无线通信系统提供了反面对抗性启示。
💡 推荐理由: 无线自编码器是未来物理层通信的前沿技术,本研究暴露了其在面对智能对抗攻击时可能完全失效,且攻击难以被现有检测机制发现,对无线通信安全构成潜在威胁。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Devina Jain, David Hartmann, Chuan Li
该论文提出一个针对LLM代理(agent)安全性的多轮自适应对抗攻击基准。现有安全评估通常使用固定的攻击池,在单轮或多轮场景下评估防御者,但忽略了攻击者能够根据防御者响应动态调整策略的能力。为此,作者构建了一个包含21个场景的基准,每个场景模拟了无记忆LLM防御者面对自适应多轮攻击的情况。攻击者是一个自主LLM,它观察防御者之前的响应并在各轮次之间调整攻击策略,防御者每次响应都被视为全新交互(无记忆)。实验固定21个场景、攻击者、防御者和结构化输出评分,结果发现:仅允许第一轮攻击时,攻击成功率(ASR)为0-1%;允许15轮自适应攻击后,ASR上升至5.4-14.0%。将三个前沿攻击者LLM的攻击结果合并,发现的独特成功攻击数量是单个最佳攻击者的1.4-2.2倍,且生成攻击与现有基准中的攻击具有极低余弦相似度(0.02-0.14)。Claude Opus 4.6和GPT-5.4平均ASR均为5.4%(95%置信区间重叠),但它们的弱点分布差异显著:在某个场景中Claude Opus ASR达60%(CI 36-80%),而GPT-5.4和Gemini仅7%(CI 1-30%)。21个场景中有13个能够区分至少一对防御者,但排名在不同场景间不一致(Kendall's W=0.19)。作者开源了该基准,包括21个评估场景、10个开发场景、编排器、基线框架、多攻击者CLI,以及945个来自3×3前沿模型矩阵的对话记录、攻击回放数据集和18,422场开源竞赛的对战记录。该工作为LLM代理安全性评估提供了更贴近真实攻击的动态基准,揭示了现有防御在自适应攻击下的脆弱性,并强调了多模型联合评估的重要性。
💡 推荐理由: 本文揭示了固定攻击池评估的局限性,提出自适应多轮攻击基准更贴合现实威胁,能暴露不同LLM防御模型间的显著弱点差异,对构建鲁棒的LLM代理安全评估体系具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Avital Shafran, Roei Schuster, Vitaly Shmatikov
检索增强生成(RAG)系统通过从知识数据库中检索相关文档,并利用大型语言模型(LLM)处理这些文档来回答查询。本文发现,当RAG系统操作包含不可信内容的数据库时,容易受到一种称为“jamming”的拒绝服务攻击。攻击者可以向数据库中添加单个“blocker”文档,该文档会在特定查询时被检索,导致RAG系统无法回答该查询,表面上是因为缺乏相关信息或回答不安全。作者描述并测量了多种生成blocker文档的方法,包括一种基于黑盒优化的新方法。该方法(1)不依赖于指令注入,(2)不需要攻击者了解目标RAG系统使用的嵌入或LLM,以及(3)不使用辅助LLM。作者在多种嵌入和LLM上评估了jamming攻击,并证明现有的LLM安全指标无法捕捉其对jamming的脆弱性。最后,讨论了针对blocker文档的防御措施。本文的核心贡献在于揭示并量化了RAG系统在面对恶意文档时的拒绝服务风险,提出了一种通用的攻击生成方法,并对现有安全评估的不足进行了批判。
💡 推荐理由: RAG系统广泛应用于企业知识库和问答服务,本文揭示的jamming攻击可导致关键功能拒绝服务,且攻击者无需特殊权限或了解内部模型,实际威胁较大。现有安全指标未能有效预警,需引起防御者重视。
🎯 建议动作: 研究跟进:评估使用的RAG系统是否易受jamming攻击,并参考论文中讨论的防御策略进行加固
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Meng Chen 0011, Kun Wang 0025, Li Lu 0008, Jiaheng Zhang, Tianwei Zhang 0004
本文揭示了一种针对大型音频-语言模型(LALMs)的新型安全威胁——听觉提示注入(auditory prompt injection)。与传统的文本提示注入不同,攻击者可以在连续的、高维度的音频信道中嵌入恶意指令,且这些指令在上下文无关和感知不可见的情况下操纵模型行为。作者提出了一个名为AudioHijack的通用攻击框架,通过采样梯度估计实现端到端优化,绕过不可微的音频分词器,并利用注意力监督和多上下文训练,使模型注意力聚焦于对抗性音频,同时保持对未见用户上下文的泛化能力。设计的卷积混合方法将扰动调制成自然的混响效果,极大提高了隐蔽性。在13个最新LALMs上的实验表明,该方法在6种恶意行为类别中平均成功率高达79%-96%,且音频保真度高。真实世界测试显示,Mistral AI和Microsoft Azure的商业语音代理可被诱导执行未经授权的操作。该工作系统性地揭示了LALMs在音频输入方面的安全漏洞,强调亟需针对性的防御措施。适合安全研究员、AI系统开发者及语音助手服务提供商阅读。
💡 推荐理由: 该研究首次系统性地提出并实践了针对大型音频-语言模型的听觉提示注入攻击,暴露了当前语音助手的安全盲区,对于推动多模态AI安全防御具有重要预警价值。
🎯 建议动作: 研究跟进,评估自身LALM产品对此类攻击的脆弱性,并关注后续防御方案。
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hengwei Chen, Menglan Hu, Tianyue Zheng
该内容触发安全策略,已拒绝摘要,请看原链。
👥 作者: Dima Galat, Marian-Andrei Rizoiu
本研究旨在探究哪些大语言模型(LLM)文本逃避攻击能够绕过当前最先进的对抗性微调检测器。作者发现,虽然对抗性微调可以轻易封堵2025年获胜的逃避方法,但检测器存在一个根本性的不对称漏洞:将生成文本推出检测器的训练分布(out-of-distribution, OOD)能够可靠地击败对抗性检测,而将文本拉入分布(例如模仿人类训练数据)则完全失效。基于此,作者提出了两种新型OOD攻击家族:跨年代语域攻击(cross-decade register attacks)和现代主义意识流形式(modernist stream-of-consciousness form)。这两种策略均能轻松绕过对抗性防御,在保持文本自然度的同时,将欺骗成功率提升至先前方法的约50倍。此外,实验表明,部署者最直观的应对措施(用年代散文扩充训练数据)也无法封堵该漏洞。这些发现表明,包括对抗性微调检测器在内的多个检测器家族,在结构性OOD偏移下均存在持续漏洞,而这一机制正是作者团队在ELOQUENT 2026 Voight-Kampff排行榜上取得领先成绩的核心驱动力。
💡 推荐理由: 揭示了当前AI写作检测器在对抗结构性分布偏移时的根本弱点,攻击者仅需改变文本的语域或文学形式即可轻易绕过最先进的对抗性防御,对学术诚信、内容审核等依赖AI文本检测的场景构成严峻挑战。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yibo Hu, Ren Wang
该论文研究多智能体LLM系统在运行时监控方面的安全漏洞。现有安全机制通常对每个智能体的消息、工具调用或步骤进行独立检查(局部监控),但作者发现这存在根本性缺陷:分布式后门攻击可以将有害负载拆分到多个智能体中,使得每个局部检查都通过,而组合后的对象却是攻击载荷。局部监控在每一步都是正确的,但仍可能漏检攻击。问题的关键不是拆分本身(因为拆分后的片段仍可能泄漏可疑令牌或溯源边),而是“局部无害性”:没有任何片段携带危害,剩余部分看起来像正常流量。作者将这一现象形式化为“可观测性边界”:监控只能捕捉到其视角下能与正常流量区分开的内容。证明表明,一旦片段在监控视角下看起来无害,任何基于该视角的检测器都无法捕捉它们。在受控测试平台、外部基准和端到端智能体运行中,局部监控恰好会在局部证据消失时丢失信号,只有在监控看到组合对象时才重新捕获信号。仅用正常流量训练的监控能够在保留的编码上恢复攻击的代码结构(平均AUROC 0.874)。给定编码族后,一种解码视图门可以阻止所有测试的攻击。但仅仅看到更多还不够:全迹监控和解码器仍然会失败,除非它们达到负载暴露的表示层。论文结论是,当危害是组合性时,局部安全不等于全局安全,开放问题是如何找到那个暴露负载的表示层。适合从事LLM安全、多智能体系统防御的研究者和工程师阅读。
💡 推荐理由: 揭示了多智能体LLM系统中局部运行时监控的根本性盲点,对于构建实际可部署的安全防御具有重要指导意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang, Longwei Wang
大型语言模型(LLM)尽管能力强大,但仍极易受到对抗性提示和越狱攻击。现有研究主要通过输入-输出行为或归因方法分析这些失败,对对抗性扰动如何改变模型内部推理机制的洞察有限,导致对不安全或错误行为背后的机制理解不足。本文提出了一种基于内部计算图的机制性可解释性框架,用于诊断LLM的脆弱性。该框架将特定提示的推理过程表示为潜藏特征之间的结构化因果交互,称为内部计算图。通过构建并对齐干净提示和攻击提示的计算图,揭示对抗性攻击会系统地转变内部推理,包括抑制安全相关组件、出现攻击特有特征以及重定向计算路径。基于此表示,作者提出了一个统一框架,该框架能够:(i)将计算分解为不变、抑制和涌现结构;(ii)识别与失败模式相关的重复脆弱性模式;(iii)对节点、路径和子图进行因果干预,直接评估它们对攻击成功的贡献。这使得从描述性归因过渡到对模型失败的因果诊断成为可能。在多个开源LLM及多种对抗和越狱基准上的实验表明,内部计算图的结构偏差与不安全行为强相关。此外,对识别的脆弱性模式进行有针对性的干预可提高模型鲁棒性,从而将内部计算图确立为理解、诊断和缓解LLM脆弱性的原则性基础。
💡 推荐理由: 本文首次通过内部计算图机制性解释LLM越狱攻击,为理解模型脆弱性根源提供了因果视角,有助于开发更鲁棒的安全机制。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhihao Wu, Yushi Cheng, Jiahui Yang, Xiaoyu Ji 0001, Wenyuan Xu 0001
本文针对基于结构光深度相机的3D人脸活体检测系统,发现了一种新的攻击面——DepthFake攻击。攻击者仅凭目标受害者的一张2D照片即可欺骗3D人脸认证系统。该方法首先从2D照片估计人脸3D深度信息,然后利用该深度信息生成精心设计的散斑图案,将其投影到2D照片上,从而使2D照片具备3D认证特性。研究克服了多项实际挑战,包括2D照片深度估计误差、基于结构光的深度图像伪造、RGB图像与深度图像的人脸对齐等问题。在实验室环境中,对腾讯云、百度云、3DiVi三款商业人脸认证系统以及一款商业门禁设备进行了测试。基于50名用户的实验结果显示,DepthFake在真实世界中实现了79.4%的深度攻击成功率和59.4%的RGB-D攻击成功率。该工作揭示了当前3D活体检测技术的安全漏洞,对依赖人脸认证的门禁、支付等系统构成威胁。
💡 推荐理由: 首次提出利用2D照片绕过3D人脸活体检测的方法,攻击成功率高达79.4%,威胁门禁、支付等场景的安全。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Samira Hajizadeh
本文发现大型语言模型的安全对齐高度依赖于语用语境(pragmatic register),即模型对直接有害请求的拒绝并不能泛化到相同底层意图但不同语用表述的请求上。作者提出了一种名为“回溯式思维链”(RetroCoT)的单轮攻击方法,该方法将有害请求重新表述为法医重建任务:假设有害结果已经发生,要求模型以法医分析师的身份逆向重构导致该结果的因果链。实验在AdvBench子集(n=50)上进行,RetroCoT对gpt-4o的攻击成功率为58%,对gpt-4o-mini为52%,而直接请求基线分别为0%和4%。进一步分析揭示了模型代际间的显著差异:GPT-5系列模型完全拒绝RetroCoT,并在拒绝理由中明确指出重建前提,表明该语用形式已显式覆盖。然而,这种鲁棒性无法泛化到其他语用形式:单轮对抗性反馈(提供现成法医重建响应及评估者批评)在GPT-5.4-mini上将ASR从0%提升到48%,在GPT-4o上从58%提升到94%;控制条件(仅提供重建响应,省略低分)在GPT-5.4-mini上实现85%的ASR,表明关键因素是语用延续(pragmatic continuation)而非分数操纵。这些结果表明,前沿模型的安全对齐仍受语用框架制约,而非语义意图,新的语用注册表(pragmatic registers)可能继续暴露对齐漏洞。本研究适用于LLM安全研究者和防御者,提示现有安全评估方法需覆盖多样的语用表达方式。
💡 推荐理由: 揭示了LLM安全对齐的深层脆弱性:模型拒绝机制仅针对特定语用形式,而非语义意图,攻击者可通过变换语用框架轻易绕过。这对安全评估的设计和防御策略的构建具有重要警示意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Keke Tang, Tianyu Hao, Weilong Peng, Hao Jiang, Feng Wu, Peican Zhu, Jianmin Ji, Zhihong Tian
该论文针对机器人操作中的运动规划对抗攻击问题展开研究。现有攻击方法通常依赖精确位姿目标,并且需要持续查询规划器(planner-in-the-loop),这在实际中受限。为此,作者提出了一种与规划器无关(planner-agnostic)的攻击框架,专门针对容忍感知操作(tolerance-aware manipulation)。方法分为离线与在线两个阶段:离线阶段,通过运动学占用热图(kinematic occupancy heatmap)表征机器人内在的工作空间能力,该热图编码了可行轨迹的密度和鲁棒性先验,无需调用特定规划器;在线阶段,将攻击建模为预算受限的最大覆盖优化问题,在显式几何约束下策略性地部署障碍物以阻塞解空间。在仿真和真实场景中的大量实验表明,该方法能够可靠地诱导规划失败,在计算效率和攻击效能上均显著优于依赖规划器的基线方法。该工作为评估机器人操作系统的鲁棒性提供了新视角,适合机器人安全研究人员和运动规划算法开发者阅读。
💡 推荐理由: 提出一种不依赖规划器查询的攻击方法,可评估机器人操作系统的内在鲁棒性,对理解与防御面向机器人的对抗威胁有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Qi-An Fu, Yinpeng Dong, Hang Su 0006, Jun Zhu 0001, Chao Zhang 0008
该论文提出了一种名为AutoDA的自动化决策型迭代对抗攻击方法。决策型攻击是黑盒对抗攻击的一种重要形式,攻击者只能通过模型的最终决策标签(如分类结果)来生成对抗样本,而无法访问模型内部结构或置信度分数。传统决策型攻击需要手工设计攻击算法,如迭代更新扰动方向,但手工设计耗时且难以达到最优。AutoDA将攻击算法设计自动化,利用强化学习或进化策略等方法自动搜索最优的迭代更新策略。具体地,AutoDA定义了一个搜索空间,包括步长、梯度估计方法、方向更新规则等组件,然后通过采样和优化来寻找性能最佳的攻击策略。在多个标准数据集(如ImageNet)和多种模型(如ResNet、DenseNet)上的实验表明,AutoDA自动发现的攻击策略在攻击成功率和查询效率上均优于现有手工设计的决策型攻击方法。该工作为对抗攻击领域提供了新的自动化视角,有助于更全面地评估模型的鲁棒性。
💡 推荐理由: 自动化攻击设计降低了黑盒攻击的门槛,可能被用于评估和突破实际系统中的AI模型,防守方需关注此类自动化攻击的发展。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli
该论文提出了一种针对大型视觉语言模型(LVLM)的新型越狱攻击方法,名为信息过载(Information Overloading)。LVLM 在个人助理、文档分析、具身智能等场景广泛应用,但其双模态攻击面(视觉和文本)易受越狱攻击。现有攻击方法通常采用简单设计,如短文本和分布外图像,但随着大语言模型骨架和多模态机制的进步,这些攻击的可迁移性显著下降。为克服此限制,作者提出同时利用扩展文本和多维图像攻击的信息过载方法。具体而言,该方法通过递归式图像-排版布局,将文本和图像攻击组件组合,指数级增加多模态信息复杂度。这种过载方式放大了所需的跨模态处理,从而破坏 LVLM 的安全对齐。在开源和商业 LVLM 上的大量实验表明,该方法达到了最先进的越狱攻击效果:开源模型平均攻击成功率(ASR)为 88.6%,商业 LVLM 平均 ASR 为 84.0%,超过最佳基线 48.7%。此外,在开源替代模型上优化的提示能够有效跨模型族迁移。实验还通过探测受害 LVLM 中安全关键信息流,发现复杂的图像-排版组合会引发强化的跨模态处理,并降低模型生成拒绝响应的确定性。这些发现凸显了信息过载作为实际且新兴的安全风险,需要针对复杂多模态越狱输入加强防御。
💡 推荐理由: 该攻击揭示了当前LVLM安全对齐在复杂多模态输入下的脆弱性,信息过载可绕过大多数现有防御,对实际部署的视觉语言模型构成严重威胁,值得安全从业者高度关注。
🎯 建议动作: 关注该攻击模式,评估内部LVLM模型的安全性,研究针对复杂多模态越狱输入的防御策略。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Boyang Zhang, Zheng Li 0023, Ziqing Yang 0002, Xinlei He 0001, Michael Backes 0001, Mario Fritz, Yang Zhang 0016
该论文提出了一个名为 SecurityNet 的框架,旨在系统性地评估公开机器学习模型的安全性弱点。随着预训练模型在开源社区(如 Hugging Face)广泛发布,攻击者可能利用这些模型中的后门、对抗性扰动等漏洞。SecurityNet 通过组合多种攻击方法(包括对抗性攻击、后门注入、模型窃取等),对公开模型进行自动化安全评估。实验覆盖了图像分类、自然语言处理等多种任务中的主流模型架构(如 ResNet、BERT)。主要贡献包括:1) 设计了一个模块化的评估管线,支持多种攻击场景;2) 在大量公开模型上进行了实证研究,揭示了相当比例的模型存在可利用的漏洞;3) 提供了可复现的基准,帮助研究者比较不同防御手段的效果。该工作为模型发布前的安全审查和模型供应链风险管控提供了参考工具。
💡 推荐理由: 帮助安全团队在引入第三方预训练模型前评估潜在风险,降低模型供应链攻击的可能性。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Takami Sato, Junjie Shen 0001, Ningfei Wang, Yunhan Jack Jia, Xue Lin 0001, Qi Alfred Chen
该论文演示了深度学习驱动的自动车道居中(ALC)系统在物理世界攻击下的安全性问题。ALC是高级辅助驾驶系统的关键功能,依赖深度学习模型进行车道线检测和车辆横向控制。作者提出了一种物理世界对抗性攻击方法,通过在车辆前方道路放置精心设计的贴纸图案,成功欺骗ALC系统的车道线检测模型,导致车辆偏离车道或误判车道线位置。实验在真实车辆平台上进行,验证了攻击的有效性,并分析了攻击对车辆控制的影响。论文还讨论了现有防御机制的局限性,并提出了潜在的安全增强方向。该研究揭示了将深度学习模型部署于物理世界安全关键场景时面临的严峻挑战,强调了在自动驾驶系统开发中需纳入对抗性鲁棒性评估。
💡 推荐理由: 自动车道居中系统直接关系行车安全,物理世界攻击可导致车辆失控,对辅助驾驶安全构成实际威胁,值得安全从业者关注防御策略。
🎯 建议动作: 研究跟进:深入理解攻击方法,评估自身系统鲁棒性,探索对抗训练或输入验证等防御手段。
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Halima Bouzidi, Mboutidem Ekemini Mkpong, Haoyu Liu, Mohammad Abdullah Al Faruque
本文提出了一种名为 Derail 的对抗攻击框架,针对当前生成式端到端自动驾驶规划器中的评分头(scoring head)进行攻击。生成式规划器(如基于扩散去噪或词汇检索的模型)在推理时,通常会生成一组候选轨迹(锚点、词汇条目或提议查询),然后通过一个或多个学习到的评分头(基于鸟瞰图特征)对候选轨迹进行打分,最终选择得分最高的轨迹作为输出。研究发现,评分头作为感知与运动指令之间的唯一屏障,其决策边界往往很小,容易受到微小的对抗扰动影响。Derail 框架通过优化安全违反目标(safety-violating objectives),使得原本安全的候选轨迹得分下降,而不安全的轨迹得分上升,从而翻转轨迹选择。实验在多种生成式规划器上进行,结果表明 Derail 能使得分下降 39%--80%,碰撞率高达 50%,且效果优于传统的损失最大化攻击和特征散度攻击。论文进一步分析指出,安全违反目标是攻击有效性的关键驱动因素,而评分头推理模式本身是一种反复出现的攻击面,值得防御者明确考虑。该研究揭示了自动驾驶生成式规划器的一个根本性安全缺陷,即对评分头的安全依赖性可能被利用导致严重碰撞事故。适合自动驾驶安全研究员、AI安全从业者以及自动驾驶系统开发者阅读。
💡 推荐理由: 自动驾驶生成式规划器的评分头是感知到运动指令的唯一屏障,其微小决策边界易被攻击者利用,导致安全轨迹被替换为危险轨迹。该研究首次系统性地揭示了这一攻击面,对自动驾驶安全性具有警示意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Asif Shahriar, Hongyu Cai, Hadjer Benkraouda, Gang Wang, Z. Berkay Celik
该论文首次系统性地探索了大型语言模型(LLM)在代码漏洞检测中受到认知启发(cognitive heuristics)影响的现象。作者设计了一个可控框架,保持代码本身不变,仅改变周围上下文来触发三种认知启发:晕轮效应(通过作者归属)、框架效应(通过任务目标和后果)和锚定效应(通过先前的分析结果)。在三种编程语言(可能包括C、Java、Python等)上评估了8个LLM(如GPT-4、LLaMA等),进行了定量和代码级分析。结果表明,所有模型均易受这些启发影响,其中框架效应的平均影响最高达33.2%,锚定效应23.5%,晕轮效应18.4%。代码级分析显示,需要语义推理才能检测的漏洞(如逻辑错误)比通过模式匹配可识别的漏洞(如语法错误)更容易受认知启发影响。此外,模型常常根据认知条件将代码从安全误判为脆弱,而并未准确识别实际漏洞。为了展示实际影响,作者演示了一种概念验证的黑盒认知攻击,能够抑制之前检测到的多达97%的漏洞。这些发现表明认知易感性是LLM漏洞检测中一致且可利用的属性。该研究对依赖LLM进行安全审计的开发者、安全分析师和AI安全研究者具有重要警示意义。
💡 推荐理由: 揭示了LLM在漏洞检测中可能因上下文信息(如作者、任务描述、先前结果)产生系统性误判,攻击者可利用这种认知漏洞逃避检测,对AI驱动的安全工具可靠性构成威胁。
🎯 建议动作: 研究跟进:评估内部LLM安全工具对此类认知攻击的鲁棒性,探索上下文净化或输入去偏等缓解措施。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Michael Kühr, Mevlüt Yildirim, Maximilian Luedecke, Mohammad Hamad, Sebastian Steinhorst
本文提出了一种针对自动驾驶汽车交通标志分类任务的物理对抗攻击方法。传统的物理对抗攻击通常通过在交通标志上粘贴贴纸或投射可见光扰动,虽然有效但容易被人类察觉。本文作者利用近红外光谱(NIR)和视觉暂留(Persistence of Vision, POV)原理,设计了一种动态、可远程触发的隐蔽攻击方案。攻击者通过近红外LED阵列在交通标志表面投射动态图案,这些图案在人类视觉中不可见,但能被自动驾驶汽车的摄像头捕获,从而误导分类模型。作者首先通过数字仿真确定最佳攻击位置,然后在真实场景中对两种交通标志、12种不同家族的机器学习模型(包括卷积神经网络等)进行测试,距离从近到远达20米,并考虑了不同光照条件。实验结果表明,该攻击在多数测试场景下具有很高的成功率。作为防御措施,作者提出了两种方案:一是物理层面的近红外截止滤镜,可以滤除近红外光;二是软件层面的检测机制,用于识别异常的光谱特征。此外,作者还设计了一个可见光版本的RGB原型来克服近红外显示的一些限制。这项研究揭示了交通标志分类系统中的新安全漏洞,为未来自动驾驶系统的安全设计提供了重要参考。适合自动驾驶安全研究员、对抗性机器学习研究者以及系统防御工程师阅读。
💡 推荐理由: 该攻击利用近红外光的不可见性实现物理世界的隐蔽对抗攻击,直接威胁自动驾驶汽车的感知安全,且现有防御可能无法有效应对。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chengzeng You, Binbin Xu, Soteris Demetriou
该论文研究了基于点云的3D目标检测器在复杂场景下的结构脆弱性。现有工作主要关注孤立3D模型的对抗鲁棒性,而最近的LiDAR欺骗攻击虽然针对真实驾驶场景,但侧重于物理可实现性,未深入分析检测器的行为模式或攻击效率。本文提出一种可解释性引导的对抗分析方法:首先提出Saliency-LiDAR(SALL)方法,通过聚合跨场景的积分梯度归因,生成适用于LiDAR 3D目标检测器的通用显著性图;然后基于该图设计可解释性感知的视锥攻击(EFA),仅扰动对检测结果影响最大的视锥区域,而非均匀攻击整个目标区域。在KITTI和nuScenes数据集上,针对PointPillars和SECOND等检测器的实验表明,EFA在减少15个百分点以上检测召回率的同时,所需扰动的视锥数量比现有非显著性基线少25%-50%。这些发现揭示了现代3D检测器的判别证据集中于少量空间子区域,暴露了当前LiDAR感知系统中的结构性鲁棒性漏洞。代码已开源。
💡 推荐理由: 首次利用可解释性分析揭露LiDAR检测器的结构脆弱性,为自动驾驶系统的安全评估提供新视角,攻击效率显著提升。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lan Zhang 0002, Xinben Gao, Liuyi Yao, Jinke Song, Yaliang Li
该论文针对大型语言模型(LLM)面临的任务级越狱攻击威胁,提出了一种自动化的基准测试框架。研究首先系统性地定义了任务级漏洞的概念,即攻击者通过构造特定任务输入诱使LLM执行非预期行为。作者设计了一种基于对抗性提示生成的自动化攻击方法,能够在不依赖人工参与的情况下发现LLM在各类任务中的脆弱点。同时,论文还构建了相应的防御基准,包括输入过滤、输出检测和模型微调等多种策略的评估。实验在多个主流LLM(如GPT-4、Llama等)上展开,结果表明现有模型在面对任务级攻击时存在显著的失败率,而所提出的防御措施能在一定程度上缓解风险。主要贡献包括:形式化了任务级越狱攻击的威胁模型;提供了一个可复现的自动化攻击与防御评测平台;揭示了当前LLM在任务安全性方面的不足。该工作为LLM安全测评提供了实用工具,有助于推动更鲁棒的防御机制研发。
💡 推荐理由: 该研究提出了针对LLM任务级越狱攻击的自动化基准,填补了当前安全评估中缺乏系统化、可重复评测的空白,对安全从业者理解并防御此类威胁具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Abrar Alotaibi, Moataz Ahmed
本文是一篇关于对抗性攻击与防御在跨模态AI系统中的综述,聚焦于扩散模型在文本(LLM)、图像分类器、视觉-语言模型(VLM)以及输入净化防御中作为攻击或防御机制的统一框架。作者将过去沿着四个相对独立轨迹发展的研究整合起来:基于扩散的文本/LLM攻击、基于扩散的图像分类器攻击、针对VLM的越狱流水线、以及基于扩散的输入净化防御。综述分析了50篇已发表论文,覆盖四个主要领域(文本/LLM、图像分类器、VLM、防御),还包括4个以扩散LLM为受害者的条目和10个非扩散基线方法。作者提出了一个六类扩散角色分类法(如生成对抗样本、净化噪声等),并结合威胁模型维度(攻击者知识、查询预算、目标可访问性)进行标注,同时采用五维评估框架(攻击成功率、可迁移性、查询预算、困惑度、防御规避性)跨模态统一度量。本文采用攻击者-防御者双重视角,除攻击分类外,还涵盖四种基于扩散的防御方法。批判性分析指出了当前LLM侧文献中五个反复出现的弱点,并提出了开放问题与具体实验设计的研究议程。论文附带目录和电子表格。
💡 推荐理由: 该综述首次跨模态统一了扩散模型在对抗性攻击与防御中的角色,为安全从业者提供了系统性的技术分类和评估框架,有助于理解跨模态攻击的共性和迁移风险。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Linghan Chen, Kaiyan Ji, Minyu Guo
本研究聚焦于视觉-语言-动作(VLA)策略中一种新型攻击面:世界-动作模型(WAM)的“可信想象”。许多现代VLA策略采用“先想象后行动”的设计:WAM首先生成一个短期未来潜在轨迹z~,然后动作基于该轨迹进行条件化。作者识别出该想象过程存在一种不对称性:破坏想象(即生成偏离自然流形的z~)相对容易,而精确控制想象(即到达指定的流形内目标)却困难。他们提出了一种基于能力的威胁模型,假设攻击者在L-无穷范数有界的观测扰动下,通过完全可微的观测-想象映射应用投影梯度下降(PGD)来破坏想象。研究发现,无目标破坏的强度大约是随机的60倍,且被AUC为1.0的无参数去噪器检测器完美检测;而目标控制仍然受限。自适应攻击者只有放弃破坏才能逃避检测。反应式策略对受损想象保持鲁棒,但原生的想象驱动型模型预测控制(MPC)首次出现针对特定对手的任务失败(在epsilon=0.01时,成功率从0.70降至0.05,Fisher p<10^-4)。论文在RynnVLA-002、LingBot-VA和LaDi-WM三个模型上进行了评估。主要贡献包括:揭示WAM想象过程作为暴露攻击面;提出非对称攻击和防御方法;实验证明攻击可导致下游安全门、视觉MPC规划器或“先想象后验证”验证器失效。
💡 推荐理由: 该研究首次揭示世界-动作模型的想象过程是一个易受攻击的暴露面,对依赖未来预测的安全门、MPC等下游组件构成威胁,对VLA策略的鲁棒性评估和防御设计具有重要指导意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Mingyuan Fan, Cen Chen
随着物联网设备的普及,分布式边缘系统开始大规模收集敏感数据,为设备端机器学习提供了应用场景。联邦学习(FL)通过仅传输模型参数而不交换原始数据,在一定程度上缓解了隐私泄露风险。然而,当前研究忽视了一个关键盲点:在个性化联邦学习(PFL)场景中,客户端各自维护私有模型以应对数据异质性,但这种个性化机制反而使得系统更容易受到基于迁移的对抗性攻击。本文首先系统分析了多种主流PFL方法,发现相较于集中式学习,PFL在对抗样本转置攻击下表现出显著更高的脆弱性:恶意客户端可利用本地模型知识构造对抗样本,进而攻击其他对等客户端的个性化模型。作者通过理论分析并在多个基准数据集(如CIFAR-10、MNIST等)上进行实证评估,验证了该脆弱性,结果显示各PFL方法的准确率均大幅下降。为应对这一挑战,论文提出了一种协同防御框架,具体包括:(1)在输入层注入随机噪声,以破坏对抗扰动的有效性;(2)引入输入缩放迹正则化,约束模型更新方向;(3)最大化参数敏感度,增强模型对微小扰动的鲁棒性。实验证明,该框架能有效恢复模型精度,平衡隐私与安全性。这项工作首次对PFL系统中的对抗威胁进行了系统性研究,既揭示了安全隐患,也提供了实用的诊断工具与防御手段,适合联邦学习、分布式机器学习及安全领域的从业者阅读。
💡 推荐理由: 个性化联邦学习(PFL)被广泛应用在IoT、医疗等敏感场景,但现有安全研究多关注标准FL,忽视了PFL的独特脆弱性。本文首次证实PFL更易遭受对抗攻击,并提出了针对性的防御框架,对保护分布式模型安全具有重要实践指导意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md Anas Biswas
本文研究提示注入检测器在攻击分布迁移场景下的置信度校准问题。当前检测器通常将模型对输入的打分与固定阈值比较,决定是否拦截。然而,实际攻击分布(如间接注入、越狱变体)可能偏离模型训练或调优时使用的干净基准分布,导致检测器在未知攻击上表现不稳定。作者以三种公开检测器(ProtectAI-v2 和两种 Prompt-Guard-2 检查点)为研究对象,在单一源校准阈值下,将其迁移至五种攻击分布偏移场景,并引入严重性度量 S(表示检测器对漏报攻击的置信度水平)。实验发现:在所有偏移和所有检测器上,漏报攻击的 S 值始终介于 0.99 到 1.00 之间,而假阴性率从 0.01 到 0.97 不等——即检测器一旦漏报,几乎以绝对自信忽略攻击。特别地,三种检测器一致对间接行为劫持注入(促使模型执行恶意操作的类型)表现出盲点。标准池化校准误差无法捕捉该现象:一个被认为校准良好(0.06)的检测器,在仅考虑攻击时校准误差高达 0.91。在实际模型测试中,漏报的注入会泄露大部分可工作漏洞,拦截率与其他攻击相同。作者通过受控实验追溯原因,发现是检测器过度依赖内容关键词而非注入结构,且指令微调模型作为裁判时表现出相同盲点。黑盒重写器利用内容键控机制可制造高置信度的漏报,尤其对最危险的攻击类别效果显著。代码和数据已公开。本文为 LLM 安全评估提供了新视角,强调校准质量不能仅靠平均误差衡量,必须针对攻击子集单独评估。
💡 推荐理由: 提示注入是 LLM 应用的核心威胁,而现有检测器在攻击分布迁移时可能以极高自信漏报关键攻击,标准校准指标无法反映该风险。安全团队需重新审视检测器的置信度可靠性,特别关注间接注入盲点。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Weikang Ding, Hanqing Guo, Rui Duan, Guangjing Wang, Yuanda Wang, Mingzhe Chen, Qiben Yan
本文提出了一种针对音频水印的自适应攻击方法(AWM),旨在绕过现有的水印检测防御策略。研究发现,水印解码器的消息概率遵循正态分布,这一特性被现有防御方法利用来检测攻击行为。AWM 采用两阶段优化:第一阶段确保攻击成功,第二阶段提升音频质量。为了规避检测,该方法从目标音频的有限样本中估计正态分布参数,然后自适应地将解码概率调整回估计的正常范围内。在三个语音数据集上对两种水印方法进行测试,AWM 在实现高攻击成功率的同时,能够绕过最先进的检测器:替换和创建攻击的检测率低于10%,移除攻击的检测率为0%。
💡 推荐理由: 音频水印是保护生成音频版权的关键技术,而本文揭示了一种能够有效逃避现有检测机制的自适应攻击,对版权保护系统的安全性构成严重威胁。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lijia Yu, Jiuxin Cao, Yuchen Qiang, Changhao Chen, Yifei Huang, Bo Liu
本文针对视觉-语言预训练(VLP)模型的对抗可迁移性问题展开研究。现有基于迁移的黑盒攻击方法通常严重依赖替代模型,导致对抗样本在替代模型上有效,但在未知目标模型上效果不佳。作者将此归因于对抗优化过程中替代模型特定的偏差(surrogate-specific bias),即更新方向更多地响应替代模型的特性而非输入语义。为纠正这一偏差,提出 DeBias-Attack 方法。该方法维护两个扰动分支:主分支在原始图像上优化扰动,获取破坏图像-文本对齐的对抗梯度;参考分支在弱语义图像上优化扰动,该弱语义图像由数据集平均图像加上每轮重新采样的小高斯噪声构成,由于缺乏清晰视觉内容,其优化过程更能反映替代模型的响应,从而估计出替代特定偏差。通过从主梯度中移除其在参考梯度上的对齐投影,再结合上下文感知文本替换更新对抗图像,实现偏差纠正。实验在多种 VLP 模型(如 ALBEF、BLIP)、下游任务(图像检索、图像描述)以及开源和闭源多模态大语言模型上验证了该方法的优越性能。本文首次将梯度校正引入 VLP 迁移攻击,为黑盒攻防研究提供了新视角。
💡 推荐理由: 本研究揭示了VLP模型对抗迁移性瓶颈的根源——替代特定偏差,并提出有效纠正方法,为设计更鲁棒的视觉-语言模型及防御策略提供关键参考。
🎯 建议动作: 研究跟进,评估该方法对内部VLP模型的影响,并探索相应的防御手段。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Qin Yang, Lu Malloy, Joshua Lee, Xiaohan Chang, Meisam Mohammady, Doowon Kim, Yuan Hong
这篇论文研究了基于大型语言模型(LLM)的内容审核系统在视觉感知上的盲点。作者指出,当前的内容审核系统主要依赖令牌化文本,忽略了人类在理解内容时所依赖的视觉线索,例如字体、间距、排列等排版特征。这种感知不匹配导致:人类能轻易识别的有害内容,对自动审核系统来说可能完全不可见。为了系统性地研究这一漏洞,作者提出了一类新的攻击手段——人类感知对抗攻击(Human-Perceptible Adversarial Attacks, HPAA)。其核心思想是通过视觉上显著的排版操纵,将有害表达嵌入到看似无害的文本中,使得人类仍能识别其有害性,而机器检测率大幅下降。攻击完全在黑盒设置下进行,仅需少量查询(实验中仅需3次),无需模型访问或梯度信息。作者在多个数据集和十种实际部署的审核系统(包括商业API和最先进的开源防护栏)上评估了攻击效果。结果显示,攻击生成的内容在人类识别率超过86%的同时,在所有被评估系统上的检测率均低于1%。进一步的消融实验分析了促成成功规避的排版因素,并讨论了当前审核架构为何无法捕捉这些信号。最后,作者提出了一些实用性防御措施。该研究揭示了当前基于LLM的审核生态系统中的一个根本盲点,强调需要开发能够更符合人类感知理解的内容审核系统。
💡 推荐理由: 该研究揭示了LLM内容审核系统在视觉感知层面的结构性缺陷,攻击仅需少量查询即可实现极低检测率,对依赖LLM过滤有害内容的平台构成潜在威胁。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yifan Liao, Zongmin Zhang, Zhen Sun, Yuhui Sun, Xinhu Zheng, Xinlei He
本文针对自动语音识别(ASR)系统的对抗鲁棒性展开研究。现有对抗攻击直接在波形域添加噪声,存在两个主要局限:一是对黑盒ASR系统的迁移性差,二是易被专门防御波形扰动的机制缓解。为此,作者提出了一种基于代理模型的Clean-Referenced Feature-Vocoder Attack(CR-FVA),将对抗扰动空间从原始波形转移到自监督学习(SSL)表示空间。具体而言,攻击者首先在代理ASR模型(如Whisper-small)的SSL特征层上计算对抗梯度,并扰动更具泛化性的声学-音素表示,从而减少对代理模型特定波形梯度的依赖,提升跨系统迁移性;然后利用声码器(vocoder)将扰动后的SSL特征重构为类语音波形信号,使得最终对抗样本看起来更像自然语音,从而绕过基于波形边界的防御。实验表明,仅以公开的Whisper-small为代理模型,CR-FVA在多个黑盒ASR模型上实现了相对最佳基线平均+26.6%的词错误率(WER)提升;针对多种训练防御(如对抗训练、频谱压缩等),WER提升幅度达+36.2%。该研究揭示了当前ASR鲁棒性评估中的一个盲区:大多数防御仅关注波形域扰动,而基于更高层特征的攻击能轻易绕过。本文工作适合ASR安全研究者、对抗机器学习从业者以及语音系统防御工程师阅读,有助于理解现有防御的不足并设计更全面的鲁棒性评估方案。
💡 推荐理由: 该攻击方法揭示了ASR系统在特征层面的新攻击面,能有效绕过现有基于波形扰动的防御,并展现出强黑盒迁移性,对语音助手、会议转录等关键应用的安全性构成潜在威胁,促使防御者重新审视鲁棒性评估标准。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bochen Lyu, Yiyang Jia, Xiaohao Cai, Zhanxing Zhu
本文研究了大型语言模型(LLM)安全对齐的脆弱性,提出其根本原因在于自回归一致性——即自回归模型在预测下一个token时倾向于保持并延续当前生成轨迹的特性。作者通过分析安全对齐微调的学习动态,发现对齐更新主要集中在输出序列的前几个token上,导致安全对齐呈现“浅层”现象:模型仅在早期响应中拒绝有害请求,而后续生成可能偏离安全轨迹。这一机制也预测了一类更广泛的攻击:攻击者可以在输出轨迹的任意位置诱导一个有害的“连续状态”(harmful continuation state),从而劫持生成过程。作为具体示例,本文提出了随机插入攻击(random insertion attack),该方法在原本安全的拒绝回复中插入一个简短的有害片段(例如几个有害词),利用自回归一致性使模型延续该有害分支,即使之前已有大量拒绝前缀也能成功绕过安全对齐。实验表明,即使插入片段很短,也能使模型产生有害输出,凸显了自回归一致性作为更广泛失败机制的可能性。基于以上发现,作者提出对抗性安全对齐(adversarial safety alignment)框架,通过考虑最坏情况下的有害连续状态来训练模型,并实例化为随机最坏插入训练(random worst-insertion training)。总体而言,本文揭示了自回归一致性在安全对齐和攻击设计中的核心地位,为理解LLM安全脆弱性提供了新的理论视角,并为防御策略改进指明了方向。
💡 推荐理由: 本文首次从自回归一致性的动力学角度解释了LLM安全对齐浅层化的根本原因,并据此预测并验证了一种新型攻击(随机插入攻击),同时提出了对抗性安全对齐的防御框架。对安全从业者而言,理解这一机制有助于设计更鲁棒的对齐方法和评估现有防御的局限性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Malia Barker, Bishal Lakha, Edoardo Serra, Francesco Gullo
该论文研究了大型语言模型(LLM)在算术推理任务中对数值变化的鲁棒性问题。尽管LLM在基准测试中表现优异,但已有研究表明其对数值变化敏感:同一问题在不同数值下可能失败。现有方法多依赖模板或人工约束,局限性较大。为此,作者提出一种自动化的数值重映射攻击算法,能够生成保留原始推理程序的小规模数值变换,从而测试模型的泛化能力。该方法首先从问题中提取符号表示,生成受约束的数值重映射,重新计算正确答案,并通过LLM生成的编辑计划实现确定性变换。通过阶段验证和高置信度审计确保攻击可靠性,使管道可扩展。在GSM8K、MAWPS和MultiArith三个数据集上对DeepSeek-R1(70B)、Gemma4(31B)和GPT-OSS(120B)进行了评估。结果显示,在GSM8K上,已完成运行的模型条件准确率下降了12.16至25.82个百分点,而MAWPS和MultiArith则非常稳定,攻击后准确率仍接近或超过98%。这表明数值重映射鲁棒性高度依赖于数据集结构:GSM8K即使在保留推理程序和重计算答案的情况下仍然脆弱,而更短、更规整的数据集则更为鲁棒。该工作为评估LLM的算术推理泛化能力提供了一种新方法,对安全从业者理解LLM在数值推理任务中的局限性具有参考价值。
💡 推荐理由: 本方法揭示了LLM在算术推理中仍存在数值泛化脆弱性,即使使用小幅度、保留推理逻辑的数值变化也能导致准确率显著下降,对依赖LLM进行数学推理的应用场景构成潜在风险。
🎯 建议动作: 研究跟进,评估自身LLM对数值变化的鲁棒性,并在关键场景中考虑添加外部验证。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jinghuai Zhang, Yetian He, Kunlin Cai, Han Zhao, Fnu Suya, Yuan Tian
本文提出了 RogueMerge,一个针对大语言模型(LLM)模型合并过程的统一攻击框架。模型合并通过聚合来自未经验证的公共平台的任务向量,将多个专用能力组合到单个 LLM 中,这暴露了关键的供应链攻击面:因为任何恶意行为都可以编码到任务向量中,且合并过程授予第三方向量对模型权重的直接写入权限,攻击者提供的任务向量可以启用或放大多种下游威胁。之前的工作仅研究针对分类器的静态算术启发式后门攻击,无法有效处理生成式 LLM 上的多种攻击,原因有三:(i) LLM 依赖自回归解码,合并引入的微小参数漂移会在 token 间累积,迅速降低攻击效果;(ii) 攻击者不知道受害者合并配置,静态攻击向量容易被稀释或破坏;(iii) 实际威胁诱导必须泛化到优化期间未见过的攻击提示,静态向量无法充分编码。RogueMerge 解决了这三个挑战:为处理自回归生成,它用联合优化替换静态算术,显式地确保合并后攻击成功;为处理未知合并设置,它将攻击注入形式化为随机最小-最大问题,并通过元学习风格模拟求解;为跨异构攻击提示泛化,它采用分布鲁棒优化并推导出 LLM 规模下可处理的一阶泰勒近似,具有可证明的误差界。在四种威胁、六种合并算法和超过 170 个合并 LLM 上,RogueMerge 持续优于现有攻击,且在不同合并设置下保持稳定,并能抵抗标准防御。
💡 推荐理由: 模型合并作为 LLM 供应链中的新兴范式,其安全性研究严重不足。RogueMerge 首次系统地揭示了该场景下的统一攻击面,对依赖公共模型合并的团队构成切实威胁,也为防御机制设计提供了基准。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yingzi Ma, Zhengyue Zhao, Xiaogeng Liu, Minhui Xue, Yue Zhao, Chaowei Xiao
本文提出了一种针对扩散大规模语言模型(dLLMs)的黑盒越狱攻击方法MaskForge。dLLMs通过迭代去噪部分掩码序列生成文本,其安全面与自回归LLMs不同:掩码令牌是原生输入,令牌基于置信度而非位置确定,因此有害内容可以通过填充(infilling)并在监控前缀之外诱导。现有越狱方法要么忽略这种原生填充能力,要么使用低多样性的掩码模板,缺乏结构适应性。MaskForge将dLLM红队测试转化为对结构模式库的优化搜索:它抽象成功尝试为可重用模式,使用上置信界(UCB)多臂赌博机算法选择与目标兼容的模式,并在当前库失败时调用评分器引导的回落机制;成功尝试被蒸馏回模式库,实现跨目标的经验积累。在5个公开dLLM和3个基准上,MaskForge的平均攻击成功率达79.3%,相对最强基线提升17.6%;其成熟模式库无需更新即可迁移至AdvBench,攻击成功率达88.2%,相对最强基线提升67%。该研究揭示了dLLM特有的安全风险,为防御者提供了新的攻击面认知。
💡 推荐理由: 扩散LLM在工业界应用渐广,其双向上下文生成机制带来与传统自回归模型不同的安全面。MaskForge首次系统性地利用dLLM的填充能力进行自适应攻击,防御者需了解此类攻击向量以设计针对性防护。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yani Wang, Yilong Yang, Yang Liu, Zhuzhu Wang, Zuobin Ying, Zhuo Ma
该论文提出了一种名为分布式语义重组(DSR)的新型跨模态越狱攻击框架,旨在绕过多模态大语言模型(MLLM)的安全防护。现有安全措施主要针对单模态文本输入进行拦截,但跨模态攻击可能通过图像等非文本载体隐藏恶意意图。DSR的核心思想是将有害意图分解为一组良性的文本和视觉基元(例如无害的短语和图片),这些基元单独看来不包含危险内容,但经过模型的推理和跨模态融合后,能在输出端组合成有害信息。这种方法利用MLLM强大的指令遵循和推理能力,使得模型自身成为攻击的助力。该框架无需在输入中携带任何显式有害内容,因此难以被现有基于输入过滤的安全机制检测。实验在多个商业MLLM流水线上进行,结果显示DSR实现了极高的攻击成功率,同时输入毒性极低甚至可忽略不计。该工作揭示了MLLM中存在的“效用-安全悖论”:模型越能准确理解并执行复杂指令,就越容易被利用来生成有害输出。论文还讨论了防御方向,如加强跨模态推理阶段的监控和输出过滤。研究贡献在于首次系统性地提出并验证了纯良性输入导致有害输出的跨模态攻击范式,对MLLM安全设计具有重要警示意义。
💡 推荐理由: 揭示了MLLM面临的全新威胁:攻击者无需输入任何恶意内容,仅通过精心编排的良性文本和图像组合即可使模型生成危险输出。这对依赖输入过滤的现有防御体系构成了根本挑战。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ei Hmue Khine, Yao Li, Jiebao Sun, Shengzhu Shi, Zhichang Guo, Boying Wu
该论文聚焦于决策型黑盒对抗攻击(decision-based black-box adversarial attacks)这一严重安全威胁。现有方法存在根本性局限:像素级攻击常引入不自然的高频视觉伪影,而潜在空间框架受限于低维流形的搜索空间以及固有的重建缺陷。为克服这些问题,作者提出了一种名为Latent Geometric Chords(LGC)的高效查询型决策黑盒对抗攻击方法及其变体LGC-H。LGC的核心是在压缩语义流形内执行曲率感知的几何搜索以导航决策边界。为保证高视觉保真度并规避维度瓶颈,作者引入了基于残差的对抗生成(RAG)机制。RAG将语义扰动隔离为几何弦,并直接叠加到原始源图像上,从而显著改善了基线重建缺陷,并将可搜索空间维度有效翻倍。实验结果表明,LGC具有鲁棒的跨数据集迁移能力,并在多个性能指标上显著优于现有基线方法。具体而言,在5000次查询限制下,LGC实现了最小扰动幅度和最高视觉保真度,结构相似性指数(SSIM)超过0.99,学习感知图像块相似度(LPIPS)低于0.01,同时在严格的感知约束下保持高攻击成功率,成功攻破了经过对抗训练(adversarially trained)的鲁棒模型。该工作对理解黑盒模型的脆弱性以及开发更安全的机器学习系统具有重要意义。
💡 推荐理由: 该研究提出了一种高效且视觉保真的决策型黑盒攻击方法,可有效评估和暴露机器学习模型的安全隐患,对开发防御策略和提升模型鲁棒性具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Churui Zeng, Weiwei Qi, Kedong Xiu, Tianhang Zheng, Chaochao Lu, Liang He, Zhan Qin, Kui Ren
随着LLM Agent(智能体)的兴起,它们能够自主规划、编写代码甚至端到端执行专家级的攻击工作流,这带来了新的安全威胁。然而,这种威胁目前尚未被充分研究和重视,原因有二:一是安全对齐机制阻止LLM直接生成有害指令;二是现有的越狱方法大多无法持续诱导Agent执行恶意操作。本文提出了TRACE,一个实用的Agent越狱框架,旨在进一步揭示该威胁面的风险。为了隐藏恶意意图,TRACE将恶意任务分解为多个不同方案下的子任务序列,并选择其中显式有害子任务最少的序列。然后,TRACE通过将剩余的有害子任务嵌入到任务感知的场景中(包含相关角色、环境、指令和启发式规则)来伪装成看似良性的指令。这些场景通过明确定义的转换操作进行迭代演化,这些转换操作由Q-learning启发的机制采样,以诱导Agent执行有害子任务。在AgentHarm和AdvCUA上的广泛评估表明,TRACE在多个先进的LLM Agent上持续优于现有的越狱基线,实现了高达100%的绕过率和0.73的平均成功得分。此外,作者还在受控的网络攻击实例中展示了TRACE的有效性。代码和演示可在GitHub上获取。本文的核心贡献在于系统性地揭示了LLM Agent面临的越狱风险,并提出了一种可复现的评估框架。适合AI安全研究员、红队工程师和LLM应用开发者阅读。
💡 推荐理由: 该研究首次系统性地针对LLM Agent的越狱威胁提出了实用框架,揭示了Agent在自动化攻击任务中的脆弱性,为防御方理解并评估此类风险提供了重要参考。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Brian Crawford, Justin Phillips, Patrick McClure
该论文研究了针对大型语言模型(LLM)驱动的逆向工程 AI 代理的自动化攻击方法。随着 LLM 被集成到如 Ghidra 等二进制逆向工程工具中,自动化分析流程得以实现,但同时也引入了新的安全风险。作者提出了一种基于遗传算法的提示生成技术(AutoDAN 的变种),用于欺骗 LLM 驱动的反汇编和反编译系统,使其错误理解二进制可执行文件,从而破坏分析输出。该方法利用 LLM 在处理反编译代码时对提示注入的脆弱性,通过在二进制文件中插入不影响功能的额外字符串变量赋值,向 LLM 传递隐蔽指令。实验通过多个简洁示例展示了该攻击的有效性,证明攻击者能够绕过依赖 LLM 分析的自动化检测系统。该研究揭示了将 LLM 集成到网络安全工具链中的安全隐患,并为构建更稳健的自主代码分析系统提供了见解。适合安全研究人员、LLM 安全工程师及逆向工程工具开发者阅读。
💡 推荐理由: 该论文首次系统性地提出针对 LLM 逆向工程代理的自动化对抗攻击,揭示了 AI 驱动安全工具的新脆弱面,对依赖 LLM 进行恶意软件分析的安全运营团队具有重要警示意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Junke Zhang, Jianwei Wang, Sishuo Chen, Yizhang He, Qingshuai Feng, Zhengyi Yang
该论文提出了一种名为MemoAttack的黑盒越狱攻击框架,旨在自动化生成对大型语言模型(LLM)的有效对抗性提示。现有黑盒越狱方法要么依赖样本级启发式搜索,要么通过积累策略池或方法库来利用攻击经验,但缺乏对攻击经验的系统组织和管理。MemoAttack通过三个关键设计解决这一问题:(1)技能结构化记忆建模,将积累的攻击经验抽象为可复用的技能结构化攻击记忆,每个记忆单元将攻击技能与模板、证据和生命周期状态配对;(2)生命周期驱动的记忆演化,通过基于证据的试用、晋升、退休、重新激活、淘汰和存储清理来演化记忆;(3)探索-利用平衡的记忆选择,通过上下文汤普森采样在可靠记忆复用与不确定性驱动的探索之间取得平衡。在AdvBench上的实验表明,MemoAttack实现了98.00%的平均攻击成功率,比最强基线高出16.67个百分点,同时将请求数量减少了45.9%。此外,随着更多样本的记忆积累,MemoAttack的性能持续提升。该研究揭示了攻击经验的有效组织可显著提升越狱攻击的效率与效果,对LLM安全评估具有重要警示意义。
💡 推荐理由: 该工作展示了通过结构化记忆管理可以大幅提升黑盒越狱攻击的成功率(98%)并降低请求成本,揭示了当前LLM安全防御面临的系统性风险,安全团队需关注此类攻击演进趋势。
🎯 建议动作: 研究跟进,评估自身LLM服务对该类攻击的鲁棒性,并关注后续防御方案。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yinyuan Zhang, Cuiying Gao, Yueming Wu 0001, Shihan Dou, Cong Wu 0003, Ying Zhang 0066, Wei Yuan 0001, Yang Liu 0003
本文提出了一种名为“Fighting Fire with Fire”的连续攻击方法,用于对抗Android恶意软件检测系统。研究背景是当前Android恶意软件检测模型容易受到对抗样本攻击,而现有的防御方法往往被动且效果有限。核心问题是如何主动且持续地生成对抗样本以训练更鲁棒的检测模型。方法上,作者设计了一种迭代攻击框架,能够在检测模型不断更新的过程中持续生成高效对抗样本,形成攻击与防御的博弈。实验表明,该方法能显著降低多种主流检测模型(如Drebin、MalDozer)的准确率,并证明通过这种连续攻击训练出的模型在对抗性上比传统对抗训练更具鲁棒性。主要贡献包括:1) 首次提出连续攻击范式;2) 揭示了静态对抗训练的局限性;3) 提供了一种新的评估检测模型鲁棒性的方法。适合安全研究人员及Android安全工程师阅读。
💡 推荐理由: 对抗攻击是安全模型部署的主要威胁,本文提出的连续攻击方法能帮助蓝队更真实地评估和增强检测模型的鲁棒性,具有直接防御价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Qingying Hao, Licheng Luo, Steve T. K. Jan, Gang Wang 0011
本论文研究了感知哈希(Perceptual Hashing)算法的安全性,重点关注其在实际应用(如版权检测、内容审核)中的脆弱性。作者提出了一种针对感知哈希的对抗性攻击方法,能够操纵图像使得其感知哈希值在攻击者控制下发生变化,而视觉效果保持相似或不同。具体来说,攻击者可以生成两张视觉上相同但哈希值截然不同的图像,或者视觉上不同但哈希值相同的图像。这种攻击利用了感知哈希算法对图像微小扰动的敏感性,通过优化噪声添加来实现。实验在pHash、DCT-based哈希等常见感知哈希算法上进行,证明了攻击的有效性。结果表明,基于感知哈希的应用可能被欺骗,从而绕过版权检测、虚假删除合法内容或隐藏恶意内容。论文还讨论了潜在防御策略,如更鲁棒的哈希设计或结合图像质量指标。该工作揭示了感知哈希在安全关键场景中的不足,对内容平台和数字取证领域具有重要警示意义。
💡 推荐理由: 感知哈希广泛应用于版权检测和内容审核,该攻击揭示其易被操纵,可能导致误判或滥用,影响平台安全与内容合规。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Aditya Sridhar
概念瓶颈模型(CBM)是可解释机器学习的重要方法,通过显式的概念激活提供人类可理解的中间表示。然而,这种可解释性引入了一个此前未被探索的攻击面:概念瓶颈层本身。本文首次系统性地研究了CBM在概念层面的对抗性脆弱性,发现针对输入像素的微小、定向扰动可通过操纵语义表示导致灾难性的分类错误。作者建立了一个严格的理论框架来量化概念空间的鲁棒性,提出了新的度量标准,揭示了这些架构的脆弱性景观。在CUB-200-2011数据集上的广泛分析表明,标准CBM对概念级操纵表现出严重的脆弱性。为应对这一关键弱点,作者引入了SPECTRA(基于语义扰动的概念训练以增强鲁棒性),这是一种原则性的稳定性正则化防御。SPECTRA有效地强化了语义表示空间,将成功攻击所需的最小扰动范数从0.46提高到超过4200,使得定向概念操纵在计算上不可行。此外,SPECTRA将基线分类准确率保持在2.2%以内。通过将概念级攻击确立为一个根本不同的威胁模型,这项工作在可解释机器学习与对抗鲁棒性的交叉领域开辟了一个新的研究前沿。
💡 推荐理由: 首次揭示可解释CBM自身的高危攻击面:通过微小像素扰动操纵中间概念层即可导致分类失效,威胁依赖CBM的安全关键应用(如医疗影像、自动驾驶)。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Phuc Duc Nguyen, Quang Duc Nguyen
本文研究了测试时自适应(Test-time Adaptation, TTA)场景下的一种新型对抗攻击。TTA通过利用无标签测试流来应对分布漂移,但这也为对手提供了可乘之机。现有的类级别定向攻击在TTA中不够隐蔽:由于TTA批量处理,迫使部分样本趋向目标标签会无意中带动相似良性样本,导致目标标签出现频率过高,容易被检测。本文提出一种更真实的样本级定向攻击,攻击者仅使携带特定触发器的样本被错误分类,同时保持良性查询的全局标签分布不变以规避检测。为此,作者设计了一种基于元学习的攻击方法,并引入优先级感知梯度对齐策略,将梯度更新建模为椭球置信域问题,从而缓解攻击成功与分布隐蔽之间的冲突。理论上保证了在梯度不一致的情况下仍能有效优化攻击目标。在CIFAR-10-C、CIFAR-100-C和ImageNet-C数据集上,结合多种TTA协议进行了大量实验,结果表明该方法在保持与无攻击基线一致的标签分布的同时,实现了高定向攻击成功率,在无标签的TTA部署场景中难以被检测。此外,该攻击对现有防御手段表现出强鲁棒性。本文适合从事对抗性机器学习、TTA安全以及鲁棒性评估的研究人员阅读。
💡 推荐理由: TTA作为应对分布漂移的常用技术,其安全性至关重要。本文揭示了更隐蔽的样本级定向攻击,突破了现有防御的检测能力,为TTA的实际部署敲响警钟。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yutong Liu, Chenyi Wang, Ming F. Li, Qingzhao Zhang
该论文研究了协作感知(CP)系统中的信任机制安全性。协同感知允许联网自动驾驶车辆共享传感器数据并联合推理环境,现有的防御机制通过跨车辆不一致性检测和信任估计来惩罚与多数观察冲突的车辆。然而,本文指出这类防御本身引入了新的攻击面。作者提出TrustFlip攻击,通过部署真实的物理对抗物体,使良性车辆之间产生不一致的观察结果,从而被防御机制误认为是目标车辆的行为,导致其信任度下降,最终被降权或排除出协作。实验表明,该攻击在多达87.7%的场景中成功移除目标车辆,并使平均精度(AP)下降最多13%。作为初步缓解,作者提出TrustReflect——一种轻量级自反射机制,将争议区域标记为不确定并排除出信任评估,可将攻击成功率降低35-100%。该论文揭示了自动驾驶协同感知中信任机制的新漏洞,对设计更鲁棒的协作感知系统具有重要警示意义。
💡 推荐理由: 首次揭示协同感知系统中信任机制自身可被利用,导致良性车辆被错误排除,可能引发安全关键事故。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Leitao Yuan, Qinghua Mao, Daizong Liu, Kun Wang, Wenjie Wang, Yan Teng, Jing Shao, Dongrui Liu
多模态大语言模型(MLLMs)尽管性能强大,但仍易受基于迁移的目标攻击:攻击者在开源代理编码器上优化扰动,该扰动可泛化至闭源MLLMs。提升对抗迁移性的关键在于有效捕获不同模型共享的内在视觉焦点,使扰动对齐可迁移的语义线索而非代理特定行为。现有方法受限于空间域特征冗余和代理特定梯度信号,阻碍了跨模型迁移性。本文提出FRA-Attack,从统一的频率域正则化视角解决这两个挑战。在特征对齐方面,对块特征使用高通DCT目标,抑制冗余全局结构并将损失集中在承载MLLMs内在视觉焦点的高频带上。在梯度优化方面,引入频率域梯度正则化(FGR),一种模型无关的低通正则化器,仅利用几何频率坐标调节代理梯度,不涉及任何代理导出统计量,因此FGR天然模型无关,去除代理特定高频伪影的同时保留可迁移的低频方向。两者结合形成统一的频率域迁移性处理。在来自7个供应商的15个旗舰MLLM上的广泛实验表明,FRA-Attack实现了优异的跨模型迁移性,尤其在GPT-5.4、Claude-Opus-4.6和Gemini-3-flash上达到最先进性能。
💡 推荐理由: 该攻击方法揭示了当前MLLMs在对抗迁移性方面的严重脆弱性,防御者需关注频域特征对齐和梯度正则化作为潜在防御思路,并评估自研模型对类似攻击的鲁棒性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuxin Cao, Xi Xiao, Ruoxi Sun 0001, Derui Wang, Minhui Xue 0001, Sheng Wen
本文提出了一种名为 StyleFool 的黑盒视频对抗攻击方法,利用风格迁移技术欺骗视频分类系统。当前的黑盒攻击通常需要大量查询才能成功,导致计算开销巨大;而限制扰动的攻击易被去噪或对抗训练等防御手段抵御。StyleFool 采用无限制扰动,首先通过颜色主题邻近性选择最佳风格图像,以避免风格化视频中出现不自然细节。在定向攻击中,额外考虑目标类别置信度,通过将风格化视频移近甚至跨越决策边界来影响分类器的输出分布。然后使用无梯度方法进一步优化对抗扰动。在 UCF-101 和 HMDB-51 两个标准数据集上的大量实验表明,StyleFool 在查询次数和对现有防御的鲁棒性方面均优于现有先进对抗攻击。值得注意的是,非定向攻击中 50% 的风格化视频无需任何查询即可成功欺骗视频分类模型。此外,通过用户研究评估了不可区分性,证明 StyleFool 的对抗样本在无限制扰动下对人眼几乎不可察觉。该工作揭示了视频分类系统在风格迁移攻击下的脆弱性,为提升视频分类系统的安全性提供了新视角。
💡 推荐理由: StyleFool 提出了一种高效且鲁棒的黑盒视频对抗攻击方法,显著降低了攻击所需的查询次数,同时生成的对抗样本更自然、不易被察觉,对视频分类系统的安全性构成实际威胁,值得安全从业者关注其防御策略。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hyo Seo Kim, Gang Luo, Can Chen, Binghui Wang, Yue Duan, Ren Wang
本文提出了一种基于模式连通性(Mode Connectivity)的高效进化攻击方法 MoCo-EA,旨在解决传统进化算法在生成对抗样本时因离散交叉操作破坏对抗属性而导致效率低下的问题。核心创新在于将传统进化算法中的交叉算子替换为基于贝塞尔曲线(Bézier curve)的连续优化交叉算子。作者首先发现成功对抗扰动之间存在模式连通性,即对抗样本在高维空间中位于连续流形上,且流形上的中间点不仅能保持甚至能增强攻击效果。基于此,MoCo-EA 通过优化父本扰动之间的连续贝塞尔路径,生成新的后代扰动,避免了离散插值带来的对抗性损失。实验表明,MoCo-EA 在多个基准数据集上显著优于传统离散遗传操作,不仅收敛时间更短、查询次数更少,而且生成的对抗样本具有更高的可迁移性。该工作挑战了将对抗样本视为孤立点的传统观点,揭示了对抗空间的几何结构,为攻击生成与防御研究提供了新方向。
💡 推荐理由: MoCo-EA 通过模式连通性改进了进化攻击的效率与迁移性,可能降低黑盒攻击成本,同时启发防御者利用对抗空间结构设计更鲁棒的模型。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zehan Sun, Dingfan Chen, Songze Li
该研究首次系统性地揭示了大型语言模型(LLM)级联系统在对抗性攻击下的脆弱性。LLM级联系统通过轻量级模型处理常规查询,仅将复杂请求转发给更强大的模型,旨在平衡效率与性能、降低计算成本和延迟。然而,这种级联设计引入了新的攻击面:前端轻量模型和内部决策机制成为弱点。作者提出了一种新型攻击框架,利用级联依赖关系下的约束序列协同优化对抗后缀,同时攻击轻量模型和决策机制。该框架可适应不同能力的攻击者,实现对成本效率和准确性的可控降级。与攻击单一模型的传统方法不同,该攻击策略性地利用级联结构,显著增强了攻击效果。在多种数据集和代表性LLM级联系统上的大量实验验证了该攻击的实用性和严重性。研究结果强调亟需严格审视LLM级联系统的安全性,并呼吁关注此类设计中固有的系统性风险。
💡 推荐理由: LLM级联系统因效率优势正被广泛部署,但本研究揭示了其安全盲区:攻击者可利用级联结构同时破坏性能与成本优势,对依赖此类系统的大规模应用构成实际威胁。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Rui Wen, Mark Russinovich, Andrew Paverd, Jun Sakuma, Ahmed Salem
该论文提出了一种新型后门攻击方法 MetaBackdoor,利用 Transformer 架构中位置编码 (Positional Encoding) 的内在特性作为触发器,而不需要修改输入文本内容。现有的后门攻击大多依赖内容触发器(如特定词语、句子),容易被基于文本异常的防御机制检测。作者的核心洞察是:Transformer 模型在处理有序序列时必须编码 token 位置信息,因此输入长度相关的结构会反映在模型内部计算中,可以被用作非内容触发器。论文展示了即使简单的基于长度的位置触发器也能激活隐匿的后门行为。与之前攻击不同,MetaBackdoor 作用于可见且语义正常的输入,使后门 LLM 在满足长度条件时泄露敏感内部信息(如专有系统提示),甚至出现自激活场景——正常的多轮交互可将对话上下文推至触发区,诱导恶意工具调用行为,而无需攻击者提供触发文本。此外,MetaBackdoor 与基于内容的后门正交,可组合使用以创建更精确、更难检测的触发条件。实验证明该方法在多种 LLM 架构上有效。该工作扩展了 LLM 后门的威胁模型,揭示了位置编码这一被忽视的攻击面,对现有侧重文本异常检测的防御策略提出了挑战。
💡 推荐理由: 揭示了 LLM 位置编码可作为新型后门触发器,绕过现有基于文本内容的防御,引发系统提示泄露、恶意工具调用等安全风险,需要安全社区重新评估防御策略。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jean-Philippe Monteuuis, Cong Chen, Jonathan Petit
该论文揭示了当前大型语言模型(LLM)越狱攻击评估中的关键问题:攻击成功率(ASR)作为主要基准指标存在不稳定性。作者观察到,即使一篇顶级论文(如来自Anthropic的BoN或Microsoft Research的Crescendo)宣称在闭源模型上达到80%的ASR,但实际复现时,针对同一目标模型生成的越狱提示在10次尝试中仅能连续成功5次(50%),远低于宣称值。这导致发表论文中的ASR数字被系统性高估且无法跨论文比较。核心研究问题为:为何一个成功的越狱提示在目标模型上无法稳定复现?为回答该问题,作者系统研究了随机性在攻击评估和攻击生成两个阶段的影响,涵盖多种越狱攻击、不同规模和供应商的模型以及多种评估器(judge)。基于此,他们提出了一个新指标和两个框架:(1)CAS-eval(一致性攻击成功率评估框架),要求越狱提示在多次尝试中持续成功,实验表明采用该评估后ASR可下降多达30个百分点;(2)CAS-gen(一致性攻击生成框架),通过改进现有越狱方法,帮助恢复这30个百分点的性能损失。该研究对LLM安全评估标准和方法论有重要贡献,提醒从业者ASR作为单一指标的局限性,并提供了更稳健的评估与生成方案。适合LLM安全研究人员、红蓝队工程师以及评估基准设计者阅读。
💡 推荐理由: 揭示了LLM越狱攻击评估中ASR指标的系统性缺陷,并提供了可落地的评估与生成改进框架,有助于提高安全测试的真实性和可复现性。
🎯 建议动作: 研究跟进,将CAS-eval和CAS-gen方法纳入内部LLM安全评估流程
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zirui Kong, Youqian Zhang, Sze Yiu Chau
该论文首次揭示了具身智能机器人触觉传感器面临的安全威胁。研究团队聚焦于霍尔效应指尖传感器,发现其易受故意电磁干扰(EMI)攻击。通过注入特定电磁信号,攻击者可以诱导出显著的“幻影力”,使感知的力大小放大超过9倍,力方向偏差达到65度。这种攻击能够瘫痪基于学习的触觉分类模型,严重影响机器人的运动控制。实验表明,攻击者可以利用该漏洞迫使机器人手部压碎易碎物体或丢弃危险载荷。论文指出了现有电磁干扰防护措施在机器人触觉感知领域的缺失,并呼吁学术界和工业界共同关注这一新兴安全挑战。
💡 推荐理由: 触觉传感器是机器人安全交互的关键,但其电磁干扰攻击风险此前未被充分认知。该研究揭示了可导致物理破坏的新攻击面,对无人机、医疗机器人和工业机械臂等依赖触觉反馈的应用场景构成直接威胁。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jung-Woo Chang, Ke Sun 0012, Nasimeh Heydaribeni, Seira Hidano, Xinyu Zhang 0003, Farinaz Koushanfar
本文提出了一种名为Magmaw的新型无线攻击方法,旨在针对基于机器学习(ML)的无线通信系统生成通用对抗扰动。现有针对ML无线系统的对抗攻击方法缺乏对源数据多模态性、常见物理层协议和无线域约束的全面考虑。Magmaw能够为通过无线信道传输的任何多模态信号生成通用对抗扰动,并引入了针对下游应用的对抗攻击新目标。为验证其鲁棒性,作者采用了广泛使用的防御机制,并通过软件定义无线电系统构建了实时无线攻击平台进行概念验证评估。实验结果表明,即使在强防御机制下,Magmaw仍能造成显著的性能下降。此外,在加密通信信道和基于信道模态的ML模型两个案例研究中进一步验证了其有效性。该研究揭示了ML无线通信系统在面对多模态通用对抗攻击时的脆弱性,对无线安全领域具有重要警示意义。
💡 推荐理由: 该研究首次系统性地提出了针对多模态无线通信系统的通用对抗攻击方法,揭示了现有ML无线系统在安全设计上的不足,对保障未来无线通信(如5G/6G)的安全性具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shuo Ju, Qingzhao Zhang, Huashan Chen, Xuheng Wang, Haotang Li, Wanqian Zhang, Feng Liu, Kebin Peng, Sen He
本文提出了一种针对基于视觉的自动驾驶系统的新型物理对抗攻击范式。现有物理攻击通常需要复杂的补丁或动态变化的图案,以在不同的视角下保持欺骗效果,而本文反其道而行之,将视角变化本身转化为攻击工具。攻击者只需在目标车辆上安装一个静态的、被动的对抗性伪装(即一种特制的车身涂装),其外观会随着相对运动而自然变化,从而在受害者车辆的感知系统中诱发持续的特征漂移。这种漂移导致系统推断出一个物理上合理但错误的轨迹(例如虚假的切入行为),进而传播到下游决策模块,触发不必要的紧急刹车。攻击无需主动干预或多视角鲁棒性优化,部署极为简便:一辆静止的伪装车辆即可使通过的自动驾驶车辆急刹车。在nuScenes数据集上的实验表明,该方法在硬刹车事件上的端到端成功率达87.5%,且对不同场景背景、受害者车速和感知模型均具有鲁棒性。
💡 推荐理由: 该攻击展示了利用自然视角变化实现低成本、高成功率物理对抗攻击的可能性,对自动驾驶安全性构成潜在威胁,值得感知安全研究人员关注。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zi Liang, Ronghua Li, Yanyun Wang, Qingqing Ye, Haibo Hu
该论文提出了一种针对基于大语言模型(LLM)的智能体系统的新型攻击范式,称为 Mobius Injection,可引发基于智能体的面向服务的分布式拒绝服务(AbO-DDoS)攻击。作者发现智能体逻辑中存在的结构漏洞“语义闭合”(Semantic Closure),攻击者通过一次文本注入即可诱导智能体组件进入持续递归执行状态,将智能体节点转变为“僵尸节点”,从而消耗计算资源并放大对下游LLM基础设施的请求流量。实验在三个代表性“爪子风格”智能体和三个主流编码智能体上进行,集成12种前沿商用或开源LLM,结果显示单节点调用放大倍数可达51.0倍,多节点p95延迟膨胀高达229.1倍,且攻击性能随中毒节点数超线性增长。该攻击轻量、隐蔽(可绕过传统DDoS检测和AI安全过滤器)且高度可配置。防御方面,作者提出基于智能体组件能量(ACE)分析的主动防御机制,通过检测组件图中异常能量来识别恶意递归触发器。这篇论文适合LLM安全研究人员、AI基础设施运维人员及对抗性机器学习从业者阅读。
💡 推荐理由: 揭示了LLM智能体作为系统枢纽时被武器化发动大规模DDoS的新风险,攻击轻量隐蔽、放大效应显著,对AI服务可用性构成严重威胁。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zheng Fang, Xiaosen Wang, Shenyi Zhang, Shaokang Wang, Zhijin Ge
本文针对音频语言模型(ALM)的越狱攻击展开研究。现有的越狱攻击通常在整个音频波形上密集地优化扰动,以诱使ALM生成不安全的内容。作者首先通过分析ALM中token对齐梯度的结构,发现梯度能量在音频token上高度不均匀,即只有少量token对应的音频区域主导了优化信号。基于这一观察,提出了Token-Aware梯度优化(TAGO)方法,该方法在每次迭代中仅保留与高梯度能量音频token对齐的波形梯度,而屏蔽其余梯度,从而实现稀疏越狱优化。在三个ALM(包括Qwen3-Omni)上的实验表明,TAGO在显著稀疏化(如token保留率0.25)时仍能保持较高的攻击成功率(例如Qwen3-Omni上ASR_l为86%,而完全保留token时为87%),证明了密集波形更新在很大程度上是冗余的。该工作揭示了token级别异质梯度结构,为未来ALM越狱和安全对齐研究提供了新方向,并建议防御者关注此类稀疏攻击的潜在威胁。
💡 推荐理由: 该研究揭示了音频语言模型越狱攻击中梯度结构的非均匀性,并证明只需少量token即可实现高效攻击,这提示防御者不能仅依赖全波形扰动防御,需开发针对token级稀疏扰动的检测与缓解措施。
🎯 建议动作: 研究跟进,评估自身ALM系统对此类稀疏攻击的脆弱性
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhaoxi Zhang 0001, Xiaomei Zhang 0001, Yanjun Zhang, He Zhang 0012, Shirui Pan, Bo Liu 0001, Asif Gill, Leo Yu Zhang
本文研究字符级扰动对大型语言模型(LLM)水印技术的破坏效果。水印技术被广泛用于追踪LLM生成内容,防止滥用。作者系统分析了多种字符级扰动(如拼写错误、同音替换、随机插入等)对当前主流水印方案(如基于n-gram的Aaronson水印、基于软水印的Kirchenbauer方案等)的鲁棒性影响。实验在多个开源LLM(如Llama2、OPT)上进行,结果表明,简单的字符级扰动即可显著降低水印检测的准确率,甚至完全绕过检测。作者进一步探讨了结合语义保持的对抗性扰动,发现更难防御。本文揭示了LLM水印在字符层面的脆弱性,对内容追踪与反滥用领域具有警示意义。
💡 推荐理由: LLM水印是防止AI生成内容滥用的重要手段,但本文揭示其易被字符级扰动绕过,威胁内容溯源与检测机制的有效性。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Maximilian Thang, Stjepan Picek, Ahmad-Reza Sadeghi
该论文提出了 NeuroStrike,一种针对对齐大型语言模型(LLM)的新型攻击框架。作者发现,当前的安全对齐技术(如监督微调和基于人类反馈的强化学习)会在模型中引入稀疏的“安全神经元”,这些神经元负责检测和抑制有害输入。NeuroStrike 利用这一根本性漏洞,通过在前馈激活分析中识别这些安全神经元,并在推理过程中将其剪枝,从而禁用安全机制。在白盒设置中,该方法只需移除目标层中不到 0.6% 的神经元,即可在 20 多个开源 LLM 上达到平均 76.9% 的攻击成功率(ASR)。此外,NeuroStrike 还扩展到多模态 LLM,在 unsafe 图像输入上实现了 100% ASR。在黑盒设置中,作者提出了首个 LLM 分析攻击,利用安全神经元的可迁移性,在开源代理模型上训练对抗性提示生成器,然后部署到黑盒及专有模型上。实验表明,该黑盒攻击在 5 个黑盒模型(包括 Google Gemini 系列)上平均 ASR 为 63.7%。安全神经元在架构间有效迁移,使 11 个微调模型和 5 个蒸馏模型的 ASR 分别提升至 78.5% 和 77.7%。该工作揭示了当前对齐技术的脆弱性,并强调了安全神经元的可迁移性带来的广泛威胁。
💡 推荐理由: NeuroStrike 揭示了对齐 LLM 中安全神经元的可迁移性和脆弱性,表明仅依赖稀疏神经元的安全机制极易被绕过。该攻击泛化到多种模型和输入形式,对 LLM 的安全部署构成严重威胁,值得安全从业者高度关注。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Reachal Wang, Yuqi Jia, Neil Zhenqiang Gong
本文提出了一种针对多源数据LLM应用的新型提示注入攻击方法ObliInjection。在现实场景中,LLM的输入数据往往来自多个不同来源,每个来源贡献一个输入段,攻击者仅能控制其中部分段,且通常不知道各段在输入中的排列顺序。现有的提示注入攻击要么假设整个输入数据来自单一攻击者控制的来源,要么忽略多源数据中段顺序的不确定性,因此在多源场景下成功率有限。ObliInjection通过两项关键技术创新解决这一挑战:一是“顺序无关损失”(order-oblivious loss),该损失函数量化了无论干净段和污染段如何排列,LLM完成攻击者选定任务的可能性;二是“顺序GCG算法”(orderGCG),专门设计用于最小化顺序无关损失并优化污染段的内容。实验涵盖了三个不同应用领域的数据集和十二种LLM,结果表明即使只污染输入中6-100个段中的一个,ObliInjection也能高效实施攻击。论文提供了代码和数据开源链接。本研究揭示了多源数据LLM应用中一个被忽视的安全漏洞,对LLM安全防护具有重要参考价值。
💡 推荐理由: 提示注入是LLM安全的核心威胁之一,而多源数据场景普遍存在于各类LLM Agent和工具链中。ObliInjection首次系统地研究了段顺序不确定下的注入攻击,该攻击隐蔽性强且成功率较高,对依赖多源输入的LLM应用构成实际风险。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kemal Derya, Berk Sunar
本文针对大型语言模型(LLM)的越狱攻击防御展开研究,重点重访了近期提出的JBShield防御机制。JBShield通过检测两种概念信号(毒性概念和越狱概念)来识别恶意提示,在部分设置下声称攻击成功率为0%。然而,本文设计了一种新的自适应攻击方法JB-GCG,它修改了贪婪坐标梯度(GCG)攻击的目标函数,结合了两个项:一是通过计算拒绝方向与隐藏状态表示的余弦相似度来抑制拒绝方向,二是利用JBShield自身的毒性概念分数进行正则化。在Llama-3-8B模型上的五种配置中,JB-GCG实现了平均46.2%的攻击成功率,最强设置下达到53.4%。攻击对JBShield的增强版本JBShield-M同样有效,成功率高达30.7%。实验表明,该攻击在多次重新校准后依然有效,确认了漏洞是结构性的而非校准特定。进一步分析发现,越狱表示的余弦相似度特征在拒绝方向指纹空间中占据了一个独特区域,既不属于无害提示也不属于有害提示。基于此,作者提出了表示轨迹验证(RTV)新防御方法,利用多层拒绝方向指纹进行马氏距离异常检测,对提出的攻击实现了0.99的AUROC。最后,作者设计了针对RTV的完全白盒自适应攻击,最佳攻击在计算成本增加13倍的情况下仅达到7%的成功率。结果表明,非自适应检测的强性能并不意味着在自适应威胁模型下具有鲁棒性,多层表示一致性比单层概念相似性更适合作为越狱检测的基础。
💡 推荐理由: 该研究揭示了现有越狱防御在自适应攻击下的脆弱性,强调了评估防御时必须考虑自适应威胁模型,为LLM安全社区提供了更可靠的防御设计方向。
🎯 建议动作: 建议安全研究人员阅读原文,了解自适应攻击细节,并评估自身LLM防御系统对类似攻击的鲁棒性。
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Han Liu, Shanghao Shi, Yevgeniy Vorobeychik, Chongjie Zhang, Ning Zhang
本文系统研究了对抗扰动是否具有低秩结构。受Low-Rank Adaptation (LoRA)启发——LoRA通过低秩矩阵更新神经网络层显著提升了大型语言模型的训练效率——作者提出对抗样本的生成也是优化过程,因此自然产生疑问:对抗扰动是否也呈现低秩结构?通过理论分析和多种攻击方法、模型架构、数据集上的大量实验,本文证实对抗扰动确实具有内在低秩性质。基于这一发现,作者聚焦于利用低秩性质改进黑盒对抗攻击的效率与有效性,因为黑盒攻击通常面临查询次数过多的问题。方法分为两步:首先使用参考模型和辅助数据指导梯度投影到低维子空间;然后将黑盒攻击中的扰动搜索限制在该低秩子空间内,从而大幅提升攻击效率和效果。实验覆盖多种攻击方法、基准模型、数据集和威胁模型,结果表明所提出的低秩对抗攻击相比传统方法在全方面取得显著且一致的性能提升。该研究揭示了对抗扰动与模型更新之间的结构相似性,为设计更高效的对抗攻击与防御策略提供了新视角。
💡 推荐理由: 揭示对抗扰动的低秩结构,为黑盒攻击效率提升提供新思路,间接启示防御者关注低维扰动空间的检测与防御。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ping He, Yifan Xia, Xuhong Zhang 0002, Shouling Ji
本文针对基于机器学习的Android恶意软件检测(AMD)方法,提出了一种名为AdvDroidZero的高效查询式攻击框架。当前对该类方法的对抗样本攻击大多依赖较强假设,如攻击者知晓特征空间、模型参数或训练数据集等知识,这在现实攻击场景中往往不成立。AdvDroidZero在零知识设置下运作,即攻击者无需提前了解目标模型的内部细节,仅通过黑盒查询即可生成对抗样本。该框架通过设计高效的查询策略和针对性扰动生成方法,显著降低了攻击所需的查询次数,同时保持了高攻击成功率。在多个主流基于机器学习的AMD方法(包括最新技术)以及真实世界反病毒产品上的广泛评估表明,AdvDroidZero能够有效规避检测,揭示了当前检测方法的脆弱性。论文分析了攻击成本与效果,并讨论了可能的防御方向。本研究对安全社区理解对抗性机器学习威胁具有重要意义,尤其针对移动安全领域的现实攻击场景。
💡 推荐理由: 该攻击在零知识条件下(更贴近真实攻击者能力)仍能高效绕过主流ML检测和真实反病毒产品,迫使安全团队重新评估现有Android恶意软件检测方案的稳健性。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Christopher DiPalma, Ningfei Wang, Takami Sato, Qi Alfred Chen
该论文聚焦于自动驾驶系统中基于摄像头的感知模块在对抗性攻击下的安全性问题。研究团队设计了一种实用的对抗性贴片攻击方法,专门针对基于摄像头的障碍物检测系统。作者发现箱式卡车的后部是一个有效的攻击向量,通过在卡车后部粘贴特制的对抗性图案,可以欺骗障碍物检测算法使其无法正确识别。为了增强攻击的鲁棒性,该方法考虑了攻击场景中多种可能的输入帧(例如不同角度、光照条件等),使得攻击在真实世界中更加稳定。论文通过模拟器中的视频演示展示了该攻击能够在代表性的自动驾驶系统(如端到端驾驶模型)上引发连续的严重后果,例如导致车辆未能及时刹车或改变路径。研究揭示了当前基于视觉的感知系统在面对精心设计的物理对抗样本时的脆弱性,强调了开发更鲁棒感知算法的迫切需求。该工作为自动驾驶安全领域提供了重要的攻击面分析和安全启示。
💡 推荐理由: 自动驾驶安全直接关系到人身安全,该研究揭示了基于摄像头的感知系统在物理世界中的严重漏洞,可能被用于诱导碰撞等事故。
🎯 建议动作: 研究跟进
排序因子: Community 数据源 (+1) | LLM 评分加成 (+0.4)