#backdoor

共收录 40 条相关安全情报。

← 返回所有主题
👥 作者: Roberto Riaño, Gorka Abad, Stjepan Picek, Aitor Urbieta

本文研究脉冲神经网络(SNN)中的一种新型后门攻击——"时间投毒"(Temporal Poisoning),属于干净标签(clean-label)攻击范畴。与以往依赖脏标签(dirty-label)的后门攻击不同,该方法仅对目标类别的训练样本施加固定的时间戳变换,而不改变其标签。该变换在逐像素、逐极性的事件计数上与原始数据完全一致,因此在时间聚合后,干净样本与触发样本在静态特征上不可区分,但输入序列的时间顺序被改变,从而影响SNN的处理过程。研究者在三个神经形态数据集上,针对卷积架构和Transformer架构的受害者模型进行了实验,在最强配置下攻击成功率(ASR)达到1.00。论文通过投毒预算和触发形状的消融实验分析了攻击特性,并评估了多种已有的后门防御方法。结果表明,凡是在检查前将时间轴折叠(rate-collapsed)的防御方法,由于设计上忽略时序信息,对此攻击天然失效;基于特征空间的防御仅在特定设置下能够检测到异常。作者进一步提出一种无需模型(model-free)的检测器,基于逐步骤事件质量(per-step event mass)来识别时间变换,证明了该攻击的隐蔽性边界。据作者所述,这是首个针对SNN和神经形态事件数据的干净标签后门攻击研究。本文主要面向研究SNN安全、神经形态计算以及后门攻防的研究人员和安全从业者,有助于理解时间维度上的数据投毒风险。

💡 推荐理由: 该研究揭示SNN在时间维度上存在新的数据投毒风险,打破了传统时间聚合后特征不变的安全假设,提醒防御者不能仅依赖静态特征或折叠时间轴的检测方法,需要关注时序信息完整性。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 10.6
Conf: 50%
👥 作者: Anthony Hughes, Nicole Xing, Collin Francel, Andy Kim, Andrew Draganov

该论文针对大语言模型(LLM)在关键领域部署时面临的数据投毒后门攻击问题展开研究。攻击者可能通过污染训练数据植入后门触发器,使得模型在推理阶段遇到特定输入时被隐蔽地操控行为。作者聚焦于防御者在现实约束下的触发器恢复能力:仅拥有模型的白盒权重访问权限和已知目标危害行为,但无法访问训练数据、没有可信参考模型、不知道触发器内容、甚至不确定模型是否已被投毒。为了系统评估这一能力,作者发布了 ToxScreen 基准,包含约 800 个被植入后门的模型,覆盖攻击目标、触发器机制、投毒比例、模型规模和训练机制等多个维度,并确保这些后门具备高质量:高攻击成功率、对未见有害输入具有泛化性、且不损害正常任务性能。实验上,作者比较了两种触发器恢复方法:基于梯度的提示优化和基于 token 查表的候选排序(按攻击成功率排名)。结果显示,基于梯度的提示优化未能成功恢复触发器,而 token 查表方法能够在所有后门有效的模型上恢复触发器。进一步的权重分析揭示了一个重要现象:后门攻击与越狱(jailbreak)行为在机制上存在差异,这使得防御者可以借此区分并过滤掉越狱样本。尽管没有任何单一方法能可靠地暴露所有后门,但论文指出一个广泛可越狱的模型本身就是异常信号,即使未能恢复具体触发器,也可用于检测。作者公开了所有模型和评估代码,为后续研究提供基准。本文的核心贡献包括:构建大规模后门模型基准、实证对比两种恢复方法的有效性、揭示后门与越狱的机制差异、以及提出可操作的异常信号。适合从事 LLM 安全性研究、模型红队测试、AI 安全防御的工程师和研究人员阅读。

💡 推荐理由: 本文为检测 LLM 后门提供首个大规模基准和有效方法,颠覆了梯度优化在触发器恢复上的预期,并揭示了后门与越狱的差异性信号,对 AI 安全防御实践有直接指导价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Dimitri Kokkonis, Michaël Marcozzi, Stefano Zacchiroli

该论文针对开源软件供应链中代码级后门注入的威胁提出了一种自动化检测方法 Lily。代码级后门是一种隐蔽的代码改动,通过秘密触发器授予隐藏权限,难以被发现。此前针对广泛使用项目的后门注入尝试(如恶意提交、被篡改的发布包、受污染的第三方依赖)往往仅靠运气和人工审查才被阻止。现有持续集成(CI)流水线无法检测此类攻击,而下游二进制分析工具则需要大量人工分析。Lily 将后门检测机制集成到两个环节:一是 CI 流水线,用于在代码提交阶段阻断恶意提交;二是发布审查流程,用于防止被篡改的发布包或受损依赖进入大型生态系统(如 Linux 发行版)。Lily 有两个核心贡献:第一,它增强了兼容 CI 的模糊测试(fuzzing),能够基于历史和当前软件执行来检测可疑行为的触发器,从而在 CI 和更新验证流程中实现快速且精确的后门检测;第二,它将代码变更分析与模糊测试数据相结合,即使发布更新涉及数百万行代码改动,也能精确地将维护者定位到暴露后门的代码区域。论文还概述了攻击者可能规避 Lily 的五种策略,并评估了相应的防御措施。作者在数百个良性提交/发布和带后门提交/发布的实验表明,Lily 能以较低的误报率实现高检测精度,可靠地识别恶意代码,抵抗对抗性尝试,并且能够阻止真实世界中的后门事件。

💡 推荐理由: 该研究直接回应了软件供应链中后门注入的严峻挑战,提出可集成到 CI 和发布流程的自动化检测方案,能够提升蓝队和开源维护者对恶意提交、篡改发布包和受损依赖的防御能力,具有实际部署价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Chengkun Wei, Wenlong Meng, Zhikun Zhang 0001, Min Chen 0032, Minghu Zhao, Wenjing Fang, Lei Wang 0152, Zihui Zhang, Wenzhi Chen

该论文针对提示微调(prompt-tuning)范式中的后门安全威胁展开研究。提示微调因其在下游任务中的高效性和多任务服务能力而被广泛用于部署大语言模型,但作者通过实验证明,提示微调容易受到预训练模型中存在的任务无关后门(task-agnostic backdoors)的攻击。这类后门与具体下游任务无关,可影响任意下游任务,且现有最先进的后门检测方法因无法有效收敛后门触发器逆向过程而难以防御。为此,本文提出LMSanitator,一种针对Transformer模型的任务无关后门检测与移除方法。其核心思想是:不直接逆向触发器,而是逆向预定义攻击向量(即输入嵌入触发器时预训练模型的输出),从而获得更好的收敛性和后门检测精度。LMSanitator还利用提示微调中冻结预训练模型的特性,在推理阶段实现精确快速的输出监控和输入清洗。在多个语言模型和NLP任务上的大量实验表明,LMSanitator在960个模型上达到92.8%的后门检测准确率,并在大多数场景下将攻击成功率降至1%以下。该工作为提示微调的安全性提供了有效的防御机制。

💡 推荐理由: 提示微调是当前大模型落地的主流范式之一,但针对其安全性研究不足。本文揭示了任务无关后门这一新型威胁,并提出了首个可实际部署的检测与清除方案,对保障大模型服务安全具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Shaofeng Li 0001, Hui Liu, Tian Dong, Benjamin Zi Hao Zhao, Minhui Xue 0001, Haojin Zhu, Jialiang Lu

本文展示了自然语言处理(NLP)系统容易受到后门攻击,攻击者可以在语言模型中植入隐藏特征(后门),仅当特定触发条件(如特定输入文本)出现时才会被激活,导致模型产生意外行为。作者提出了两种创建隐蔽且自然触发器的文本后门攻击方法,称之为“隐藏后门”。第一种方法基于同形字符替换(homograph replacement),通过视觉上相似的字符替换(例如使用Unicode同形异码字符)来嵌入触发器,这种替换对人类视觉检查具有欺骗性。第二种方法利用语言模型生成的文本与真实自然文本之间的细微差异,生成语法正确、流畅度高的触发句子,使之难以被察觉。作者在三个代表性的安全关键型NLP下游任务上验证了攻击效果:毒性评论检测、神经机器翻译(NMT)和问答(QA)。实验结果显示,在毒性评论检测任务中,仅需注入3%的含触发数据即可达到至少97%的攻击成功率(ASR);在NMT任务中,注入数据少于0.5%即可达到95.1%的ASR;在QA任务中,仅用27个投毒样本(原训练集包含92024个样本,即0.029%)即可实现91.12%的ASR。攻击在保持模型对正常用户功能的同时,使触发器对人类管理员不可见。该研究揭示了现代以人为中心的NLP系统在面对精心设计的后门攻击时的脆弱性。

💡 推荐理由: 该研究揭示了NLP模型极易被植入隐蔽后门,且触发器可绕过人类审查,对部署了毒性检测、机器翻译、问答等NLP系统的安全防御团队构成严重威胁。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Simin Chen, Jinjun Peng, Yixin He 0002, Junfeng Yang, Baishakhi Ray

本研究首次系统性地揭示了深度学习编译器中的编译不一致性漏洞(Compilation Inconsistency Vulnerability)。作者发现,即使是官方、未经修改的深度学习编译器,也可能在模型编译过程中静默改变模型语义,从而引入隐藏后门。研究从两个角度展开:对抗性设定和自然设定。在对抗性设定中,作者精心构造了良性模型,其中的触发器在编译前不产生任何效果,但经过编译器编译后,触发器变为有效的后门。在6个模型(包括ResNet、BERT等)、3个商用编译器(如TensorFlow XLA、PyTorch JIT、TVM)以及2种硬件平台(CPU和GPU)上的实验表明,该攻击对触发输入的成功率为100%,同时保持正常准确率,并能绕过最先进的防御检测器。攻击泛化到不同编译器、硬件和浮点设置。在自然设定中,作者分析了HuggingFace上排名前100的模型(包括一个下载量超2.2亿的模型),发现其中31个模型存在自然触发器,即在编译后模型对某些正常输入的行为发生改变。这表明即使没有对抗性操纵,编译器也可能引入风险。该工作首次暴露了深度学习编译器设计中被忽视的安全威胁,为构建安全可信的机器学习系统开辟了新方向。

💡 推荐理由: 深度学习编译器是AI基础设施的核心组件,本发现揭示其可能被利用来植入后门,影响所有使用编译器的模型部署。安全团队需关注编译环节的完整性,防止供应链攻击。

🎯 建议动作: 研究跟进:阅读论文获取详细攻击方法与检测方案,评估内部使用的编译器是否受影响。

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Ahatesham Bhuiyan, Hoang Ngo, Cheng Chu, Qian Lou, Lei Jiang, My T. Thai, Mengxin Zheng

该论文首次提出针对变分量子算法(VQAs)的参数供应链后门攻击——CutBackdoor。VQAs是近期量子计算的主要范式,结合了参数化量子电路与经典优化,广泛应用于量子化学、组合优化和量子机器学习。实际部署中,由于量子电路规模常超过硬件可用量子比特数,量子电路切割(如CutQC)成为必要执行策略,而预训练参数通过公共仓库分发引入了供应链安全风险。现有量子后门攻击要么引入可检测的电路修改,要么依赖设备特定噪声,且均未考虑电路切割作为攻击面。CutBackdoor利用CutQC的切割电路执行作为部署阶段触发器:攻击者在参数中植入后门,使得在完整电路验证时保持低误差(高隐蔽性),但在受害者因资源限制调用切割流程时,大幅增加切割路径的重建误差(1.3倍至2.9倍能量放大)。该攻击无需修改电路,无需攻击者在线参与。理论分析结合在IBM量子后端多个基准(VQE、VQD、QAOA)上的实验验证了攻击有效性,并表明零噪声外推(ZNE)仅能部分缓解。该工作揭示了量子计算软件供应链的新型攻击面。

💡 推荐理由: 揭示了量子计算软件供应链中参数分发环节的隐蔽后门风险,提醒安全社区关注新兴量子计算系统的供应链安全。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Andrej Bogdanov, Alon Rosen, Neekon Vafa

本文研究深度神经网络中后门植入的统计不可检测性。作者展示了一种对抗性模型训练者可以在大规模前馈神经网络中植入后门的方法,这些后门在白盒设置下是统计不可检测的,即后门模型与诚实训练模型之间的总变差距离很小,即使审查者拥有模型的完整描述(如所有权重)。后门提供了对每个输入的不变性对抗样本,能将相距很远的输入映射到异常接近的输出。然而,在没有后门的情况下,在标准密码学假设下,任何多项式时间内生成此类对抗样本都是不可能的。理论分析和初步实证结果表明,模型训练者与模型使用者之间存在根本性的能力不对称性。该工作揭示了恶意训练者可以植入理论上不可检测的后门,对模型供应链安全构成潜在威胁。适合安全研究者、机器学习工程师以及关注模型完整性的从业者阅读。

💡 推荐理由: 该研究揭示了深度神经网络后门攻击的一种新范式:后门在白盒环境下统计不可检测,颠覆了传统认知。安全从业者需关注模型训练环节的信任根问题。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Steyn Hommes, Vincent Dankbaar, Tanguy Stekke, Xiaomeng Wang, Lisanne Weidmann, Senna van Hoek, Durba Chatterjee, Lejla Batina, Zhuoran Liu

本文研究了一种跨层级攻击方法,将嵌入式神经网络实现层面的物理故障注入与算法层面的对抗攻击相结合。传统故障注入攻击主要关注通过破坏权重或中间计算导致分类错误,而忽略了与算法级对抗威胁的交互。作者首先通过表征推理期间故障引起的数据扰动,将故障注入与后门学习联系起来,从而能够联合利用实现层和算法层的漏洞。具体而言,提出了一种精确的故障注入方法,能够在执行期间可靠地将目标寄存器值操纵到可预测的状态。利用这种高精度故障注入,提出了一种新颖的端到端特征图层级后门攻击,其中物理诱导的中间扰动作为隐蔽触发器。与传统的基于输入的后门不同,该触发器仅在物理故障下激活,导致神经网络表现出对抗行为,破坏系统完整性,而在正常操作时保持良性。实验在ARM Cortex-M4微控制器(一种常用于受限嵌入式应用的平台)上通过电磁故障注入对卷积神经网络实施,证明了攻击的实用性。结果表明,这种物理触发的后门可以有效规避现有通常假设输入空间触发器的后门防御。该工作强调了在硬件和算法抽象层面交叉处的新攻击向量,需要跨抽象层次的防御。

💡 推荐理由: 本文首次将物理故障注入与算法后门攻击结合,展示了硬件与AI安全交叉的新攻击面,提示现有防御(如输入空间后门检测)可能完全失效。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jinyuan Jia 0001, Yupei Liu, Neil Zhenqiang Gong

自监督学习在计算机视觉领域通过大量无标签图像或(图像,文本)对预训练图像编码器,然后将该编码器作为特征提取器,用于少量或零标注数据的下游分类任务。本文提出BadEncoder,是首个针对自监督学习的后门攻击方法。该方法将后门注入预训练图像编码器,使得基于该编码器构建的多个下游分类器同时继承后门行为。攻击者通过优化问题形式化BadEncoder,并采用梯度下降方法从干净编码器生成带后门的编码器。在多个数据集上的实验表明,BadEncoder能在保持下游分类器精度的同时实现高攻击成功率。进一步在真实世界编码器(如Google在ImageNet上预训练的编码器和OpenAI在4亿(图像,文本)对预训练的CLIP图像编码器)上验证了有效性。现有防御方法(包括经验性防御Neural Cleanse、MNTD以及可证明防御PatchGuard)均无法有效防御BadEncoder,凸显了开发新型防御的需求。代码已开源。

💡 推荐理由: 该研究首次揭示自监督预训练编码器存在后门攻击风险,现有防御全面失效,威胁广泛使用的CLIP等模型,急需防御方案。

🎯 建议动作: 研究跟进,评估自身自监督模型后门风险,关注后续防御方案

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 9.5
Conf: 50%
👥 作者: Eugene Bagdasaryan, Vitaly Shmatikov

这篇论文研究了一种新型的深度学习模型后门注入方法。与传统的后门攻击不同,该方法不依赖于修改训练数据、观察代码执行或访问最终模型,因此被称为“盲后门攻击”。攻击者通过破坏模型训练代码中的损失值计算过程,在训练过程中动态生成带有毒化的训练样本,并利用多目标优化技术确保主任务和后门任务同时达到高精度。论文展示了多种比先前工作更强大的后门类型:在ImageNet模型上实现单像素后门(仅修改一个像素即可触发后门)、物理后门(通过物理世界中的特定图案触发)、隐蔽后门(将模型切换为侵犯隐私的隐蔽任务)以及无需推理时输入修改的后门(后门在模型内部被静态编码)。实验证明,这些盲后门能够逃避当前已知的所有防御机制。论文还提出了新的防御思路,但未给出具体防御方案。该研究揭示了深度学习供应链中训练代码本身可能成为攻击向量,对模型安全性构成严重威胁。适合机器学习安全研究人员、模型开发者和部署者阅读。

💡 推荐理由: 首次提出无需控制训练数据和模型访问权限的盲后门攻击,突破了传统后门攻击的假设,对现有防御体系构成根本性挑战,迫使安全社区重新审视训练代码的完整性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Stefan Bühler, Mark Schutera

该论文研究了针对开源机器人视觉语言动作模型(VLA)的数据投毒攻击,特别是触发词(trigger-word)投毒。作者指出,当前开源机器人生态系统在社区贡献的数据集上存在信任假设,而攻击者可以通过注入少量中毒样本就能隐蔽地嵌入后门,使机器人在接收到特定触发词时失效。论文以smolVLA模型为测试对象,在LeRobot平台的真实拾放(pick-and-place)任务上进行实验,设置了三种中毒比例(1/320、3/320、10/320),并评估了不同触发词位置(前置、中置、后置)的影响。实验结果显示:仅需3个中毒片段(episode)即可实现完全拒绝服务(DoS),所有触发词条件下的成功率降至0.0±0.0%,机器人锁定在固定关节配置,不执行任何任务运动;而在正常提示下,模型保持约50%的成功率,表明攻击具有隐蔽性。即使仅1个中毒片段,成功率也降至6.7±6.7%,机器人虽有运动但无法完成任务。攻击还能泛化到中置和后置触发词位置,尽管训练时仅使用前置触发。该研究证明此威胁是实际可行、低成本且隐蔽的,因此需要将数据集来源的可信性视为开源机器人生态中的首要安全问题。

💡 推荐理由: 首次实践验证对开源机器人VLA模型的数据投毒攻击,证明其低成本、高隐蔽性及严重后果(完全拒绝服务),对机器人安全社区具有重要警示意义。

🎯 建议动作: 研究跟进,关注数据集来源验证和投毒检测技术

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Boyang Zhang, Zheng Li 0023, Ziqing Yang 0002, Xinlei He 0001, Michael Backes 0001, Mario Fritz, Yang Zhang 0016

该论文提出了一个名为 SecurityNet 的框架,旨在系统性地评估公开机器学习模型的安全性弱点。随着预训练模型在开源社区(如 Hugging Face)广泛发布,攻击者可能利用这些模型中的后门、对抗性扰动等漏洞。SecurityNet 通过组合多种攻击方法(包括对抗性攻击、后门注入、模型窃取等),对公开模型进行自动化安全评估。实验覆盖了图像分类、自然语言处理等多种任务中的主流模型架构(如 ResNet、BERT)。主要贡献包括:1) 设计了一个模块化的评估管线,支持多种攻击场景;2) 在大量公开模型上进行了实证研究,揭示了相当比例的模型存在可利用的漏洞;3) 提供了可复现的基准,帮助研究者比较不同防御手段的效果。该工作为模型发布前的安全审查和模型供应链风险管控提供了参考工具。

💡 推荐理由: 帮助安全团队在引入第三方预训练模型前评估潜在风险,降低模型供应链攻击的可能性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

该论文提出了一种针对视觉语言模型(VLM)的新型后门攻击框架ReShift,其核心创新在于实现推理层面的后门注入,而非传统的输出层操纵。现有后门攻击方法往往在推理链中留下不一致或可检测的痕迹,容易被现有防御机制发现。ReShift通过“顿悟时刻”(aha-moment)驱动的方式,在模型内部思维链(CoT)过程中引导推理轨迹发生偏移,同时保持表面上的逻辑连贯性。框架包含两个关键组件:毒化推理感知数据构建(PRDC)管道,用于生成带有触发条件且推理过程异常的样本;以及监督-强化联合优化(SRJO)策略,用于稳定地诱导触发条件下的推理偏移。论文进一步形式化了“熵反弹”(Entropy Rebound)作为推理重定向的特征信号,并给出一系列理论保证,说明熵缺口与轨迹级差异之间的关系。实验表明,ReShift能够在保持干净任务性能和生成合理推理轨迹的前提下实现高攻击成功率,显著提升对抗现有防御的隐蔽性。该研究揭示了VLM在推理层面存在的安全脆弱性,对构建可信赖的多模态AI系统提出了新挑战。适合AI安全研究员、模型开发人员和防御团队阅读。

💡 推荐理由: 该攻击揭示了VLM推理层面的脆弱性,现有防御难以检测此类隐蔽后门,威胁到安全关键场景中VLM的可信性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Arash Raftari, Mehrdad Mahdavi, Nathan Blackthorn, Andrew Arash Mahyari

本文研究了大语言模型(LLM)中的后门攻击防御问题。后门攻击通过在正常输入中嵌入隐藏触发器,使得模型在触发器存在时产生攻击者指定的恶意行为,而在无触发器时表现正常。现有防御方法通常需要重新训练整个模型或进行全局微调,成本高昂且可能破坏模型原有能力。作者提出了一种基于曲率引导的模块定位与低秩修复的框架,在仅访问受害模型(无干净训练数据或原始训练过程)的条件下实现后门解毒。该方法首先利用激活修补(activation patching)定位对触发器响应敏感的中间层模块,然后通过Fisher信息矩阵和K-FAC曲率分析进一步筛选出对后门行为贡献最大的关键模块。最后,对这些选定模块应用低秩约束的修复(低秩适应),仅调整少量参数以抑制触发器引发的恶意输出,同时尽量保持模型在正常输入上的表现。在Llama-3.2-1B-Instruct模型上,作者在提示的不同位置(开头、中间、结尾)插入触发器构建后门变体,实验表明该方法能有效降低后门攻击成功率(ASR),且对良性样本的困惑度(perplexity)影响极小。与全参数微调、权重掩码等基线相比,该方法在参数效率、解毒效果和通用性上均具优势。论文的主要贡献在于:(1)揭示了后门解毒可以转化为局部结构修复问题,而非全局行为对齐;(2)提出了结合激活修补与曲率分析的模块定位方法;(3)展示了低秩修复在资源受限场景下的实用性。适合对LLM安全、后门防御、可解释性感兴趣的研究者和安全工程师阅读。

💡 推荐理由: 本文提供了一种无需重训即可移除LLM后门的实用方法,降低了防御成本,对确保部署模型的安全性有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

模型量化是降低大语言模型存储和推理开销的关键技术,但最近的研究表明,量化引入的离散化和舍入误差可被攻击者利用,构造量化条件后门攻击。在这种攻击下,恶意行为在全精度阶段保持休眠,仅在量化部署后激活,从而绕过传统的安全审计和检测机制。针对这一威胁,本文提出了一种主动的预量化防御方法 QuantGuard。该方法引入了可微的舍入控制变量,并结合了误差引导的舍入反转约束、输出分布一致性和权重距离正则化,以精细调控关键的舍入行为。关键的是,QuantGuard 仅使用少量校准数据集,且不修改现有量化算法。这种设计打破了攻击者精心构造的权重模式与量化边界之间的精确对齐,有效抑制了量化后的后门激活路径,同时保持了模型的原始功能和性能。作者在六个主流大语言模型(包括 LLaMA-3 和 Qwen2.5-Coder)上,使用三种量化精度(INT8、FP4 和 NF4),在三个代表性场景(易受攻击代码生成、内容注入和过度拒绝)下进行了系统实验。结果表明,QuantGuard 能够持续缓解量化条件后门攻击,将攻击成功率降低到与干净模型相当的水平,同时在通用能力基准测试上基本保持性能。该方法计算开销低,为安全量化部署 LLM 提供了一种有效实用的解决方案。

💡 推荐理由: 量化是LLM部署的关键技术,但量化条件后门攻击可绕过传统安全审计。本文提出的QuantGuard防御方法能在不改变量化算法的前提下有效抑制后门,为实际安全部署提供了重要保障。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: William Aiken, Paula Branco, Guy-Vincent Jourdan, Iosif-Viorel Onut

本文提出了一种针对扩散模型(Diffusion Models)的新型后门攻击框架TEMPO-Diffusion。传统的基于噪声的后门攻击通常依赖于在推理时注入触发器、非目标激活以及生成分布外目标,这些假设降低了攻击的隐蔽性和实际相关性。TEMPO-Diffusion将恶意分布偏移限制在时间上的同分布暴露中,使得后门更加隐蔽。该框架支持:(i) 针对特定类别的攻击(攻击特定类别并生成特定类别结果);(ii) 多子图像后门,即在多个不同输出图像和多个位置重建特定特征;(iii) 利用时间条件触发器的图像修复(in-painting)。为了研究使用带后门的扩散模型生成合成训练数据相关的实际安全问题,作者还引入了CALISA数据集:一个平衡的、区域感知的交通标志数据集,重点涵盖加拿大和美国的道路标志。在CIFAR10、GTSRB和CALISA上的实验表明,TEMPO-Diffusion能够可靠地污染特定类别的合成数据生成,并在使用该数据训练的下游分类器中实现高攻击成功率。本文的研究揭示了扩散模型在合成数据生成场景下可能被植入持续性后门的风险,对AI安全社区具有警示意义。

💡 推荐理由: 该研究首次提出时间条件触发的同分布后门攻击,显著提高了扩散模型后门的隐蔽性和实战性,对依赖扩散模型生成训练数据的AI供应链构成重大威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Toby Briston, Illya Kosyk, Kuniyih S

传感器是现代智能设备的关键组件。随着物联网和可穿戴移动设备的普及,传感器被广泛用于环境监测和预测行动。人体活动识别(HAR)是其中一个重要应用,它利用惯性测量单元(IMU)传感器(如加速度计和陀螺仪)来提供健康、训练和医疗诊断方面的洞见。然而,HAR模型的准确性受到数据不足的限制。基于扩散模型的技术已被证明能够成功生成合成数据来训练HAR模型。本文提出了一种后门训练技术IMU-DM-CLIP,该技术利用扩散模型和CLIP(对比语言-图像预训练)引导来对HAR模型实施基于触发器的攻击。实验分析表明,即使后门注入率仅为10%,且仅有10%的数据用于引导扩散模型,攻击依然能够成功。这项研究揭示了HAR模型在安全方面的潜在脆弱性,特别是当训练数据中包含后门触发样本时,模型可能被恶意操控,导致错误的识别结果。对于依赖HAR进行健康监测或安全关键应用的系统,这种攻击可能带来严重后果。论文的主要贡献在于首次将CLIP引导的扩散模型用于生成HAR领域的后门数据,展示了低注入率下攻击的高效性,并引发了关于传感器数据完整性和模型安全性的思考。适合安全研究人员和HAR系统开发者阅读,以了解此类新兴攻击向量。

💡 推荐理由: 该研究揭示了HAR模型面临的新型后门攻击风险,利用扩散模型生成后门数据,即使注入率极低也能成功攻击。对于使用HAR的健康监测、运动训练等应用,模型被植入后门可能导致错误行为预测,甚至危及用户安全。安全从业者需关注这一新兴威胁,并评估自身系统的防护能力。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shanghao Shi, Chaoyu Zhang, Heng Jin, Yang Xiao, Yevgeniy Vorobeychik, William Yeoh, Ning Zhang, Y. Thomas Hou, Wenjing Lou

这篇论文揭示了联邦学习(FL)在语言模型微调过程中的隐私后门攻击风险。在联邦学习中,多个参与者协作微调模型而不共享原始数据,但全模型微调计算成本高昂,因此参数高效微调(PEFT)成为实际应用中的主流方法,它冻结基础模型仅训练少量适配器。本文提出一种名为NeuroImprint的攻击方法,由恶意参数服务器实施,能够将PEFT适配器隐秘地转化为隐私后门,该后门隐式地记忆客户端的训练样本,以每个样本对应的隔离参数更新形式存储在单独的神经元中,且不降低模型效用。具体来说,NeuroImprint为每个训练样本分配一个专用的记忆神经元,并约束每个神经元在本地微调轨迹中最多更新一次,从而解决了大本地批次和有状态优化器(如Adam/AdamW)导致的交叉样本碰撞和交叉步骤混合问题。微调完成后,这些隔离的样本更新可以通过闭式解析方法逆向恢复为文本嵌入,并确定性地映射回 token 序列。作者在多种语言模型(BERT、GPT-2、Qwen2、Llama3.2)和四个不同领域的微调数据集上验证了该方法,结果显示攻击能够重构59%至79%的微调样本,且具有较高的语义保真度。该研究首次系统性地展示了在联邦语言模型微调中利用PEFT适配器实现隐私泄露的可行性,对联邦学习的安全隐私保护提出了新的挑战。

💡 推荐理由: 该研究揭示了联邦语言模型微调中一种隐蔽且高效的隐私攻击方式,直接威胁到使用PEFT的联邦学习系统的用户数据安全。安全从业者应关注此类针对适配器的后门攻击,并评估现有防御措施的不足。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kaihsun Yang, Min-Yan Tsai, Chia-Mu Yu

该论文针对模型量化中的后门攻击(Quantization-Conditioned Backdoors, QCBs)提出了一种新型防御方法。QCBs 是一种后门威胁:模型在全精度下表现正常,但经过量化后激活恶意行为。现有防御通常需要修改量化过程或校正激活统计信息,导致额外计算开销或依赖特定量化设置。作者从参数空间角度出发,观察到全精度模型与量化模型之间的权重差异编码了一种结构化的行为偏移,这种偏移可被解释为恶意任务向量而非随机量化噪声。基于此,提出了 QVec 方法:在部署前通过受控参数修正来抵消该恶意方向。QVec 无需重训练、无需触发器样本,仅需一次量化传递来估计参数偏移,并结合轻量级超参数搜索。在图像分类基准和多种大语言模型(LLM)攻击场景上的实验表明,QVec 能在保持干净模型性能的同时持续抑制后门激活。该方法为防御 QCBs 提供了一种高效且通用的新思路。

💡 推荐理由: 模型量化广泛应用,QCBs 是一种隐蔽且危险的攻击;QVec 无需修改量化流程或重训练,即插即用,对于保护量化模型安全具有实际价值。

🎯 建议动作: 研究跟进,在内部评估 QVec 对现有量化模型的防御效果。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
推荐 5.5
Conf: 50%
👥 作者: Nils Loose, Jonas Sander, Felix Mächtle, Thomas Eisenbarth

大型语言模型(LLM)日益部署在软件工程等敏感场景中,其输出直接影响下游工件。近期研究发现,同一模型在不同部署平台上可能产生可测量的输出差异,这是由非结合浮点运算和不同的内核实现所致。本文研究了这种平台依赖可变性的安全影响,揭示了LLM部署中一种新的攻击面。作者提出FloatDoor,首个输入无关、平台触发的生成式LLM后门攻击。受感染的模型在目标平台上呈现对手选择的恶意行为,在其他平台上则表现正常。FloatDoor通过两个轻量级LoRA适配器实现:一个放大跨平台的数值发散,另一个将由此产生的平台特征绑定到恶意下游任务,同时保持模型整体效用大致不变。该攻击利用了模型审计与服务之间显著的时间差(TOCTOU)。作者在Qwen3-4B上对多种部署目标(包括NVIDIA GPU、Google TPU、AWS Graviton、Alibaba Yitian-710)演示了FloatDoor。最后,案例研究表明,FloatDoor能在所选目标平台上可靠地诱发可利用的代码漏洞。该研究定义了LLM部署的一类新攻击,强调了在敏感的LLM驱动应用中建立可信模型供应链的紧迫性。

💡 推荐理由: LLM在代码生成等关键任务中的广泛应用,使得平台触发后门攻击具有严重威胁。该攻击难以通过常规模型审计发现,且能定向破坏特定平台上的输出,直接威胁软件供应链安全。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kunlan Xiang, Haomiao Yang, Wenbo Jiang

本文研究了对比语言-图像预训练(CLIP)模型在不同下游部署接口(如特征提取、检索、重排序和选择)中后门暴露的一致性问题。现有CLIP后门攻击通常在单一原生任务上验证,但模型复用时,相同后门在不同接口下的暴露程度未知:可能保持、减弱或失效。作者提出DIFE(部署接口足迹评估)框架,通过指定每个接口的组件读出、触发通道、目标事件、参考条件和指标,实现跨接口的可比评估。DIFE还引入了有效足迹诊断,识别承载暴露的可复用CLIP组件或组件组合,并解释风险迁移。使用DIFE审计复现的CLIP后门发现:原生成功并非检查点级别的风险证书;暴露遵循组件足迹;文本侧中毒不会导致文本编码器控制;某些耦合攻击仍受机制限制。审计还揭示了现有CLIP后门中的关键缺口:文本编码器本身可成为对抗行为的可复用载体。为此,作者提出BadTextTower攻击,能够在文本条件检索、重排序和选择中产生强暴露,同时保持视觉复用几乎干净。实验证明了框架的有效性和攻击的威胁性。

💡 推荐理由: 揭示了CLIP模型后门在不同部署接口下的暴露差异,强调原生成功不代表整体安全,并指出文本编码器成为新风险载体,对模型复用场景的安全评估具有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jiamin Chang, Salil Kanhere, Piotr Koniusz, Jason, Xue, Hammond Pearce

本文研究视觉-语言智能体系统(VLAS)中的后门攻击问题。VLAS将视觉感知与规划、工具使用和物理动作相连接,因此后门触发器可以通过决策管线及其连接的接口传播,使视觉后门成为系统级威胁。当前评估仅关注干净准确率和攻击成功率(ASR),这些指标只衡量触发器是否有效,但无法判断攻击是否“精确”——即是否仅在预期条件下触发隐藏行为。本文形式化了触发器不精确的失败为“触发器泄露”:视觉或语义上与预期触发器相近的输入,无意中激活了攻击者指定的行为。为量化泄露,作者提出邻域泄露率(NLR)。实验表明,在3%的投毒比例下,图标和文本触发器对常见视觉变换保持鲁棒,但其邻近变体泄露严重,NLR分别达到0.996(图标)和0.944(文本)。使用文本触发器作为受控探针,结果表明标准微调学习到一个较宽的激活区域而非精确触发条件,导致即使是稍有不同的邻近字符串也会调用恶意行为。通过加入编辑距离为1的硬负样本进行训练,可以显著缩小激活区域并减少泄露,在图像编辑和具身操作工作流中,泄露的触发器可能传播到可执行程序和动作序列。本研究的贡献在于正式定义了触发泄露问题,提出了NLR指标,并展示了通过硬负样本训练来缓解泄露的方法。适合对AI安全、后门攻击防御感兴趣的学术界和工业界研究人员阅读。

💡 推荐理由: 后门攻击在VLAS中的精确性问题常被忽视,本工作揭示了标准评估指标的盲区,并提出NLR新指标,为提升智能体系统安全性提供了新视角。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuchen Chen, Weisong Sun, Haocheng Huang, Yuan Xiao, Chunrong Fang, Yiran Zhang, Tingting Xu, Zhenpeng Chen, An Guo, Peizhuo Lv, Xiaofang Zhang, Zhenyu Chen, Yang Liu, Baowen Xu

本文针对代码语言模型(CodeLMs)中的自然后门漏洞进行了深入的实证研究。自然后门是指模型在正常训练过程中无意习得的后门行为,与通过数据投毒注入的后门不同,其产生机制与模型内部表征有关。研究覆盖了多种模型架构(如GPT、BERT变体)和代码智能任务(如代码补全、缺陷检测、代码翻译),在44个场景下系统性地评估了自然后门的存在性,结果表明自然后门在CodeLMs中普遍且固有。作者从模型层面和参数层面揭示了自然后门与注入后门的差异:前者往往与更多参数相关且分布更散。进一步分析了自然后门在数据集、模型架构和共享知识上的可迁移性,发现它们能在不同任务间迁移。成因分析从训练数据(如数据中的隐性偏差)和训练过程(如过拟合)两方面展开。评估了现有防御技术(包括预训练、训练中、训练后防御)对自然后门的缓解效果,发现多数防御效果有限。最后提出了ScanNBT检测方法,通过特征分析和异常模式识别来增强对自然后门的检测能力。该研究有助于理解CodeLMs的安全隐患,为开发更安全的代码模型提供指导。适合安全研究人员、AI安全工程师、代码智能开发者阅读。

💡 推荐理由: 自然后门可能潜伏在正常训练的代码模型中,影响代码生成、漏洞检测等关键任务的安全性与可靠性,现有防御手段难以有效清除,对依赖CodeLMs的软件供应链构成潜在威胁。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bastien Vuillod, Kevin Hector, Pierre-Alain Moellic, Jean-Max Dutertre, Olivier Potin

该论文研究联邦学习(FL)中的模型投毒攻击。传统FL后门攻击主要依赖算法层面操纵训练数据,但本文引入一类新的攻击:利用硬件故障(如Rowhammer)在本地模型参数中注入比特翻转,从而在联邦学习期间植入后门。攻击过程分为离线阶段:攻击者从预训练模型出发,通过分析确定要翻转的比特位;在线阶段:恶意客户端在本地训练时通过硬件故障(比特翻转)修改模型参数,使全局模型在目标任务上保持正常性能,但后门触发时输出攻击者指定的错误结果。实验表明,在ResNet-18等模型上,平均每次恶意客户端出现仅需10次比特翻转,共19次恶意交互即可达到94%的攻击成功率。论文还讨论了攻击的实用性及潜在防御的鲁棒性,并指出Rowhammer是该类威胁的主要攻击向量。该工作揭示了硬件安全与联邦学习安全的交叉风险,对设计防御策略具有指导意义。

💡 推荐理由: 该研究首次将硬件故障攻击(比特翻转)与联邦学习后门攻击结合,拓宽了攻击面,提醒安全从业者关注底层硬件威胁对模型安全的影响。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hongtao Wang, Se Yang, Yu Chen, Puzhuo Liu

本文提出了一种针对大型语言模型(LLM)智能体长期记忆系统的隐蔽后门攻击方法——MemPoison。LLM智能体通过长期记忆支持持续自主的任务执行,但记忆系统的选择性提取和重写机制使得传统记忆投毒攻击难以生效。MemPoison通过对话交互将可触发的后门注入智能体长期记忆,从而误导其后续响应。该方法包含三个关键组件:(1)语义关系桥,将触发词与载荷绑定为连贯语句,确保它们被一同提取至记忆;(2)实体伪装,优化触发词使其模仿命名实体,抵抗记忆重写;(3)联合嵌入优化,将包含触发词的文本在嵌入空间中形成紧密簇,并与良性嵌入保持隔离,实现隐蔽性。实验覆盖不同智能体领域和记忆机制,MemPoison攻击成功率高达0.95,显著优于现有基线。机制分析表明,攻击利用了嵌入空间的各向异性并改变了注意力模式,揭示了选择性记忆系统的核心脆弱性。论文还评估了多种防御策略,证明它们在缓解该攻击方面存在根本性局限。该工作适合AI安全研究员、LLM智能体开发者以及关注对抗机器学习的防御者阅读。

💡 推荐理由: 首次展示攻击者通过自然对话即可在LLM智能体长期记忆中植入隐蔽后门,绕过了现有选择性记忆机制,对依赖记忆的自主智能体构成可信赖性威胁。

🎯 建议动作: 研究跟进,评估现有记忆系统的防御能力,并关注后续防御方案。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jianwei Li, Jung-Eun Kim

该立场论文指出,AI/ML 社区不应过度使用“正向后门”(positive backdoor)这一标签,而应将触发激活的隐藏行为视为“秘密对齐”(Secret Alignment)。在私有AI时代,开放权重的大语言模型和可获取的训练/推理栈使语言模型成为私有数字资产,带来了未经授权访问、模型窃取和行为滥用的安全风险。最近,一系列被称为“正向后门”的工作被提出以应对这些挑战,其核心思想是在模型中植入隐蔽的触发-行为关联,用于访问控制、所有权归属和安全强制。本文将这些方法统一为秘密对齐的一种形式,并评估了三个代表性应用在六个核心属性(有效性、无害性、持久性、效率、鲁棒性和可靠性)上的表现。结果表明,触发-行为映射在机密性、完整性、可用性(CIA)方面存在显著的脆弱性,远不如现有声称的那样可靠。作者进一步将结果关联到行为密度和决策复杂度,提供了一个行为学视角来理解部署时风险,并呼吁社区采用严格的、标准化的评估来使秘密对齐的主张可证明。

💡 推荐理由: 纠正了对“正向后门”的误用,强调了对模型隐藏行为进行严格评估的必要性,对LLM安全部署和防御有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Khang Tran, Yazan Boshmaf, Issa Khalil, NhatHai Phan, Ting Yu, Md Rizwan Parvez

本文提出一种名为Poison-with-Style (PwS)的实用且隐蔽的模型投毒攻击,针对代码大语言模型(CLLM)。与以往假设攻击者能够在推理时主动将显式触发器(如特定单词)嵌入开发者提示中的攻击不同,PwS利用开发者的代码风格作为隐式触发器,这些触发器自然地蕴含在提示中。PwS引入了一种新颖的数据收集方法和两步训练策略来微调CLLM,使得模型在遇到包含特定代码风格的提示时生成含漏洞的代码,而在其他提示下保持正常行为。在Python代码补全任务上的实验表明,PwS能够抵御最先进的防御措施,并在多种漏洞类型上实现高攻击成功率,同时保持标准代码补全基准(如HumanEval和MBPP)上的良好性能。例如,当使用触发代码风格时,PwS投毒的模型在95%的情况下生成CWE-20漏洞代码,而在HumanEval和MBPP上的pass@1性能下降不到5%。该研究表明,代码风格这种看似无害的特征可被用作隐蔽的后门触发器,对基于CLLM的代码代理构成严重威胁,并凸显了需要更细粒度的防御策略来检测此类隐式触发器的必要性。

💡 推荐理由: 该攻击利用开发者自然的代码风格作为隐蔽触发器,极具实用性和隐蔽性,能绕过现有防御,威胁基于代码大模型的智能代理安全。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 10.6
Conf: 50%
👥 作者: Zedian Shao, Charles Fleming, Teodora Baluta

大型语言模型(LLM)通常使用未经过滤的文本数据集进行微调,而对手可以污染这些数据集。现有的数据投毒攻击主要依赖于固定的触发短语,这些短语可以被异常检测、干净数据正则化或在线监控等防御手段中和。本文提出了一种新的数据投毒方法,通过共享知识(如事实或概念)与攻击者选择的短语之间的语义关联,使LLM学习一种可靠且隐蔽的信息隐藏方案。这种隐藏方案可以编码和解码任意恶意指令,从而揭示了一种新的、微妙的投毒诱导漏洞:隐蔽控制攻击。作者精确刻画了隐蔽控制攻击的特征,并在5个LLM、3种后门防御和4种提示注入防御上进行了评估。在较小的污染比例下,相比干净的微调模型,隐蔽控制攻击在平均攻击成功率上比基于启发式的提示注入攻击相对提高了约40%。它们还能规避基于检测和微调的防御,在后门防御后保持高达93%的攻击成功率,在提示注入防御后保持高达98%的攻击成功率。这项研究展示了LLM微调过程中一种新型的、难以防御的威胁,对LLM的安全部署提出了严峻挑战。

💡 推荐理由: 该攻击通过语义关联隐藏指令,能绕过现有检测和防御机制,对LLM安全构成新威胁,安全从业者需关注此类隐蔽后门攻击的演变。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zeyao Liu, Zhendong Zhao, Xiaojun Chen, Xin Zhao, Yuexin Xuan, Xiaoshuang Ji

该论文研究视觉Transformer(ViT)后门攻击的安全风险。现有基于全量微调的后门攻击计算开销大且导致性能下降,因此攻击者转向视觉参数高效微调(PEFT)范式,其中基于适配器(如LoRA)和基于提示(如VPT)的方法占主导。尽管适配器安全性已有初步研究,但基于提示的生态系统风险尚未被充分探索。论文填补了这一空白,揭示了VPT向动态、上下文感知架构演化过程中出现的一种更危险的威胁:即使这些动态模块在良性任务上表现优异,却可能被利用来植入后门。作者提出VIPER攻击框架,其核心是轻量级的动态视觉提示生成器(VPG)。该动态架构能够实现“功能融合”(Functional Fusion)这一新兴现象:恶意逻辑与良性任务功能紧密融合在同一稀疏、高幅值的参数核心中。这造成了一种“人质”困境:若剪除攻击参数,则良性性能必然被破坏。实验表明,VIPER有效解决了攻击者的三难困境:在干净数据上达到最先进性能,在VPG模块剪枝率达90%时仍保持近100%的攻击成功率(而LoRA攻击已崩溃),且推理延迟仅增加0.06毫秒(1.16%)。该工作揭示了动态提示架构中一种范式级的新风险。

💡 推荐理由: 揭示了动态提示架构中一种新型后门攻击,其恶意逻辑与良性功能高度融合,使得传统防御措施(如剪枝)失效,对基于PEFT的ViT系统构成严重威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Daniel Yiming Cao, Chengzhong Wang, Sheng-Yen Chou, Chengyu Huang, Pin-Yu Chen, Shengwei An

该论文首次系统研究了掩码扩散语言模型(MDLM)在训练阶段的后门攻击。MDLM是一种新兴的文本生成范式,其训练时安全性尚未得到充分探索。现有的针对高斯扩散模型或自回归语言模型的后门攻击无法直接应用于MDLM,因为MDLM依赖于离散状态破坏和迭代去噪,而非连续加噪或从左到右预测。为此,作者提出SHADOWMASK后门攻击方法,通过修改MDLM的前向破坏过程,将标准的全掩码终端分布替换为触发词-掩码混合先验分布,从而创建一条从触发词破坏状态到攻击者指定目标的专用去噪路径,同时保持干净的去噪行为。论文给出了后门前向过程的数学定义,推导了反向时间后验,并得到了连续时间训练目标。在基于DiT的MDLM和LLaDA-8B-Instruct模型上,使用WikiText-103、OpenWebText和Alpaca数据集进行评估,结果表明SHADOWMASK实现了接近100%的攻击成功率,显著优于标准数据投毒,且基本保持了干净效用,在全模型微调和参数高效微调下仍有效,并对代表性防御方法具有鲁棒性。

💡 推荐理由: MDLM作为新兴文本生成范式,其安全性尚未被充分研究。本文揭示了MDLM存在训练时后门攻击风险,攻击者可通过修改前向过程植入后门,且攻击成功率高、隐蔽性强。安全社区需关注此类新型攻击路径,并在部署MDLM前进行安全评估。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tobias Braun, Jonas Henry Grebe, Hossein Shakibania, Anna Rohrbach, Marcus Rohrbach

本文首次研究了统一自回归模型(UAM)中的后门攻击漏洞。UAM是一种Transformer模型,能够在单个自回归过程中同时生成文本和图像token。其共享参数和多模态词汇简化了训练流程并支持灵活的多模态生成,但也引入了新的安全风险。作者提出了Token by Token后门攻击(ToBAC),这是首个针对UAM的后门攻击方法,涵盖基于数据和基于模型的投毒策略。攻击者可以将看似无害的字符或常见单词作为触发器,在图像生成过程中引发恶意行为,同时操纵视觉输出和伴随文本,从而提高虚假内容的可信度。在模型可访问的场景下,攻击者可以对统一Liquid模型进行攻击,使得一个微妙单词(如“cool”)在55%的生成中诱发与模态一致的品牌推广或意识形态影响。在无模型访问时,通过数据投毒即可实现攻击,对JanusPro的平均成功率达63.1%。实验表明,UAM的跨模态参数共享使得后门触发器能够跨模态传播恶意效果,这是一种新型安全威胁。本文的贡献在于揭示UAM特有的安全隐患,并展示了多模态后门攻击的可行性和有效性。

💡 推荐理由: 统一自回归模型是未来多模态AI的重要方向,本文揭示了其特有的后门攻击风险,攻击者可同时篡改文本和图像输出,对内容安全构成严重威胁。

🎯 建议动作: 跟进该研究,评估自身使用的UAM模型是否存在类似后门风险;关注后续防御技术发展。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Cheng Chu, Qian Lou, Fan Chen, Lei Jiang

该论文提出了一种名为QNBAD(量子噪声诱导后门攻击)的新型攻击方法,针对量子机器学习(QML)中的零噪声外推(ZNE)防御。ZNE是当前量子计算中广泛使用的错误缓解技术,旨在通过外推拟合和处理噪声,提高量子计算的可靠性。QNBAD利用量子噪声的特殊性质——即攻击者通过操控特定量子比特的噪声水平,在神经网络中植入后门模式。这种后门仅在触发噪声模式时激活,导致模型输出预设的错误结果,而正常输入下模型精度几乎不受影响。实验在多个量子神经网络基准测试上进行,结果表明攻击成功率超过90%,同时模型在干净数据上的精度下降不足1%。该方法首次揭示了ZNE防御的脆弱性,表明即使采用先进的错误缓解技术,量子模型仍可能被恶意噪声诱导的后门所破坏。论文还讨论了对抗性噪声的生成策略和攻击的隐蔽性,指出检测此类攻击的难度较高。该研究对量子机器学习的安全性提出了新的挑战,提醒研究者在部署量子模型时需考虑对抗性噪声威胁。

💡 推荐理由: 为首次证明零噪声外推(ZNE)无法抵御恶意注入的量子噪声后门,揭示了量子机器学习中新的攻击面,对量子计算安全研究具有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Rui Wen, Mark Russinovich, Andrew Paverd, Jun Sakuma, Ahmed Salem

该论文提出了一种新型后门攻击方法 MetaBackdoor,利用 Transformer 架构中位置编码 (Positional Encoding) 的内在特性作为触发器,而不需要修改输入文本内容。现有的后门攻击大多依赖内容触发器(如特定词语、句子),容易被基于文本异常的防御机制检测。作者的核心洞察是:Transformer 模型在处理有序序列时必须编码 token 位置信息,因此输入长度相关的结构会反映在模型内部计算中,可以被用作非内容触发器。论文展示了即使简单的基于长度的位置触发器也能激活隐匿的后门行为。与之前攻击不同,MetaBackdoor 作用于可见且语义正常的输入,使后门 LLM 在满足长度条件时泄露敏感内部信息(如专有系统提示),甚至出现自激活场景——正常的多轮交互可将对话上下文推至触发区,诱导恶意工具调用行为,而无需攻击者提供触发文本。此外,MetaBackdoor 与基于内容的后门正交,可组合使用以创建更精确、更难检测的触发条件。实验证明该方法在多种 LLM 架构上有效。该工作扩展了 LLM 后门的威胁模型,揭示了位置编码这一被忽视的攻击面,对现有侧重文本异常检测的防御策略提出了挑战。

💡 推荐理由: 揭示了 LLM 位置编码可作为新型后门触发器,绕过现有基于文本内容的防御,引发系统提示泄露、恶意工具调用等安全风险,需要安全社区重新评估防御策略。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
INFO
PAPER 2026-05-07

Stateful Agent Backdoor

推荐 5.5
Conf: 50%
👥 作者: Zhengchunmin Dai, Jiaxiong Tang, Liantao Wu, Peng Sun, Honglong Chen

该论文提出了一种针对基于大型语言模型(LLM)的智能体的有状态后门攻击方法。现有后门攻击在单个会话内执行固定行为,且攻击状态无法跨会话持久化。作者设计了一种有状态后门,通过持久化组件(如文件系统、数据库等)维护攻击状态,使得在一次触发注入后,攻击能够在多个会话中自主、增量地执行,即使这些会话处于权限隔离环境中。形式上,作者将攻击建模为Mealy机,并推导出分解框架,使得每个状态转换的数据可以独立构建。他们基于此框架实现了一个主要攻击实例和两种扩展变体(不同拓扑结构和持久化组件)。在四个主流LLM模型上的实验表明,主要攻击实例的成功率达到80%–95%,每转换分析验证了分解方法的有效性。扩展变体也展示了一致的效果。该研究揭示了LLM Agent在面对跨会话持久化后门时的脆弱性,对Agent安全防御具有警示意义。适合AI安全研究员、LLM应用开发者阅读。

💡 推荐理由: 该研究揭示了LLM Agent面临的新型持久化后门威胁,突破了传统单会话攻击的局限,对构建鲁棒的Agent安全防护具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 14.6
Conf: 50%
👥 作者: Eden Luzon, Guy Amit, Roy Weiss, Torsten Krauß, Alexandra Dmitrienko, Yisroel Mirsky

本论文提出一种针对联邦学习的训练时后门攻击方式,使恶意服务器能够系统性地提取客户端完整训练样本。传统数据提取方法往往只能概率性重建或产生幻觉,无法精确恢复原始数据。该方法通过修改训练过程,在模型中嵌入一个后门触发器,当输入特定索引模式时,模型会直接输出对应训练样本。由于输出尺寸限制,攻击者将样本分割为多个补丁依次提取,并在服务器端重组。攻击仅需对训练代码做微小修改,客户端验证难以察觉,构成联邦学习供应链安全威胁。实验覆盖分类器、分割模型和大语言模型,显示可以数千计地恢复敏感样本,且对主任务性能影响极小(如医学分割数据集仅降低3%准确率)。研究揭示了联邦学习系统中数据隐私的重大漏洞,强调加强分布式训练管道完整性和透明性的必要性。适合联邦学习安全研究员、隐私保护工程师阅读。

💡 推荐理由: 该攻击首次实现联邦学习中精确、高容量的训练数据提取,仅需轻微破坏模型效用,严重威胁隐私敏感的医学等场景。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Linzhi Chen, Yang Sun, Hongru Wei, Yuqi Chen

本文针对低秩适配(LoRA)模型在开源社区(如Hugging Face)中广泛使用所带来的安全挑战展开研究。LoRA作为一种高效的大语言模型微调方法,其适配器文件可被轻易分享和传播,但这也为恶意攻击者提供了植入后门的机会。现有后门攻击方法在LoRA场景下面临三个主要问题:依赖原始训练数据(通常不可获取)、未考虑LoRA特有的结构属性、以及高虚假触发率(False Trigger Rate, FTR)导致隐蔽性差。为此,作者提出了一种因果引导去毒后门攻击框架(CBA),该框架无需访问原始训练数据即可实施攻击。CBA的核心创新包括两点:一是基于覆盖引导的数据生成流水线,通过行为探索合成与任务对齐的输入;二是因果引导的去毒策略,通过保留任务关键神经元来合并中毒适配器和干净适配器。与以往方法不同,CBA允许攻击者在后训练阶段通过因果影响权重分配来控制攻击强度,无需重复训练。在六个LoRA模型上的实验表明,CBA在实现高攻击成功率的同时,将FTR相比基线方法降低了50-70%。此外,该方法对现有先进的后门防御方法表现出增强的抵抗力,凸显了其隐蔽性和鲁棒性。本文的研究揭示了开源LoRA模型生态中存在的严重安全隐患,提醒社区关注此类新型后门攻击的威胁。

💡 推荐理由: 本研究揭示了开源LoRA模型共享生态中一种高隐蔽性、无需原始训练数据的后门攻击方法,对依赖LoRA微调的AI应用构成潜在威胁,值得安全从业者警惕并提前部署检测与防御机制。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sarthak Choudhary, Atharv Singh Patlan, Nils Palumbo, Ashish Hooda, Kassem Fawaz, Somesh Jha

该论文提出了一种名为 Sparse Backdoor 的供应链攻击,能够在预训练图像分类器(包括卷积网络和视觉Transformer)中植入一个理论上不可检测的后门。攻击方法是在每个全连接层的少量列上沿随机方向注入结构化稀疏扰动,从而将触发信号传播到攻击者选择的目标类别,并通过独立的各向同性高斯抖动掩盖该扰动。抖动的作用是产生一个以预训练权重为锚点的干净参考分布,据此形式化定义不可检测性。在预训练分类器满足温和的边际条件时,论文证明了抖动后的参考模型与原始分类器功能等价。进一步,论文证明区分植入了后门的模型与该参考模型至少与Sparse PCA检测问题一样困难,而后者在标准难度假设下是计算不可行的。该保证适用于任何具有白盒参数访问权限的概率多项式时间区分器。

💡 推荐理由: 该研究揭示了机器学习供应链中一种新型后门攻击,能在参数层面实现理论上的不可检测性,对AI模型的可信部署构成严重威胁。安全从业者需关注此类攻击对模型审计和安全性评估的挑战。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zi Li, Tian Zhou, Wenze Li, Jingyu Hua, Yunlong Mao, Sheng Zhong

本文揭示了一种针对本地大语言模型(LLM)微调过程的供应链攻击新范式。传统观点认为本地离线微调能够保护训练数据中的敏感信息(如API密钥、个人标识符、金融记录等),但本文证明,通过向模型代码中植入伪装成标准架构定义的后门,攻击者即可实现高成功率的秘密窃取。不同于以往被动的预训练权重投毒(主要依赖概率性语义前缀,难以捕获稀疏高熵的目标),本文提出了一种主动执行劫持方法:攻击者将恶意代码伪装为模型架构定义(如PyTorch模块),在微调时触发执行劫持。核心技术包括:1)确定性全链记忆机制,通过在线张量规则匹配锁定动态计算流中的令牌级秘密;2)值-梯度解耦技术,隐蔽地注入攻击梯度,克服梯度淹没问题迫使模型记忆秘密;3)首次实现攻击者可验证的秘密窃取——通过黑盒查询精确区分真实泄露与幻觉。实验表明,该方法在保持主任务性能的前提下,严格攻击成功率(Strict ASR)超过98%,并能有效绕过差分隐私(DP-SGD)、语义审计和代码审计等防御措施。该研究提醒安全社区,模型代码供应链是不可忽视的攻击面。

💡 推荐理由: 挑战了“本地离线微调天然安全”的假设,揭示了模型代码后门可被用于窃取训练数据中的高价值秘密,对使用第三方模型代码或依赖微调服务的企业构成直接威胁。

🎯 建议动作: 审阅内部微调流程中使用的模型代码来源,实施代码审查与完整性验证;评估是否引入额外的运行时监控以检测异常梯度或执行流。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mengnan Zhao, Lihe Zhang, Tianhang Zheng, Bo Wang, Baocai Yin

本文旨在解释快速对抗训练(Fast Adversarial Training, FAT)中出现的灾难性过拟合(Catastrophic Overfitting, CO)现象。FAT能高效提升神经网络对对抗样本的鲁棒性,但容易发生CO,即模型过度拟合训练时使用的特定攻击,导致对其他攻击的泛化能力差。现有方法虽提出了各种缓解策略,但缺乏系统直观的解释。本文创新性地从后门攻击(backdoor)的角度解读CO:通过路径划分、多样特征预测和通用类别可区分触发器的验证,将CO视为不可学习任务(unlearnable tasks)的弱触发器变体,从而统一了CO、后门攻击和不可学习任务的理论框架。基于此,作者提出了多种后门启发的缓解方法:(1)使用微调、线性探测或重新初始化技术重新校准受CO影响的模型参数;(2)引入权重异常值抑制约束,控制模型权重的异常偏差。大量实验支持了对CO的解释,并证明了所提缓解策略的有效性。本文适合机器学习安全、对抗鲁棒性方向的研究人员阅读。

💡 推荐理由: 该研究首次将灾难性过拟合与后门攻击统一在同一个框架下,为理解模型鲁棒性问题提供了新视角,并提出了有效的缓解策略。

🎯 建议动作: 研究跟进

排序因子: Community 数据源 (+1) | LLM 评分加成 (+0.5)