#backdoor

共收录 57 条相关安全情报。

← 返回所有主题
👥 作者: Michael Collins, Jada Cumberland, Brianne Dunn, Ross Gore, Samuel Jackson, Sachin Shetty

Goldwasser 等人此前证明,在随机傅里叶特征(RFF)算法训练的机器学习模型中,可以植入一类不可检测后门,其安全性建立在与连续学习带误差问题(CLWE)相关的困难假设之上;在标准密码学假设下,即使对模型权重做完全白盒审计也无法发现该后门。但原始论文仅以密码学归约和概率引理的形式给出构造,没有参考实现,且依赖 Sparse Gaussian Pancakes 分布、齐次 CLWE 条件密度等辅助机制,仅凭论文难以判断其能否在普通数值代码中落地。本文的工作正是填补这一空白:作者仅使用 numpy 与 scipy,端到端实现了白盒 CLWE-RFF 后门构造,用以检验该威胁是可用通用科学计算工具复现,还是必须依赖专门的密码学基础设施。论文为构造核心所需的 GP_d(b_k) 分布提供了两种采样器:一是基于拒绝采样的近似方案,二是由齐次 CLWE 条件密度推导出的精确闭式采样器,并用其自身解析形式进行了验证。在此基础上,作者开展统计不可区分性测试,同时覆盖权重空间审计与黑盒功能对比两类视角,在多个稀疏比 ρ = d_sparse/D 下均未发现后门模型与干净模型之间存在可检测差异。论文还具体报告了构造中哪些部分易于实现、哪些需要论文未给出的额外推导,并明确列出未尝试复现的部分,包括底层的格困难性归约。作者将本工作定位为对 Goldwasser 白盒 CLWE 核心实务可实现性的贡献,而非新的理论结果。适合机器学习安全、模型供应链与可信 AI、密码学工程方向的研究者与防御方阅读。

💡 推荐理由: 它表明“不可检测后门”并非纸面理论:仅凭通用 numpy/scipy 即可复现,权重级白盒审计与黑盒功能测试都可能看不出异常。这直接动摇第三方模型/权重可被信任的假设,对模型供应链与可信部署构成现实压力。

🎯 建议动作: 研究跟进;纳入内部模型供应链安全评估

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Aashiq Muhamed, Mona T. Diab, Virginia Smith, Andrew Ilyas, Matthew Jagielski

该论文聚焦大语言模型微调阶段的后门数据投毒评估方法学。传统后门研究通常固定投毒样本数量,再从候选数据池中随机抽取投毒集合,并据此估计模型的最坏情况脆弱性。作者指出这种做法会严重低估真实风险:在三个基于 LLaMA-3-8B 的后门实验设置中,当模型、干净数据与投毒样本数量全部保持不变,仅改变"选中哪些样本构成投毒集合"这一个变量时,攻击成功率即可在 3% 到 80% 之间大幅波动。换言之,随机采样只探测到了风险空间的一小部分。为刻画这一问题,作者把投毒集合的选择形式化为"受 oracle 预算约束的集合优化":每次"微调 + 评测"调用代价高昂,因此必须在有限次真实评测下,从海量候选集合中找出最危险的那一批。为此提出 SAILS(Set-level Audit-Informed Iterative Learned Selection,集合级、由审计信息驱动的迭代学习式选择):先用几百次微调-评测运行训练一个"集合打分器",用它为数百万个候选投毒集合排序,再只对排名靠前的小规模候选名单进行真实审计验证,从而在预算内逼近最坏情况。实验表明,SAILS 在留出集合上的攻击成功率平均比最强的影响力(influence)基线高出约 30 个百分点;该方法还能从较小规模微调迁移到完整规模微调,并可扩展到代码生成、智能体(agentic)以及仅提供 API 的后门场景。整体研究视角属于"对抗性评估方法学",即通过构造更强的攻击者模型来暴露当前后门评测与防御体系的盲区,而非提出新的实际攻击载荷或绕过技术。

💡 推荐理由: 许多后门防御与安全评测默认随机抽取投毒集合,本文证明这会系统性低估最坏情况风险(同一配置下攻击成功率可在 3%~80% 间波动)。这意味着基于弱随机基线的"防御有效"结论可能不成立,安全团队需以对抗性、集合级视角重新审视微调数据供应链与后门评估指标。

🎯 建议动作: 研究跟进,并纳入内部评估:把随机投毒基线升级为集合级最坏情况评估方法

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Toshif Khan, Muhammad Abusaqer

该论文针对监督学习中的训练阶段数据投毒问题开展了一次系统的实证评测。研究背景是:数据投毒通过污染训练集来破坏模型整体性能,或向模型中植入由攻击者控制的后门行为,目前多数公开研究聚焦于单一攻击或单一模型,缺乏在统一实验条件下对不同投毒方式、不同投毒比例与不同分类器之间可比性的评估。为此,作者选取了两类具有代表性的训练时攻击——标签翻转(label flipping)与后门投毒(backdoor poisoning),并在 MNIST 与 Fashion-MNIST 两个图像分类数据集上进行对比实验。所用基线分类器包括逻辑回归(Logistic Regression)、线性支持向量机(Linear SVM)和随机森林(Random Forest),覆盖线性与非线性、参数化与非参数化模型,以便观察攻击效果对模型族的依赖。实验设计上,作者将干净训练(0% 投毒)与 5%、10%、20% 三档投毒率进行对照,评估指标不仅包括常规的干净测试集准确率,还引入宏平均精确率、宏平均召回率与宏平均 F1,用以捕捉类别层面的性能失衡;针对后门攻击,额外统计攻击成功率(Attack Success Rate, ASR),衡量攻击者指定目标行为的达成程度。主要发现分为两部分:其一,标签翻转会造成可观测的性能下降,且对逻辑回归与线性 SVM 的破坏最明显,随机森林相对更稳定,说明不同模型对标签噪声的鲁棒性存在显著差异;其二,后门投毒在两个数据集、三类模型上均取得 0.9667 至 1.0000 的攻击成功率,同时在多数情况下干净测试集性能仍接近基线水平。这一结果清晰地区分了“无差别投毒”与“定向后门投毒”:前者会在标准指标上暴露,后者则相对隐蔽,却能在特定触发条件下嵌入高度有效的恶意行为。论文由此论证,仅依赖干净测试集指标不足以评估模型的安全性,需要引入面向安全的评测流程,例如在训练数据审计、触发集检测与模型行为一致性检查等维度补充评估手段。该工作适合机器学习安全研究者、模型训练与数据治理工程师、以及负责 AI 供应链风险的安全团队阅读,可作为投毒风险基线评测与内部红队验证的参考。

💡 推荐理由: 论文用统一实验证明:后门投毒可在攻击成功率接近 100% 的同时保持干净测试性能几乎不变,常规测试指标几乎无法发现。这直接说明依赖准确率验收的模型上线流程存在盲区,安全团队需要将数据投毒纳入 AI 供应链威胁建模与评测基线。

🎯 建议动作: 研究跟进:将其实验设计(多投毒率、多模型、干净指标与 ASR 并行)纳入内部 AI 安全评测基线,并评估在自有数据管道中复现验证。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.6
Conf: 50%
👥 作者: Zahra Tarkhani, Georgios Akkogiounoglou, Lorena Qendro, Isabel Tscherniak, Anil Madhavapeddy

该论文聚焦于 AI 与脑机接口 (BCI) 融合后新出现的、此前缺乏系统研究的攻击面。随着 AI 被广泛嵌入以人为中心的系统,神经信号与物理执行设备之间形成了一条新的信任链:一端是采集到的脑电等神经生理信号,另一端是假肢、外骨骼、轮椅、神经刺激器等可被驱动的物理装置。作者指出,这一链路一旦被滥用,直接威胁认知自主权、精神隐私与人身安全,风险范围从神经数据外泄一直延伸到对 BCI 所连接设备的恶意操控。为把零散的个案研究上升为系统性分析,论文提出 NERVE Attacks 攻击分类学,用五个正交维度覆盖完整 BCI 技术栈:神经模仿式伪造 (Neuro-mimetic Forgery)、基于失同步的规避 (Evasion via Desynchronization)、重放式劫持 (Replay-based Hijacking)、静脉窃听/传感通路窃取 (Vein Tapping) 以及嵌入式后门 (Embedded Backdoors)。为对该分类进行实证评估,作者构建了 EEGle——一个 AI 辅助、可扩展的 BCI 安全分析框架,用于系统化地构造与验证神经域特有的安全问题。评估结果显示 17 个此前未被报道的神经特异性攻击实例,并揭示出 BCI 后门设计中独有的一条“隐蔽性—有效性”权衡谱系,说明在神经信号场景下,隐蔽性与攻击效果之间存在不同于传统软件后门的取舍关系。论文进一步指出,生成式 AI 显著降低了非专业攻击者的入门门槛,使原本需要神经科学与信号处理专业知识的操作变得更容易复现。作者将 EEGle 开放给社区,用于构建和验证这类高度个人化设备的安全性。整体而言,该工作属于面向 BCI 的威胁建模与安全评估方法论贡献,论文视角强调研究问题定义、分类学构建、可复用评估框架,以及为后续防御研究提供基准;适合 BCI/神经工程研发者、医疗设备安全团队、AI 安全与隐私研究人员,以及关注人机融合系统合规与伦理的从业者阅读。

💡 推荐理由: 脑机接口正从实验室走向医疗与消费场景,而神经信号到物理执行器的链路此前缺少系统性威胁模型。该论文提供的分类学与开源评估框架,可帮助蓝队在 BCI 产品设计早期识别神经域特有问题(伪造、失同步、重放、后门等),避免把传统 IT 安全思路直接套用到人身安全攸关的设备上。

🎯 建议动作: 研究跟进:阅读原文并将 NERVE 分类学与 EEGle 纳入内部 BCI/医疗设备安全评估清单。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Wenkai Huang, Siyuan Liang, Gaolei Li, Yiming Li, Tianhao Peng, Jianhua Li, Dacheng Tao

本文提出了一种针对基于世界模型的强化学习智能体的后门攻击框架 TrojanWorld。世界模型作为模型-based 强化学习智能体的预测核心,使智能体能够在执行动作前模拟未来动态并基于想象轨迹进行推理。由于其训练成本高昂,预训练世界模型常被分发和复用,这引入了模型供应链安全风险。后门攻击是定向且隐蔽的供应链攻击方式,但针对交互式世界模型智能体的威胁尚未被充分研究。TrojanWorld 通过引导智能体内部的想象过程来触发攻击者指定的行为:物理世界中的物体作为触发器,经由智能体原生观测流程激活后门,无需对观测流进行数字篡改。为实现有效、隐蔽且持久的控制,TrojanWorld 结合了三种机制:决策反射诱导(Decision-Reflective Induction)利用决策反馈将触发条件下的想象引向攻击者指定动作;干净行为锚定(Clean Behavior Anchoring)保持触发器不存在时预测与行为的保真度;因果传播(Causal Propagation)使触发器消失后,被诱导的偏好仍沿后续轨迹保持。这些机制构成了从物理感知经受污染的想象到恶意动作选择的端到端攻击链。实验在 TD-MPC2、DreamerV3 和 R2-Dreamer 系统上,覆盖 DeepMind Control、MetaWorld、MyoSuite 和 RoboDesk 基准测试。结果显示,触发器激活下目标动作偏差最低为 0.026,同时保留至少 98.8% 的干净性能。即使触发器移除,受感染智能体仍可能陷于诱导的行为轨迹,持续执行攻击者指定的动作。

💡 推荐理由: 首个针对世界模型智能体的后门攻击框架,揭示供应链预训练模型被植入后门后可通过物理触发器操控智能体决策,对部署在机器人、自动驾驶等物理场景的模型增强 RL 系统构成潜在威胁,值得研究者和防御者关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Marco Antonio Corallo, Andrea Agiollo, Mauro Conti, Alberto Giaretta

该论文从神经符号(Neuro-Symbolic, NeSy)视角出发,首次系统评估了后门攻击对NeSy模型的影响。NeSy AI旨在将亚符号神经感知与基于符号的推理相结合,以提高AI系统的透明性、可解释性和效率,通常被认为是“设计上安全”的。然而,神经与符号的集成过程引入了额外的复杂层,可能成为攻击者的入口点。作者认为有必要深入调查NeSy模型的对抗鲁棒性,并提出首个针对NeSy的后门攻击系统性评估。实验采用了最流行的NeSy框架DeepProbLog,与基线神经网络在八种后门设置和四种推理任务上进行比较。结果表明:平均而言,NeSy模型确实比纯神经网络更具鲁棒性,但其鲁棒性强烈依赖于所执行的推理过程的严格程度,以及推理过程与所选择的后门攻击目标之间的兼容性。作者已公开实验代码以促进复现。该研究揭示了神经符号集成在对抗场景下的安全属性并非天然坚固,为后续设计更安全的NeSy系统提供了重要参考。适合关注AI安全、对抗机器学习以及神经符号结合方向的研究者、安全工程师和模型设计者阅读。

💡 推荐理由: 安全从业者常默认符号推理可提升模型鲁棒性,但论文指出其鲁棒性受推理严格程度影响,不可盲目信任。对评估和部署NeSy模型的后门风险具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yunjie Zhou, Yuheng Huang, Diqun Yan

本文提出了一种名为 Ouroboros 的新型后门攻击框架,专门针对语音增强(Speech Enhancement)模型。语音增强模型通常作为实时语音服务的前端模块,用于降噪和语音质量提升,但以往的后门攻击研究主要集中于分类任务,且依赖主动注入触发器。然而,语音增强模型的被动处理特性使得这些传统方法难以适用。Ouroboros 的核心创新在于利用语音增强模型自身理想的干净输出作为自然触发器,从而无需在推理阶段注入任何外部信号即可激活后门。具体来说,攻击者在训练阶段将特定类型的干净语音样本与恶意行为绑定,使模型学习到当输入符合某种自然声学特征时,输出被篡改或失效。实验部分在多种模型和数据集上进行了广泛评估,结果显示 Ouroboros 能够达到接近完美的攻击成功率,同时对正常语音增强性能的影响极小。此外,作者还进行了物理世界验证,证明真实环境下自然录制且未经修改的干净音频也能可靠触发后门。该方法进一步扩展至定向内容篡改攻击,并且对常见的过滤和微调防御手段具有鲁棒性。本文首次系统地探索了语音增强模型的后门漏洞,揭示了此类前端模块可能隐藏的安全风险。适合语音处理安全研究人员、AI红队成员以及语音服务提供方的安全工程师阅读。

💡 推荐理由: 语音增强模型作为前端组件广泛部署,其安全漏洞可能波及后续语音识别、通话等业务。本文首次揭示此类模型可被无注入后门攻击,威胁模型隐蔽且物理可实现,值得安全从业者关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Javor Nikolov, Alessandro Pegoraro, Phillip Rieger, Ahmad-Reza Sadeghi

联邦学习(FL)允许多方在不集中收集数据的情况下协作训练深度神经网络(DNN),每个客户端本地训练模型并仅向中央服务器共享模型参数。虽然这种模式增强了客户端隐私,但也为恶意客户端操纵模型和注入后门提供了机会。现有的大多数后门攻击与防御研究假设良性客户端数据独立同分布(IID),而对更具挑战性的非独立同分布(non-IID)场景关注不足。本文提出了一种名为LayerDBA的攻击方法,专门针对non-IID场景下基于相似性的防御机制。LayerDBA的核心思想是将恶意中毒参数值分散到不同的模型更新中,使得各个更新之间的欧氏距离保持较大,从而规避诸如FoolsGold、Contra等现有先进防御——这些防御通常假设中毒更新之间具有高相似性。作者还将LayerDBA与动态Marksman触发器相结合,形成一种高效且隐蔽的后门攻击。实验表明,在控制5%客户端的情况下,LayerDBA针对CIFAR-10数据集可实现50%的攻击成功率,针对MNIST数据集可实现80%的攻击成功率,且能够绕过当前最先进的防御方法。该研究揭示了在non-IID联邦学习场景下,现有相似性防御假设的脆弱性,表明高级攻击者总能构造出具有高距离的恶意更新,对联邦学习的安全性提出了新的挑战。

💡 推荐理由: 该研究揭示联邦学习在non-IID场景下基于相似性的防御存在根本缺陷,提醒蓝队和安全工程师不能仅依赖此类防御,需关注更鲁棒的聚合策略与异常检测机制。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yudong Gao, Zongjian Ding, Linghan Chen, Yajing Chen, Yu Xinglin, Jiale Liu, Shan Huang, Mingjun Cheng

GhostSplat 针对前馈式 3D 高斯泼溅(Feed-forward 3D Gaussian Splatting, 3DGS)提出了一种输入触发的后门攻击方法。前馈式 3DGS 模型能够通过一次前向传播从稀疏图像中重建三维场景,其共享的预训练权重构成了供应链攻击面。已有的 Neural Radiance Field 和 3DGS 后门攻击大多只能修改单个场景,并在特定视角下激活,无法在共享生成器权重中植入持久行为。GhostSplat 首次实现了在共享权重中植入输入触发后门:向输入图像添加一种低振幅的特定图案,即可使被污染的生成器在未见过的受害者场景上渲染攻击者选择的载荷。该方法通过将载荷锚定到三维点并重新投影到每个目标视角,确保载荷的多视角一致性;同时利用生成器表征特有的一致性集合进行精确投影,使已生成的载荷在输出属于该集合时保持不变。训练框架在三种主流架构(MVSplat、pixelSplat、DepthSplat)和两个数据集(RealEstate10K、ACID)上均成功验证。最强的注入和删除设置分别达到 96% 和 100% 的攻击成功率,且未观测到误报,同时能够抵抗 JPEG 压缩、模糊和重采样等常见图像处理。该研究表明,仅依赖同一集合一致性投影的防御措施是不充分的,有效的缓解需要额外信息或超出该集合投影范围的干预。本文适合关注三维视觉模型安全性、供应链攻击和防御的研究人员阅读。

💡 推荐理由: 该研究揭示前馈式 3D 重建模型供应链中可被植入持久后门的新风险,现有防御(仅检测多视角一致性)无法有效缓解,对三维内容生成与 AR/VR 应用安全有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Arham Riaz, Ting Yu

该论文研究深度学习中后门攻击与防御的一个根本性假设缺陷。传统上,攻击者和防御者都默认成功的后门必须具有高攻击成功率(ASR),现有防御机制也大多基于这一前提进行设计和评估。作者指出,ASR并非后门的内在属性,而是可由攻击者人为控制的变量——攻击者可以在不消除后门行为的前提下,刻意降低模型的ASR,从而规避依赖高ASR特征进行检测的防御体系。为此,论文提出一种“反向训练框架”,通过削弱触发器与目标类别之间的关联强度,生成低ASR的后门模型,同时保持模型在干净输入上的性能基本不变。作者在多个数据集、多种攻击家族和多种网络架构上进行了大量实验,结果表明,现有最先进的防御方法在低ASR条件下均会失效,从而暴露出攻击者与防御者之间严重的能力不对称。该研究的意义在于揭示了一个防御盲区:安全社区不能仅以ASR作为后门检测的唯一信号,否则很容易被攻击者通过降低ASR这种简单策略绕过。论文适合从事深度学习安全、后门防御、模型可信赖性研究的研究人员和安全工程师阅读,也为设计更鲁棒的后门检测与防御机制提供了新的思考方向。

💡 推荐理由: 该研究颠覆了“高ASR是后门必要条件”的传统认知,证明攻击者可刻意降低ASR绕过现有防御,为蓝队评估模型供应链安全提供了新的风险视角。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiali Wei, Ming Fan, Mingkun Zhang, Haoyu Wang, Jun Sun, Guoheng Sun, Xiaoning Ren, Haijun Wang, Ting Liu

多模态大语言模型(MLLM)在用户端应用中日益普及,但其构建流程可能引入后门风险:触发器可能位于图像、文本或两者中。现有面向传统分类器的模型级后门移除方法对 MLLM 效果有限,而针对 MLLM 的防御大多在推理时进行,通过过滤可疑输入来缓解风险,并未真正移除模型内嵌的后门。为从源头消除 MLLM 中的潜在后门,本文提出 RACER(Region-Aware Consistency Repair)框架,其核心观察是:后门会导致内部表示在层间演化出现异常,作者称之为“层间不一致性异常”。该异常具有模态依赖性,主要集中在编码触发器特征的 token 区域。RACER 将融合表示分解为视觉和文本 token 区域,分别对其层间不一致性进行归一化,并在深层窗口上使用模态感知权重重组,形成区域感知的不一致性目标,从而更精确地捕获局部后门异常。通过最小-最大优化,该目标驱动最坏情况扰动合成和对抗微调,抑制后门行为依赖的深层表示方向性偏移。RACER 仅需 100 个干净样本,无需知道触发器、攻击目标甚至模型是否包含后门。在三个开源 MLLM、覆盖图像/文本/多模态触发器的 36 种后门设置中,RACER 将平均攻击成功率(ASR)降至 1.1%,其中 32 种设置达到 0%,同时保持后门模型和干净模型的干净任务效用。该方法为 MLLM 模型级后门修复提供了新思路。

💡 推荐理由: MLLM 后门威胁日益严峻,现有防御多在推理层过滤,无法根除。RACER 提出首个模型级修复框架,仅需少量干净样本即可有效清除后门,为安全从业者提供了治理 MLLM 原生风险的可行方案。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ziqi Zhao, Jialin Lu, Junjie Shan, Junyuan Zhang, Shuya Yang, Ka-Ho Chow

垂直联邦学习(VFL)允许多个组织在不共享原始数据的前提下,基于同一组样本的不同特征协作训练模型。与水平联邦学习不同,VFL 中存在典型的非对称信息结构:发起方掌握学习任务定义(如标签),而参与方仅持有局部特征,这种结构顺应了日益增长的隐私保护需求。然而,非对称性也带来了独特的安全隐患,其中后门攻击尤为突出:恶意参与方不仅可以在训练阶段向模型注入投毒样本,还能够在推理阶段激活后门以操控预测结果。尽管已有研究声称后门攻击能达到接近完美的成功率,并提出了多种防御机制,本文作者通过系统性实验发现,这些结论在真实条件下大多不成立,暴露了研究与实际应用之间的明显差距。本文从实践导向出发,系统研究了 VFL 中的后门漏洞,指出现有方法在方法论设计和评估实践两方面都存在缺陷:它们忽略关键的实际约束,依赖不切实际的先验知识;同时,文献中不良的评估设计掩盖了这些局限。为了弥合这一差距,作者在现实约束下重新定义了威胁模型,提出了面向实践的后门攻击工作流,并构建了一个以 VFL 后门为中心的基准测试平台 BVBench。该基准预置了多种当前最先进的后门攻击与防御基线,旨在提供公平、实用、全面的评估框架。实验结果表明,当前对 VFL 后门风险的理解是脆弱的,许多先前结论无法在现实设置中复现。本研究为后续研究者识别真实可行的漏洞、设计更有效的防御机制提供了坚实基础,尤其适合关注机器学习安全、隐私计算以及联邦学习实际部署中对抗威胁的研究人员和工程人员阅读。

💡 推荐理由: 该研究揭示了 VFL 后门攻击研究长期依赖不现实假设,导致防御措施对真实攻击失效;对安全工程师而言,理解评估陷阱有助于在部署联邦学习前正确设计威胁模型与基线测试。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Soumya Mazumdar, Vineet Kumar Rakesh, Tapas Samanta

本文是一篇关于联邦学习中聚合方法在模型投毒与后门攻击下鲁棒性的系统性比较研究。作者重建了一个包含500个单元格的评估矩阵,覆盖五种聚合方法(如Trimmed Mean、Krum等)、五个数据集、五种模型架构,以及四种记录条件:干净环境、符号翻转攻击、高斯噪声攻击和BadNets后门攻击。通过溯源原始运行日志,识别出454次成功运行和36次修复或重跑的执行,另有10个干净的SVHN单元格仅有汇总级溯源。实验结果显示,在干净环境下,Trimmed Mean取得了最高的宏平均准确率(76.02%)和最低的平均任务内排名(1.70);而在符号翻转和高斯配置下,Krum取得了最高的记录准确率。当仅保留21个所有方法-条件组合均具备原始成功日志的任务对时,相对排名保持不变。作者还对提供的BadNets指标实现进行了审计,发现其实现导致每个测试输入在目标标签计数前均被触发,因此保留的指标实际是“触发目标标签率”(TTLR),而非传统的不含目标的攻击成功率。此外,对提供的FedPARETO脚手架代码的审计揭示了一条路径:预测摘要可能描述一个未损坏的本地模型,而聚合权重却应用于一个单独被损坏的更新,导致报告预测结果与实际用于聚合的更新之间存在潜在的不一致。论文强调,该矩阵每个单元格仅有一个确定的种子,且攻击与配置的完整血统不完整,因此研究结论应视为在记录配置范围内的描述性比较,而非统计估计或关于鲁棒性的普适性声明。适合联邦学习研究者、聚合算法设计者以及关注模型鲁棒性的安全工程师阅读。

💡 推荐理由: 该研究提供了联邦聚合方法在多种攻击下的横向对比,并揭示了指标实现与聚合代码中可能存在的陷阱,对于蓝队评估联邦学习系统鲁棒性、审阅第三方聚合库具有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tao Lin, Gaojie Jin, Zongxin Liu, Peng Wu, Lijia Yu

该论文提出了一种面向视觉语言模型(VLM)的可编程后门攻击方法,挑战了传统后门攻击“静态绑定”的假设。传统攻击中,触发器与目标输出在训练阶段固定绑定(一对一或N对N),攻击者无法在推理时动态选择目标。本文作者证明,仅需一次中毒训练,即可在VLM中植入可编程后门,使攻击者能在推理阶段任意指定未见过的目标字幕语义,并即时生成对应的隐蔽触发器。该方法包含两个核心组件:一是启发式中毒策略,通过向模型暴露多样的触发器-字幕对,促使模型学习“触发器即指令”的通用规则,而非记忆特定模式;二是基于特征空间的触发器隐写方法,将攻击者指定的目标字幕映射为隐蔽视觉触发器,可实现为范数受控的扰动或非语义补丁。将这些触发器嵌入任意图像后,即可诱导中毒VLM生成与选定目标字幕语义对齐的输出,即使该目标在中毒阶段从未出现。实验表明,该方法实现了较高的任意到任意字幕控制成功率,保持模型干净状态下的可用性,并在多种经典后门防御下依然有效。该研究揭示了VLM后门威胁的动态性和可扩展性,对AI安全评估具有重要参考价值。适合VLM安全研究者、AI红队和模型部署方阅读。

💡 推荐理由: 该研究突破了传统后门静态绑定的认知,展示VLM后门可在推理时动态控制目标,极大扩展了攻击面,提醒安全社区重新评估VLM供应链风险。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiangxiang Chen 0002, Peixin Zhang 0001, Jun Sun 0001, Wenhai Wang, Jingyi Wang 0004

本文提出了一种名为 QURA 的新型后门攻击方法,其核心攻击面是深度学习模型的量化(quantization)过程。模型量化通常被用于在资源受限环境(如嵌入式设备、移动端)中部署模型,以降低存储和计算开销。然而,作者指出这一过程本身可能引入此前被忽视的安全风险。与传统后门攻击依赖训练数据投毒或模型训练阶段操纵不同,QURA 仅通过操控量化过程中的舍入(rounding)操作即可在模型中嵌入恶意行为。具体而言,QURA 首先设计了一种权重选择策略,从预训练模型中识别出对后门目标影响最大、同时尽量不损害模型整体性能的关键权重;随后,通过优化这些权重的舍入方向,在多个层内逐步放大后门效应,同时保持模型的正常精度。实验结果表明,在大多数场景下 QURA 的攻击成功率接近 100%,且模型性能下降可忽略不计。此外,作者还展示了 QURA 能够自适应地绕过现有的后门防御机制,凸显了其潜在威胁。该研究揭示了广泛使用的模型量化流程中存在的关键安全漏洞,强调了在部署量化模型时需要更强的安全防护措施。代码已在 GitHub 上开源。本文适合模型部署工程师、AI安全研究员以及关注供应链安全的蓝队人员阅读,以理解量化环节可能引入的新型攻击面。

💡 推荐理由: 模型量化是边缘部署的标准步骤,但其安全影响常被忽视。QURA 表明无需篡改训练数据或训练过程,仅操纵量化舍入即可植入后门,扩大了攻击面,且能绕过现有防御,值得AI安全与供应链安全从业者警惕。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Doniyorkhon Obidov, Honggang Yu, Xiaolong Guo, Kaichen Yang

本文提出了一种名为 LoRAScan 的新型防御方法,用于检测大型语言模型(LLM)低秩适配器(LoRA)中的后门提示。LoRA 是一种高效的模型微调技术,通过引入小型适配器模块来降低计算成本,但也带来了供应链安全风险:不可信的适配器可能包含后门,使得模型在遇到特定触发词时生成有害内容、恶意代码、政治宣传或隐蔽广告。现有防御方法主要分为两类:一类是适配器无关的防御,将适配器与基础模型合并,这会稀释后门信号并降低检测性能;另一类是适配器感知的方法,但要么训练一个防御性适配器来修复被后门化的基础模型(关注的是对抗问题而非保护适配器本身),要么使用分类器将整个适配器标记为可疑,需要单独处理。这些方法都忽略了后门适配器中触发输入产生的不同潜在空间特征。LoRAScan 是第一个在推理时检测并拒绝触发输入、且不修改适配器参数的适配器感知防御方法。其核心观察是:大约 5% 的 LoRA 插入位点在干净输入下保持稳定,但在触发词存在时,其下投影激活会表现出高度集中的尖峰。LoRAScan 在模型部署前识别这些低方差插入位点,并在推理过程中监控它们。在标准 LLM 后门基准测试中,LoRAScan 能拒绝约 98.49% 的恶意输入,同时在干净输入上保持较低的误报率,在多种评估设置下均优于现有防御方法。

💡 推荐理由: LoRA 适配器的供应链攻击是当前 LLM 安全的重要风险,LoRAScan 提供了首个不修改适配器参数即可在推理时拒绝后门输入的方案,对依赖第三方适配器的企业 LLM 部署具有直接防护意义。

🎯 建议动作: 研究跟进:评估 LoRAScan 在自身 LoRA 适配器场景中的适用性,并关注其误报率与性能开销。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.6
Conf: 50%
👥 作者: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

本文提出了一种针对自进化智能体(self-evolving agents)的新型攻击方法 SkillJack。自进化智能体会将交互历史转化为可复用的技能(skills),这些技能可以跨任务持久保存。以往研究关注的是记忆与检索投毒,但此类攻击仅在恶意记录被检索为上下文时才会生效。本文发现了更根本的风险:被投毒的经验可能被智能体自身转化为持久的行为工件。SkillJack 首次利用自进化智能体的经验-技能转换管道(experience-to-skill pipeline),通过劫持智能体自身的学习过程,将恶意行为植入其可复用的技能库中,而不是直接操纵运行时上下文。作者识别出该攻击的三个关键特性:净化洗白(sanitization whitewashing),即恶意意图在技能提取过程中被掩盖;跨层提升(cross-layer promotion),即瞬态经验成为持久能力;持久性隔离(persistence isolation),即攻击能在删除原始源记录后继续存活。作者在 SkillX 和 Anything2Skill 两个代表性系统上进行了评估,使用包含 150 条轨迹的共享数据集,覆盖四类政策风险。结果表明,技能提取显著降低了攻击的可检测性:在 SkillX 中,安全检测率从针对被投毒轨迹的 98.5% 降至针对提取技能后的 11.4%,Anything2Skill 也呈现类似效果。同时,植入的技能仍然有效,在两个系统上的攻击成功率分别达到 56.2% 和 89.2%。此外,80.0% 的经由技能介导的攻击在删除原始被投毒记录后仍然存在,部分技能还会在良性查询上意外激活。这些发现揭示了技能演化是一个新的攻击面,并提出了对技能生命周期进行来源感知保护的需求。代码已开源。

💡 推荐理由: 首次揭示自进化智能体的技能提取管道可被投毒,且攻击具有持久性和隐蔽性,威胁持久化能力远超传统上下文注入,对AI代理安全防护提出全新挑战。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Giorgio Severi, Shujaat Mirza, Blake Bullwinkel, Amanda Minnich

该论文研究链式思维(Chain-of-Thought, CoT)监控在AI安全栈中的局限性。CoT监控假设模型的推理轨迹能够反映其真实行为,但作者通过模型投毒的手段挑战了这一假设。他们证明,攻击者可以在推理模型中植入后门,使模型执行攻击者指定的行为,同时其CoT轨迹看起来完全正常。这种被称为“CoT-Hidden backdoor”的后门可以通过简单的微调在多种推理模型架构和不同尺寸上成功植入。当直接投毒效果不佳时,作者提出了一种课程训练(curriculum training)方法,逐步教会模型在生成推理轨迹时隐藏目标行为,同时产生攻击者期望的输出。实验发现,这类攻击使得CoT监控的重心应从对单条轨迹的异常检测转向对推理轨迹与最终响应一致性的验证。论文还通过因果干预揭示了隐藏行为的机制:存在一个不依赖于可见推理的触发条件激活通路,而残差流中的言语化(verbalizations)在答案生成附近会产生异常警告,但无法识别触发器、目标或后门机制。该研究对依赖CoT监控的AI安全实践提出了严重挑战,并为设计更鲁棒的监控机制提供了新视角。适合AI安全研究者、红队和蓝队成员阅读。

💡 推荐理由: CoT监控被广泛用于保障大模型的安全性,本论文揭示其可被后门攻击轻易绕过,颠覆了“推理轨迹可反映真实意图”的核心假设,对依赖该技术的安全防御体系构成重大威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

本文研究了扩散模型语义水印系统的一个关键安全漏洞。语义水印被广泛用于保护潜在扩散模型(LDM)生成的图像版权,但其检测流程依赖神经网络,这引入了被植入后门的攻击面。作者提出了 GhostVAE,一种通过在后变分自编码器(VAE)的编码器中植入隐蔽后门的方法,能够可靠地规避语义水印检测。GhostVAE 采用两阶段攻击:首先通过功率谱正则化构造通用触发器,提升触发器的鲁棒性;然后使用参数对齐目标训练带有后门的 VAE 编码器,使其在正常输入下保持原有功能,仅在触发器激活时改变输出。实验覆盖三种最新语义水印方案和三种广泛使用的 LDM,结果表明 GhostVAE 在良性图像上保持了水印检测性能(平均真阳性率 94.4%),同时在触发激活时实现了高效规避(平均攻击成功率 94.6%)。作者还分析了 17 种代表性防御方法,证明 GhostVAE 在输入空间、参数空间和潜在空间均保持隐蔽性。这项研究从根本上削弱了语义水印系统的可信度,强调安全部署语义水印需要端到端的安全考虑,尤其是对神经网络组件的保护。适合 AI 安全研究人员、模型部署工程师和内容保护系统设计者阅读。

💡 推荐理由: 该研究揭示了语义水印系统依赖神经网络组件可能被植入后门,导致版权保护机制失效。对依赖水印追踪 AI 生成内容的安全团队有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Roberto Riaño, Gorka Abad, Stjepan Picek, Aitor Urbieta

本文首次在脉冲神经网络(SNN)和神经形态事件数据上提出并评估了干净标签后门攻击。以往针对 SNN 的后门攻击大多假设脏标签设置,即攻击者将带有触发器的训练样本重新标记为目标类别。本文则研究干净标签时序毒化攻击:仅对目标类别的训练数据流施加固定的时间戳变换,同时保持原始标签不变。该变换在逐像素、逐极性上精确保留事件计数,因此在时间聚合后,正常样本与触发样本在外观上完全一致,但输入到 SNN 中的事件序列已被改变。实验覆盖三个神经形态数据集和两类受害模型(卷积网络与 transformer 架构),在最强配置下攻击成功率(ASR)可达 1.00。作者通过毒化预算和触发器形状消融实验分析了攻击特性,并评估了适用于脉冲模型的既有后门防御:在检测前将时间轴折叠的防御方法在原理上必然失效;而基于特征空间的防御仅在部分设置下能检测出毒化。最后,论文提出了一种模型无关的检测器,基于每个时间步的事件质量分布,能够有效检测所评估的时间变换,从而揭示了基于速率折叠防御的局限性以及该攻击的隐蔽性边界。该工作填补了干净标签后门在 SNN 领域的研究空白,对神经形态计算的安全性具有重要参考意义。适合研究 SNN 安全、后门攻击与防御以及神经形态系统的研究人员阅读。

💡 推荐理由: SNN 和神经形态硬件正逐渐应用于边缘设备与实时传感器处理,若安全防护沿用传统时间聚合思路,将无法防御此类干净标签时序后门。理解该攻击机理有助于提前设计保留时间信息的检测与防御机制。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 10.6
Conf: 50%
👥 作者: Anthony Hughes, Nicole Xing, Collin Francel, Andy Kim, Andrew Draganov

该论文针对大语言模型(LLM)在关键领域部署时面临的数据投毒后门攻击问题展开研究。攻击者可能通过污染训练数据植入后门触发器,使得模型在推理阶段遇到特定输入时被隐蔽地操控行为。作者聚焦于防御者在现实约束下的触发器恢复能力:仅拥有模型的白盒权重访问权限和已知目标危害行为,但无法访问训练数据、没有可信参考模型、不知道触发器内容、甚至不确定模型是否已被投毒。为了系统评估这一能力,作者发布了 ToxScreen 基准,包含约 800 个被植入后门的模型,覆盖攻击目标、触发器机制、投毒比例、模型规模和训练机制等多个维度,并确保这些后门具备高质量:高攻击成功率、对未见有害输入具有泛化性、且不损害正常任务性能。实验上,作者比较了两种触发器恢复方法:基于梯度的提示优化和基于 token 查表的候选排序(按攻击成功率排名)。结果显示,基于梯度的提示优化未能成功恢复触发器,而 token 查表方法能够在所有后门有效的模型上恢复触发器。进一步的权重分析揭示了一个重要现象:后门攻击与越狱(jailbreak)行为在机制上存在差异,这使得防御者可以借此区分并过滤掉越狱样本。尽管没有任何单一方法能可靠地暴露所有后门,但论文指出一个广泛可越狱的模型本身就是异常信号,即使未能恢复具体触发器,也可用于检测。作者公开了所有模型和评估代码,为后续研究提供基准。本文的核心贡献包括:构建大规模后门模型基准、实证对比两种恢复方法的有效性、揭示后门与越狱的机制差异、以及提出可操作的异常信号。适合从事 LLM 安全性研究、模型红队测试、AI 安全防御的工程师和研究人员阅读。

💡 推荐理由: 本文为检测 LLM 后门提供首个大规模基准和有效方法,颠覆了梯度优化在触发器恢复上的预期,并揭示了后门与越狱的差异性信号,对 AI 安全防御实践有直接指导价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Dimitri Kokkonis, Michaël Marcozzi, Stefano Zacchiroli

该论文针对开源软件供应链中代码级后门注入的威胁提出了一种自动化检测方法 Lily。代码级后门是一种隐蔽的代码改动,通过秘密触发器授予隐藏权限,难以被发现。此前针对广泛使用项目的后门注入尝试(如恶意提交、被篡改的发布包、受污染的第三方依赖)往往仅靠运气和人工审查才被阻止。现有持续集成(CI)流水线无法检测此类攻击,而下游二进制分析工具则需要大量人工分析。Lily 将后门检测机制集成到两个环节:一是 CI 流水线,用于在代码提交阶段阻断恶意提交;二是发布审查流程,用于防止被篡改的发布包或受损依赖进入大型生态系统(如 Linux 发行版)。Lily 有两个核心贡献:第一,它增强了兼容 CI 的模糊测试(fuzzing),能够基于历史和当前软件执行来检测可疑行为的触发器,从而在 CI 和更新验证流程中实现快速且精确的后门检测;第二,它将代码变更分析与模糊测试数据相结合,即使发布更新涉及数百万行代码改动,也能精确地将维护者定位到暴露后门的代码区域。论文还概述了攻击者可能规避 Lily 的五种策略,并评估了相应的防御措施。作者在数百个良性提交/发布和带后门提交/发布的实验表明,Lily 能以较低的误报率实现高检测精度,可靠地识别恶意代码,抵抗对抗性尝试,并且能够阻止真实世界中的后门事件。

💡 推荐理由: 该研究直接回应了软件供应链中后门注入的严峻挑战,提出可集成到 CI 和发布流程的自动化检测方案,能够提升蓝队和开源维护者对恶意提交、篡改发布包和受损依赖的防御能力,具有实际部署价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Chengkun Wei, Wenlong Meng, Zhikun Zhang 0001, Min Chen 0032, Minghu Zhao, Wenjing Fang, Lei Wang 0152, Zihui Zhang, Wenzhi Chen

该论文针对提示微调(prompt-tuning)范式中的后门安全威胁展开研究。提示微调因其在下游任务中的高效性和多任务服务能力而被广泛用于部署大语言模型,但作者通过实验证明,提示微调容易受到预训练模型中存在的任务无关后门(task-agnostic backdoors)的攻击。这类后门与具体下游任务无关,可影响任意下游任务,且现有最先进的后门检测方法因无法有效收敛后门触发器逆向过程而难以防御。为此,本文提出LMSanitator,一种针对Transformer模型的任务无关后门检测与移除方法。其核心思想是:不直接逆向触发器,而是逆向预定义攻击向量(即输入嵌入触发器时预训练模型的输出),从而获得更好的收敛性和后门检测精度。LMSanitator还利用提示微调中冻结预训练模型的特性,在推理阶段实现精确快速的输出监控和输入清洗。在多个语言模型和NLP任务上的大量实验表明,LMSanitator在960个模型上达到92.8%的后门检测准确率,并在大多数场景下将攻击成功率降至1%以下。该工作为提示微调的安全性提供了有效的防御机制。

💡 推荐理由: 提示微调是当前大模型落地的主流范式之一,但针对其安全性研究不足。本文揭示了任务无关后门这一新型威胁,并提出了首个可实际部署的检测与清除方案,对保障大模型服务安全具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Shaofeng Li 0001, Hui Liu, Tian Dong, Benjamin Zi Hao Zhao, Minhui Xue 0001, Haojin Zhu, Jialiang Lu

本文展示了自然语言处理(NLP)系统容易受到后门攻击,攻击者可以在语言模型中植入隐藏特征(后门),仅当特定触发条件(如特定输入文本)出现时才会被激活,导致模型产生意外行为。作者提出了两种创建隐蔽且自然触发器的文本后门攻击方法,称之为“隐藏后门”。第一种方法基于同形字符替换(homograph replacement),通过视觉上相似的字符替换(例如使用Unicode同形异码字符)来嵌入触发器,这种替换对人类视觉检查具有欺骗性。第二种方法利用语言模型生成的文本与真实自然文本之间的细微差异,生成语法正确、流畅度高的触发句子,使之难以被察觉。作者在三个代表性的安全关键型NLP下游任务上验证了攻击效果:毒性评论检测、神经机器翻译(NMT)和问答(QA)。实验结果显示,在毒性评论检测任务中,仅需注入3%的含触发数据即可达到至少97%的攻击成功率(ASR);在NMT任务中,注入数据少于0.5%即可达到95.1%的ASR;在QA任务中,仅用27个投毒样本(原训练集包含92024个样本,即0.029%)即可实现91.12%的ASR。攻击在保持模型对正常用户功能的同时,使触发器对人类管理员不可见。该研究揭示了现代以人为中心的NLP系统在面对精心设计的后门攻击时的脆弱性。

💡 推荐理由: 该研究揭示了NLP模型极易被植入隐蔽后门,且触发器可绕过人类审查,对部署了毒性检测、机器翻译、问答等NLP系统的安全防御团队构成严重威胁。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Simin Chen, Jinjun Peng, Yixin He 0002, Junfeng Yang, Baishakhi Ray

本研究首次系统性地揭示了深度学习编译器中的编译不一致性漏洞(Compilation Inconsistency Vulnerability)。作者发现,即使是官方、未经修改的深度学习编译器,也可能在模型编译过程中静默改变模型语义,从而引入隐藏后门。研究从两个角度展开:对抗性设定和自然设定。在对抗性设定中,作者精心构造了良性模型,其中的触发器在编译前不产生任何效果,但经过编译器编译后,触发器变为有效的后门。在6个模型(包括ResNet、BERT等)、3个商用编译器(如TensorFlow XLA、PyTorch JIT、TVM)以及2种硬件平台(CPU和GPU)上的实验表明,该攻击对触发输入的成功率为100%,同时保持正常准确率,并能绕过最先进的防御检测器。攻击泛化到不同编译器、硬件和浮点设置。在自然设定中,作者分析了HuggingFace上排名前100的模型(包括一个下载量超2.2亿的模型),发现其中31个模型存在自然触发器,即在编译后模型对某些正常输入的行为发生改变。这表明即使没有对抗性操纵,编译器也可能引入风险。该工作首次暴露了深度学习编译器设计中被忽视的安全威胁,为构建安全可信的机器学习系统开辟了新方向。

💡 推荐理由: 深度学习编译器是AI基础设施的核心组件,本发现揭示其可能被利用来植入后门,影响所有使用编译器的模型部署。安全团队需关注编译环节的完整性,防止供应链攻击。

🎯 建议动作: 研究跟进:阅读论文获取详细攻击方法与检测方案,评估内部使用的编译器是否受影响。

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Ahatesham Bhuiyan, Hoang Ngo, Cheng Chu, Qian Lou, Lei Jiang, My T. Thai, Mengxin Zheng

该论文首次提出针对变分量子算法(VQAs)的参数供应链后门攻击——CutBackdoor。VQAs是近期量子计算的主要范式,结合了参数化量子电路与经典优化,广泛应用于量子化学、组合优化和量子机器学习。实际部署中,由于量子电路规模常超过硬件可用量子比特数,量子电路切割(如CutQC)成为必要执行策略,而预训练参数通过公共仓库分发引入了供应链安全风险。现有量子后门攻击要么引入可检测的电路修改,要么依赖设备特定噪声,且均未考虑电路切割作为攻击面。CutBackdoor利用CutQC的切割电路执行作为部署阶段触发器:攻击者在参数中植入后门,使得在完整电路验证时保持低误差(高隐蔽性),但在受害者因资源限制调用切割流程时,大幅增加切割路径的重建误差(1.3倍至2.9倍能量放大)。该攻击无需修改电路,无需攻击者在线参与。理论分析结合在IBM量子后端多个基准(VQE、VQD、QAOA)上的实验验证了攻击有效性,并表明零噪声外推(ZNE)仅能部分缓解。该工作揭示了量子计算软件供应链的新型攻击面。

💡 推荐理由: 揭示了量子计算软件供应链中参数分发环节的隐蔽后门风险,提醒安全社区关注新兴量子计算系统的供应链安全。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Andrej Bogdanov, Alon Rosen, Neekon Vafa

本文研究深度神经网络中后门植入的统计不可检测性。作者展示了一种对抗性模型训练者可以在大规模前馈神经网络中植入后门的方法,这些后门在白盒设置下是统计不可检测的,即后门模型与诚实训练模型之间的总变差距离很小,即使审查者拥有模型的完整描述(如所有权重)。后门提供了对每个输入的不变性对抗样本,能将相距很远的输入映射到异常接近的输出。然而,在没有后门的情况下,在标准密码学假设下,任何多项式时间内生成此类对抗样本都是不可能的。理论分析和初步实证结果表明,模型训练者与模型使用者之间存在根本性的能力不对称性。该工作揭示了恶意训练者可以植入理论上不可检测的后门,对模型供应链安全构成潜在威胁。适合安全研究者、机器学习工程师以及关注模型完整性的从业者阅读。

💡 推荐理由: 该研究揭示了深度神经网络后门攻击的一种新范式:后门在白盒环境下统计不可检测,颠覆了传统认知。安全从业者需关注模型训练环节的信任根问题。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Steyn Hommes, Vincent Dankbaar, Tanguy Stekke, Xiaomeng Wang, Lisanne Weidmann, Senna van Hoek, Durba Chatterjee, Lejla Batina, Zhuoran Liu

本文研究了一种跨层级攻击方法,将嵌入式神经网络实现层面的物理故障注入与算法层面的对抗攻击相结合。传统故障注入攻击主要关注通过破坏权重或中间计算导致分类错误,而忽略了与算法级对抗威胁的交互。作者首先通过表征推理期间故障引起的数据扰动,将故障注入与后门学习联系起来,从而能够联合利用实现层和算法层的漏洞。具体而言,提出了一种精确的故障注入方法,能够在执行期间可靠地将目标寄存器值操纵到可预测的状态。利用这种高精度故障注入,提出了一种新颖的端到端特征图层级后门攻击,其中物理诱导的中间扰动作为隐蔽触发器。与传统的基于输入的后门不同,该触发器仅在物理故障下激活,导致神经网络表现出对抗行为,破坏系统完整性,而在正常操作时保持良性。实验在ARM Cortex-M4微控制器(一种常用于受限嵌入式应用的平台)上通过电磁故障注入对卷积神经网络实施,证明了攻击的实用性。结果表明,这种物理触发的后门可以有效规避现有通常假设输入空间触发器的后门防御。该工作强调了在硬件和算法抽象层面交叉处的新攻击向量,需要跨抽象层次的防御。

💡 推荐理由: 本文首次将物理故障注入与算法后门攻击结合,展示了硬件与AI安全交叉的新攻击面,提示现有防御(如输入空间后门检测)可能完全失效。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Eugene Bagdasaryan, Vitaly Shmatikov

这篇论文研究了一种新型的深度学习模型后门注入方法。与传统的后门攻击不同,该方法不依赖于修改训练数据、观察代码执行或访问最终模型,因此被称为“盲后门攻击”。攻击者通过破坏模型训练代码中的损失值计算过程,在训练过程中动态生成带有毒化的训练样本,并利用多目标优化技术确保主任务和后门任务同时达到高精度。论文展示了多种比先前工作更强大的后门类型:在ImageNet模型上实现单像素后门(仅修改一个像素即可触发后门)、物理后门(通过物理世界中的特定图案触发)、隐蔽后门(将模型切换为侵犯隐私的隐蔽任务)以及无需推理时输入修改的后门(后门在模型内部被静态编码)。实验证明,这些盲后门能够逃避当前已知的所有防御机制。论文还提出了新的防御思路,但未给出具体防御方案。该研究揭示了深度学习供应链中训练代码本身可能成为攻击向量,对模型安全性构成严重威胁。适合机器学习安全研究人员、模型开发者和部署者阅读。

💡 推荐理由: 首次提出无需控制训练数据和模型访问权限的盲后门攻击,突破了传统后门攻击的假设,对现有防御体系构成根本性挑战,迫使安全社区重新审视训练代码的完整性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Stefan Bühler, Mark Schutera

该论文研究了针对开源机器人视觉语言动作模型(VLA)的数据投毒攻击,特别是触发词(trigger-word)投毒。作者指出,当前开源机器人生态系统在社区贡献的数据集上存在信任假设,而攻击者可以通过注入少量中毒样本就能隐蔽地嵌入后门,使机器人在接收到特定触发词时失效。论文以smolVLA模型为测试对象,在LeRobot平台的真实拾放(pick-and-place)任务上进行实验,设置了三种中毒比例(1/320、3/320、10/320),并评估了不同触发词位置(前置、中置、后置)的影响。实验结果显示:仅需3个中毒片段(episode)即可实现完全拒绝服务(DoS),所有触发词条件下的成功率降至0.0±0.0%,机器人锁定在固定关节配置,不执行任何任务运动;而在正常提示下,模型保持约50%的成功率,表明攻击具有隐蔽性。即使仅1个中毒片段,成功率也降至6.7±6.7%,机器人虽有运动但无法完成任务。攻击还能泛化到中置和后置触发词位置,尽管训练时仅使用前置触发。该研究证明此威胁是实际可行、低成本且隐蔽的,因此需要将数据集来源的可信性视为开源机器人生态中的首要安全问题。

💡 推荐理由: 首次实践验证对开源机器人VLA模型的数据投毒攻击,证明其低成本、高隐蔽性及严重后果(完全拒绝服务),对机器人安全社区具有重要警示意义。

🎯 建议动作: 研究跟进,关注数据集来源验证和投毒检测技术

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Boyang Zhang, Zheng Li 0023, Ziqing Yang 0002, Xinlei He 0001, Michael Backes 0001, Mario Fritz, Yang Zhang 0016

该论文提出了一个名为 SecurityNet 的框架,旨在系统性地评估公开机器学习模型的安全性弱点。随着预训练模型在开源社区(如 Hugging Face)广泛发布,攻击者可能利用这些模型中的后门、对抗性扰动等漏洞。SecurityNet 通过组合多种攻击方法(包括对抗性攻击、后门注入、模型窃取等),对公开模型进行自动化安全评估。实验覆盖了图像分类、自然语言处理等多种任务中的主流模型架构(如 ResNet、BERT)。主要贡献包括:1) 设计了一个模块化的评估管线,支持多种攻击场景;2) 在大量公开模型上进行了实证研究,揭示了相当比例的模型存在可利用的漏洞;3) 提供了可复现的基准,帮助研究者比较不同防御手段的效果。该工作为模型发布前的安全审查和模型供应链风险管控提供了参考工具。

💡 推荐理由: 帮助安全团队在引入第三方预训练模型前评估潜在风险,降低模型供应链攻击的可能性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

该论文提出了一种针对视觉语言模型(VLM)的新型后门攻击框架ReShift,其核心创新在于实现推理层面的后门注入,而非传统的输出层操纵。现有后门攻击方法往往在推理链中留下不一致或可检测的痕迹,容易被现有防御机制发现。ReShift通过“顿悟时刻”(aha-moment)驱动的方式,在模型内部思维链(CoT)过程中引导推理轨迹发生偏移,同时保持表面上的逻辑连贯性。框架包含两个关键组件:毒化推理感知数据构建(PRDC)管道,用于生成带有触发条件且推理过程异常的样本;以及监督-强化联合优化(SRJO)策略,用于稳定地诱导触发条件下的推理偏移。论文进一步形式化了“熵反弹”(Entropy Rebound)作为推理重定向的特征信号,并给出一系列理论保证,说明熵缺口与轨迹级差异之间的关系。实验表明,ReShift能够在保持干净任务性能和生成合理推理轨迹的前提下实现高攻击成功率,显著提升对抗现有防御的隐蔽性。该研究揭示了VLM在推理层面存在的安全脆弱性,对构建可信赖的多模态AI系统提出了新挑战。适合AI安全研究员、模型开发人员和防御团队阅读。

💡 推荐理由: 该攻击揭示了VLM推理层面的脆弱性,现有防御难以检测此类隐蔽后门,威胁到安全关键场景中VLM的可信性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Arash Raftari, Mehrdad Mahdavi, Nathan Blackthorn, Andrew Arash Mahyari

本文研究了大语言模型(LLM)中的后门攻击防御问题。后门攻击通过在正常输入中嵌入隐藏触发器,使得模型在触发器存在时产生攻击者指定的恶意行为,而在无触发器时表现正常。现有防御方法通常需要重新训练整个模型或进行全局微调,成本高昂且可能破坏模型原有能力。作者提出了一种基于曲率引导的模块定位与低秩修复的框架,在仅访问受害模型(无干净训练数据或原始训练过程)的条件下实现后门解毒。该方法首先利用激活修补(activation patching)定位对触发器响应敏感的中间层模块,然后通过Fisher信息矩阵和K-FAC曲率分析进一步筛选出对后门行为贡献最大的关键模块。最后,对这些选定模块应用低秩约束的修复(低秩适应),仅调整少量参数以抑制触发器引发的恶意输出,同时尽量保持模型在正常输入上的表现。在Llama-3.2-1B-Instruct模型上,作者在提示的不同位置(开头、中间、结尾)插入触发器构建后门变体,实验表明该方法能有效降低后门攻击成功率(ASR),且对良性样本的困惑度(perplexity)影响极小。与全参数微调、权重掩码等基线相比,该方法在参数效率、解毒效果和通用性上均具优势。论文的主要贡献在于:(1)揭示了后门解毒可以转化为局部结构修复问题,而非全局行为对齐;(2)提出了结合激活修补与曲率分析的模块定位方法;(3)展示了低秩修复在资源受限场景下的实用性。适合对LLM安全、后门防御、可解释性感兴趣的研究者和安全工程师阅读。

💡 推荐理由: 本文提供了一种无需重训即可移除LLM后门的实用方法,降低了防御成本,对确保部署模型的安全性有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

模型量化是降低大语言模型存储和推理开销的关键技术,但最近的研究表明,量化引入的离散化和舍入误差可被攻击者利用,构造量化条件后门攻击。在这种攻击下,恶意行为在全精度阶段保持休眠,仅在量化部署后激活,从而绕过传统的安全审计和检测机制。针对这一威胁,本文提出了一种主动的预量化防御方法 QuantGuard。该方法引入了可微的舍入控制变量,并结合了误差引导的舍入反转约束、输出分布一致性和权重距离正则化,以精细调控关键的舍入行为。关键的是,QuantGuard 仅使用少量校准数据集,且不修改现有量化算法。这种设计打破了攻击者精心构造的权重模式与量化边界之间的精确对齐,有效抑制了量化后的后门激活路径,同时保持了模型的原始功能和性能。作者在六个主流大语言模型(包括 LLaMA-3 和 Qwen2.5-Coder)上,使用三种量化精度(INT8、FP4 和 NF4),在三个代表性场景(易受攻击代码生成、内容注入和过度拒绝)下进行了系统实验。结果表明,QuantGuard 能够持续缓解量化条件后门攻击,将攻击成功率降低到与干净模型相当的水平,同时在通用能力基准测试上基本保持性能。该方法计算开销低,为安全量化部署 LLM 提供了一种有效实用的解决方案。

💡 推荐理由: 量化是LLM部署的关键技术,但量化条件后门攻击可绕过传统安全审计。本文提出的QuantGuard防御方法能在不改变量化算法的前提下有效抑制后门,为实际安全部署提供了重要保障。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: William Aiken, Paula Branco, Guy-Vincent Jourdan, Iosif-Viorel Onut

本文提出了一种针对扩散模型(Diffusion Models)的新型后门攻击框架TEMPO-Diffusion。传统的基于噪声的后门攻击通常依赖于在推理时注入触发器、非目标激活以及生成分布外目标,这些假设降低了攻击的隐蔽性和实际相关性。TEMPO-Diffusion将恶意分布偏移限制在时间上的同分布暴露中,使得后门更加隐蔽。该框架支持:(i) 针对特定类别的攻击(攻击特定类别并生成特定类别结果);(ii) 多子图像后门,即在多个不同输出图像和多个位置重建特定特征;(iii) 利用时间条件触发器的图像修复(in-painting)。为了研究使用带后门的扩散模型生成合成训练数据相关的实际安全问题,作者还引入了CALISA数据集:一个平衡的、区域感知的交通标志数据集,重点涵盖加拿大和美国的道路标志。在CIFAR10、GTSRB和CALISA上的实验表明,TEMPO-Diffusion能够可靠地污染特定类别的合成数据生成,并在使用该数据训练的下游分类器中实现高攻击成功率。本文的研究揭示了扩散模型在合成数据生成场景下可能被植入持续性后门的风险,对AI安全社区具有警示意义。

💡 推荐理由: 该研究首次提出时间条件触发的同分布后门攻击,显著提高了扩散模型后门的隐蔽性和实战性,对依赖扩散模型生成训练数据的AI供应链构成重大威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Toby Briston, Illya Kosyk, Kuniyih S

传感器是现代智能设备的关键组件。随着物联网和可穿戴移动设备的普及,传感器被广泛用于环境监测和预测行动。人体活动识别(HAR)是其中一个重要应用,它利用惯性测量单元(IMU)传感器(如加速度计和陀螺仪)来提供健康、训练和医疗诊断方面的洞见。然而,HAR模型的准确性受到数据不足的限制。基于扩散模型的技术已被证明能够成功生成合成数据来训练HAR模型。本文提出了一种后门训练技术IMU-DM-CLIP,该技术利用扩散模型和CLIP(对比语言-图像预训练)引导来对HAR模型实施基于触发器的攻击。实验分析表明,即使后门注入率仅为10%,且仅有10%的数据用于引导扩散模型,攻击依然能够成功。这项研究揭示了HAR模型在安全方面的潜在脆弱性,特别是当训练数据中包含后门触发样本时,模型可能被恶意操控,导致错误的识别结果。对于依赖HAR进行健康监测或安全关键应用的系统,这种攻击可能带来严重后果。论文的主要贡献在于首次将CLIP引导的扩散模型用于生成HAR领域的后门数据,展示了低注入率下攻击的高效性,并引发了关于传感器数据完整性和模型安全性的思考。适合安全研究人员和HAR系统开发者阅读,以了解此类新兴攻击向量。

💡 推荐理由: 该研究揭示了HAR模型面临的新型后门攻击风险,利用扩散模型生成后门数据,即使注入率极低也能成功攻击。对于使用HAR的健康监测、运动训练等应用,模型被植入后门可能导致错误行为预测,甚至危及用户安全。安全从业者需关注这一新兴威胁,并评估自身系统的防护能力。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shanghao Shi, Chaoyu Zhang, Heng Jin, Yang Xiao, Yevgeniy Vorobeychik, William Yeoh, Ning Zhang, Y. Thomas Hou, Wenjing Lou

这篇论文揭示了联邦学习(FL)在语言模型微调过程中的隐私后门攻击风险。在联邦学习中,多个参与者协作微调模型而不共享原始数据,但全模型微调计算成本高昂,因此参数高效微调(PEFT)成为实际应用中的主流方法,它冻结基础模型仅训练少量适配器。本文提出一种名为NeuroImprint的攻击方法,由恶意参数服务器实施,能够将PEFT适配器隐秘地转化为隐私后门,该后门隐式地记忆客户端的训练样本,以每个样本对应的隔离参数更新形式存储在单独的神经元中,且不降低模型效用。具体来说,NeuroImprint为每个训练样本分配一个专用的记忆神经元,并约束每个神经元在本地微调轨迹中最多更新一次,从而解决了大本地批次和有状态优化器(如Adam/AdamW)导致的交叉样本碰撞和交叉步骤混合问题。微调完成后,这些隔离的样本更新可以通过闭式解析方法逆向恢复为文本嵌入,并确定性地映射回 token 序列。作者在多种语言模型(BERT、GPT-2、Qwen2、Llama3.2)和四个不同领域的微调数据集上验证了该方法,结果显示攻击能够重构59%至79%的微调样本,且具有较高的语义保真度。该研究首次系统性地展示了在联邦语言模型微调中利用PEFT适配器实现隐私泄露的可行性,对联邦学习的安全隐私保护提出了新的挑战。

💡 推荐理由: 该研究揭示了联邦语言模型微调中一种隐蔽且高效的隐私攻击方式,直接威胁到使用PEFT的联邦学习系统的用户数据安全。安全从业者应关注此类针对适配器的后门攻击,并评估现有防御措施的不足。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kaihsun Yang, Min-Yan Tsai, Chia-Mu Yu

该论文针对模型量化中的后门攻击(Quantization-Conditioned Backdoors, QCBs)提出了一种新型防御方法。QCBs 是一种后门威胁:模型在全精度下表现正常,但经过量化后激活恶意行为。现有防御通常需要修改量化过程或校正激活统计信息,导致额外计算开销或依赖特定量化设置。作者从参数空间角度出发,观察到全精度模型与量化模型之间的权重差异编码了一种结构化的行为偏移,这种偏移可被解释为恶意任务向量而非随机量化噪声。基于此,提出了 QVec 方法:在部署前通过受控参数修正来抵消该恶意方向。QVec 无需重训练、无需触发器样本,仅需一次量化传递来估计参数偏移,并结合轻量级超参数搜索。在图像分类基准和多种大语言模型(LLM)攻击场景上的实验表明,QVec 能在保持干净模型性能的同时持续抑制后门激活。该方法为防御 QCBs 提供了一种高效且通用的新思路。

💡 推荐理由: 模型量化广泛应用,QCBs 是一种隐蔽且危险的攻击;QVec 无需修改量化流程或重训练,即插即用,对于保护量化模型安全具有实际价值。

🎯 建议动作: 研究跟进,在内部评估 QVec 对现有量化模型的防御效果。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
推荐 5.5
Conf: 50%
👥 作者: Nils Loose, Jonas Sander, Felix Mächtle, Thomas Eisenbarth

大型语言模型(LLM)日益部署在软件工程等敏感场景中,其输出直接影响下游工件。近期研究发现,同一模型在不同部署平台上可能产生可测量的输出差异,这是由非结合浮点运算和不同的内核实现所致。本文研究了这种平台依赖可变性的安全影响,揭示了LLM部署中一种新的攻击面。作者提出FloatDoor,首个输入无关、平台触发的生成式LLM后门攻击。受感染的模型在目标平台上呈现对手选择的恶意行为,在其他平台上则表现正常。FloatDoor通过两个轻量级LoRA适配器实现:一个放大跨平台的数值发散,另一个将由此产生的平台特征绑定到恶意下游任务,同时保持模型整体效用大致不变。该攻击利用了模型审计与服务之间显著的时间差(TOCTOU)。作者在Qwen3-4B上对多种部署目标(包括NVIDIA GPU、Google TPU、AWS Graviton、Alibaba Yitian-710)演示了FloatDoor。最后,案例研究表明,FloatDoor能在所选目标平台上可靠地诱发可利用的代码漏洞。该研究定义了LLM部署的一类新攻击,强调了在敏感的LLM驱动应用中建立可信模型供应链的紧迫性。

💡 推荐理由: LLM在代码生成等关键任务中的广泛应用,使得平台触发后门攻击具有严重威胁。该攻击难以通过常规模型审计发现,且能定向破坏特定平台上的输出,直接威胁软件供应链安全。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kunlan Xiang, Haomiao Yang, Wenbo Jiang

本文研究了对比语言-图像预训练(CLIP)模型在不同下游部署接口(如特征提取、检索、重排序和选择)中后门暴露的一致性问题。现有CLIP后门攻击通常在单一原生任务上验证,但模型复用时,相同后门在不同接口下的暴露程度未知:可能保持、减弱或失效。作者提出DIFE(部署接口足迹评估)框架,通过指定每个接口的组件读出、触发通道、目标事件、参考条件和指标,实现跨接口的可比评估。DIFE还引入了有效足迹诊断,识别承载暴露的可复用CLIP组件或组件组合,并解释风险迁移。使用DIFE审计复现的CLIP后门发现:原生成功并非检查点级别的风险证书;暴露遵循组件足迹;文本侧中毒不会导致文本编码器控制;某些耦合攻击仍受机制限制。审计还揭示了现有CLIP后门中的关键缺口:文本编码器本身可成为对抗行为的可复用载体。为此,作者提出BadTextTower攻击,能够在文本条件检索、重排序和选择中产生强暴露,同时保持视觉复用几乎干净。实验证明了框架的有效性和攻击的威胁性。

💡 推荐理由: 揭示了CLIP模型后门在不同部署接口下的暴露差异,强调原生成功不代表整体安全,并指出文本编码器成为新风险载体,对模型复用场景的安全评估具有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jiamin Chang, Salil Kanhere, Piotr Koniusz, Jason, Xue, Hammond Pearce

本文研究视觉-语言智能体系统(VLAS)中的后门攻击问题。VLAS将视觉感知与规划、工具使用和物理动作相连接,因此后门触发器可以通过决策管线及其连接的接口传播,使视觉后门成为系统级威胁。当前评估仅关注干净准确率和攻击成功率(ASR),这些指标只衡量触发器是否有效,但无法判断攻击是否“精确”——即是否仅在预期条件下触发隐藏行为。本文形式化了触发器不精确的失败为“触发器泄露”:视觉或语义上与预期触发器相近的输入,无意中激活了攻击者指定的行为。为量化泄露,作者提出邻域泄露率(NLR)。实验表明,在3%的投毒比例下,图标和文本触发器对常见视觉变换保持鲁棒,但其邻近变体泄露严重,NLR分别达到0.996(图标)和0.944(文本)。使用文本触发器作为受控探针,结果表明标准微调学习到一个较宽的激活区域而非精确触发条件,导致即使是稍有不同的邻近字符串也会调用恶意行为。通过加入编辑距离为1的硬负样本进行训练,可以显著缩小激活区域并减少泄露,在图像编辑和具身操作工作流中,泄露的触发器可能传播到可执行程序和动作序列。本研究的贡献在于正式定义了触发泄露问题,提出了NLR指标,并展示了通过硬负样本训练来缓解泄露的方法。适合对AI安全、后门攻击防御感兴趣的学术界和工业界研究人员阅读。

💡 推荐理由: 后门攻击在VLAS中的精确性问题常被忽视,本工作揭示了标准评估指标的盲区,并提出NLR新指标,为提升智能体系统安全性提供了新视角。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuchen Chen, Weisong Sun, Haocheng Huang, Yuan Xiao, Chunrong Fang, Yiran Zhang, Tingting Xu, Zhenpeng Chen, An Guo, Peizhuo Lv, Xiaofang Zhang, Zhenyu Chen, Yang Liu, Baowen Xu

本文针对代码语言模型(CodeLMs)中的自然后门漏洞进行了深入的实证研究。自然后门是指模型在正常训练过程中无意习得的后门行为,与通过数据投毒注入的后门不同,其产生机制与模型内部表征有关。研究覆盖了多种模型架构(如GPT、BERT变体)和代码智能任务(如代码补全、缺陷检测、代码翻译),在44个场景下系统性地评估了自然后门的存在性,结果表明自然后门在CodeLMs中普遍且固有。作者从模型层面和参数层面揭示了自然后门与注入后门的差异:前者往往与更多参数相关且分布更散。进一步分析了自然后门在数据集、模型架构和共享知识上的可迁移性,发现它们能在不同任务间迁移。成因分析从训练数据(如数据中的隐性偏差)和训练过程(如过拟合)两方面展开。评估了现有防御技术(包括预训练、训练中、训练后防御)对自然后门的缓解效果,发现多数防御效果有限。最后提出了ScanNBT检测方法,通过特征分析和异常模式识别来增强对自然后门的检测能力。该研究有助于理解CodeLMs的安全隐患,为开发更安全的代码模型提供指导。适合安全研究人员、AI安全工程师、代码智能开发者阅读。

💡 推荐理由: 自然后门可能潜伏在正常训练的代码模型中,影响代码生成、漏洞检测等关键任务的安全性与可靠性,现有防御手段难以有效清除,对依赖CodeLMs的软件供应链构成潜在威胁。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bastien Vuillod, Kevin Hector, Pierre-Alain Moellic, Jean-Max Dutertre, Olivier Potin

该论文研究联邦学习(FL)中的模型投毒攻击。传统FL后门攻击主要依赖算法层面操纵训练数据,但本文引入一类新的攻击:利用硬件故障(如Rowhammer)在本地模型参数中注入比特翻转,从而在联邦学习期间植入后门。攻击过程分为离线阶段:攻击者从预训练模型出发,通过分析确定要翻转的比特位;在线阶段:恶意客户端在本地训练时通过硬件故障(比特翻转)修改模型参数,使全局模型在目标任务上保持正常性能,但后门触发时输出攻击者指定的错误结果。实验表明,在ResNet-18等模型上,平均每次恶意客户端出现仅需10次比特翻转,共19次恶意交互即可达到94%的攻击成功率。论文还讨论了攻击的实用性及潜在防御的鲁棒性,并指出Rowhammer是该类威胁的主要攻击向量。该工作揭示了硬件安全与联邦学习安全的交叉风险,对设计防御策略具有指导意义。

💡 推荐理由: 该研究首次将硬件故障攻击(比特翻转)与联邦学习后门攻击结合,拓宽了攻击面,提醒安全从业者关注底层硬件威胁对模型安全的影响。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hongtao Wang, Se Yang, Yu Chen, Puzhuo Liu

本文提出了一种针对大型语言模型(LLM)智能体长期记忆系统的隐蔽后门攻击方法——MemPoison。LLM智能体通过长期记忆支持持续自主的任务执行,但记忆系统的选择性提取和重写机制使得传统记忆投毒攻击难以生效。MemPoison通过对话交互将可触发的后门注入智能体长期记忆,从而误导其后续响应。该方法包含三个关键组件:(1)语义关系桥,将触发词与载荷绑定为连贯语句,确保它们被一同提取至记忆;(2)实体伪装,优化触发词使其模仿命名实体,抵抗记忆重写;(3)联合嵌入优化,将包含触发词的文本在嵌入空间中形成紧密簇,并与良性嵌入保持隔离,实现隐蔽性。实验覆盖不同智能体领域和记忆机制,MemPoison攻击成功率高达0.95,显著优于现有基线。机制分析表明,攻击利用了嵌入空间的各向异性并改变了注意力模式,揭示了选择性记忆系统的核心脆弱性。论文还评估了多种防御策略,证明它们在缓解该攻击方面存在根本性局限。该工作适合AI安全研究员、LLM智能体开发者以及关注对抗机器学习的防御者阅读。

💡 推荐理由: 首次展示攻击者通过自然对话即可在LLM智能体长期记忆中植入隐蔽后门,绕过了现有选择性记忆机制,对依赖记忆的自主智能体构成可信赖性威胁。

🎯 建议动作: 研究跟进,评估现有记忆系统的防御能力,并关注后续防御方案。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jianwei Li, Jung-Eun Kim

该立场论文指出,AI/ML 社区不应过度使用“正向后门”(positive backdoor)这一标签,而应将触发激活的隐藏行为视为“秘密对齐”(Secret Alignment)。在私有AI时代,开放权重的大语言模型和可获取的训练/推理栈使语言模型成为私有数字资产,带来了未经授权访问、模型窃取和行为滥用的安全风险。最近,一系列被称为“正向后门”的工作被提出以应对这些挑战,其核心思想是在模型中植入隐蔽的触发-行为关联,用于访问控制、所有权归属和安全强制。本文将这些方法统一为秘密对齐的一种形式,并评估了三个代表性应用在六个核心属性(有效性、无害性、持久性、效率、鲁棒性和可靠性)上的表现。结果表明,触发-行为映射在机密性、完整性、可用性(CIA)方面存在显著的脆弱性,远不如现有声称的那样可靠。作者进一步将结果关联到行为密度和决策复杂度,提供了一个行为学视角来理解部署时风险,并呼吁社区采用严格的、标准化的评估来使秘密对齐的主张可证明。

💡 推荐理由: 纠正了对“正向后门”的误用,强调了对模型隐藏行为进行严格评估的必要性,对LLM安全部署和防御有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Khang Tran, Yazan Boshmaf, Issa Khalil, NhatHai Phan, Ting Yu, Md Rizwan Parvez

本文提出一种名为Poison-with-Style (PwS)的实用且隐蔽的模型投毒攻击,针对代码大语言模型(CLLM)。与以往假设攻击者能够在推理时主动将显式触发器(如特定单词)嵌入开发者提示中的攻击不同,PwS利用开发者的代码风格作为隐式触发器,这些触发器自然地蕴含在提示中。PwS引入了一种新颖的数据收集方法和两步训练策略来微调CLLM,使得模型在遇到包含特定代码风格的提示时生成含漏洞的代码,而在其他提示下保持正常行为。在Python代码补全任务上的实验表明,PwS能够抵御最先进的防御措施,并在多种漏洞类型上实现高攻击成功率,同时保持标准代码补全基准(如HumanEval和MBPP)上的良好性能。例如,当使用触发代码风格时,PwS投毒的模型在95%的情况下生成CWE-20漏洞代码,而在HumanEval和MBPP上的pass@1性能下降不到5%。该研究表明,代码风格这种看似无害的特征可被用作隐蔽的后门触发器,对基于CLLM的代码代理构成严重威胁,并凸显了需要更细粒度的防御策略来检测此类隐式触发器的必要性。

💡 推荐理由: 该攻击利用开发者自然的代码风格作为隐蔽触发器,极具实用性和隐蔽性,能绕过现有防御,威胁基于代码大模型的智能代理安全。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 10.6
Conf: 50%
👥 作者: Zedian Shao, Charles Fleming, Teodora Baluta

大型语言模型(LLM)通常使用未经过滤的文本数据集进行微调,而对手可以污染这些数据集。现有的数据投毒攻击主要依赖于固定的触发短语,这些短语可以被异常检测、干净数据正则化或在线监控等防御手段中和。本文提出了一种新的数据投毒方法,通过共享知识(如事实或概念)与攻击者选择的短语之间的语义关联,使LLM学习一种可靠且隐蔽的信息隐藏方案。这种隐藏方案可以编码和解码任意恶意指令,从而揭示了一种新的、微妙的投毒诱导漏洞:隐蔽控制攻击。作者精确刻画了隐蔽控制攻击的特征,并在5个LLM、3种后门防御和4种提示注入防御上进行了评估。在较小的污染比例下,相比干净的微调模型,隐蔽控制攻击在平均攻击成功率上比基于启发式的提示注入攻击相对提高了约40%。它们还能规避基于检测和微调的防御,在后门防御后保持高达93%的攻击成功率,在提示注入防御后保持高达98%的攻击成功率。这项研究展示了LLM微调过程中一种新型的、难以防御的威胁,对LLM的安全部署提出了严峻挑战。

💡 推荐理由: 该攻击通过语义关联隐藏指令,能绕过现有检测和防御机制,对LLM安全构成新威胁,安全从业者需关注此类隐蔽后门攻击的演变。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zeyao Liu, Zhendong Zhao, Xiaojun Chen, Xin Zhao, Yuexin Xuan, Xiaoshuang Ji

该论文研究视觉Transformer(ViT)后门攻击的安全风险。现有基于全量微调的后门攻击计算开销大且导致性能下降,因此攻击者转向视觉参数高效微调(PEFT)范式,其中基于适配器(如LoRA)和基于提示(如VPT)的方法占主导。尽管适配器安全性已有初步研究,但基于提示的生态系统风险尚未被充分探索。论文填补了这一空白,揭示了VPT向动态、上下文感知架构演化过程中出现的一种更危险的威胁:即使这些动态模块在良性任务上表现优异,却可能被利用来植入后门。作者提出VIPER攻击框架,其核心是轻量级的动态视觉提示生成器(VPG)。该动态架构能够实现“功能融合”(Functional Fusion)这一新兴现象:恶意逻辑与良性任务功能紧密融合在同一稀疏、高幅值的参数核心中。这造成了一种“人质”困境:若剪除攻击参数,则良性性能必然被破坏。实验表明,VIPER有效解决了攻击者的三难困境:在干净数据上达到最先进性能,在VPG模块剪枝率达90%时仍保持近100%的攻击成功率(而LoRA攻击已崩溃),且推理延迟仅增加0.06毫秒(1.16%)。该工作揭示了动态提示架构中一种范式级的新风险。

💡 推荐理由: 揭示了动态提示架构中一种新型后门攻击,其恶意逻辑与良性功能高度融合,使得传统防御措施(如剪枝)失效,对基于PEFT的ViT系统构成严重威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Daniel Yiming Cao, Chengzhong Wang, Sheng-Yen Chou, Chengyu Huang, Pin-Yu Chen, Shengwei An

该论文首次系统研究了掩码扩散语言模型(MDLM)在训练阶段的后门攻击。MDLM是一种新兴的文本生成范式,其训练时安全性尚未得到充分探索。现有的针对高斯扩散模型或自回归语言模型的后门攻击无法直接应用于MDLM,因为MDLM依赖于离散状态破坏和迭代去噪,而非连续加噪或从左到右预测。为此,作者提出SHADOWMASK后门攻击方法,通过修改MDLM的前向破坏过程,将标准的全掩码终端分布替换为触发词-掩码混合先验分布,从而创建一条从触发词破坏状态到攻击者指定目标的专用去噪路径,同时保持干净的去噪行为。论文给出了后门前向过程的数学定义,推导了反向时间后验,并得到了连续时间训练目标。在基于DiT的MDLM和LLaDA-8B-Instruct模型上,使用WikiText-103、OpenWebText和Alpaca数据集进行评估,结果表明SHADOWMASK实现了接近100%的攻击成功率,显著优于标准数据投毒,且基本保持了干净效用,在全模型微调和参数高效微调下仍有效,并对代表性防御方法具有鲁棒性。

💡 推荐理由: MDLM作为新兴文本生成范式,其安全性尚未被充分研究。本文揭示了MDLM存在训练时后门攻击风险,攻击者可通过修改前向过程植入后门,且攻击成功率高、隐蔽性强。安全社区需关注此类新型攻击路径,并在部署MDLM前进行安全评估。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tobias Braun, Jonas Henry Grebe, Hossein Shakibania, Anna Rohrbach, Marcus Rohrbach

本文首次研究了统一自回归模型(UAM)中的后门攻击漏洞。UAM是一种Transformer模型,能够在单个自回归过程中同时生成文本和图像token。其共享参数和多模态词汇简化了训练流程并支持灵活的多模态生成,但也引入了新的安全风险。作者提出了Token by Token后门攻击(ToBAC),这是首个针对UAM的后门攻击方法,涵盖基于数据和基于模型的投毒策略。攻击者可以将看似无害的字符或常见单词作为触发器,在图像生成过程中引发恶意行为,同时操纵视觉输出和伴随文本,从而提高虚假内容的可信度。在模型可访问的场景下,攻击者可以对统一Liquid模型进行攻击,使得一个微妙单词(如“cool”)在55%的生成中诱发与模态一致的品牌推广或意识形态影响。在无模型访问时,通过数据投毒即可实现攻击,对JanusPro的平均成功率达63.1%。实验表明,UAM的跨模态参数共享使得后门触发器能够跨模态传播恶意效果,这是一种新型安全威胁。本文的贡献在于揭示UAM特有的安全隐患,并展示了多模态后门攻击的可行性和有效性。

💡 推荐理由: 统一自回归模型是未来多模态AI的重要方向,本文揭示了其特有的后门攻击风险,攻击者可同时篡改文本和图像输出,对内容安全构成严重威胁。

🎯 建议动作: 跟进该研究,评估自身使用的UAM模型是否存在类似后门风险;关注后续防御技术发展。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Rui Wen, Mark Russinovich, Andrew Paverd, Jun Sakuma, Ahmed Salem

该论文提出了一种新型后门攻击方法 MetaBackdoor,利用 Transformer 架构中位置编码 (Positional Encoding) 的内在特性作为触发器,而不需要修改输入文本内容。现有的后门攻击大多依赖内容触发器(如特定词语、句子),容易被基于文本异常的防御机制检测。作者的核心洞察是:Transformer 模型在处理有序序列时必须编码 token 位置信息,因此输入长度相关的结构会反映在模型内部计算中,可以被用作非内容触发器。论文展示了即使简单的基于长度的位置触发器也能激活隐匿的后门行为。与之前攻击不同,MetaBackdoor 作用于可见且语义正常的输入,使后门 LLM 在满足长度条件时泄露敏感内部信息(如专有系统提示),甚至出现自激活场景——正常的多轮交互可将对话上下文推至触发区,诱导恶意工具调用行为,而无需攻击者提供触发文本。此外,MetaBackdoor 与基于内容的后门正交,可组合使用以创建更精确、更难检测的触发条件。实验证明该方法在多种 LLM 架构上有效。该工作扩展了 LLM 后门的威胁模型,揭示了位置编码这一被忽视的攻击面,对现有侧重文本异常检测的防御策略提出了挑战。

💡 推荐理由: 揭示了 LLM 位置编码可作为新型后门触发器,绕过现有基于文本内容的防御,引发系统提示泄露、恶意工具调用等安全风险,需要安全社区重新评估防御策略。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
INFO
PAPER 2026-05-07

Stateful Agent Backdoor

推荐 5.5
Conf: 50%
👥 作者: Zhengchunmin Dai, Jiaxiong Tang, Liantao Wu, Peng Sun, Honglong Chen

该论文提出了一种针对基于大型语言模型(LLM)的智能体的有状态后门攻击方法。现有后门攻击在单个会话内执行固定行为,且攻击状态无法跨会话持久化。作者设计了一种有状态后门,通过持久化组件(如文件系统、数据库等)维护攻击状态,使得在一次触发注入后,攻击能够在多个会话中自主、增量地执行,即使这些会话处于权限隔离环境中。形式上,作者将攻击建模为Mealy机,并推导出分解框架,使得每个状态转换的数据可以独立构建。他们基于此框架实现了一个主要攻击实例和两种扩展变体(不同拓扑结构和持久化组件)。在四个主流LLM模型上的实验表明,主要攻击实例的成功率达到80%–95%,每转换分析验证了分解方法的有效性。扩展变体也展示了一致的效果。该研究揭示了LLM Agent在面对跨会话持久化后门时的脆弱性,对Agent安全防御具有警示意义。适合AI安全研究员、LLM应用开发者阅读。

💡 推荐理由: 该研究揭示了LLM Agent面临的新型持久化后门威胁,突破了传统单会话攻击的局限,对构建鲁棒的Agent安全防护具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 14.6
Conf: 50%
👥 作者: Eden Luzon, Guy Amit, Roy Weiss, Torsten Krauß, Alexandra Dmitrienko, Yisroel Mirsky

本论文提出一种针对联邦学习的训练时后门攻击方式,使恶意服务器能够系统性地提取客户端完整训练样本。传统数据提取方法往往只能概率性重建或产生幻觉,无法精确恢复原始数据。该方法通过修改训练过程,在模型中嵌入一个后门触发器,当输入特定索引模式时,模型会直接输出对应训练样本。由于输出尺寸限制,攻击者将样本分割为多个补丁依次提取,并在服务器端重组。攻击仅需对训练代码做微小修改,客户端验证难以察觉,构成联邦学习供应链安全威胁。实验覆盖分类器、分割模型和大语言模型,显示可以数千计地恢复敏感样本,且对主任务性能影响极小(如医学分割数据集仅降低3%准确率)。研究揭示了联邦学习系统中数据隐私的重大漏洞,强调加强分布式训练管道完整性和透明性的必要性。适合联邦学习安全研究员、隐私保护工程师阅读。

💡 推荐理由: 该攻击首次实现联邦学习中精确、高容量的训练数据提取,仅需轻微破坏模型效用,严重威胁隐私敏感的医学等场景。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Linzhi Chen, Yang Sun, Hongru Wei, Yuqi Chen

本文针对低秩适配(LoRA)模型在开源社区(如Hugging Face)中广泛使用所带来的安全挑战展开研究。LoRA作为一种高效的大语言模型微调方法,其适配器文件可被轻易分享和传播,但这也为恶意攻击者提供了植入后门的机会。现有后门攻击方法在LoRA场景下面临三个主要问题:依赖原始训练数据(通常不可获取)、未考虑LoRA特有的结构属性、以及高虚假触发率(False Trigger Rate, FTR)导致隐蔽性差。为此,作者提出了一种因果引导去毒后门攻击框架(CBA),该框架无需访问原始训练数据即可实施攻击。CBA的核心创新包括两点:一是基于覆盖引导的数据生成流水线,通过行为探索合成与任务对齐的输入;二是因果引导的去毒策略,通过保留任务关键神经元来合并中毒适配器和干净适配器。与以往方法不同,CBA允许攻击者在后训练阶段通过因果影响权重分配来控制攻击强度,无需重复训练。在六个LoRA模型上的实验表明,CBA在实现高攻击成功率的同时,将FTR相比基线方法降低了50-70%。此外,该方法对现有先进的后门防御方法表现出增强的抵抗力,凸显了其隐蔽性和鲁棒性。本文的研究揭示了开源LoRA模型生态中存在的严重安全隐患,提醒社区关注此类新型后门攻击的威胁。

💡 推荐理由: 本研究揭示了开源LoRA模型共享生态中一种高隐蔽性、无需原始训练数据的后门攻击方法,对依赖LoRA微调的AI应用构成潜在威胁,值得安全从业者警惕并提前部署检测与防御机制。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sarthak Choudhary, Atharv Singh Patlan, Nils Palumbo, Ashish Hooda, Kassem Fawaz, Somesh Jha

该论文提出了一种名为 Sparse Backdoor 的供应链攻击,能够在预训练图像分类器(包括卷积网络和视觉Transformer)中植入一个理论上不可检测的后门。攻击方法是在每个全连接层的少量列上沿随机方向注入结构化稀疏扰动,从而将触发信号传播到攻击者选择的目标类别,并通过独立的各向同性高斯抖动掩盖该扰动。抖动的作用是产生一个以预训练权重为锚点的干净参考分布,据此形式化定义不可检测性。在预训练分类器满足温和的边际条件时,论文证明了抖动后的参考模型与原始分类器功能等价。进一步,论文证明区分植入了后门的模型与该参考模型至少与Sparse PCA检测问题一样困难,而后者在标准难度假设下是计算不可行的。该保证适用于任何具有白盒参数访问权限的概率多项式时间区分器。

💡 推荐理由: 该研究揭示了机器学习供应链中一种新型后门攻击,能在参数层面实现理论上的不可检测性,对AI模型的可信部署构成严重威胁。安全从业者需关注此类攻击对模型审计和安全性评估的挑战。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zi Li, Tian Zhou, Wenze Li, Jingyu Hua, Yunlong Mao, Sheng Zhong

本文揭示了一种针对本地大语言模型(LLM)微调过程的供应链攻击新范式。传统观点认为本地离线微调能够保护训练数据中的敏感信息(如API密钥、个人标识符、金融记录等),但本文证明,通过向模型代码中植入伪装成标准架构定义的后门,攻击者即可实现高成功率的秘密窃取。不同于以往被动的预训练权重投毒(主要依赖概率性语义前缀,难以捕获稀疏高熵的目标),本文提出了一种主动执行劫持方法:攻击者将恶意代码伪装为模型架构定义(如PyTorch模块),在微调时触发执行劫持。核心技术包括:1)确定性全链记忆机制,通过在线张量规则匹配锁定动态计算流中的令牌级秘密;2)值-梯度解耦技术,隐蔽地注入攻击梯度,克服梯度淹没问题迫使模型记忆秘密;3)首次实现攻击者可验证的秘密窃取——通过黑盒查询精确区分真实泄露与幻觉。实验表明,该方法在保持主任务性能的前提下,严格攻击成功率(Strict ASR)超过98%,并能有效绕过差分隐私(DP-SGD)、语义审计和代码审计等防御措施。该研究提醒安全社区,模型代码供应链是不可忽视的攻击面。

💡 推荐理由: 挑战了“本地离线微调天然安全”的假设,揭示了模型代码后门可被用于窃取训练数据中的高价值秘密,对使用第三方模型代码或依赖微调服务的企业构成直接威胁。

🎯 建议动作: 审阅内部微调流程中使用的模型代码来源,实施代码审查与完整性验证;评估是否引入额外的运行时监控以检测异常梯度或执行流。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mengnan Zhao, Lihe Zhang, Tianhang Zheng, Bo Wang, Baocai Yin

本文旨在解释快速对抗训练(Fast Adversarial Training, FAT)中出现的灾难性过拟合(Catastrophic Overfitting, CO)现象。FAT能高效提升神经网络对对抗样本的鲁棒性,但容易发生CO,即模型过度拟合训练时使用的特定攻击,导致对其他攻击的泛化能力差。现有方法虽提出了各种缓解策略,但缺乏系统直观的解释。本文创新性地从后门攻击(backdoor)的角度解读CO:通过路径划分、多样特征预测和通用类别可区分触发器的验证,将CO视为不可学习任务(unlearnable tasks)的弱触发器变体,从而统一了CO、后门攻击和不可学习任务的理论框架。基于此,作者提出了多种后门启发的缓解方法:(1)使用微调、线性探测或重新初始化技术重新校准受CO影响的模型参数;(2)引入权重异常值抑制约束,控制模型权重的异常偏差。大量实验支持了对CO的解释,并证明了所提缓解策略的有效性。本文适合机器学习安全、对抗鲁棒性方向的研究人员阅读。

💡 推荐理由: 该研究首次将灾难性过拟合与后门攻击统一在同一个框架下,为理解模型鲁棒性问题提供了新视角,并提出了有效的缓解策略。

🎯 建议动作: 研究跟进

排序因子: Community 数据源 (+1) | LLM 评分加成 (+0.5)