#backdoor-defense

共收录 14 条相关安全情报。

← 返回所有主题
👥 作者: Jinwen Xin, Xixiang Lv

本文提出 SpeechGuard,首个针对语音识别模型的在线后门防御流水线。后门攻击通过在训练阶段注入少量恶意样本,使模型在遇到特定触发器时输出攻击者指定的错误结果,这在自动驾驶语音交互等安全敏感场景中危害极大。SpeechGuard 针对音频信号特性,设计了两阶段防御:第一阶段基于改进的 STRIP 方法(S-STRIP),通过自适应扰动注入检测并过滤被投毒的音频样本;第二阶段利用时频(T-F)掩码抑制触发器信号的表达,并基于自编码器自动生成掩码,从而净化中毒样本,即使输入含有触发器的语音也能得到正确预测。实验表明,SpeechGuard 能准确过滤中毒样本,显著缓解后门威胁,同时保持较高的预测精度。

💡 推荐理由: 首次提出针对语音识别模型的在线后门防御方案,填补了运行时防御的空白,对自动驾驶等关键场景有直接应用价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md Raihan Uddin, Fatemeh Lotfi, Tolunay Seyfi, Fatemeh Afghah

开放无线接入网络(O-RAN)越来越多地将近实时控制委托给从第三方供应商获取的深度强化学习(DRL)xApp,这引入了新的供应链攻击面。后门策略在正常情况下表现最优,但一旦对手向观察到的关键性能指标(KPI)遥测数据中注入隐蔽触发器,就会产生有害的控制动作,降低服务质量(QoS)。本文提出ORAN-DEFEND,一种无需重新训练的包装器,通过奇异值分解(SVD)从少量可信的干净轨迹中估计安全子空间,将每个KPI窗口投影到该安全子空间上,从而净化冻结的、可能被攻陷的xApp。作者从分析和实验两方面建立了精确的恢复条件:如果触发器能量集中在安全子空间的正交补中,则防御成功,并通过触发器的正交补能量分数量化该边界。在Colosseum COLORAN数据集上,评估了四种结构不同的DRL后门攻击(TrojDRL、SleeperNets、BadRL和Q-Incept),涵盖内环和外环投毒机制,结果表明在子空间假设成立时,所有攻击都实现了100%的回报恢复和≥99.5%的防御成功率。几何消融实验揭示了任何线性投影防御的内在且此前未表征的极限:当触发器与合法信号共定位时,正交补能量分数单调地控制恢复,线性残差检测器降至随机水平,而非线性分类器仍保持完美可分性。

💡 推荐理由: O-RAN供应链中第三方DRL xApp的后门攻击是新兴威胁,ORAN-DEFEND提供了一种轻量级、无需重新训练的防御方案,对保障O-RAN安全性具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ahmadreza Azizi, Ibrahim Asadullah Tahmid, Asim Waheed, Neal Mangaokar, Jiameng Pu, Mobin Javed, Chandan K. Reddy, Bimal Viswanath

本文提出 T-Miner,一种针对深度神经网络 (DNN) 文本分类器 Trojan 攻击的防御框架。Trojan 攻击通过在训练阶段植入后门触发器,使得任何包含该触发器的输入都会被误分类为攻击者指定的目标标签。与图像领域丰富的防御工作相比,文本领域的后门防御研究相对有限。T-Miner 采用序列到序列 (seq2seq) 生成模型,该模型探测可疑分类器并学习生成可能包含 Trojan 触发器的文本序列。其关键创新在于:不需要访问训练数据集或干净输入,而是使用人工合成的“无意义”文本作为初始种子来训练生成模型。随后,T-Miner 分析生成模型输出的文本,判断其中是否包含触发器短语,从而确定分类器是否被植入了后门。实验在 1100 个模型实例上进行,覆盖 3 种主流 DNN 架构(如 LSTM、CNN、BERT 等)、5 种不同的分类任务(如情感分析、垃圾邮件检测等)以及多种触发器短语。结果显示,T-Miner 对 Trojan 模型和干净模型的总体检测准确率达到 98.75%,在干净模型上误报率极低。此外,T-Miner 对针对性的自适应攻击也表现出鲁棒性,能够抵御攻击者刻意绕过检测的尝试。本文的主要贡献在于:提出了首个基于生成模型的无数据文本后门防御方法,并通过大规模实验验证了其有效性和鲁棒性。

💡 推荐理由: 文本分类模型在安全敏感场景(如邮件过滤、内容审核)中广泛应用,但 Trojan 攻击可导致严重误判。T-Miner 不依赖原始训练数据,具有实际部署价值,填补了文本领域后门防御的空白。

🎯 建议动作: 研究跟进,评估方法在自己模型上的适用性

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Guanming Che, Qiang Wang, Jian Xu, Fucai Zhou

联邦学习(FL)极易受到隐蔽后门攻击的影响,攻击者通过植入特定触发器,迫使模型对包含该触发器的输入预测攻击者指定的目标类别。然而,现有的统计防御方法主要关注模型收敛的早期阶段。本文发现了一个根本性漏洞,称为“后期失败”(Late-stage Failure)。我们证明,随着全局模型收敛,梯度范数衰减导致恶意更新和良性更新在形态上难以区分。这种消失的统计方差实际上使传统防御方法失效,使自适应攻击者能够保持休眠状态,随后劫持训练过程。为了克服这些限制,我们提出了Secure-CHG,一个混合框架,将防御范式从表面的形态检测转向内在的语义贡献验证。Secure-CHG采用自适应防御管道:在早期振荡阶段,级联统计滤波器稳定优化过程;而在后期收敛阶段,新型CHG-Shapley机制接管。通过利用样本难度(即局部训练损失)将更新投影到复合硬度-梯度空间,有效放大了对抗性语义痕迹,即使梯度范数消失也能隔离隐蔽攻击者。此外,我们推导了CHG-Shapley的闭式解,实现了低复杂度、无需重新训练的节点估值和信任调制聚合。在CIFAR-10、MedMNIST和NEU-SDDB上的广泛评估表明,Secure-CHG有效缓解了后期失败问题。具体而言,相对于主流Krum和Trimmed Mean基线,它将高级后门攻击的成功率分别降低了2.3倍和2.0倍。

💡 推荐理由: 揭示了联邦学习后期收敛阶段统计防御的根本失效问题,并提出了可操作的新型防御框架,对推进FL安全性有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tuo Chen, Minjing Dong, Benlei Cui, Jian Liu, Jie Gui

本文针对自监督学习(SSL)预训练模型易受后门攻击的问题,提出了一种全新的、攻击无关、模型无关、模态无关的黑盒测试时防御范式——柏拉图表示防御(Platonic Representation Defense)。该方法受柏拉图表示假设启发,该假设认为大规模独立训练的编码器会收敛到对同一潜在现实的兼容投影。作者将这一思想形式化为一个条件能量函数,该函数定义在源表示和一组参考表示上。能量函数通过噪声对比估计进行检测训练,并通过去噪得分匹配进行表示净化训练。理论上,匹配样本与不匹配样本之间的能量差由源表示与参考表示之间的互信息下界所保证。实验在多个自编码器(如SimCLR、MoCo等)和超过10种攻击下验证了方法的有效性,该方法能同时进行表示检测和净化,并在多种攻击下实现了显著的性能提升。代码已开源。该研究为黑盒场景下的后门防御提供了全新思路,尤其适用于大规模预训练模型部署场景。

💡 推荐理由: 现有后门防御方法大多需要标签、攻击模式或训练数据,无法在完全黑盒的测试时场景下有效工作。本文提出的方法不依赖任何先验知识,仅利用参考模型集合即可实现检测与净化,为实际部署中的SSL模型安全提供了可行的解决方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Osama Wehbi, Sarhad Arisdakessian, Omar Abdel Wahab, Azzam Mourad, Hadi Otrok

联邦学习(FL)允许多方协作训练模型而不共享原始数据,但分布式特性使其易受后门攻击——恶意客户端在本地训练数据中嵌入隐藏触发器,操纵模型预测。现有防御主要在聚合前或聚合中生效,无法完全消除收敛后全局模型中残留的后门行为。此外,服务器在训练后缺乏触发器模式或恶意客户端的信息,导致后门残留或正常准确率下降。为此,本文提出SCRUB-FL(通过遗忘后门来净化和清洗表示),一种两阶段后门清除方案。训练阶段:客户端使用频谱分析和激活聚类识别可疑样本,然后训练轻量级WGAN-GP(带梯度惩罚的Wasserstein生成对抗网络)捕获触发器相关分布;服务器端聚合生成器参数,构建可疑模式的全局表示而不暴露原始数据。收敛后阶段:服务器合成近似触发器的样本,应用机器遗忘(machine unlearning)通过将预测分布重定向为均匀分布来擦除触发器-目标关联。在CIFAR-10和GTSRB数据集上,针对三种攻击类型和高达40%的恶意参与率,实验表明SCRUB-FL将后门攻击成功率降至3.88%,同时保持超过91%的正常任务准确率,优于现有最先进防御,且无需服务器预先知道触发器模式或拥有大型干净代理数据集。

💡 推荐理由: 联邦学习中的后门攻击难以彻底清除,现有方法依赖聚合阶段防御或需要大量干净数据。SCRUB-FL首次将机器遗忘引入FL后门移除,无需先验触发器知识,显著降低攻击成功率而几乎不影响主任务,为隐私敏感场景(如医疗、金融)提供了实用防护方案。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Junfeng Guo Heng Huang

强化学习(RL)在现实世界中的应用日益广泛,但其安全性问题仍需更多关注。最新研究表明,RL智能体容易受到后门攻击的影响:当特定触发器被激活时,本应行为正常的智能体会执行恶意动作。现有的RL后门防御方法要么需要访问智能体的内部参数,要么仅在模型或轨迹级别运行,或者仅限于特定攻击类型。本文提出了一种名为PolicyGuard的新型防御机制,该机制在测试时、步骤级别进行后门检测。PolicyGuard利用高斯过程(GP)后验方差,并通过生成伪轨迹来计算每个时间步的不确定性,从而识别异常行为。此外,作者提供了理论依据来解释GP后验方差的有效性。在七个RL游戏环境中进行了大量实验,结果表明PolicyGuard在大多数情况下达到了最先进的检测性能:对于基于扰动的攻击,平均AUROC为0.856;对于对抗性智能体攻击,平均AUROC为0.859。本文的主要贡献包括:首次提出测试时、步骤级别的后门防御方法;利用GP后验方差实现细粒度不确定性量化;提供了理论支撑;以及通过广泛实验验证了方法的有效性。适合强化学习安全研究员、AI安全工程师以及对抗机器学习方向的研究者阅读。

💡 推荐理由: 强化学习后门攻击威胁严重,但现有防御存在短板。PolicyGuard首次实现测试时步骤级检测,无需修改训练过程或访问内部参数,为RL安全提供了实用且高效的防护方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kazuki Iwahana, Masaru Matsubayashi, Takuma Koyama, Toshiki Shibahara, Kenichiro Omintato, Akira Ito

该论文针对大型语言模型(LLM)面临的后门攻击威胁,提出了一种基于共享内部机制的未知后门移除方法。后门攻击会使模型在干净输入下表现正常,但遇到特定触发器时输出攻击者指定的有害内容。由于防御者通常不了解后门类型或内部机制,移除未知后门极具挑战性。论文首先通过实验证明,不同后门在同一攻击目标下会引发相似的激活模式变化。基于这一发现,作者设计了一种简单而有效的防御策略:主动向模型中植入一个已知触发器的虚拟后门(dummy backdoor),然后通过与干净响应配对的虚拟触发器输入进行微调来移除该虚拟后门。由于虚拟后门与未知后门共享内部机制,移除虚拟后门的同时也会削弱未知后门的效果。论文在三个模型家族上针对三种后门攻击类型进行了评估,结果表明该方法显著降低了未知后门的攻击成功率,同时保持了模型实用性,在防御有效性和效用保留方面均优于现有代表性防御方法。该方法为LLM后门防御提供了新思路,利用防御者可控的后门作为代理来缓解未知后门威胁。

💡 推荐理由: LLM后门攻击是当前AI安全的核心威胁之一,现有防御方法难以应对未知后门。该论文首创性地利用虚拟后门作为代理,通过共享内部机制实现有效防御,为业界提供了一种无需先验知识的高效后门移除方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Quang Duc Nguyen, Siyuan Liang, Yiming Li, Fushuo Huo, Dacheng Tao

时间序列预测(TSF)在众多领域(如金融、气候、工业监控)中发挥着关键作用,但容易受到后门攻击的威胁。然而,针对TSF的后门防御研究仍处于起步阶段,主要面临两大挑战:数据纠缠(data entanglement)导致不同时间序列通道间的信号相互干扰,以及任务形式转变(task-formulation shift)使得后门注入与正常训练难以区分。本文首先系统评估了十三种代表性后门防御方法在TSF全生命周期中的表现,分析其失败模式,发现两个根本问题:1)数据纠缠引发通道级信号稀释,使基于样本过滤或触发器合成的防御方法无法准确定位后门;2)任务形式转变导致训练损失退化,使得中毒窗口与干净窗口在训练阶段变得不可区分。基于这些发现,作者提出一种针对TSF的训练时后门防御方法——TimeGuard。该方法采用通道级池训练(channel-wise pool training)为核心范式,利用时间感知标准初始化高置信度池以缓解信号稀释;同时引入距离正则化损失选择策略,在训练过程中逐步扩展可靠池,缓解损失退化。在多个数据集、预测架构和TSF后门攻击上的广泛实验表明,TimeGuard显著提升了鲁棒性,平均绝对误差(MAE_P)相比领先基线提升1.96倍,同时干净性能MAE_C控制在5%以内。本文为TSF安全防御提供了新的思路和实用方法。

💡 推荐理由: 时间序列预测安全是AI安全重要分支,此前缺乏针对性后门防御。本文揭示TSF特有挑战并提出有效方法,为保护关键基础设施(如电网、金融市场)提供新工具。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mengting Pan, Fan Li, Chen Chen, Xiaoyang Wang

图神经网络(GNN)在关系学习中取得了显著成功,但其对图后门攻击(GBA)的脆弱性,阻碍了其在高风险应用中的广泛采用。现有的图后门防御(GBD)方法主要针对基于子图的GBA,假设被投毒的目标节点明确连接到子图触发器。然而,实验结果表明,这些以结构为中心的方法无法防御新兴的基于特征的GBA,后者保持了图拓扑结构。因此,本文研究了一个新的通用图后门防御问题。首先,从基于特征的同质性角度出发,研究了两种攻击类型的共同影响,该角度描述了节点与其邻居之间的局部特征一致性。深入的理论和实证分析表明,无论触发器机制如何,由GBA引起的后门节点表现出比干净节点更低的基于特征的同质性,表明局部特征相似性存在差异。受此启发,作者提出利用节点级局部特征一致性(通过邻居感知重建损失建模)来区分后门节点与干净节点。然后,开发了一种鲁棒训练策略,以消除触发器影响并减少检测不确定性引入的噪声。大量实验表明,该框架在基于子图和基于特征的攻击下,显著降低了攻击成功率,并保持了有竞争力的干净准确率。

💡 推荐理由: 本文首次系统研究了基于特征的图后门攻击,并提出统一防御框架,填补了现有结构中心防御的空白,对提升GNN在安全敏感场景的可靠性具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hao Yu 0017, Chuan Ma 0001, Xinhang Wan, Jun Wang 0118, Tao Xiang 0001, Meng Shen 0001, Xinwang Liu 0002

图神经网络(GNN)容易受到后门攻击,攻击者通过在原始图中插入触发器使模型输出恶意指定的预测。针对GNN的后门攻击通常聚焦于节点分类任务,可分为脏标签攻击和干净标签攻击两类。现有防御方法往往依赖从其他领域(如图像)借用的强假设,例如在中毒样本上损失快速下降,但面对复杂触发器时效果不佳,且无法同时防御脏标签和干净标签攻击。本文提出DShield,一种基于差异学习机制的综合防御框架。首先,研究发现攻击过程中存在两种关键现象:语义漂移(脏标签攻击改变中毒节点的语义信息)和属性过度强调(干净标签攻击夸大特定属性迫使模型输出恶意预测)。DShield利用自监督学习框架构建不依赖于被操纵标签信息的模型,然后联合使用自监督模型和可能被后门的模型分析语义信息和属性重要性的差异,从而有效过滤中毒节点。最后,DShield在保留的干净节点上训练正常模型,最大程度减少中毒节点的影响。在7个数据集、2个受害模型和21种后门攻击下,与6种最先进防御方法相比,DShield显著降低了攻击成功率。例如在Cora数据集上,DShield将攻击成功率从第二名防御Prune的54.47%降至1.33%,同时在正常节点上保持82.15%的性能。该工作为GNN后门防御提供了新思路,适合研究GNN安全的研究人员阅读。

💡 推荐理由: 图神经网络在社交网络、推荐系统等领域广泛应用,后门攻击威胁严重。现有防御无法同时应对脏标签和干净标签攻击,本文DShield通过揭示语义漂移和属性过度强调现象,提出通用防御框架,对保护GNN应用安全具有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Fatima Z. Abacha, Sin G. Teo, Yuanxiang Wu, Lucas C. Cordeiro, Mustafa A. Mustafa

联邦学习(FL)极易受到后门攻击的影响,恶意客户端会向全局模型中注入特定行为。现有的防御方法在真实世界的非独立同分布(non-IID)数据下存在较高的误报率,会错误地将良性客户端标记为恶意,即使正确识别了对手也会导致模型精度下降。本文提出了一种新颖的后门防御方法FedSurrogate,它通过结合双向梯度对齐过滤与层自适应异常检测来解决这一局限性。FedSurrogate通过方向散度分析识别安全关键层,并在这些层上进行选择性聚类,将检测信号集中到低维子空间中。双向软过滤阶段对受信任的客户端进行筛选以去除残留污染,同时从可疑客户端中救回误报,显著减少了异构条件下的误分类。FedSurcore不直接移除确认的恶意更新,而是用来自结构相似的良性客户端的降尺度替代更新来替换它们,从而在保持梯度多样性的同时中和对抗性影响。大量实验表明,FedSurrogate在所有数据集和攻击类型下将误报率保持在10%以下(最接近的可比较基线为31-32%),同时在具有挑战性的non-IID设置下实现了更高的主任务准确率,并将攻击成功率保持在2.1%以下。

💡 推荐理由: 联邦学习后门防御中误报率过高导致模型精度下降是实际部署的重大障碍,FedSurrogate通过创新方法显著降低了误报率,为安全联邦学习提供了实用方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kealan Dunnett, Reza Arablouei, Dimity Miller, Volkan Dedeoglu, Raja Jurdak

本文研究目标检测模型中的后门攻击防御问题。后门攻击会向深度模型中植入恶意行为,同时保持其在干净数据上的性能,对安全关键的视觉系统构成严重威胁。虽然图像分类领域的后门防御已有广泛研究,但目标检测的防御方法相对不成熟。对抗微调是分类任务中常用的后门缓解方法,但直接迁移到目标检测面临挑战:分类导向的对抗生成与检测攻击空间不匹配(攻击可能导致目标误分类或消失),且标准检测损失会在众多预测中稀释修复信号。本文提出了一种检测感知的对抗微调框架,在防御者仅能访问受损检测器和少量干净数据集、且未知攻击目标的情况下缓解目标检测后门。首先,为了在不需攻击目标知识的情况下生成对抗样本,引入了软分支最小化(soft-branch minimisation),使用软门控组合针对误分类和消失攻击的目标,并结合检测感知的分类损失最大化。其次,针对定向修复,提出了一种对目标匹配预测应用的双目标微调损失,将防御更新集中在与后门行为最相关的预测上。在基于CNN和Transformer的检测器上的实验表明,与分类导向的基线方法相比,该方法在更有效降低攻击成功率的同时保持真实检测性能,并维持了有竞争力的干净检测性能。

💡 推荐理由: 首次系统性地将对抗微调后门防御从分类扩展到目标检测,填补了该领域防御方法的空白,对提升自动驾驶、安防等安全关键视觉系统的鲁棒性具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mengyuan Sun, Yu Li 0006, Yunjie Ge, Yuchen Liu, Bo Du, Qian Wang 0002

本文提出了一种名为InverTune的多模态对比学习后门防御方法。多模态对比学习(如CLIP)易受后门攻击,攻击者可通过在训练数据中注入触发模式,使模型在测试时对带有触发器的样本产生恶意预测。现有防御方法通常假设攻击者仅篡改单模态或依赖干净数据,难以应对实际攻击。InverTune通过后门-对抗相关性分析(Backdoor-Adversarial Correlation Analysis)来检测并抵御后门。具体而言,该方法利用后门触发器与对抗性扰动之间的统计相关性,设计了一种新的训练范式,使模型在对比学习过程中自动抑制后门特征。实验在多个多模态数据集(如Flickr30K、MSCOCO)上验证了有效性,与现有防御相比,InverTune在保持下游任务性能的同时显著降低了后门攻击成功率,且不需要任何干净参考样本。本文主要贡献包括:首次将后门与对抗相关性引入多模态防御,提出无需干净数据的训练框架,以及在多个攻击场景下的鲁棒性验证。

💡 推荐理由: 多模态对比学习(如CLIP)被广泛用于图像检索、视觉问答等关键任务,其后门安全隐患可能被攻击者利用。InverTune提供了一种无需干净数据、通用性强的防御思路,对保护多模态AI系统具有重要实践价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)