#backdoor-attacks

共收录 5 条相关安全情报。

← 返回所有主题
👥 作者: Jacopo Dardini, Claudio Stanzione, Giordano Colò, Giuseppe Fenza

本文针对大语言模型(LLM)后训练量化这一常见优化流程,提出并验证了一种新型后门攻击范式。量化通常被视为语义中立,但在实际工作流中,模型通常先在源精度(如FP16)上完成评估,之后再应用量化并直接部署,这种'验证-部署差距'(validation-deployment gap)为攻击者提供了可乘之机。作者首先形式化定义了量化行为等价类(QBEC),并证明同一QBEC内的模型不一定行为等价,从而从理论上揭示了量化压缩可以触发隐藏行为。在此基础上,提出一种三阶段对抗性微调框架,能够在满足源精度检查的同时,将潜在恶意载荷嵌入模型,使模型在INT8或4比特量化后表现出特定攻击行为。实验选取两个操作场景:战术机器翻译与政治内容分析,覆盖从仅解码器因果语言模型到多语言编码器-解码器序列到序列模型的扩展。结果表明,受后门影响的翻译模型在修复的FP16下友军-敌军腐败率为0%,但量化后最高可导致85.02%的输出反转;配套的立场分类器在压缩后产生ΔBias=0.33的意识形态漂移。跨量化器迁移性分析进一步发现,攻击的持久性取决于具体量化方案与模型架构,而非仅由标称位宽决定。该研究揭示,仅依赖源精度审计无法确保部署后的行为安全,必须将对量化后最终配置的验证纳入行为认证流程,为可信边缘AI部署提供重要警示。

💡 推荐理由: 该研究揭示了大模型量化部署中一个被广泛忽视的安全盲区:基于源精度的安全评估无法保证量化后模型的行为等价。对于依赖量化模型进行边缘部署的团队,这意味着现有验证流程可能无法检出潜在后门,攻击者可在不被察觉的情况下控制模型在特定压缩位宽下的行为,安全影响严重。

🎯 建议动作: 研究跟进与内部评估

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mouhamed Amine Bouchiha, Gregory Blanc, Yufei Han

去中心化联邦学习(DFL)通过点对点模型交换替代中心化参数服务器,旨在实现无需信任的协作学习。然而,这种架构转变从根本上重塑了威胁模型:由于缺乏全局协调的聚合机制,DFL特别容易受到后门攻击的影响——恶意参与者可以在保持干净任务性能的同时植入持久隐藏行为。本文指出,DFL的鲁棒性此前被显著高估。现有研究往往依赖简化的威胁模型、非自适应攻击者、碎片化的评估协议、不一致的通信拓扑以及临时训练配置,导致对DFL安全性的理解不完整。为填补这一空白,作者提出了BackDFL,一个统一基准,用于在现实且自适应的后门攻击下系统评估DFL。通过大量实验,BackDFL揭示了去中心化学习的关键失效模式。结果表明,最先进的拜占庭鲁棒DFL方法以及经过适配的联邦学习后门防御方法,在低至15%的恶意参与率下即宣告失败,尤其在异构环境中表现更差,而其鲁棒性在不同通信图拓扑间存在显著差异。该研究强调,DFL的安全性需结合拓扑、异构性等实际因素重新审视,并为后续防御设计提供可复现的评估框架。适合关注联邦学习安全、鲁棒聚合算法及对抗性机器学习的研究人员和工程师阅读。

💡 推荐理由: 该研究打破了对去中心化联邦学习鲁棒性的乐观假设,证明现有防御在低恶意参与率下即可失效,为蓝队和安全工程师评估分布式学习系统风险提供了关键依据。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Abile Jean, Kuniyilh S

本文研究了针对信息物理系统(CPS)中基于机器学习的故障检测与定位机制的后门攻击。CPS(如智能电网、工业自动化)依赖传感器、计算和控制器实时检测电压波动等故障并执行负载均衡。近年来,深度学习模型被广泛用于异常检测,但它们易受对抗性攻击。后门攻击中,攻击者向训练数据注入恶意模式,使模型在大部分时间表现正常,但遇到特定触发器时输出攻击者控制的结果。作者定义了在CPS故障检测场景下的后门威胁,设计了触发器生成方法,并通过实验验证了攻击有效性,即使只有10%的训练数据被投毒也能成功。论文的主要贡献在于系统性地将后门攻击引入CPS故障检测领域,并展示了其可行性,警示了AI驱动CPS的安全脆弱性。适合CPS安全研究人员、机器学习安全工程师阅读。

💡 推荐理由: CPS是关键基础设施的核心,后门攻击可能导致故障被隐藏或误报,引发电力中断等灾难性后果,安全团队需警惕AI供应链风险。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lei Jiang, Fan Chen

该论文综述了变分量子电路(VQC)中的后门攻击威胁。变分量子算法(VQA)是含噪中等规模量子计算的核心范式,但其依赖预设计和预训练的VQC引入了严重的安全漏洞,特别是后门攻击。这些攻击将隐藏的恶意行为嵌入模型中,在正常情况下保持休眠,但被特定触发器激活后会导致对抗性后果,如错误预测或操纵目标值。论文系统性地梳理了后门攻击的分类,涵盖数据投毒、编译器级别和量子原生机制,形式化了关键术语和威胁模型,并回顾了现有攻击策略及其经验特征。此外,分析了当前检测与防御方法,指出了其局限性,尤其是在应对量子特定威胁方面的不足。通过综合最新进展,论文勾勒了VQC的安全演变格局,并指出了在混合量子-经典系统中开发鲁棒、量子感知防御的关键挑战和未来方向。适合量子计算安全研究人员、VQC开发者和对AI安全感兴趣的读者。

💡 推荐理由: 首次系统梳理量子电路后门攻击,揭示NISQ时代量子机器学习的新威胁面,对量子安全研究具有奠基意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Marte Eggen, Eirik Reiestad, Kristian Gjøsteen, Inga Strümke

本文系统性地研究了现代神经网络中后门攻击的密码学不可检测性问题。传统后门攻击往往依赖特定的触发器模式,且容易被防御机制检测。受近期密码学进展启发,作者提出了一种基于潜在空间方向的攻击框架,将后门通道建模为网络在训练过程中学习的潜在方向。核心创新在于:将不可检测性问题转化为一个假设检验问题——攻击者无需引入外部结构,而是利用网络自身几何中已存在的方向作为后门载体。通过在标准图像分类数据集上对ResNet和Vision Transformer架构进行实验,该方法在保持干净样本精度几乎不下降的同时实现了持续的高攻击成功率,并能抵抗多种主流的后训练防御(如剪枝、微调、神经元清洗等),除非将模型完全破坏。作者进一步从理论上论证,由于模型参数的分布复杂,区分后门模型与干净模型的假设检验在实践中是难解的,从而建立了后门的密码级不可检测性。该工作表明,密码学意义上的后门并非只能用于理论架构,而是现代深度学习模型潜在空间固有几何属性的直接体现,对AI安全领域具有重要的理论推进价值。

💡 推荐理由: 该研究首次在实用级神经网络(ResNet、ViT)上实现了密码学意义上的不可检测后门,挑战了当前多数防御机制的有效性基础。安全团队需认识到潜在空间中的后门可能难以通过统计检测发现,对模型供应链安全、白盒审计提出新课题。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)