#clean-label-backdoor

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Yi Zeng 0005, Minzhou Pan, Hoang Anh Just, Lingjuan Lyu, Meikang Qiu, Ruoxi Jia 0001

本文提出了一种名为 Narcissus 的实用后门攻击方法,属于干净标签(clean-label)后门攻击的新变体。传统后门攻击通过在训练集中注入带有触发器且标签被篡改的数据,使模型在推理阶段将含触发器输入误分类为攻击者指定类别。干净标签攻击则要求注入数据本身标签正确,以绕过人工审查,但现有干净标签方法通常依赖攻击者能够访问完整训练集,这在实际中常因数据来自不同来源(如不同用户的图像)而难以实现。Narcissus 的核心贡献在于,它仅需极少量信息(例如少量样本或类级别的统计信息)即可实施有效攻击,无需完整的训练集访问权限。方法上,它利用模型自身的表征空间或可迁移的特征来构造与目标类别语义一致但包含隐蔽触发器的样本,从而在保持标签正确的前提下诱导模型学习触发器与目标类别的错误关联。实验部分(基于摘要)展示了在多个图像分类基准上的攻击成功率,并强调其实用性:即使攻击者信息受限,仍可对深度学习模型构成现实威胁。该论文主要面向机器学习安全研究者、模型部署者和蓝队人员,帮助理解数据供应链中潜在的后门注入风险,并启发设计更鲁棒的防御机制。

💡 推荐理由: 该研究揭示了干净标签后门攻击在训练数据不可全量访问时依然可行,警示数据众包场景下模型面临的实际投毒风险,促使防御方重新评估数据来源可信度。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)