该论文针对基于扩散模型的文生图模型,提出了一种名为 Nightshade 的提示词特异性投毒攻击方法。研究背景是:扩散模型通常在数十亿张图像上训练,传统的数据投毒攻击往往需要污染近 20% 的训练样本才能生效,因此被认为对这类模型几乎无效。但作者指出两点关键洞察:第一,虽然模型训练数据规模巨大,但针对某一个具体概念或提示词的训练样本数量通常只有数千张,这为针对特定提示词的投毒攻击提供了可行性;第二,投毒样本可以被精心构造以最大化攻击效力,从而用极少量样本实现成功攻击。基于这些洞察,Nightshade 攻击被设计为一种高效能、提示词特异性的投毒方法。实验表明,在 Stable Diffusion 最新模型 SDXL 上,仅用不到 100 个投毒训练样本就能完全控制某个特定提示词的生成输出。Nightshade 生成的投毒图像在视觉上与正常图像几乎无法区分,具有很强的隐蔽性;并且投毒效果可以“渗透”到相关概念,即影响与目标提示词语义相近的生成结果。更重要的是,对多个独立提示词进行中等规模的 Nightshade 攻击,可以破坏模型的整体稳定性,导致模型对所有提示词都无法正常生成图像。论文最后提出,Nightshade 这类工具可以被内容所有者用作防御手段,以对抗那些无视 opt-out 或 do-not-crawl 指令的网页爬虫。文章讨论了该攻击对模型训练者和内容所有者的潜在影响,包括训练方可能面临的供应链风险以及内容所有者可获得的保护能力。该研究主要面向深度学习安全、生成模型安全以及数据治理领域的研究者,也适用于模型训练平台和内容版权方理解并缓解此类威胁。
💡 推荐理由: 该研究表明文生图模型并非对数据投毒免疫,少量高质量投毒样本即可破坏特定提示词乃至整个模型的生成能力,对依赖大规模爬取数据训练模型的公司构成现实供应链风险,也启发内容所有者的新型防御思路。
🎯 建议动作: 研究跟进