本文提出 DiffSafeMerge (DSM),解决扩散模型 checkpoint 合并过程中的后门继承问题。在无条件下扩散模型合并场景中,通常假设来自公共仓库的 checkpoint 是良性来源,但攻击者可能发布一个包含休眠后门的恶意 checkpoint。当它与良性模型合并后,生成的图像在常规条件下表现正常,但一旦遇到特定触发器,就会产生攻击者指定的目标输出。由于防御方不知道哪个源是恶意的、触发器形状或目标类别,直接对合并后的模型进行广泛消毒(sanitization)又可能显著降低生成图像质量,因此缓解十分困难。DSM 的核心理念是:仅使用一个小的未标记干净数据集和一组固定的、与具体攻击无关的“压力探针”,对参与合并的源模型各个层块(blocks)进行评分,识别出可疑贡献;然后将其权重向一个可信的参考模型收缩,并在一个干净去噪损失预算的约束下选择衰减强度,从而在不破坏正常生成能力的前提下削弱后门。论文评估了四种不同的后门攻击、两个数据集和 21 个目标条件。结果表明,在 14 个源案例中,有 10 个案例的预期合并操作本身就已实现 worst-target ASR(最差目标攻击成功率)为零;DSM 能够保持这些良性结果,在其余 4 个案例中,三个不同随机种子下都没有记录到任何目标匹配,其中包括三个基线 ASR 高达 48%–100% 的案例。与在两个数据集上均能达到零 worst-target ASR 的其他防御方法相比,DSM 在 seed-0 的匹配比较中获得了最低的案例平均 FID,说明其在防御后门的同时保持了最好的生成质量。该研究面向模型供应链安全、扩散模型安全以及 AI 模型可信赖部署方向,适合模型安全研究员、ML 系统防御者和安全工程师阅读。
💡 推荐理由: 扩散模型合并已成为基础模型供应链中的常见操作,但也引入了隐蔽后门注入风险。DSM 提供了无需知道恶意源、触发器或目标的缓解思路,对保护模型集成流程有直接参考价值,可迁移到其他生成模型合并场景。
🎯 建议动作: 研究跟进