深度伪造(deepfake)检测器普遍面临基于迁移的黑盒攻击威胁:攻击者在一个本地替代模型(source surrogate)上构造对抗样本,再直接投放到未知的目标检测器(target)上,从而在不接触目标模型的情况下实现绕过。然而,源模型与目标模型之间的“兼容性”如何决定迁移成功率,此前一直缺乏系统认识——已有研究往往只评测少量检测器,且很少把网络结构因素与训练因素(预训练方式、训练数据)分离开来。本文针对这一问题开展受控评测:作者构建了覆盖 60 个检测器、6 种骨干网络、2 种预训练范式、5 种训练数据配置的评测矩阵,并采用两种攻击流程——AutoAttack(AA)与带期望变换的 Carlini–Wagner 攻击(CW–EOT)——进行成对(pairwise)迁移测试。匹配对照结果显示,当源与目标共享完全相同的骨干、同一架构家族、同一预训练范式或同一训练数据时,迁移成功率显著更高;而且这种兼容性结构依赖于攻击方式:AA 下“骨干完全相同”的增益最大,CW–EOT 下“共享预训练”与“共享训练数据”的影响最大。在跨所有非目标源取平均时,AA 的平均攻击成功率(ASR)为 7.21%,CW–EOT 为 19.52%;但若使用一个同时整合两种攻击的多源 oracle,在排除骨干与训练数据完全匹配的组合后,平均 ASR 仍可达 64.48%。这说明仅按单一源模型平均得到的 ASR 会严重低估目标模型的真实脆弱性。作者同时公开了 24 万张对抗扰动图像、完整的成对迁移结果、各检测器配置以及评测代码,并据此提出:源—目标兼容性与源模型选择,应当成为基于迁移的黑盒鲁棒性评测中不可回避的核心维度。
💡 推荐理由: 它提醒防御方:单源平均 ASR 会系统性低估检测器真实脆弱性,鲁棒性评测必须纳入源模型选择与源—目标兼容性维度,否则结论不可信。
🎯 建议动作: 研究跟进,并纳入内部 deepfake 检测器鲁棒性评估流程