本文是团队"Go To Germany"参加ImageCLEF 2026深度伪造检测与生成任务的系统描述,并在官方任务之外额外开展了基于净化的对抗检测研究。在图像生成任务中,作者使用FLUX.1-dev与PuLID进行身份保持的人脸合成,并设计了一种针对12个检测器同时进行的多模型PGD对抗攻击,该攻击集成了DiffJPEG可微压缩环、MI/DI/EoT多种梯度优化策略、自适应权重以及两阶段热启动机制。该攻击使生成图像对组织方检测器逃脱率达90%,对参赛方检测器逃脱率57.6%,最终生成得分为0.4170。在图像检测任务中,作者组合了两种互补检测器:SigLIP+DINOv2用于识别AI生成图像,GenD-DINOv3用于识别人脸操作,通过最大概率集成,在基线深度伪造上达到99.4%的准确率,但在真实图像上产生较高的假阳性率,最终检测得分为0.6986。在官方提交之外,作者自主探索了基于净化的对抗检测方法,比较了三种检测信号家族,并基于共享CLIP ViT-L/14骨干的六个检测器进行了实验。结果表明,在采用中值滤波(median-3)净化后,通过EFFORT检测器使用的原始|Δlogit|(净化前后logit差异绝对值)能够在四种对抗源类型上将对抗输入与干净输入分离,AUROC达到0.81-0.98。这一发现反驳了简单的骨干保留假说(即净化会破坏对抗扰动,从而暴露对抗样本),并揭示了在JPEG质量因子Q70处存在一个尖锐的质量悬崖,当质量低于该阈值时,检测信号会突然崩溃。该研究为深度伪造检测与对抗鲁棒性提供了实证洞察。
💡 推荐理由: 深度伪造检测是防御者面临的重要威胁,本文展示了对抗攻击能显著降低检测器性能,同时发现了一种基于净化logit差异的可靠检测信号,可帮助蓝队构建更鲁棒的Deepfake检测系统,并警惕JPEG压缩等预处理对检测的破坏性影响。
🎯 建议动作: 研究跟进