#purification

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Junghyun Kim, Seunghyun Kim, Jiyoung Woo

本文是团队"Go To Germany"参加ImageCLEF 2026深度伪造检测与生成任务的系统描述,并在官方任务之外额外开展了基于净化的对抗检测研究。在图像生成任务中,作者使用FLUX.1-dev与PuLID进行身份保持的人脸合成,并设计了一种针对12个检测器同时进行的多模型PGD对抗攻击,该攻击集成了DiffJPEG可微压缩环、MI/DI/EoT多种梯度优化策略、自适应权重以及两阶段热启动机制。该攻击使生成图像对组织方检测器逃脱率达90%,对参赛方检测器逃脱率57.6%,最终生成得分为0.4170。在图像检测任务中,作者组合了两种互补检测器:SigLIP+DINOv2用于识别AI生成图像,GenD-DINOv3用于识别人脸操作,通过最大概率集成,在基线深度伪造上达到99.4%的准确率,但在真实图像上产生较高的假阳性率,最终检测得分为0.6986。在官方提交之外,作者自主探索了基于净化的对抗检测方法,比较了三种检测信号家族,并基于共享CLIP ViT-L/14骨干的六个检测器进行了实验。结果表明,在采用中值滤波(median-3)净化后,通过EFFORT检测器使用的原始|Δlogit|(净化前后logit差异绝对值)能够在四种对抗源类型上将对抗输入与干净输入分离,AUROC达到0.81-0.98。这一发现反驳了简单的骨干保留假说(即净化会破坏对抗扰动,从而暴露对抗样本),并揭示了在JPEG质量因子Q70处存在一个尖锐的质量悬崖,当质量低于该阈值时,检测信号会突然崩溃。该研究为深度伪造检测与对抗鲁棒性提供了实证洞察。

💡 推荐理由: 深度伪造检测是防御者面临的重要威胁,本文展示了对抗攻击能显著降低检测器性能,同时发现了一种基于净化logit差异的可靠检测信号,可帮助蓝队构建更鲁棒的Deepfake检测系统,并警惕JPEG压缩等预处理对检测的破坏性影响。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hanrui Wang, Ruihao Zheng, Shuo Wang, Isao Echizen, Xingbo Dong, Zhe Jin

该论文揭示了鲁棒性优化防御(如对抗训练和对抗净化)中存在一种新的安全风险:共享脆弱性。尽管这些防御方法在单独评估时能显著提升模型对对抗样本的鲁棒性,但一旦某一代表性防御被有效攻破,整个同类防御家族可能面临暴露。为了区分真正的可迁移性、失真导致的退化以及复杂攻击的算法增益,作者引入了更严格的仅迁移(transfer-only)协议,并设计了一种简单的自适应攻击 PGDTransfer。此外,他们提出了对抗敏感性图(Adversarial Sensitivity Maps, AdvSMs),用于可视化和量化超过可微分类器的共享对齐,包括随机和非可微防御。实验覆盖了对抗训练的分类器、基于净化的防御以及具有鲁棒视觉编码器的大型视觉语言模型(LVLMs)。结果表明,在每个鲁棒性家族内部存在自然的可迁移性,即使用简单的 PGD 风格优化即可实现迁移,而无需专门的可迁移性攻击设计。风险在净化防御中尤为严重:在 ε=4/255 下,PGDTransfer 在基于滤波、压缩和扩散的净化器上平均迁移攻击成功率达到 80.4%,表明净化防御可能不再提供可靠保护。随着攻击技术的进步,当前更强大的鲁棒性家族也可能面临相同风险。因此,未来防御应将脆弱性多样性和迁移隔离作为安全目标,而非仅优化个体鲁棒性。

💡 推荐理由: 该研究首次系统性地揭示鲁棒性优化防御可能因共享脆弱性而整体失效,颠覆了单纯堆叠鲁棒性指标的防御思路,对安全社区设计新一代不可迁移、异构化的防御策略具有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)