本论文探讨图像水印扰动作为对抗性噪声时,对深度学习模型产生的欺骗威胁。传统对抗样本 (AE) 检测方法通常假设噪声为典型的扰动模式(如 Lp 范数约束),因此面对嵌入水印标志这类结构化噪声时往往失效,即水印扰动 AE 可绕过现有检测。文章提出 Themis,一种无需修改受保护分类器、也不依赖 AE 生成过程的检测方法。Themis 基于可用信息论(Usable Information Theory)计算每个样本的点级得分(pointwise score),利用该得分识别出可能经过水印扰动的异常实例。实验涵盖 5 种不同标志的水印扰动,在图像分类任务上,Themis 的检测准确率比五种 SOTA 检测方法平均提升超过 15%;可视化表明其得分在 AE 与非 AE 之间具有明显可分离性;并且 Themis 在广泛阈值下实现更大的 ROC 曲线下面积 (AUC),显示了良好的阈值鲁棒性。计算开销仅约 0.04 秒,适合近实时应用。由于 Themis 不干扰原分类器,可作为一种外挂式防御组件。本文对该领域的主要贡献在于把可用信息论引入水印对抗样本检测,解决了水印噪声结构化与异质性的难点,并通过对比实验证实了有效性。
💡 推荐理由: 针对水印扰动的 AE 检测是当前防御盲区;Themis 采用可用信息论方法,无需修改模型,检测精度显著优于现有方案,为版权水印场景下的模型安全提供了新工具,值得防御方关注。
🎯 建议动作: 研究跟进