该研究揭示了一种针对隐形水印的新型规避风险——水印清洗(watermark laundering)。传统上,隐形水印的鲁棒性测试仅针对压缩、模糊、噪声、裁剪、去噪等预定义扰动。然而,公开的基础图像模型(如 OpenAI 和 Google 的图像编辑模型)带来了一种截然不同的威胁:攻击者只需向模型提交一张带水印的图像并给出一个简单的重构提示(reconstruction prompt),模型便会返回视觉上高度保真的输出,但该输出中的隐形水印已无法被可靠解码。作者将这种失效模式形式化为水印清洗,并提出联合载荷-保真度评估框架,结合比特错误率(BER)与视觉/语义保持度进行量化。实验覆盖了六个 OpenAI 和 Google 图像编辑模型、三种代表性水印方案(含 DwtDct)以及 1,800 个重构输出。主要发现包括:OpenAI 模型在多数方案中产生最强的载荷破坏;Nano Banana 2 模型下 DwtDct 在高质量重构中仍显脆弱;消除提示(prompt ablation)表明,无需特定去除指令,单纯的重构路径即可导致水印失效,说明该效果主要来自重构机制而非攻击性措辞;与传统攻击(如加噪、压缩)相比,提示条件重构是一种独立的操作攻击界面。该研究为水印社区提出了新的要求:应将基础模型重构作为隐形水印鲁棒性评估中缺失的一项条件。适合水印技术研究者、AI安全工程师、内容溯源系统设计者阅读。
💡 推荐理由: 基础模型可被用作隐形的“水印清洗器”,只需一条简单提示即能绕过内容溯源机制,威胁版权保护和深度伪造溯源体系。安全团队需意识到传统鲁棒性测试已不足以覆盖现实攻击面。
🎯 建议动作: 研究跟进