推荐 3.5
Conf: 50%
本论文针对潜在扩散模型(LDM)中语义水印的黑盒伪造攻击进行了重新思考。此类水印通过将信息嵌入到LDM的初始噪声中,但现有研究显示其在黑盒场景下易受伪造攻击,且缺乏对攻击成功条件的严格理论理解。为弥补这一空白,作者从潜在空间中的率失真理论视角出发,分析了伪造攻击的本质。研究发现,由于代理模型与目标模型之间存在结构不匹配,会产生一个不可约的失真下限,这从根本上限制了伪造水印的保真度。进一步,作者将这种失真表征为潜在流形上的结构化几何偏差,包括全局漂移和局部变形,而非随机噪声。基于这些洞察,作者提出了一种与具体方案无关的检测方法,能够在执行水印验证之前区分伪造样本。大量实验表明,该方法在多种黑盒场景下均有效,同时对常见失真保持鲁棒性。该工作为理解语义水印的安全性与设计可泛化的防御机制提供了理论依据。
💡 推荐理由: 语义水印是保护LDM生成内容版权的关键技术,但黑盒伪造攻击威胁其可靠性。本文提出的检测方法能有效识别伪造,对数字水印安全防御具有直接价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)