#semantic-watermark

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Abdulrahman Diaa, Jonathan Petit, Florian Kerschbaum

本文研究大语言模型(LLM)生成文本的语义水印技术及其鲁棒性。现有语义水印将标记绑定到句子语义而非具体词元选择,理论上能抵抗改写等保留内容的编辑。但攻击者提供给检测器的文本可能经过改写、重排序或重新分段,这些操作都会导致嵌入位移——检测时使用的嵌入与嵌入水印时选择的嵌入不一致,从而使水印丢失。作者提出一种自适应的嵌入位移攻击(EDA),将改写、重排序和重新分段统一在一个优化目标下,最大化嵌入位移。该攻击仅需公共释义模型和代理编码器,无需访问提供方的生成器或秘密密钥。在 5% 误报率(FPR)和内容保留阈值 q=90% 下,EDA 在四个现有方案上成功移除水印的比例在 32.6% 到 47.9% 之间,是所有测试攻击中成功率最高的,证明比被动释义更能全面评估方案的鲁棒性。为应对这些漏洞,作者设计了 k-SwordStamp:一种基于子句单元的顺序鲁棒检测语义水印方案,通过降低对攻击者选择结构的敏感性,仅以较小的质量代价换取鲁棒性。实验表明,针对 k-SwordStamp 的最强无盒攻击(一种适配其设计的 EDA 变体)成功率仅为 10.8%;而能访问提供方检测器和秘密密钥的更强 EDA 成功率也仅达 39.7%,远低于对 k-SemStamp 的 65.5%。代码已开源。本文适合关注 LLM 内容溯源、水印稳健性和对抗攻击的研究人员及安全工程师阅读。

💡 推荐理由: 该研究首次系统揭示语义水印在重排序和重分段下的脆弱性,并提出了更强的攻击与更鲁棒的方案,对 LLM 内容溯源和防伪造有直接指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Cheng-Yi Lee, Yichi Zhang, Yuchen Yang, Chun-Shien Lu, Jun-Cheng Chen

本论文针对潜在扩散模型(LDM)中语义水印的黑盒伪造攻击进行了重新思考。此类水印通过将信息嵌入到LDM的初始噪声中,但现有研究显示其在黑盒场景下易受伪造攻击,且缺乏对攻击成功条件的严格理论理解。为弥补这一空白,作者从潜在空间中的率失真理论视角出发,分析了伪造攻击的本质。研究发现,由于代理模型与目标模型之间存在结构不匹配,会产生一个不可约的失真下限,这从根本上限制了伪造水印的保真度。进一步,作者将这种失真表征为潜在流形上的结构化几何偏差,包括全局漂移和局部变形,而非随机噪声。基于这些洞察,作者提出了一种与具体方案无关的检测方法,能够在执行水印验证之前区分伪造样本。大量实验表明,该方法在多种黑盒场景下均有效,同时对常见失真保持鲁棒性。该工作为理解语义水印的安全性与设计可泛化的防御机制提供了理论依据。

💡 推荐理由: 语义水印是保护LDM生成内容版权的关键技术,但黑盒伪造攻击威胁其可靠性。本文提出的检测方法能有效识别伪造,对数字水印安全防御具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)