#watermark

共收录 21 条相关安全情报。

← 返回所有主题
👥 作者: Jian Lou 0001, Chenyang Zhang, Xiaoyu Zhang 0010, Kai Wu 0003

本文提出 PreferCare,这是首个专门针对 LLM 对齐训练中偏好数据集版权保护的水印注入与验证框架。随着 LLM 应用安全性需求日益迫切,对齐训练算法(如 RLHF/DPO 等)依赖大量高质量偏好数据来微调模型,使其行为符合人类价值观。然而,这类数据集的生成与人工标注成本高昂且劳动密集,因此其版权保护至关重要。PreferCare 包含两个阶段:注入阶段和验证阶段。注入阶段设计了基于风格迁移的水印信号和双层水印优化过程,将水印嵌入偏好数据集中,使其不易被察觉且不影响数据质量。验证阶段采用统计检验方法,判断可疑 LLM 是否在未授权情况下使用了含水印的偏好数据集。在多个主流 LLM 上的大量实验表明,PreferCare 在不同设置下具备有效性、无害性、可迁移性和鲁棒性,并能在 20 次查询内成功完成水印验证。该研究为 AI 数据版权保护提供了新思路,尤其适用于保护用于对齐训练的偏好数据不被非法使用。

💡 推荐理由: 为偏好数据集版权保护提供了首个专门方案,填补了该领域空白,对依赖 LLM 对齐技术的企业或研究机构的数据资产保护具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Simone Ceppi, Ignacio Sanchez

该论文提出了一种名为 Stateless Bernoulli Watermarking(SBW)的新型大语言模型(LLM)文本水印方法,旨在以极低的计算开销实现可靠的模型输出标记与检测。与现有方法如 KGW(基于词汇置换和固定大小绿名单)和 SynthID(基于多层锦标赛)不同,SBW 通过独立的逐 token 伯努利试验来确定每个 token 是否属于“绿名单”,无需维护全局置换或状态。其核心创新在于仅需对每个 token 进行一次基于计数器随机数生成器的比较即可完成绿名单判定,将成员复杂度降至 O(1),并支持单内核执行且无中间分配,从而显著提升推理速度。论文证明,该无状态方案在统计上保留了与固定大小绿名单相同的检测保证,即在原假设下 z 分数服从标准正态分布。这一架构还带来了已有方法无法实现的新能力:全词汇自盐(self-salt)水印,其速度比 KGW 的自盐方法快 6000 倍以上,比 SynthID 快 2 倍(尽管因使用候选相关种子而偏置了整个词汇表),并天然兼容分布式推理。在端到端生成基准测试中,SBW 在所有批处理大小下额外开销低于 1%。此外,论文首次提出哈希函数设计是影响水印质量的一个先前未被探索的维度,并展示其提出的 GPU 原生 Jenkins 哈希可将零假设校准提高 1.8 倍,同时生成更多样化的文本。实验涵盖两种种子方案和八种 (γ, δ) 配置,结果表明与现有方法在统计上等价,ROC-AUC 差异低于 0.01。该工作适合研究 LLM 水印、生成内容溯源和模型治理的研究人员阅读。

💡 推荐理由: LLM 文本水印是实现内容溯源与防止滥用(如生成式虚假信息、学术作弊)的关键技术。SBW 显著降低了水印的计算开销,使水印更易在真实生产环境中部署,且其无状态特性为分布式推理和全词汇水印提供了新途径。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Alexandr Goultiaev Tolstokorov, Kyriakos Mouratidis, Javad Dogani, Nikolaos Laoutaris

第三方检索增强生成(RAG)市场带来了新的审计问题:数据提供商将语料库授权给RAG运营商后,无法得知其文档是否被未经补偿地重复使用。由于运营商不合作、生成器会改写答案、且单次响应可能结合多个提供商的证据,审计尤为困难。为此,论文提出DirBucket框架,一种提供商侧的语义水印与黑盒审计方法,用于多提供商RAG中的文档级重用检测。DirBucket通过语义保持的同义改写嵌入水印,使嵌入偏向特定于提供商桶的隐藏方向,从而允许从黑盒答案中检测文档重用,同时保留检索效用。在反映混合提供商重用场景的挑战性基准下,DirBucket是唯一能够始终实现强目标检测且无非目标激活的方法,可在主要基准的每次审计中于23次回答内检测出不合规行为。实验表明,水印可抵抗对抗性后处理清洗,且所评估的逃避策略无法在保持用户感知答案质量的同时有效规避检测。该检测可无修改地迁移到由真实临床、网络威胁情报和法律提供商语料库构建的第二个基准。这些结果表明,嵌入空间水印可以使第三方RAG中的文档重用实现可统计的审计。

💡 推荐理由: 针对RAG服务中数据未经授权重用的审计需求,提供了一套可证明有效的黑盒检测方案,帮助数据提供商和监管者维护数据使用合规性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Ziming Zhao 0008, Zhaoxuan Li, Tingting Li 0004, Zhuoxue Song, Fan Zhang 0010, Rui Zhang 0016

本论文探讨图像水印扰动作为对抗性噪声时,对深度学习模型产生的欺骗威胁。传统对抗样本 (AE) 检测方法通常假设噪声为典型的扰动模式(如 Lp 范数约束),因此面对嵌入水印标志这类结构化噪声时往往失效,即水印扰动 AE 可绕过现有检测。文章提出 Themis,一种无需修改受保护分类器、也不依赖 AE 生成过程的检测方法。Themis 基于可用信息论(Usable Information Theory)计算每个样本的点级得分(pointwise score),利用该得分识别出可能经过水印扰动的异常实例。实验涵盖 5 种不同标志的水印扰动,在图像分类任务上,Themis 的检测准确率比五种 SOTA 检测方法平均提升超过 15%;可视化表明其得分在 AE 与非 AE 之间具有明显可分离性;并且 Themis 在广泛阈值下实现更大的 ROC 曲线下面积 (AUC),显示了良好的阈值鲁棒性。计算开销仅约 0.04 秒,适合近实时应用。由于 Themis 不干扰原分类器,可作为一种外挂式防御组件。本文对该领域的主要贡献在于把可用信息论引入水印对抗样本检测,解决了水印噪声结构化与异质性的难点,并通过对比实验证实了有效性。

💡 推荐理由: 针对水印扰动的 AE 检测是当前防御盲区;Themis 采用可用信息论方法,无需修改模型,检测精度显著优于现有方案,为版权水印场景下的模型安全提供了新工具,值得防御方关注。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jidong Yang, Qi Li, Wei Zong, Yang-Wai Chow, Willy Susilo, Huaike Yu, Chunpeng Wang, Suo Gao

该研究揭示了一种针对隐形水印的新型规避风险——水印清洗(watermark laundering)。传统上,隐形水印的鲁棒性测试仅针对压缩、模糊、噪声、裁剪、去噪等预定义扰动。然而,公开的基础图像模型(如 OpenAI 和 Google 的图像编辑模型)带来了一种截然不同的威胁:攻击者只需向模型提交一张带水印的图像并给出一个简单的重构提示(reconstruction prompt),模型便会返回视觉上高度保真的输出,但该输出中的隐形水印已无法被可靠解码。作者将这种失效模式形式化为水印清洗,并提出联合载荷-保真度评估框架,结合比特错误率(BER)与视觉/语义保持度进行量化。实验覆盖了六个 OpenAI 和 Google 图像编辑模型、三种代表性水印方案(含 DwtDct)以及 1,800 个重构输出。主要发现包括:OpenAI 模型在多数方案中产生最强的载荷破坏;Nano Banana 2 模型下 DwtDct 在高质量重构中仍显脆弱;消除提示(prompt ablation)表明,无需特定去除指令,单纯的重构路径即可导致水印失效,说明该效果主要来自重构机制而非攻击性措辞;与传统攻击(如加噪、压缩)相比,提示条件重构是一种独立的操作攻击界面。该研究为水印社区提出了新的要求:应将基础模型重构作为隐形水印鲁棒性评估中缺失的一项条件。适合水印技术研究者、AI安全工程师、内容溯源系统设计者阅读。

💡 推荐理由: 基础模型可被用作隐形的“水印清洗器”,只需一条简单提示即能绕过内容溯源机制,威胁版权保护和深度伪造溯源体系。安全团队需意识到传统鲁棒性测试已不足以覆盖现实攻击面。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jona te Lintelo, Lichao Wu, Stjepan Picek

大型语言模型(LLM)水印技术为文本溯源提供了机制,使模型所有者能够识别机器生成内容并归属到特定水印模型。然而,现有LLM水印方法主要依赖推理时采样器,且聚焦于密集模型。这类方法仅在文本通过模型所有者受控API显式生成时有效,在模型被窃取或泄露后即失效:一旦攻击者获得模型权重,可完全控制推理并直接运行未修改的采样器,绕过水印,使窃后归属无法实现。针对这一问题,本文提出了“专家水印”(Watermarking of Experts, WoE),一种利用稀疏混合专家(Mixture-of-Experts, MoE)模型独特结构特性的黑盒文本溯源方法。WoE通过偏置特定专家的词汇分布,将水印信号嵌入模型参数内部,而非依赖可绕过的推理封装,从而确保水印与模型参数固有绑定。即使攻击者使用被窃权重、泄露检查点,或从被窃架构蒸馏出次级密集模型,防御者仍可在无需访问攻击者部署环境或权重的情况下,对生成的文本进行归属。研究在8个MoE模型上评估WoE,结果显示在1%假阳性率下,平均真阳性率达90.1%,最高可达94.9%,同时基本保持模型通用能力。此外,WoE在对抗性监督微调、模型提取和输出级释义下仍保持可检测性,迫使恶意攻击者在削弱归属信号时不得不付出额外模型适配或文本重写代价,否则将牺牲输出质量。本文的方法为模型泄露后的文本溯源提供了一种不依赖推理时控制的新范式。

💡 推荐理由: 模型泄露已成为AI安全重大风险,现有水印在权重泄露后失效。WoE首次针对MoE架构实现参数内嵌水印,即使在黑盒场景下也能溯源,为蓝队、SOC和安全工程师提供了一种可落地的模型泄露归属手段,能显著提升AI供应链安全事件的事后取证能力。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Daniele Corradetti

本论文针对语言模型统计水印在语义保持变换下的鲁棒性问题展开理论分析。现有研究通常通过比较改写前后文本的语义相似度(即“端点”度量)来评估改写对水印的破坏程度,但作者指出这种端点度量是错误的统计量。受数学中纤维丛和和乐(holonomy)概念的启发,论文引入“语言循环”(linguistic loops)形式体系,将一次改写视为文本状态空间中的一条路径。通过证明,作者发现任意保持意义的变换链,其不变量可以规范地分解为两部分:一部分是端点相关的贡献,另一部分则来自初始状态稳定子群中的和乐,后者完全无法由语义相似度捕捉。这个和乐对应着嵌入空间中单位球面上的平行移动,从而使得与威尔逊环(Wilson loop)的类比成为一个严格定理。在检测器侧,论文推导出一个精确恒等式:残余的水印统计量正比于那些“播种窗口”完整未被破坏的位置数量,并由此得到衰减定律 ρ^(h+1) 作为独立编辑假设下的推论。该恒等式带来一个令人吃惊的结论,并已通过数值验证到小数点后三位:在相同保留率下,存活信号可能为原始值的一半、四分之一或完全归零,完全取决于编辑落在文本的哪些位置。因此,仅靠保留率无法预测水印存活性,必须考虑编辑的空间分布。该工作为理解语义改写对水印的影响提供了新的几何视角,并指出了设计更鲁棒水印时需要考虑的新维度。

💡 推荐理由: LLM 水印是识别 AI 生成文本与溯源的重要防御技术,而改写攻击是最常见的绕过手段。本论文揭示现有评估方法(语义相似度)的严重缺陷,指出水印存活性不仅与改写程度相关,还关键依赖于编辑位置,直接影响水印方案的安全性评估与设计。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Torsten Krauß, Jasper Stang, Alexandra Dmitrienko

深度神经网络(DNN)在数据采集和训练过程中成本高昂,因此被视为模型创作者的知识产权。未经授权的使用、篡改或窃取可能引发法律纠纷。现有DNN水印方法大多嵌入不可见标记、依赖非直观的算法评估且缺乏人类可理解的属性,并依赖刚性阈值,在部分水印擦除的情况下容易失效。为此,本文提出ClearStamp,这是第一种专为直观人工评估设计的DNN水印方法。ClearStamp嵌入可见水印,使人类能够在不依赖严格数值阈值的情况下做出判断,同时仍支持技术辅助评估。其核心创新在于定义了一种转置模型架构,允许以反向方式使用模型,从而将水印与主任务深度交织在所有模型参数中。相比现有方法,ClearStamp产生的视觉水印易于人类理解,无需复杂验证算法或严格阈值。由于水印嵌入所有参数并与主任务强耦合,该方法表现出卓越的鲁棒性,能够抵抗部分参数修改或模型微调等对抗性操作。实验表明,ClearStamp的8,544比特水印容量可与目前最强的工作相媲美。更重要的是,它的有效性不依赖于特定模型或数据集,在四个数据集和七种网络架构上的全面研究证明了其通用性和对对抗性模型操纵的恢复力。该研究为DNN知识产权保护提供了新的可验证、人类友好的解决方案。

💡 推荐理由: 随着AI模型商业价值提升,模型窃取和未授权复制成为现实威胁。ClearStamp提供可人类直观验证的模型所有权证明,弥补了现有水印依赖隐蔽标记和复杂阈值、易被擦除的短板,为安全审计和知识产权纠纷提供可靠技术支撑,值得模型所有者与防御团队关注。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiaoyan Feng, Yanjun Zhang, He Zhang, Leo Yu Zhang, Shirui Pan

本文针对大语言模型(LLM)生成文本的溯源与篡改检测问题,提出了一种新型互补水印方法。现有水印技术通常对文本编辑具有鲁棒性,能够保持溯源属性,但这种鲁棒性也带来安全漏洞:攻击者可以在保留水印归属的同时对关键内容进行篡改,即所谓的“piggyback spoofing”(搭便车欺骗)。为此,作者设计了一种同时提供溯源证据和篡改证据的水印方案。该方法在每个生成的token中共同嵌入两种信号:一种鲁棒信号和一种脆弱信号。两种信号共享相同的机制(无偏锦标赛重加权),但使用独立的密钥以及不同的基于归一化文本的种子窗口,从而使鲁棒信号对编辑不敏感,而脆弱信号对读者可见的改动敏感。通过多轮无偏锦标赛重加权保持预期的生成分布,并采用周期性的轮次分配模式来调节两种信号之间的权衡。在检测阶段,两种信号的得分构成二维空间,支持三种决策结果:完整(Intact)、被篡改(Tampered)和无水印(No-Watermark)。在两个大语言模型和两个提示数据集上的实验表明,该方法在评估的各类方法中取得了最高的篡改检测率,同时保持了具有竞争力的溯源鲁棒性和困惑度(perplexity)。消融研究进一步证明,可靠的三态检测需要明确定义的“完整性”概念、两种信号的共同嵌入以及对编辑的互补敏感性。本文适合关注LLM内容安全、模型溯源、数据完整性验证的研究人员与安全工程师阅读,为在开放环境中防止内容被恶意篡改同时保留责任归属提供了新思路。

💡 推荐理由: 该研究直接针对LLM输出水印的现有安全缺陷(piggyback spoofing),在不牺牲溯源鲁棒性的前提下实现篡改检测,对AIGC内容完整性验证和责任追溯具有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Tarun Sharma

HaloMark 论文提出了一种针对基础模型嵌入向量的水印方案,解决现有内容溯源机制(如 C2PA)无法直接应用于嵌入向量的问题。C2PA 标准通常与具有稳定位级或感知身份的资产绑定,但嵌入向量在量化、投影、微调和窗口平均等常规操作下会发生形态改变,任何固定哈希都会失效。HaloMark 将水印与 C2PA 清单进行密码学绑定,组合了四个标准原语:块对角正交旋转、公开白化、输入相关的 LSH 承诺和逐向量 nonce,并引入一个关键协议改动:生产者将 LSH 承诺 c 签名到 C2PA 边车中,验证者直接从清单读取 c 而非重新计算。重新计算在白化操作下不可靠(在余弦相似度为 0.96 时,62% 的输入会发生承诺桶翻转),而读取已签名的 c 将验证者分数简化为 T = T_null + beta(A)*epsilon,安全强度归结为单一标量 beta。作者对线性和非自适应攻击者给出了 beta 的严格界,并通过实验刻画了自适应情形。评估场景为攻击者拥有单个密钥下多项式数量的干净/水印配对,且完全可见边车信息,共测试八个基线和十个自适应攻击者(包括去噪自编码器移除)。实验发现十一个编码器在一个经验阈值 eff_rank(Sigma)/d ≈ 0.19 处产生明显分界:高于该阈值时,在完整扫描的三个编码器上,所有预算内攻击的检测 AUROC 保持在 0.98 以上;在其余编码器上,单种子 DAE 移除攻击下 AUROC 仍不低于 0.965;低于该阈值时,所有变体均失败。阈值为何与维度一致仍未解决。在实际部署中,作为 Qdrant 准入过滤器,验证器每次向量处理耗时 284 微秒,边车开销仅 24 字节,并已针对三个 C2PA 参考 SDK 绑定进行了端到端验证。

💡 推荐理由: 嵌入向量是基础模型的核心数据资产,但现有溯源机制无法直接适用。HaloMark 首次将 C2PA 密码学绑定扩展到嵌入向量,为 AI 资产溯源、版权保护和内容鉴真提供了可落地方案,值得安全和 AI 基础设施团队关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

本文研究了扩散模型语义水印系统的一个关键安全漏洞。语义水印被广泛用于保护潜在扩散模型(LDM)生成的图像版权,但其检测流程依赖神经网络,这引入了被植入后门的攻击面。作者提出了 GhostVAE,一种通过在后变分自编码器(VAE)的编码器中植入隐蔽后门的方法,能够可靠地规避语义水印检测。GhostVAE 采用两阶段攻击:首先通过功率谱正则化构造通用触发器,提升触发器的鲁棒性;然后使用参数对齐目标训练带有后门的 VAE 编码器,使其在正常输入下保持原有功能,仅在触发器激活时改变输出。实验覆盖三种最新语义水印方案和三种广泛使用的 LDM,结果表明 GhostVAE 在良性图像上保持了水印检测性能(平均真阳性率 94.4%),同时在触发激活时实现了高效规避(平均攻击成功率 94.6%)。作者还分析了 17 种代表性防御方法,证明 GhostVAE 在输入空间、参数空间和潜在空间均保持隐蔽性。这项研究从根本上削弱了语义水印系统的可信度,强调安全部署语义水印需要端到端的安全考虑,尤其是对神经网络组件的保护。适合 AI 安全研究人员、模型部署工程师和内容保护系统设计者阅读。

💡 推荐理由: 该研究揭示了语义水印系统依赖神经网络组件可能被植入后门,导致版权保护机制失效。对依赖水印追踪 AI 生成内容的安全团队有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Saifur Rahman Tamim, Amir Labib Khan

本文针对各国政府强制要求LLM生成内容添加水印(如欧盟AI法案、加州SB 942)的背景下,检验水印检测结果是否足以作为法庭证据的可靠性。作者选取三种代表性水印方法——KGW、Unigram以及MarkLLM实现的SynthID-Text,依据美国Daubert证据可采性标准以及NIST SP 800-86数字取证流程进行评估。为系统化评估,提出了包含12项标准、3个强制关卡和60分制评分的取证就绪度评分(FRS)框架。攻击向量选用保持语义的释义(paraphrase),因其在法律场景中真实且难以被归为证据篡改。实验对每种方法在15个多样提示下进行了846次有效释义测试,结果显示:KGW和Unigram的初始水印在释义后100%被移除(条件移除率100%),SynthID略好但移除率仍达98.3%。即使在未遭受攻击时,假阴性率已很高:KGW 70%、Unigram 83%、SynthID 80%。SynthID还将5.4%的释义人类文本误标为AI生成,且18.6%的自身纯净水印输出落入不确定死区。三种方法均未满足5项Daubert因素中的2项以上。FRS计分系统虽按设计工作,但无法完全捕捉取证无用性——这一局限对未来框架设计有参考价值。结论是这些配置下的水印方法无法达到法庭要求的证据门槛。

💡 推荐理由: 直接挑战各国AI监管法律(如EU AI Act、加州SB 942)中关于水印“可靠且鲁棒”的假设,揭示水印证据在司法场景下存在根本性缺陷,影响AI内容监管法律的可执行性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiaoyu Li, Zheng Gao, Xiaoyan Feng, Jiaojiao Jiang, Yulei Sui, Jiankun Hu

本文从信息论角度系统分析了生成模型水印的取证能力。传统水印仅用于检测文本是否由机器生成,但本文提出水印还可用于用户归属(识别生成文本的用户)、隐藏载荷提取以及定位编辑后残留部分,这构成了一个“取证阶梯”(forensic ladder)。作者引入信息轮廓ν(t)=I(S;X_t|X_{<t}),该轮廓刻画了每个token关于秘密S(用户身份或载荷)所揭示的信息量。该轮廓的总和决定了归属和提取的样本复杂度,而其分布决定了定位能力;检测则不是由信息量而是由标记分布与无标记分布的距离决定。主要定理:对于统计上无失真的方案,在熵率为h的平稳遍历信源上,归属一个文本到N个用户之一需要Θ(log N/h)个token,这是首个紧致的多用户归属熵率定律(通过精确对齐实现)。自然碰撞计数分析会导致无界过估计;只有通过每个候选者自己的实际惊喜度(realized surprisal)设置阈值的解码器才能达到该速率,同时几乎不错误指责无辜用户。匹配的逆定理使得该定律双向成立。提取ℓ比特载荷需要Θ(ℓ/h)个token。存在两个真实间隙:一个Θ(log N)大小的窗口内,文本可证明是机器生成但无法归属;以及一个足迹-分辨率不确定性原理。在GPT-2、Pythia-410M和Qwen2.5上的实验恢复了预测的常数。

💡 推荐理由: 该工作为生成模型水印的取证能力提供了首个理论框架,界定了检测、归属、提取和定位所需的信息论下界,对安全从业者评估水印方案的实际安全性、设计可审计的生成模型系统具有指导意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Yule Liu, Shuai Liu, Jiaheng Wei, Xinlei He

该论文提出了一种针对视觉-语言-动作(VLA)模型和世界动作模型(WAM)的知识产权保护方法。这类模型正成为通用机器人控制的核心,将原始摄像头输入直接转化为电机指令,通常以黑盒服务形式部署(参数私有化)。由于训练此类模型需要专有数据和大量算力,部署后的模型本身成为宝贵资产。为此,作者提出了基于密钥的潜在来源验证方法,通过在模型生成前注入与常规噪声同分布的密钥化高斯噪声种子,对策略进行指纹标记。指纹注入后,水印动作与正常动作在统计上无异,攻击者无法从输出中检测或移除水印。验证时,所有者以授权方式运行可疑模型,记录机器人执行的动作通道(可能是不完整或后处理的策略输出视图),通过基于梯度的最大后验(MAP)优化恢复种子,检验是否包含密钥,并聚合多个轨迹的评分以判定可疑模型是否属于所有者。该方法在两个机器人套件上的两个代表性模型上进行了评估,实验覆盖了指纹检测、多密钥识别、多种攻击下的鲁棒性及设计原理分析。结果表明,指纹能在任务性能几乎不变的情况下可靠检测,且能抵御输出端移除攻击和权重级修改。

💡 推荐理由: 保护机器人模型的知识产权对商业部署至关重要,该方法开创性地将水印技术引入VLA/WAM领域,提供了一种实用且鲁棒的版权验证方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 10.5
Conf: 50%
👥 作者: Guang Yang, Amir Ghasemian, Fengchen Liu, Zhong Wang, Ninareh Mehrabi, Homa Hosseinmardi

这篇论文针对大型语言模型(LLM)API服务中难以检测的未授权知识蒸馏问题,提出了一种新颖的交互层反蒸馏水印方案。现有防御手段主要在教师模型的输出token层面施加水印,例如绿名单水印、密码学方案或反蒸馏采样,但这些方法容易被攻击者通过改写(paraphrasing)绕过,因为攻击者可以改变输出文本而不损失核心知识。作者主张将水印提升到交互行为层面:在教师模型响应时,通过系统提示注入间歇性的行为标记,例如明确的追问(如“您需要进一步澄清吗?”)、低频词汇变体(如使用不常见的同义词)或声明性重述(如把答案换个说法重复一遍)。无意的蒸馏者会继承这些行为模式,而防御者可以通过黑盒查询,利用经过人类验证的LLM裁判(LLM-as-judge)来审计学生模型是否表现出类似行为。实验中,以Llama-3.3-70B-Instruct为教师,对63个经过LoRA蒸馏的学生模型(涵盖Gemma、OLMo、Qwen等架构)进行了评估,共判断35,343个样本。结果显示,行为水印在不同学生模型上的转移保真度分别为:Gemma 88.9%、OLMo 80.9%、Qwen 45.2%。在非自适应DIPPER改写攻击下,鲁棒性分解为教师自身上限(约66.4%)和学生相对保留率21-112%,其中OLMo的水印保留率甚至超过教师本身。低密度(约20%)的显式和隐式声明性变体在各自家族基线上表现出显著转移。此外,一个N=20的室内实验(预注册拉丁方设计)表明,所有标记变体与基线在利克特量表上的差异均在0.22步以内,统计检验支持假设。该研究提出交互层作为反蒸馏水印的可行设计空间,与token层、模型层和推理轨迹层防御互补。

💡 推荐理由: 该研究为LLM服务提供者提供了检测模型被盗用的新手段,弥补传统输出层水印易被改写攻击绕过的缺陷,对保护模型知识产权和API安全有重要价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Juho Kim, Fei Fang, Tuomas Sandholm

本文首次研究了如何在完美信息扩展式博弈(如国际象棋)中对游戏代理的策略进行水印标记。受大型语言模型(LLM)水印技术(尤其是KGW方案)启发,作者提出了一种适应博弈场景的水印方法:在代理的策略中嵌入隐蔽信息,使得第三方可通过统计检验验证策略来源。该方法通过调整策略分布来嵌入水印,同时保证期望效用损失有界,但可检测性与策略质量之间存在权衡。实验在多种国际象棋引擎上评估,结果表明:水印对策略质量(如胜率)的影响可忽略不计,且仅需少量对局(例如5-10局)即可高置信度检测出水印。该工作为检测在线棋类游戏中的AI作弊(如未经授权使用强AI引擎)提供了技术基础,也拓展了水印技术在博弈领域的应用。核心贡献包括:形式化定义博弈代理水印问题、提出具体实现方案、理论分析效用损失界、以及实验验证有效性和低开销。

💡 推荐理由: 该研究填补了博弈代理水印的空白,为在线游戏平台(如国际象棋)反AI作弊提供了可操作的检测手段,同时为LLM水印技术向更广域智能代理安全拓展奠定了理论基础。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Su Zhang, Junfeng Guo, Heng Huang

该论文提出了一种名为 FedAttr 的新协议,用于在联邦学习(FL)环境下对大型语言模型(LLM)微调过程进行客户端级别的归属分析。传统的基于水印的放射性检测方法已证明在集中式LLM微调中有效,但在联邦学习中面临挑战:联邦学习依赖安全聚合(SA)来保护客户端更新的隐私,这使得检测哪个客户端使用了带水印的数据变得困难。FedAttr 通过配对子集差分机制实现客户端归属,同时不破坏安全聚合的隐私保证和联邦学习性能。协议分三步:首先,通过两次安全聚合查询的差分估计每个客户端的更新;其次,利用差分评分机制通过水印检测器对估计结果打分;最后,使用Stouffer方法跨轮次合并分数。理论分析表明,FedAttr 能产生每个客户端更新的无偏估计,且每轮互信息泄漏量为 O(d*/N)。实验结果显示,FedAttr 在真实数据集上实现了100%的TPR和0%的FPR,在TPR上至少优于所有基线44.4%,在FPR上至少优于19.1%,且仅增加FL训练时间6.3%的额外开销。消融研究证实了其对协议参数和配置的鲁棒性。该工作填补了联邦LLM微调中隐私保护客户端归属的空白,特别适用于数据版权保护场景。

💡 推荐理由: 联邦LLM微调中缺乏客户端级别水印归属方法,FedAttr首次在不牺牲安全聚合隐私的前提下实现高精度归属,为数据版权追溯提供可行方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jiangnan Zhu, Yuntao Wang, Shengli Pan, Yujie Gu

该论文提出了一种名为 Vol-Mark 的新型可逆零水印方法,用于保护远程医疗中 3D 医学体积数据的完整性和所有权。针对医学体积数据在网络共享中面临的数据篡改和未授权复制等安全风险,Vol-Mark 设计了两个核心组件:一是利用对比学习构建的体积特征提取器,能够高效提取具有判别性和稳定性的体积特征,增强对 3D 攻击的鲁棒性;二是引入了立方体差异扩展(c-DE)技术,基于三维整数小波变换将水印比特嵌入到低频系数的邻域体素中,通过扩展立方体内的体素差异来创建嵌入空间,并在提取时采用多数投票机制提高可靠性。该嵌入过程失真低且支持无损移除,从而保持医学体积数据的完整性和诊断精度。Vol-Mark 首先进行完整性验证,再通过假设检验进行所有权验证,以增强在数据篡改或水印移除攻击下的可靠性。实验结果表明,Vol-Mark 在常规、几何和混合攻击下均表现出优越的鲁棒性,在多数攻击场景下准确率(ACC)保持在 0.90 以上,显著优于现有方法。

💡 推荐理由: 医学体积数据是远程医疗的关键资产,其安全共享面临篡改和盗版风险。Vol-Mark 提供了一种可逆零水印方案,既能验证完整性又能在不损伤诊断精度的前提下确权,对保护患者数据和医疗知识产权具有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Cong Kong, Xin Cheng, Zhaoxia Yin, Shuai Li, Jie Zhang, Weiming Zhang

随着垂直领域预训练语言模型(VPLMs)在医疗、金融、法律等专业领域的广泛应用,模型参数和推理能力已成为重要的数字资产。如何实现VPLMs的可追溯版权验证成为一个迫切挑战。现有的版权验证方法主要依赖向模型嵌入后门水印,但这些方法大多需要额外的训练过程,水印嵌入效率低下,且缺乏面向多垂直领域的可扩展设计。针对上述局限,本文提出了VertMark——首个统一的、无需训练且鲁棒的版权水印框架,适用于多个垂直领域的VPLMs。该框架通过一种无训练的参数替换策略,在低频触发令牌与高频领域相关词之间建立隐藏的语义等价关系,从而嵌入带有所有权编码的水印。实验在医疗、金融、法律三大领域的文本理解和文本生成下游任务上验证了VertMark的有效性:它能够实现高效的水印嵌入和可靠的水印验证,同时对模型性能的影响可忽略不计。此外,VertMark对剪枝、量化等多种攻击展现出强鲁棒性,凸显了其实用价值,为VPLMs的版权安全提供了有力保护。本文适合模型提供方、安全研究人员及关注知识产权保护的技术从业者阅读。

💡 推荐理由: 本文提出了一种针对垂直领域预训练语言模型的无需训练、可扩展的水印方案,可有效防止模型被非法复制或滥用,为模型版权保护提供了新的技术手段。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ziming Zhang, Li Li, Guorui Feng, Hanzhou Wu, Xinpeng Zhang

大型语言模型(LLM)因其强大的推理能力被广泛部署于多种场景,但同时也面临被滥用的风险。为了确保模型所有权,通常采用水印技术。然而,现有大多数水印方法仅对模型的输出分布进行表层修改,导致水印容易受扰动或去除。针对这一挑战,本文提出了一种名为冗余思维链(R-CoT)的推理层水印框架,将水印嵌入模型的推理路径中。R-CoT 基于 GRPO(分组相对策略优化)设计了一种双轨迹优化机制,使原生推理路径和水印推理路径能够在共享参数空间内共存,从而将水印内化为一种独特的推理策略。这样一来,水印被嵌入模型稳定的推理路径中,避免了因输出级扰动(如文本后处理、同义词替换等)导致水印失效的问题。实验结果表明,与现有方法相比,R-CoT 在保持高水印有效性的同时具有极强的鲁棒性。在微调等后训练操作下,其真阳性率(TPR)始终保持在 95% 以上,仅出现轻微下降。本文的主要贡献在于:1) 首次在推理层嵌入水印,而非输出层;2) 提出双轨迹优化机制实现水印与原生推理策略的共存;3) 实验证明该方法对微调等操作具有高度鲁棒性。该研究适合 LLM 安全研究人员、模型部署方以及关注知识产权保护的从业者阅读。

💡 推荐理由: R-CoT 提供了一种新型推理层水印方法,相比传统表层水印更鲁棒,能有效防止模型被微调或扰动后水印失效,对 LLM 的版权保护和溯源具有重要实践意义。

🎯 建议动作: 研究跟进

排序因子: 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)

提出SSG方法,通过对数几率平衡的词汇分区提升LLM水印在低熵场景(代码生成、数学推理)下的检测能力。

💡 推荐理由: LLM水印是内容溯源的关键技术,但现有KGW方案在低熵场景下效果差。SSG改进了这一局限,对AI生成内容的版权保护与安全审计具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)