#data-watermarking

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Yihao Zheng 0001, Haocheng Xia, Junyuan Pang, Jinfei Liu, Kui Ren 0001, Lingyang Chu, Yang Cao 0011, Li Xiong 0001

本文研究面向机器学习训练所用的表格数据集的版权保护问题,提出名为 TabularMark 的水印方法。传统表格数据水印方法在可检测性、非侵入性和鲁棒性等期望属性上存在不足,并且通常仅从数据统计层面保留数据效用,而忽略了水印对下游机器学习模型性能的影响。为此,作者试图回答一个核心问题:能否在不显著损害表格数据集用于训练机器学习模型效用的前提下,为数据集添加水印,同时防止攻击者在被攻击(含水印)的数据集上训练出可用的机器学习模型?TabularMark 方法的核心贡献在于设计了一种兼顾数据统计效用与下游模型性能的水印嵌入机制,使得合法用户在加水印数据上仍能训练出精度可接受的模型,而未经授权使用该数据的攻击者即便得到数据,也难以训练出有效模型。论文通过实验验证了所提方法在可检测性、数据效用保持、鲁棒性以及对抗训练攻击方面的表现。该研究适合数据隐私保护、数据资产管理、机器学习安全以及模型知识产权保护领域的研究者与工程师阅读,属于数据水印与机器学习交叉方向的前沿探索。由于当前仅获取到论文摘要,无法得知具体实验细节与定量结果,整体判断为一项尚处于研究阶段的方法学成果。

💡 推荐理由: 数据是机器学习的关键资产,表格数据水印若能在保护版权同时不影响模型性能,将帮助企业安全团队识别数据泄露源头并遏制未授权模型训练。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Xin Che, Lingyang Chu, Qiqi Zhang, Xinyu Ma, Xuan Luo, Jian Pei

该论文针对生成式表格数据的水印技术面临的重训练攻击问题,提出了一种具有放射性的水印方法RaMark。现有水印方法在攻击者利用带水印数据集重新训练生成模型后,生成的高效用数据会丢失水印,导致所有权验证失效。RaMark通过将正弦依赖性作为数据分布的内在组成部分嵌入,使水印与底层数据分布耦合,从而确保任何保留数据效用的生成模型也必须保留水印。理论分析表明,移除水印会以高概率降低数据效用并改变数据分布。在两个真实表格数据集上,基于大规模所有权验证场景(包含10^5个独立数据所有者)的实验证明,RaMark在抵抗重训练攻击和数据修改攻击方面显著优于七种最新方法。该研究为隐私敏感数据共享中的所有权保护提供了新途径,适合从事数据安全、生成模型水印研究的学者和工程师阅读。

💡 推荐理由: 首次提出放射性水印概念,从根本上解决了生成式表格数据水印在重训练攻击下失效的问题,强化了数据所有权验证的鲁棒性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)