#unlearnable-examples

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Binze Wang, Jinyu Tian, Xingrun Wang, Xiaochen Yuan, Jianqing Li

本文针对深度学习时代数据版权保护面临的两大威胁:未经授权的模型训练(非法利用数据训练模型)和恶意数据泄露(攻击者窃取或泄露受保护数据)。现有方法通常分别使用不可学习样本(unlearnable examples)和数字水印技术,但作者发现简单组合两者会因负面交互效应而失效。为此,论文提出一种新型版权保护机制,称为可逆不可学习样本(Reversible Unlearnable Examples)。该方法的核心思想是:在图像上添加精心设计的扰动,使模型在训练时学习到输入图像中与任务无关的特征,从而无法有效学习原始数据分布,达到防止非法训练的效果;同时,通过双提取器策略(两个不同的水印提取器)消除不可学习扰动对水印提取的干扰,确保合法数据所有者仍能从被扰动图像中提取水印以证明版权。具体实现上,生成扰动时最小化模型输入与输出之间的互信息,以增强扰动的泛化能力。在ImageNet、CIFAR10和Pets三个图像数据集上的大量实验表明,该方法能够提供比现有方法更全面的版权保护,既能有效阻止未经授权的模型训练,又能保证水印的可靠提取。论文还开源了代码。本文适合研究数据安全、模型鲁棒性和版权保护的技术人员阅读,但仅基于摘要,方法细节和实验具体数据需进一步查阅原文。

💡 推荐理由: 深度学习模型的训练依赖大规模数据,数据版权保护成为现实需求。本文提出的可逆不可学习样本机制同时解决防非法训练和防数据泄露两大问题,为数据所有者提供了新的技术思路。

🎯 建议动作: 研究跟进,评估其在对内数据保护场景的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chengshuai Zhao, Pingchuan Ma, Dawei Li, Bohan Jiang, Zhiyuan Yu, Zhen Tan, Huan Liu

本文针对大语言模型(LLM)时代中未经授权数据利用与隐私泄露问题,提出一种名为 TextCloak 的防御框架。现有文本不可学习样本(UEs)方法主要面向情感分析等判别式分类任务,通过注入类别特定的语言线索来破坏模型训练效果,但在 LLM 的开放式生成场景中效果受限。TextCloak 采用强化学习(RL)驱动的生成式策略,将成批的干净文本转换为不可学习样本,同时保持语义保真度和语言自然性。其核心优化算法 GRPO-UE 基于下游微调代理 LLM 的性能下降程度设计奖励信号,并通过组相对策略优化更新生成器参数,形成双层优化,使生成器能够发现超越类别特定线索的通用保护模式。实验在六个公开数据集和九个先进 LLM 上进行,结果表明 TextCloak 能持续削弱未经授权的微调效果,同时保留文本对合法使用的效用。进一步分析验证了该方法在不同模型架构、训练配置和自适应攻击下的迁移性与鲁棒性,展示其作为抵御 LLM 未经授权利用的实际防御手段的广泛适用性。本文适合关注数据版权保护、隐私增强技术及 LLM 安全对齐的研究人员与安全防御者阅读。

💡 推荐理由: 为 LLM 时代的数据所有者提供了一种可证有效的保护机制,能够在不破坏文本自然语义的前提下阻止非法微调,是应对数据滥用与隐私泄露的前沿防御思路。

🎯 建议动作: 研究跟进,评估其作为数据保护层纳入内部数据管线或发布流程的可行性。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)