#data-governance

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Pengwei Wang, Zihan Wang, Hangcheng Cao, Qingchuan Zhao, Hongwei Li, Guowen Xu

该论文关注的是「人格技能蒸馏」(persona skill distillation)带来的隐私与劳动自主权风险:攻击者可以从个人历史信息(如文本、对话、行为记录)中提取反复出现的行为模式,把它们编码成可复用的技能,从而让 AI 系统高度复现某个特定个人的说话方式、判断风格与行为倾向。作者指出,已有的防御路线以「扰动」为主——即在数据被收集之前由个人对自身数据做扰动、加噪或替换,使蒸馏结果失真。但现实场景往往是 append-only(只追加、不可回溯改写)的:历史记录一旦被第三方或攻击者采集入库,个人就再也无法修改、净化或撤销这些数据,因此扰动类防御在时间线上已经失效,无法适配这种不可逆的采集模式。 为应对这一问题,论文提出 CounterPersona 框架,核心思路由三个环节组成:(1) 构造有针对性的「反人格证据」(targeted counter-persona evidence),即在数据侧注入与目标人格行为相冲突、但语义上自洽的内容,用以稀释和干扰可被蒸馏的一致性模式;(2) 把彼此兼容的行为状态打包成紧凑的「实现单元」(realization units),使反制信号以低冗余、可组合的形式存在,而不是零散、易被过滤的噪声;(3) 通过「理由引导的一致性改写」(rationale-guided consistency rewriting)对这些单元进行强化,使反制证据在语义层面保持前后一致,从而更难被蒸馏器的清洗、去噪或质量过滤步骤剔除。 实验部分,作者开展了较为广泛的评测,覆盖词法层面、语义层面以及基于 LLM 的判定指标,结果显示 CounterPersona 在不同度量下都能取得较强且稳定的防护效果,并且对不同的蒸馏器(distiller)保持稳健,说明该防御不依赖于某一特定模型或特定蒸馏流程的实现细节。论文的整体贡献在于提出了「技能反蒸馏」(skill anti-distillation)这一新范式,把防护重心从「采集前扰动」转向「采集后不可撤回条件下的对抗性证据构建」,为个人隐私与劳动自主权在生成式 AI 时代提供了一条新的技术路径。适合关注 LLM 智能体安全、隐私保护、数据治理以及 AI 对个人劳动替代风险的研究者与安全工程师阅读。

💡 推荐理由: LLM 智能体已能批量克隆个人写作与行为风格,直接冲击隐私与劳动自主权。更关键的是,现实中个人数据一旦被爬走便无法撤回,传统「采集前扰动」防御失效。CounterPersona 提出采集后仍可生效的反蒸馏范式,为蓝队与数据治理提供了新的防护思路。

🎯 建议动作: 研究跟进,并纳入内部 LLM 数据治理与隐私风险评估的候选方案

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Wen Hu, Ya Yu, Xutong Wang

本文针对「云-端协同 LLM 推理」中的隐私取舍问题提出 DR-SL 框架(Dehydrate-Rehydrate with Self-Learning loop,脱水-再水化自学习闭环)。现实困境在于:企业希望把敏感用户数据留在本地,却又想借用云端大模型的推理能力;而既有做法——占位符替换、差分隐私扰动、技能蒸馏——都缺少一个既安全又不显著损失任务效用的「放行决策」。作者将脱敏完备性形式化为两个可度量条件:其一是 Pufferfish 语义下的脱敏充分性,其二是通过 QA 探针衡量的任务信息保真度。系统采用完全本地的双分支验证器,在字典序门控(lexicographic gate)下迭代执行脱水操作,并给出终止性保证;门控之外还设置三层兜底:确定性硬规则红线、外部强攻击者重测、以及人工回退。理论层面,作者证明了 Fano 型下界、Pufferfish 见证(witness)与速率-隐私可行性判据,并明确限定其适用范围——这些界只能证明「发生了泄漏」,不能证明「安全」,且在当前工作点近乎空泛,因此放行安全性实际依赖经验校准、硬规则与人工审核三者。实验方面:在最坏的完全任务耦合基准上,闭环将泄漏率从 0.457 降至 0.304(p 约等于 0,即统计显著);放行链路在出口处实现 0.000 的字面泄漏(160 个实例、两个强攻击者设定),系统按可行性判据预期退化为「认证+路由」模式。在混合耦合基准上,同一安全点在零实测泄漏下自动放行 67.5% 的实例,在相同放行规则下帕累托优于占位符替换与选择性本地差分隐私方案。两项人类研究分别锚定了语义效用指标(Spearman rho = 0.839)与标注金标准(类型级召回不低于 0.987)。作者同时如实报告:探索性的自学习假设未获支持。所有理论界均通过数值验证,代码、合成数据集、协议与人类研究材料全部公开。

💡 推荐理由: 数据出域是云侧 LLM 落地的最大合规障碍。本文给出可度量、可审计的「脱敏-放行」决策框架与三层保障,并诚实说明理论界不等于安全保证,对企业 DLP、数据脱敏网关与隐私合规评审有直接参考价值。

🎯 建议动作: 研究跟进:评估其字典序门控与三层保障结构能否嵌入现有数据脱敏网关,并复现其混合耦合基准上的自动放行率与泄漏率指标

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)