#public-data

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Sajani Vithana, Sangwon Jung, Haoyang Hu, Viveck R. Cadambe, Flavio P. Calmon, Haewon Jeong

本文研究了差分隐私(DP)在合成数据生成中的固有权衡:隐私保护与统计保真度之间的矛盾。现有方法虽然利用公共数据来改善这一权衡,但通常仅在预处理(如使用预训练生成模型)或后处理(如匹配从公共数据集估计的目标统计量)中间接使用公共数据,而依赖领域无关的DP机制。本文提出了一个理论框架,将公共数据原则性地整合到DP机制本身中。作者将归一化直方图作为分布估计器,并在特定类别的DP机制内刻画了渐近最优的域感知隐私机制。具体地,他们提出了PubMix,一种公共数据感知的DP机制,可用于基于直方图的数据合成流水线。实验表明,与领域无关的隐私机制相比,PubMix显著提升了合成数据生成的质量。该工作为利用公共数据改进差分隐私合成数据提供了理论基础和实用方法。

💡 推荐理由: 本文首次理论化地将公共数据嵌入到DP机制设计本身,而非仅作为预处理或后处理,为合成数据中的隐私-效用权衡优化提供了新范式,对DP实践者有指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ahmed Mehdi Inane, Vincent Quirion, Gintare Karolina Dzugaite, Ioannis Mitliagkas

本文研究了基于噪声的认证机器学习遗忘问题。现有方法面临一个硬性天花板:为保证遗忘认证所需添加的噪声量通常会严重破坏模型效用,尤其是在大规模删除请求场景下。结合公共数据是差分隐私中缓解这一矛盾的常用技术,但在遗忘领域尚未被充分探索。本文提出非对称朗之万遗忘(ALU)框架,利用公共数据来降低隐私成本。理论证明,注入公共数据能使遗忘成本以 $O(1/n_{\mathrm{pub}}^2)$ 的因子降低,保证了相对于重新训练的计算优势,从而建立了一种新的控制机制:从业者可以通过增加公共数据量来减少高噪声需求及其伴随的效用损失。此外,本文分析了分布不匹配的现实场景,明确刻画了公共与私人源数据之间的分布偏移如何影响效用。实验表明,ALU 能够在模型需要批量遗忘固定比例数据(标准对称方法在此情况下变得不切实际)时保持高效用。基于变分 Rényi 散度与成员推断攻击的实证评估证实,在合理的分布偏移下,ALU 能有效抵御隐私攻击同时保留模型效用。

💡 推荐理由: 为大规模机器学习遗忘提供了一种实用的噪声控制方案,利用公共数据突破效用瓶颈,对隐私法规合规(如GDPR“被遗忘权”)具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)