推荐 5.6
Conf: 50%
直接偏好优化(DPO)已成为利用人类偏好数据对齐大语言模型(LLM)的标准方法。每个 DPO 样本包含一个提示(prompt)和一对候选模型回复,而回复之间的相对偏好往往反映标注者或终端用户的主观判断,可能揭示其敏感属性。现成的隐私保护方法与 DPO 的数据结构不匹配,通常导致不必要的噪声注入和训练偏差。本文形式化定义了'偏好隐私'(preference privacy),一种标签差分隐私(label-DP)风格的隐私概念,仅保护候选回复之间的相对偏好,同时假设攻击者已经掌握提示和回复内容。基于这一概念,作者设计了 PrivDPO,一种在保持与大规模 LLM 训练兼容的同时强制执行偏好隐私的 DPO 变体。核心观察是:对于仅在偏好信号上不同的相邻样本,其梯度差异位于一条由文本决定的单维偏好轴上,所有偏好信息都通过该轴流动。PrivDPO 通过无偏随机重缩放 DPO 目标,仅沿该轴添加校准随机性,从而避免逐样本梯度操作。实验在三个对齐基准和三个 LLM 家族上进行,结果表明 PrivDPO 较之隐私保护基线持续取得了更强的隐私-效用权衡。该研究为 LLM 对齐中的偏好数据保护提供了理论严谨且可扩展的解决方案,适合关注隐私增强型 AI 技术的研究者与实践者。
💡 推荐理由: LLM 对齐依赖人类偏好数据,但偏好本身可能泄露敏感信息。现有隐私方法无法兼顾精度与效用,PrivDPO 提供精准的偏好级隐私保护,为安全团队评估和构建隐私合规的对齐流程提供了新思路。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)