该论文关注扩散语言模型(DLMs)的隐私风险,这类模型作为自回归语言模型的替代方案,具备并行生成与双向上下文建模等优势,但其成员推理攻击等隐私问题尚未被充分研究。作者首先通过扩散训练动力学的理论分析,识别出一种称为“token级记忆不对称性”的现象,并由此设计了一种名为 Q-Skew 的指标,该指标基于分位数加权的偏度统计,用于对微调后的扩散语言模型进行成员推理攻击。实验在多个微调数据集和不同模型上进行,结果表明 Q-Skew 在成员推理任务上优于现有基线方法。此外,作者进一步展示 Q-Skew 还能辅助其他隐私侵犯场景,如个人身份信息提取。该研究揭示了一个此前被忽视的隐私攻击面,并强调了系统化评估扩散语言模型隐私风险的必要性。论文贡献包括:提出并理论验证了 token 级记忆不对称性;设计高效的成员推理指标 Q-Skew;通过实验验证其有效性;并扩展了该方法的潜在应用场景。适合关注生成式 AI 隐私、成员推理攻击和模型安全评估的研究人员阅读。
💡 推荐理由: 扩散语言模型作为新兴范式正被快速采用,但其隐私风险缺乏系统性评估。该研究揭示的成员推理攻击面可导致训练数据泄露,对合规与数据保护构成威胁,安全从业者需关注此类模型的隐私脆弱性。
🎯 建议动作: 研究跟进