本文研究了一种针对大型语言模型(LLM)的新型训练数据提取攻击。攻击者通过投毒一小部分训练数据,能够诱导模型泄露一条攻击者无法访问的目标记录(例如私有医疗记录或用户对话)。核心洞察是:通过在目标完成点附近重塑模型的局部损失景观,使其成为尖锐的损失最小值,同时抬高周围替代方案的损失,从而迫使模型将该目标记忆为邻域内唯一的低损失解。该攻击无需修改模型架构,且适用于集中式训练和联邦学习场景。实验表明,在纯语言模型上提取成功率达100%,在视觉-语言模型上达90%。此外,虽然差分隐私(DP)训练能够阻止该攻击,但作者提出了一种新型攻击,通过直接探测损失景观来绕过差分隐私保护。该研究揭示了即使在被认为安全的训练设置中,投毒攻击仍可能造成严重隐私泄露,强调了在LLM训练中需要更强大的隐私保护机制。
💡 推荐理由: 该攻击展示了一种新颖的隐私泄露路径:攻击者通过投毒少量训练数据,即可定向提取从未见过的目标数据,且成功率极高。这对使用LLM处理敏感数据的组织构成严重威胁,并揭示了现有差分隐私防御的局限性。
🎯 建议动作: 研究跟进