推荐 8.5
Conf: 50%
该研究聚焦于分割式大语言模型(Split-LLM)中的数据泄露与防御问题。在隐私敏感场景中,用户面临两难:使用外部API可能泄露隐私数据,而本地部署则计算成本高昂。分割学习(Split Learning)作为一种折中方案,将模型切分,客户端运行部分网络层,服务器端运行其余部分,但这也引入了新的隐私风险。以往工作主要关注输入提示(prompt)的泄露,通常通过对中间表示的逆向攻击实现,而对生成响应(response)中潜在敏感信息泄露的关注较少。本文首先揭示了Split-LLM中的新型漏洞,提出了补丁模型逆向攻击与双端初始化(PIDI),这是一种两阶段攻击方法,同时针对私有输入提示和输出响应。PIDI结合双端初始化和补丁逆向策略来处理长序列,显著优于以往的逆向方法。为抵御来自两端的威胁,作者进一步提出了基于适配器的双端防护与互信息防御(ADMI),它集成了适配器本地预热策略和互信息正则化,在最小影响任务性能的前提下提供了强大的经验隐私保护。在多种任务和模型上的大量实验表明,ADMI能有效防御PIDI及其他最新逆向攻击。该工作揭示了Split-LLM中双向数据泄露的风险,并提出了实用的防御方案,对安全部署大语言模型具有重要参考价值。
💡 推荐理由: 该研究首次系统性揭示分割式大语言模型(Split-LLM)中双向(输入提示与输出响应)数据泄露风险,并提出了有效防御方法,对保护用户隐私、指导LLM安全部署具有直接价值。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)