本文提出SurrogateShield,一种客户端代理框架,旨在解决用户与第三方大型语言模型(LLM)API交互时的隐私泄露问题。当用户查询包含个人可识别信息(PII)时,传统方法采用占位符删除(Placeholder Redaction),这会破坏语义连贯性,导致查询质量下降。SurrogateShield在传输前将检测到的PII替换为本地生成的、类型一致的替代值,并在响应中恢复原始值,确保没有真实PII离开用户设备。检测采用三级级联架构:PatternScan(基于模式)、EntityTrace(实体追踪)和ContextGuard(上下文防护),覆盖22种PII类型及基于Sweeney的k-匿名框架的准标识符组合。替代值与原始值的映射存储在AES-256-GCM加密的每会话ShadowMap中,且该映射从不离开设备。实验基于1,124条查询语料库,级联检测整体F1得分为98.87%。在语义效用方面,替代替换显著优于占位符删除,BERTScore(roberta-large)从81.59%提升至94.85%,提高13.26个百分点。在100条查询的对抗试验中,提示LLM对手无法从替代消息中恢复原始值。该研究适用于任何使用外部LLM API的场景,尤其适用于处理敏感数据的应用程序。
💡 推荐理由: 该研究解决了LLM调用中PII泄露的核心痛点,提出了一种实用、高效的客户端代理方案,兼顾隐私保护与语义质量,对安全从业者具有重要参考价值。
🎯 建议动作: 研究跟进