检索增强生成(RAG)通过在生成阶段引入外部知识库的检索结果,显著降低了大型语言模型的幻觉与事实性错误,已成为提升 LLM 输出质量的主流范式。然而近期研究揭示了一个关键隐私漏洞:攻击者可构造特定查询,借助检索环节从底层语料库中提取个人可识别信息(PII)。RAG-CT 针对该威胁提出一种轻量级防御方案,其核心思路是不改动底层 LLM 与检索器,而是对进入系统的查询进行统计特征分析——考察查询在熵(entropy)与间隔(margin)维度上的分布差异,并采用基于分数的检测方法(score-based detection)判定其是否为恶意查询。换言之,该方法将“隐私窃取型查询”视为一类可被统计指纹识别的异常输入,通过在生成前进行拦截来阻断 PII 泄漏链路。作者在两个数据集上,使用四种当前先进的攻击策略与四种防御基线开展详尽对比实验,结果表明 RAG-CT 在显著降低 PII 泄漏量的同时,整体表现优于现有防御方案。论文定位为一种无需修改模型权重、无需改动检索组件的即插即用式防护机制,部署成本低,适合在既有 RAG 服务上快速叠加。整体而言,该工作从输入侧统计检测的角度补充了 RAG 安全防护思路,与输出侧过滤、检索结果审查等方案形成互补。
💡 推荐理由: 企业 RAG 知识库普遍包含客户资料、工单、人事文档等 PII,检索环节是已被证实的泄漏通道。该方案不改模型、不改检索器即可部署,属于低成本可落地的输入侧防护,值得纳入 RAG 安全评估基线。
🎯 建议动作: 研究跟进:优先复现其检测思路,评估在本组织 RAG 语料与查询分布下的误报/漏报表现,再决定是否试点部署