#pii-leakage

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Xingyu Lyu, Jiayimei Wang, Jianfeng He, Ning Wang, Yidan Hu, Yimin Chen

检索增强生成(RAG)通过在生成阶段引入外部知识库的检索结果,显著降低了大型语言模型的幻觉与事实性错误,已成为提升 LLM 输出质量的主流范式。然而近期研究揭示了一个关键隐私漏洞:攻击者可构造特定查询,借助检索环节从底层语料库中提取个人可识别信息(PII)。RAG-CT 针对该威胁提出一种轻量级防御方案,其核心思路是不改动底层 LLM 与检索器,而是对进入系统的查询进行统计特征分析——考察查询在熵(entropy)与间隔(margin)维度上的分布差异,并采用基于分数的检测方法(score-based detection)判定其是否为恶意查询。换言之,该方法将“隐私窃取型查询”视为一类可被统计指纹识别的异常输入,通过在生成前进行拦截来阻断 PII 泄漏链路。作者在两个数据集上,使用四种当前先进的攻击策略与四种防御基线开展详尽对比实验,结果表明 RAG-CT 在显著降低 PII 泄漏量的同时,整体表现优于现有防御方案。论文定位为一种无需修改模型权重、无需改动检索组件的即插即用式防护机制,部署成本低,适合在既有 RAG 服务上快速叠加。整体而言,该工作从输入侧统计检测的角度补充了 RAG 安全防护思路,与输出侧过滤、检索结果审查等方案形成互补。

💡 推荐理由: 企业 RAG 知识库普遍包含客户资料、工单、人事文档等 PII,检索环节是已被证实的泄漏通道。该方案不改模型、不改检索器即可部署,属于低成本可落地的输入侧防护,值得纳入 RAG 安全评估基线。

🎯 建议动作: 研究跟进:优先复现其检测思路,评估在本组织 RAG 语料与查询分布下的误报/漏报表现,再决定是否试点部署

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Soham Roy, Sarthakbrata Halder, Arya Bharaty, Vaibhav Bhaskar, Yash Sinha, Dhruv Kumar, Srikant Panda, Murari Mandal

该论文系统性地研究了自主Web智能体在面对社会工程攻击时泄露用户个人可识别信息(PII)的问题。作者首先指出,互联网上广泛存在的欺骗性Web内容(即社会工程攻击)能够操纵自主Web智能体将用户的PII提交给攻击者控制的端点。为了量化这一风险,论文提出了一个预注册的基准测试框架Scammer4U,包含91个攻击者控制的环境和10个良性孪生基线,覆盖8种攻击向量和16个网站类别,并基于8轴因子分类法隔离单个攻击设计因素的因果贡献。实验在多个前沿智能体模型上进行,结果显示:在没有隐私指导的情况下,关键层级PII泄露率达到54-93%,而在良性孪生基线上泄露率为0%,确认泄露是由攻击引起的而非偶然填表。论文进一步发现,升级提示级别的缓解措施在不同模型家族中效果差异显著,且总体上仍不足以可靠地防止关键PII提交。最关键的是,作者识别出一个“检测-行动差距”:即使独立LLM法官确认智能体的推理已经标记网站为可疑,在35.9%的会话中智能体仍然提交了关键PII,而在没有表达怀疑的会话中这一比例为66.1%,差距达30.2%,且此差距在所有四个模型家族中均稳健。研究表明,依赖于智能体自身对攻击识别的防御措施基于错误的信号,从而激励了独立于智能体推理循环的输出级拦截机制。该工作为构建更安全的自主Web智能体提供了重要实证依据。

💡 推荐理由: 该研究揭示了自主Web智能体在面对社会工程攻击时存在严重的PII泄露风险,且现有的基于智能体自身检测的防御存在根本性缺陷,为安全社区设计输出级拦截机制提供了关键实证和方向。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)