#context-leakage

共收录 2 条相关安全情报。

← 返回所有主题
推荐 8.6
Conf: 50%
👥 作者: Prince Jha, Samuele Poppi, Nils Lukas

本文研究 Agentic AI 系统在推理时处理敏感数据(如医疗记录、金融文档)时面临的隐私泄露问题。与以往主要关注通过越狱攻击直接诱导模型泄露敏感内容的研究不同,本文首次系统化地研究了 Agent 自身的工具调用所组装出的隐藏上下文(hidden context)的泄露风险。作者通过安全游戏的形式形式化了上下文推断攻击(context-inference attacks),并设计了三种攻击场景:已知上下文、未知上下文以及由 Agent 通过自身工具检索得到的上下文,以反映攻击者知识逐渐减少且上下文传递变得间接的现实情况。他们还区分了灰盒设置(使用目标模型本身对观测结果打分)和黑盒设置(攻击者使用自己控制的替代模型打分)。实验针对一个具备网页浏览能力的 Agent 模型,在基线防护措施(不泄露上下文的指令、logit 抑制、上下文稀释)下,发现该 Agent 仍然可被利用:在已知上下文的小规模候选中,攻击成功率(ASR)达 100%,1024 候选时也有 63%;当模板和周围记录未知时,AUROC 为 78.9;当 14B 替代模型对 32B 目标模型打分时,AUROC 达 92.5;而当记录通过 Agent 的检索返回时,AUROC 仍达 81.8,远超随机基线(1/|Z| 和 50)。论文进一步刻画了泄露随查询预算、上下文大小和目标模型规模的变化规律,且发现同一攻击无需修改即可贯穿所有三种设置。该工作揭示了 Agentic AI 在数据组装流程中存在可被利用的侧信道信号,对安全社区理解与防御此类新型隐私威胁具有重要参考价值。适合关注 LLM 隐私、可信 AI 和安全攻防的研究人员及工程团队阅读。

💡 推荐理由: Agentic AI 正被用于处理敏感数据,但现有防护措施无法阻止上下文推断攻击。该攻击不依赖越狱,可在黑盒条件下以替代模型实现高精度泄露,为安全评估和隐私防护带来全新挑战。

🎯 建议动作: 研究跟进并评估自身 Agent 服务的上下文泄露风险

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Jaiden Fairoze, Neal Mangaokar, Kamalika Chaudhuri, Sanjam Garg, Saeed Mahloujifar

本文研究了语言模型在上下文中持有敏感用户数据(如日历、凭证、健康记录和财务信息)时发生的意外信息泄漏问题。作者首先探索了这样一个核心问题:即使模型正确拒绝了直接的秘密提取请求,秘密在上下文窗口中的存在是否会在模型的良性输出中引入隐藏相关性,从而允许攻击者重建秘密。随后,他们进一步研究了攻击者能否主动构造提示来放大这种效应,利用模型作为隐蔽载体,通过看似无害的文本传输敏感信息。为此,作者提出了一种新颖的自适应攻击方法,该方法假设对底层模型具有黑盒访问权限。通过在八个专有模型上进行的受控实验,他们发现模型在响应普通、非对抗性请求时,能够以接近完美的准确率重建2位数字的上下文秘密,并以82%的精确匹配率重建4位数字的秘密。此外,实验观察到更有能力的模型泄露更多信息:更强的指令遵循能力放大了对上下文秘密的敏感性,这表明该泄漏是模型能力提升的副产品,而非可简单修补的缺陷。作者进一步展示了该泄漏在实际中的两种攻击场景:(1)训练一个分类器,从常规自然语言输出中推断用户记忆的语义谓词(如健康状况、财务事件);(2)使用强化学习训练的对抗者,从生产风格的代理中提取完整的美国社会安全号码。本文的贡献在于揭示了一种新的、隐蔽的隐私泄漏通道,并证明了其对基于LLM的代理系统构成严重威胁。该研究适合所有关注LLM安全、隐私保护以及AI代理可靠性的研究人员和从业者阅读。

💡 推荐理由: 该研究揭示了LLM代理在处理敏感上下文时存在新的隐私泄漏风险,即使模型输出看似正常文本也可能泄秘密。这直接影响所有被授权访问用户隐私数据的AI代理应用,将隐私风险评估提升到新的高度。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)