本文研究 Agentic AI 系统在推理时处理敏感数据(如医疗记录、金融文档)时面临的隐私泄露问题。与以往主要关注通过越狱攻击直接诱导模型泄露敏感内容的研究不同,本文首次系统化地研究了 Agent 自身的工具调用所组装出的隐藏上下文(hidden context)的泄露风险。作者通过安全游戏的形式形式化了上下文推断攻击(context-inference attacks),并设计了三种攻击场景:已知上下文、未知上下文以及由 Agent 通过自身工具检索得到的上下文,以反映攻击者知识逐渐减少且上下文传递变得间接的现实情况。他们还区分了灰盒设置(使用目标模型本身对观测结果打分)和黑盒设置(攻击者使用自己控制的替代模型打分)。实验针对一个具备网页浏览能力的 Agent 模型,在基线防护措施(不泄露上下文的指令、logit 抑制、上下文稀释)下,发现该 Agent 仍然可被利用:在已知上下文的小规模候选中,攻击成功率(ASR)达 100%,1024 候选时也有 63%;当模板和周围记录未知时,AUROC 为 78.9;当 14B 替代模型对 32B 目标模型打分时,AUROC 达 92.5;而当记录通过 Agent 的检索返回时,AUROC 仍达 81.8,远超随机基线(1/|Z| 和 50)。论文进一步刻画了泄露随查询预算、上下文大小和目标模型规模的变化规律,且发现同一攻击无需修改即可贯穿所有三种设置。该工作揭示了 Agentic AI 在数据组装流程中存在可被利用的侧信道信号,对安全社区理解与防御此类新型隐私威胁具有重要参考价值。适合关注 LLM 隐私、可信 AI 和安全攻防的研究人员及工程团队阅读。
💡 推荐理由: Agentic AI 正被用于处理敏感数据,但现有防护措施无法阻止上下文推断攻击。该攻击不依赖越狱,可在黑盒条件下以替代模型实现高精度泄露,为安全评估和隐私防护带来全新挑战。
🎯 建议动作: 研究跟进并评估自身 Agent 服务的上下文泄露风险