本文研究 LLM 智能体(Agent)在使用基于知识的工具(如文件、数据库、搜索索引)时面临的一类新型安全风险:工具介导的知识提取(tool-mediated knowledge extraction)。当 Agent 为了回答用户提问调用目标工具并获得源内容后,攻击者只需通过精心构造的查询序列,就可能从 Agent 的输出中逐步重建目标工具背后的完整知识源,造成数据泄露。作者指出工具调用环节存在两个核心挑战:一是工具选择不确定性,Agent 可能根据模糊查询调用竞争工具而非目标工具,影响提取效率;二是工具参数压缩,Agent 生成调用参数时会丢失细粒度查询信息,导致提取不完整。针对上述挑战,作者提出 ToolSiphon——一种仅基于查询交互的黑盒提取攻击方法,包含两个互补信号:目标判别信号通过“工具对比分析”不断修正查询方向,使其更多落在目标工具上;响应支撑事实信号通过“证据链反馈”利用上下文中的事实信息缓解参数压缩,并逐步扩大提取覆盖面。实验覆盖三类基于知识的工具和六个领域数据集,结果表明:在提供非目标工具粗粒度信息时,ToolSiphon 平均可恢复 74.3% 的源记录(文本恢复率 83.2%,语义相似度 90.2%);即便没有该信息也能恢复 66.3% 的源记录。此外,该方法对代表性防御措施仍然有效,并在三个真实智能体平台上得到了验证。该工作首次系统性地刻画了工具调用引起的知识提取风险,为 LLM Agent 的安全设计提供了重要警示。
💡 推荐理由: LLM Agent 正广泛集成私有数据工具,此项研究揭示仅通过自然语言查询即可从 Agent 输出中萃取后端知识源,威胁数据保密性与合规性;防御者需重新审视工具调用边界与输出管控。
🎯 建议动作: 研究跟进:阅读论文全文,评估自身 Agent 工具链的可提取性,设计针对性的输出过滤与查询管控方案。