#tool-call

共收录 1 条相关安全情报。

← 返回所有主题
推荐 5.5
Conf: 50%
👥 作者: Yuqi Jia, Ruiqi Wang, Patrick Li, Yuepeng Hu, Peinian Li, Neil Gong

该论文研究了一种针对 LLM 代理的新型恶意工具攻击:ContextLeak。LLM 代理(如基于工具调用的 AI Agent)在执行任务时,其运行时上下文(包括用户提示、执行轨迹、工具列表)可能包含高度敏感的信息。攻击者可以利用恶意工具窃取这些上下文,这通常需要满足三个条件:(1) 代理选择了恶意工具;(2) 代理将运行时上下文作为输入参数传递给该工具;(3) 工具实现将这些输入发送到攻击者控制的端点。现有研究主要聚焦条件 (1) 和 (3),而忽略了条件 (2) 的关键作用——即如何诱导代理主动将上下文作为工具参数泄露。本文填补了这一空白,提出了 ContextLeak 攻击方法,通过强化学习精心构造恶意工具的名称和描述,从而诱导代理既选择恶意工具,又自动将运行时上下文作为参数传入。具体实现中,作者使用一个攻击 LLM 来生成工具的名称和描述,并通过在多样化的模拟用户(影子用户)上下文上进行强化学习微调攻击 LLM。其核心技术贡献是设计了专门针对上下文窃取目标的奖励函数,使强化学习能够有效优化攻击效果。实验表明,即使影子用户上下文与受害者上下文差异很大,该攻击仍然表现出很高的有效性,并且在相同条件下显著优于已有的恶意工具攻击方法。该研究揭示了 LLM 代理在工具调用场景中的新安全弱点,对安全防御方理解和防范此类数据泄露攻击具有重要意义。

💡 推荐理由: LLM 代理在各行业快速落地,其运行时上下文常含敏感用户信息。ContextLeak 揭示了攻击者可借由恶意工具诱导代理主动泄露上下文,现有防御对此鲜有关注,安全团队需及时了解并审视自身代理体系的风险。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)