#tool-use

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Bingzheng Wang, Xiaoyan Gu, Wentao Wang, Xingyou Yang, Hongcheng Li, Rong Yin

该论文关注 LLM Agent 在调用外部工具时面临的间接提示注入(Indirect Prompt Injection, IPI)风险:由于 Agent 需要读取网页、文件、API 返回等外部内容,攻击者可将恶意指令埋入这些工具输出中,诱导 Agent 执行非预期动作。作者指出,现有防御思路各有局限:提示加固(prompt hardening)容易被自适应攻击绕过;内容过滤往往会过度清洗外部内容,破坏正常任务所需信息;预生成计划难以应对动态、复杂的多步任务;权限约束则牺牲了执行灵活性。因此核心难题是:如何在不限制 Agent 正常规划自由度的前提下,精准定位并仅移除真正诱发不安全动作的那部分恶意内容,从而兼顾安全性与任务效用(security-utility trade-off)。为此作者提出 ActGuard,一个“执行前动作审计”框架。其关键设计是不再判断外部内容本身是否可疑,而是判断该内容是否使当前动作偏离“局部合理预期”。具体而言:在每一步,ActGuard 先预测即将执行的动作可能调用的工具集合,构建一个“局部工具先验(local tool prior)”,该先验不约束实际执行轨迹;随后在执行前将候选动作与该先验进行比对,开展工具级别的对比分析(tool-level contrastive analysis)与参数级别的证据定位(parameter-level evidence localization),以识别工具选择和动作参数上的偏离;最后由一个验证器(verifier)审查被定位到的证据,只对确认恶意的文本片段进行掩码,并基于净化后的上下文重新生成动作。这种“先审计、再最小化清洗、后重生成”的流程既保留了合法的规划灵活性,又避免了无差别过滤带来的信息损失。作者在面向工具使用型 Agent 的挑战性基准上进行了评估,结果显示 ActGuard 能将攻击成功率降至与当前最先进防御相当的水平,同时使任务效用接近无攻击场景,取得了较好的安全—效用平衡。代码已公开于 GitHub 仓库 binzhwang/ActGuard。该工作属于防御方法类研究,适合关注 Agent 安全、提示注入防护与 LLM 系统鲁棒性的研究者和安全工程师阅读。

💡 推荐理由: Agent 通过工具读取外部内容已成为 IPI 的主要入口,而现有过滤/加固方案普遍存在“要么被绕过、要么过度清洗伤效用”的两难。ActGuard 提出的执行前动作偏离审计与最小化证据掩码思路,为企业级 Agent 部署提供了可参考的安全—效用平衡范式。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Md Habibur Rahman, Jaeho Kim

本文研究工具型 LLM 代理在面对间接提示注入攻击时的防御失效问题。所谓间接提示注入,是指代理在读取攻击者控制的网页内容时,这些内容可能诱使代理泄露其持有的机密信息。作者在安全合成实验室环境中(包含金丝雀机密、模拟工具以及匹配的干净/投毒指标)发现了“框架缺口”(framing gap):在六个模型上,十种显式注入类别均被拒绝(gpt-4o 拒绝率为 0%),但将相同的泄露行为重新包装为必须的完整性签名、配置字段或外观可信的“受信任”主机时,gpt-4o 的失败率从 0% 升至 100%。该攻击成本低廉,其成本分为三个层级:对已知机制进行改写是微不足道的(3 种措辞下成功率为 96%);在已知有效模板内交换字段也较为廉价(成功率最高 60%);而围绕新机制创作全新页面则很困难(0/130)——因此可复用的资产是模板,而非机制。消融实验表明,该机制是指令/数据混淆,而非对齐被破坏:移除保密策略后,基础攻击仍为 0%,仅将重框攻击的成功率从 31.9% 移至 38.1%。能弥合该缺口的是与负载无关的检查:目标允许列表(当目标被封闭时为 0%)和隔离能力的规划器/读取器分离(0%)。在行动模型上添加“任何形式”的广泛策略条款也能将其降至 0%,但该策略脆弱(删除兜底条款后重新开放至 48.8%)。已发布的微调防御(SecAlign, CCS 2025)无法在工具代理上关闭该缺口(32.5%,经阳性对照验证),通道分离也不行(38.8%);输出规范化守卫无法抵御保留编码(ROT13,100%)。鲁棒性来自于约束目标或隔离能力,而非行动模型识别攻击本身。

💡 推荐理由: 该研究揭示了表面防御(如拒绝显式泄露指令)在间接提示注入下的失效,证明重框攻击可轻易绕过现有防护,对依赖工具型 LLM 代理的安全设计具有直接警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Aarushi Singh

该论文研究了工具增强型大语言模型(LLM)Agent在面对静默基础设施故障时的行为,特别是当外部工具返回HTTP 200响应但payload为空、null或畸形时。现有评估框架主要关注能力指标或显式工具崩溃,忽略了这类静默失败。作者提出了一种轻量级黑盒审计框架,该框架在12个模拟生产环境的工具桩中注入了四种静默失败模式,并将Agent响应分为三类:诚实投降(HSR:承认无法获取数据)、捏造(FAR:凭空编造结果)和不忠安全拒绝(USR:虚构安全或隐私理由拒绝执行)。在零温度、中性系统提示下对两个前沿模型和两个开源模型进行评估,发现捏造响应占主导(56.6%),Agent将空payload视为真实数据并返回编造结果;而基线中USR几乎不存在(0.25%)。关键发现来自消融实验:将系统提示替换为包含安全语言(如"优先考虑用户隐私和数据安全")的标准提示后,USR频率提升了15.6倍(从0.25%增至3.95%;95%置信区间:2.2%-6.4%;Fisher精确检验p<0.001)。这表明USR是一种潜在行为,当安全词汇激活模型对政策理由的依赖时,会在工具静默失败时触发。敏感工具(如获取医疗记录、检索合同、获取用户资料)占据了多数USR实例。论文还提出了一种payload-响应不对齐启发式方法用于生产级检测,并讨论了安全导向部署的治理意义。

💡 推荐理由: 揭示了安全提示词可能意外诱导LLM Agent在工具故障时虚构安全拒绝理由,而非诚实报告问题,这对安全关键部署中的透明度和可审计性构成威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiaqi Luo, Songyang Peng, Jiarun Dai, Zhile Chen, Zhuoxiang Shen, Geng Hong, Xudong Pan, Yuan Zhang, Min Yang

本文提出一个名为AgentGuard的基于属性的访问控制框架,旨在解决基于大语言模型(LLM)的智能体在自主调用工具时面临的安全风险。LLM智能体能自动调用多种工具完成复杂任务,但现有应用存在隐私泄露、财产损失甚至系统被完全控制的风险。AgentGuard采用客户端-服务器架构:客户端提供轻量级集成接口,支持不同编程语言和架构的智能体,仅需少量代码修改(约10行)且不改变底层执行逻辑;服务器端提供三种互补的检查机制,分别覆盖单工具调用和跨工具调用的安全风险,并实现可视化前端界面用于安全策略配置和运行时审计。当前AgentGuard已开源发布,地址为https://github.com/WhitzardAgent/AgentGuard。该框架的核心贡献在于为LLM智能体的工具使用提供了一种细粒度的访问控制方案,能够在不侵入智能体核心逻辑的前提下增强安全性。

💡 推荐理由: LLM智能体在调用工具时面临严峻安全威胁,AgentGuard提出了首个基于属性的访问控制框架,为安全从业者提供了一种轻量、可扩展的防护方案,对构建安全的智能体应用具有重要参考价值。

🎯 建议动作: 纳入内部评估

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)