推荐 10.6
Conf: 50%
本文首次系统性地研究了大语言模型(LLM)智能体(Agent)中的“资源劫持”(resource hijacking)安全盲区。以往智能体安全研究主要关注指令注入、数据泄露和工具滥用等攻击,而智能体可访问的高价值资源(如计算基础设施、凭证、使用预算、身份、私有知识、通信渠道和组织工作流)作为直接攻击目标很少被关注。资源劫持是指攻击者诱导智能体调用、消耗、转移或控制这些高价值资源以达到自身目的,而无需直接获得资源本身或对应凭证。作者提出了 ResourceHijackBench 基准测试,并构建了自动化的资源劫持案例生成流水线。他们将高价值资源分为六类,构造了 300 个攻击场景和 900 条攻击提示。每个案例在隔离的本地环境中运行,记录实际资源使用情况,从而可以基于智能体的行为而非仅文本响应评估攻击。实验结果显示,在没有额外防御的情况下,OpenClaw 的平均攻击成功率高达 84.06%;在不同模型后端上攻击依然有效,平均成功率在 69.98% 到 89.58% 之间。现有防御措施只能降低部分风险,即使最强的已评估防御,平均攻击成功率仍为 55.11%。这些结果表明,智能体可访问的高价值资源构成了一个重要且此前被忽视的攻击面,而当前智能体防御不足以防范资源劫持风险。
💡 推荐理由: 该研究揭示了智能体安全中一个被忽视的高价值攻击面,提醒安全团队不能只关注指令和工具层,还需防范资源被恶意利用。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)