#security-exposure

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Md Jafrin Hossain, Nur Al Hasan Haldar

长期运行的大语言模型(LLM)智能体在与不受信任的内容、持久化内存、外部状态和敏感工具交互时,面临严重的安全风险。现有的安全分析往往以恶意输入与下游动作之间的执行步数来衡量攻击的距离,但本文指出,对于有状态的智能体,这种时间上的距离可能高估了安全隔离效果。为此,作者提出了一种基于溯源(provenance)的执行图,通过确定性状态、标识符和工具溯源将智能体事件关联起来,并定义了“影响距离”(DI),即从不可信源到敏感动作的最短结构路径。他们将其与常用的“序列距离”(DT,即在有序轨迹中最短的注入-汇聚路径)进行比较。由于影响图包含所有序列边,因此 DI ≤ DT;它们的差距 Gap=DT-DI 量化了被步数隐藏的安全分离。作者在 AgentDojo 数据集上进行了大规模实验,使用 OpenAI 的 gpt-4o-mini 和 gpt-4o 以及 Claude 的 Haiku 4.5 和 Sonnet 4.6 等模型,涵盖 360 条长期轨迹中的 454 对注入-汇聚点。结果显示,96.9% 的对具有 Gap>0,中位数为 9 跳;即使移除最大的仅溯源边类别,91.0% 的对仍然解耦。在 AgentDojo 的银行测试套件中,377 条轨迹中的 231 对中有 33.8% 通过不同的溯源机制解耦。在 274 对 OpenAI 数据中,控制 DT、攻击类型和后端后,Gap 不能独立预测攻击成功(β=0.066,p=.088)。在匹配阈值 k=2,3 时,基于 DI 的确定性预执行门控能够阻止仅序列门控遗漏的 5 个攻击汇聚点,且没有额外的良性阻断,但配对增益不显著(p=.0625)。因此,执行结构揭示了被步数掩盖的接近性,可以支持有针对性的运行时干预。本文度量的是候选影响路径,而非因果归因。这项工作为 LLM 智能体的安全评估提供了新的视角和工具。

💡 推荐理由: 该研究首次从执行结构与溯源视角量化长周期 LLM 智能体的安全暴露,揭示仅依赖步骤数会严重低估风险的接近程度,为安全团队设计运行时门控和攻击面评估提供了更精确的度量基础,对构建安全的智能体系统具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)