#state-corruption

共收录 1 条相关安全情报。

← 返回所有主题
推荐 3.6
Conf: 50%
👥 作者: Sanjay Kariyappa, Severin Klingler, G. Edward Suh

本文研究了工具型智能体(tool-using agents)在消费外部数据时面临的安全问题。这类智能体会从不同可信级别的来源获取数据,但工具响应通常不标明每个响应单元的来源或预期语义,导致智能体可能被攻击者控制的内容污染。作者将这种攻击定义为“状态破坏攻击”(state-corruption attacks):攻击者注入的内容在环境状态方面做出超出其响应组件信息权威的断言,从而扭曲智能体对环境的认知,使后续动作在现有防护机制看来是合理的。针对此问题,论文提出 PIPES(Provenance-Informed, Prior-Enforced Screening,即来源感知与先验强制的筛查机制)。PIPES 利用语义先验和来源元数据对响应单元进行筛查:当 schema 提供稳定预期时使用静态字段契约;对于开放式内容,则依据响应前轨迹和可信来源元数据来决定是否过滤。PIPES 会标记违反语义先验或来源层级的单元,部署时可选择移除、警告、阻断或升级处理。实验采用原子移除方式,在 VitaBench 和 AgentDyn 的多个数据集上以 Gemma 4 31B IT 作为目标智能体,评估了针对自适应 PAIR 风格攻击的防御效果。结果显示,PIPES 将平均攻击成功率从 84.7% 降至 2.3%,同时保持了较高的良性任务效用(无防御时为 90.6%,启用 PIPES 后为 92.5%)。该研究揭示了工具型智能体安全中一个被忽视的信任边界问题,并提出了一种基于来源与先验的实用防御机制,为构建更安全的智能体系统提供了新思路。主要贡献包括:定义状态破坏攻击、提出 PIPES 筛查框架、并通过实验验证其有效性。适合关注智能体安全、LLM 应用安全以及可信 AI 的研究人员和从业者阅读。

💡 推荐理由: 该研究揭示了工具型智能体在混合可信数据下存在的‘状态破坏’攻击路径,现有护栏可能被绕过。PIPES 提供轻量级筛查思路,对构建安全的 LLM 智能体系统具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)