#policy-language

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Basavesh Ammanaghatta Shivakumar, Swarn Priya, Peng Gao

该论文提出 AgentFlow,一种面向 LLM 智能体系统的流中心策略语言与运行时强制模型。研究背景是:LLM 智能体会读取不可信内容、调用外部工具、访问私有数据并委派任务给其他智能体,危害往往不是源于单个不安全动作,而是敏感数据在一系列看似合理的步骤间流动。AgentFlow 的核心思路是将安全策略定义在带标签的运行时边上,明确数据在智能体系统中的允许流向。策略语言支持流规则和路径规则、任务范围的能力、受控释放以及有状态污点语义。运行时参考监视器对智能体动作进行中介,并使用有界 SMT 验证器检查结构化策略子集的安全属性。实验方面,原型中七个安全属性每个不到 0.5 秒验证完成,且能捕获所有注入的不安全策略变体;在 AgentDojo 四个套件共 949 个注入案例中,确认受损率从 33.0% 降至 0.0%,同时聚合效用从 46.7% 提升至 63.3%;在 AgentDyn Dailylife 的 200 个案例中,确认受损率从 73.5% 降至 0.0%,效用几乎保持不变(44.5% 至 43.5%)。广度检查覆盖 ASB、InjecAgent、BIPIA、AgentHarm、MCPTox 等基准,表明配置的策略能阻止基准指定的策略可见攻击者流;在 ASB 的直接提示注入测试中,攻击成功率为 0/1200。作者强调这些结果是初步的,仅限于建模的策略可见智能体行为和已评估基准。该论文适合智能体安全研究、策略设计与运行时监控系统的开发人员阅读。

💡 推荐理由: LLM 智能体正被用于处理敏感数据和外部工具,数据流向控制成为关键。AgentFlow 提供可形式化验证的流策略框架,能在不牺牲效用前提下大幅降低注入攻击导致的确认受损,为智能体系统的纵深防御提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)