#planner

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Zhaofeng Yu, Haokai Ma, Dongyang Zhan, Hongli Zhang, Han Fang, Ee-Chien Chang

该论文研究的是中心化 LLM 多智能体系统(MAS)在“注册阶段”引入的一类新型注入风险。在这类系统中,新加入的 worker agent 需要把自己的描述信息注册进系统,而 planner(规划器)会读取这些描述来决定三个关键决策:任务如何被拆解、每个子任务由哪个 worker 执行、以及每个子任务具体需要什么输入与产出。问题在于,这些描述由第三方在系统外部撰写,却会被 planner 当作可信信息直接采信,从而形成一条“注册时注入”(registration-time injection)通道。与常见的提示注入不同,这里的恶意载荷在任何用户指令到达之前就已经埋设完毕,攻击目标是 planner,并会沿着 planner 生成的计划向下游的良性 worker 传播。这意味着即便那个被精心构造的 worker 从未被分配任何子任务、也从未被真正调用,攻击依然可以生效。 作者首先对 worker 描述做了结构化拆解,定义了四个字段:功能(functionality)、输入规范(input specification)、输出规范(output specification)和使用约束(usage constraints)。随后他们对来自三个公开 agent 市场的 32,000 条描述进行统计,发现大多数描述缺失输入规范与使用约束,且至少 23.35% 的描述含有这四个字段之外的内容——也就是说描述文本本身存在大量可被利用的自由空间。基于此,他们构造了八种描述操纵攻击策略,分别针对任务拆解、能力接地(capability grounding)和子任务规格说明三个环节,并在 GAIA 基准上进行评测。结果显示,在最严重的情形下,仅一条被操纵的描述就能把任务成功率从 84.31% 压到 37.25%,或者让 token 消耗、执行时间上涨超过 111%;而用户的目标表述始终未变,worker 也仍然忠实地执行 planner 给出的计划——即异常完全来源于计划本身被误导,而非执行侧出错。这些效果在两种 MAS 实现、六种 planner LLM、四种 LLM 评测器以及三个市场的真实描述数据上都保持了稳定性。 针对该问题,作者提出注册时防御方案 DescGuard:在描述进入 planner 之前,仅保留与 worker 自身接口范围相关的信息。DescGuard 能把被攻击的规划指标与下游性能恢复到接近基线水平,且无需修改 worker 实现、planner 或编排逻辑,还可以与现有的隔离、权限控制与运行时机制叠加使用。

💡 推荐理由: 多智能体系统越来越多地从第三方市场动态注册 worker,planner 对描述文本的信任构成了新的信任边界缺口。该研究证明无需用户交互即可在注册阶段污染规划链路,且影响可在不调用恶意 worker 的情况下扩散,对 agent 平台准入审核与供应链治理有直接参考价值。

🎯 建议动作: 研究跟进,并纳入内部 agent 平台准入与注册流程评估

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)