本文研究了基于大语言模型(LLM)的网页智能体从单智能体系统(SAS)向多智能体系统(MAS)演进过程中攻击面的演化。多智能体系统通过将复杂任务分解给多个专用子智能体来提升性能,但这种角色分解引入了单智能体系统中不存在的新型结构攻击面。作者提出了一个针对基于网页的 MAS 的攻击向量分类法,并构建了测试平台 WebMASLab,以在完全外部、仅针对网页的敌手模型下分析智能体安全性。为隔离架构影响,作者保持用户任务、工具面和浏览器底层固定,比较单智能体与多智能体配置。研究评估了三种对抗场景,在基线、提示加固和启用推理三种条件下进行,提出了一种新的 MAS 特有的“电话环路攻击”(Telephone Loop Attack),该攻击利用跨智能体委派形成循环任务。该攻击对单智能体系统无效,但能在四个前沿模型中的三个(Claude Sonnet 4.5、GPT-5.2、GPT-5.4)上以平均 80% 的成功率(基线)突破多智能体系统;只有第四个模型 Claude Sonnet 4.6 以 92% 的检测率抵抗了该攻击。其余模型在基线时检测率为 0%,其中有一个模型在提示加固后检测率仅达 33%。实验还表明,显而易见的防御方法无法通用:提示加固将一个模型的攻击成功率从 100% 降至 8%,但对其他模型仅带来有限降低。研究结果表明,从单智能体到多智能体网页系统的转变改变了安全格局,角色专业化不仅带来性能优化,还引入了需要进一步研究和防御的新型架构风险。
💡 推荐理由: 多智能体系统正被快速部署,但其新增的架构级攻击面缺乏系统认知。本文揭示的跨智能体委派风险可能影响所有基于 LLM 的多智能体应用,为安全从业者提供了评估和防御此类系统的早期依据。
🎯 建议动作: 研究跟进