该论文是一篇关于多智能体LLM系统(MAS)安全的系统化综述(SoK)。研究背景是:多智能体LLM系统在多个主体之间传递信息、状态、决策和权限,这种跨主体的交互可能引发局部安全检查无法发现的系统性故障。作者指出,如果没有执行级别的视图,多智能体设置很容易被误认为是真正的多智能体安全效应的证据。因此,论文通过对197篇相关工作的执行中心化分析,系统化地梳理了MAS安全,涵盖了六个交互接口、四种对手位置、七类系统级风险和八种反复出现的攻击路径。论文提出了一个A-I-R框架,按照对手位置、交互接口和产生的系统级风险来组织攻击,统一了原先碎片化的攻击机制。在防御方面,论文提出了一个五部分契约,涵盖路径目标、观察、干预、信任边界和恢复,并指出路径闭合和恢复是关键挑战。此外,论文还审计了44个评估与基准工作,指出了在隔离交互效应、设计可比较和诊断性指标、支持跨MAS设计复用以及评估开放系统运行方面的开放挑战。总体而言,论文呼吁采用交互感知的MAS安全视角:端到端追踪攻击,测试防御是否能闭合这些路径,并使用适当的反事实来评估系统级效果。该研究适合安全研究人员、LLM系统设计者以及关注多智能体安全性的蓝队人员阅读。
💡 推荐理由: 多智能体LLM系统正被快速用于复杂任务,其跨主体交互引入了传统单点防护难以覆盖的新型风险。本综述为理解和防御此类系统性失效提供了首个系统化框架,是蓝队评估MAS安全性的重要参考。
🎯 建议动作: 研究跟进