该研究针对一个实际安全评估盲区: 当同一个智能体(Agent)同时使用 MCP 工具调用和 A2A 委托时,单独对每一层评估的安全性可能无法描述组合行为。作者构建了一个受控测试床: 一个真实模型主机通过本地 MCP 访问工具,再经本地 A2A 将消息传递给另一个代理,形成有序事件轨迹,并使用确定性规则进行精确计分,而不是依赖 LLM 裁判。实验采用冻结的三臂设计,包含 10 个记录场景,每个场景分别施加 "CONFIDENTIAL" 标头、无标头和 "PUBLIC - OK TO SHARE" 标头,但六个实质性记录字段的值在三种条件下字节完全相同。配置为 4 个模型 × 3 个条件 × 4 次重复,共 480 次试验。结果显示: 带 CONFIDENTIAL 标头与无标头之间的外发差异没有明确结论,且在所有模型中均接近下限;而增加 PUBLIC - OK TO SHARE 标头相对无标头会带来更高的逐字字段外发频率,但模型依赖性很大——Claude Sonnet 5 上效果强且一致(公开发送相对无标头的平均增加 0.800,所有 10 个场景均如此),GPT-5.6 的某一档中等但受到下限限制,另一档中位数增量为 0,还有一档完全没有效果。作者强调这是单一配置下的相关性而非因果关系。研究已公开代码、字节级轨迹和分析流水线,便于复现。对安全从业者的启发是: 在多协定的智能体链路中,简单的标签条件可能改变数据外发行为,不能依赖标签本身作为数据防泄漏控制,需要跨组件监督出站内容的逐字泄露。
💡 推荐理由: MCP 与 A2A 组合使敏感字段在代理间流动时可能突破单层 DLP;公开分享标签可能意外提升逐字外发风险,值得蓝队监控多智能体链路。
🎯 建议动作: 纳入内部评估