该论文对多智能体大语言模型(LLM)系统中中继键值缓存(KV cache)的因果有效性进行了审计。在多智能体系统中,智能体之间常以中继 KV 缓存代替明文文本,并声称这传递了“潜在思维”(latent thoughts)。论文指出,这种归因实质上是一个关于“哪个样本的缓存被中继”的论断,而不仅仅是“有缓存被中继”。作者在已发布的系统中进行了因果审计:将缓存替换为错配样本的缓存、零化缓存以及匹配矩的随机缓存,并在两种场景下测试:接收者是否需要发送者的私有信息。当需要私有信息时,主骨干上的相关中继几乎达到 100% 的性能,而无关中继只有 23–25%,该对比在三个模型家族、五个检查点和文档问答场景中一致复现。当不需要私有信息时,预注册的五种子协议表明,在 GSM8K、ARC-Challenge 和 MedQA 上,等价性在 2.8 个百分点以内(该边界与所审计系统报告的性能增益一致),采用 Holm 校正的 TOST 检验,覆盖三个 Qwen3 规模;另一个模型家族未检测到优势。论文强调:大的缓存效应并不必然等于配对效应——一个自然场景中,零化中继造成 14.7 点性能损失,而错配缓存仅损失 0.4 点。此外,仅仅需要信息也不足以实现潜在思维传递:同一测试下,不同系统的传输通道效果差异巨大,从 LatentMAS 的全量中继(天花板效果),到 KVComm 的部分层子集,再到 C2C 的投影器(无可检测的样本特定迁移)。结论是:基准测试的性能差异本身并不能证明潜在思维的传输;必须进行错配缓存审计才能确立因果关系。论文公开了审计代码,研究面向关注多智能体 LLM 可解释性、系统评测和因果推理的研究者。
💡 推荐理由: 该研究为评估多智能体 LLM 系统中 KV 缓存中继的真实效果提供了因果审计方法论,帮助防御者和研究人员避免被表面性能提升误导,避免高估潜在思维传递能力,对系统安全评估和模型能力边界理解有参考价值。
🎯 建议动作: 研究跟进