推荐 5.5
Conf: 50%
该论文聚焦于基于大语言模型的多智能体系统(MAS)在协作推理与决策中面临的新型系统性风险:局部幻觉可能沿着智能体之间的通信链路传播,在交互中被放大,最终触发级联故障。现有防御手段大多属于事后(post-hoc)范式,即只有在不安全行为已经出现后才识别故障,而此时有害影响可能已扩散至整个智能体网络。为弥补这一不足,论文提出一种事前(pre-hoc)风险评估框架 HalluProp,在智能体相互交互之前就估计个体智能体故障概率以及系统级幻觉风险。具体方法分为三步:首先,通过识别智能体角色与任务查询之间的细粒度语义错位,建模内在幻觉风险;其次,通过建模语义影响与通信拓扑,刻画智能体间风险传播机制;最后,利用可微的 Noisy-OR 推理机制融合内在风险与传播风险,生成系统性诊断结果。大量实验表明,HalluProp 能够准确定位故障智能体,平均 AUROC 达到 84.6%,同时可在亚秒级完成诊断,相比事后方法实现超过 65 倍的加速。通过上游筛查促成早期干预,HalluProp 有效补充了现有事后方法,凸显了事前风险推断在构建更可靠多智能体系统方面的潜力。
💡 推荐理由: 多智能体系统正在进入实际应用,但其级联幻觉风险尚无有效事前检测手段。本文提出首个可落地的预交互风险推断框架,为蓝队在设计 LLM 应用时提前发现隐患提供了新思路。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)