推荐 10.5
Conf: 50%
该论文研究了异构大语言模型(LLM)在多智能体辩论中面对恶意的对手时的表现。核心问题是:异构的同伴在传递纠正信息的同时也可能传递对抗性影响,哪一方占主导?作者通过跟踪诚实代理(defender)的修订行为来测量:他们改变答案的频率,以及改变是纠正性的还是有害的。实验比较了同质基线(全诚实)、诚实混合(诚实+诚实异构)和恶意混合(诚实+恶意异构)三种面板,以及受污染面板(已有恶意同族peer)的情况。使用四个模型家族(如Llama-3.1-70B、GPT-4等)和三个推理基准(如MATH-hard)。主要发现:(1)诚实的异构peer显著降低有害修订率(对于Llama-3.1-70B在MATH-hard上,从同质面板的89%降至35%),而恶意的异构peer将其推高至90%。(2)条件概率率对弱defender隐藏伤害,但辩论结束时的翻转率暴露了实际损害。(3)该模式在模型家族和基准上符号一致,幅度随defender-benchmark组合变化。(4)当已有恶意同族peer时,加入诚实的异构peer能降低有害修订率,并能降低初始正确答案的丢失率(翻转率从31%降至6%)。结论:LLM的异构性不仅是一个攻击面,在已有对手时也可以成为一种防御机制。该工作为多智能体系统中的鲁棒性设计提供了新视角。
💡 推荐理由: 揭示了异构LLM辩论中的攻击面与防御面,对部署多智能体系统的安全团队有重要参考,帮助理解如何在对抗环境下增强系统韧性。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)