#multi-agent-defense

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Siyuan Li, Zehao Liu, Haoyu Li, Xi Lin, Ning Liu, Jun Wu, Jianhua Li, Mohsen Guizani

本文针对大型语言模型(LLM)在多轮交互中面临的对抗性攻击持续演化问题,指出现有防御方法本质上是反应式的,难以应对攻击者在多轮对话中不断调整策略的复杂威胁。为此,作者提出了一种主动防御框架 CoopGuard,旨在通过跨多轮交互的干扰、误导和适应相结合的方式,系统性地提升 LLM 的安全性。该框架采用协作式多智能体架构,由多个专职智能体分别执行互补的防御策略:一是受控响应节奏,通过延迟或改变响应速度来增加攻击者的时间与计算成本;二是策略性模糊输出,生成含义不明确的回复,误导攻击者采用低效的攻击路径;三是交互日志取证分析,对对话记录进行深度分析以识别攻击模式,并据此改进防御策略。这些智能体由一个自适应协调机制统一调度,该机制能够根据威胁的升级程度动态调整整体防御策略。为全面评估框架效果,作者构建了 EMRA 数据集,模拟多轮攻击中策略的演化,包含 8 种攻击类型、共 5,200 个对抗样本。在多个 LLM 主干上的实验结果表明,相比现有最优基线,该框架平均将攻击成功率(ASR)降低 69%,同时维持了欺骗性互动,其平均欺骗率(DR)是最强基线的六倍以上,并使攻击者的 token 消耗平均增加 198.83%。代码和数据集已公开。该研究为 LLM 安全防御提供了一种从被动响应转向主动博弈的新思路,适合 LLM 安全研究、红蓝对抗和防御系统设计者阅读。

💡 推荐理由: 多轮攻击是实际 LLM 应用面临的高危威胁,该框架首次将主动欺骗与自适应多智能体协作引入防御,为蓝队提供了一种可借鉴的成本提升与攻击识别范式。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)