#multi-agent-security

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Haowen Dai, Zonghao Ying, Wenfeng Li, Xiangfan Wu, Yisong Xiao, Tianyuan Zhang, Jiaye Lin, Lei Wei, Guangyuan Dong, Xitong Ling, Xixun Lin, Quanchen Zou, Xiangzheng Zhang

多智能体系统通过任务分解和角色专业化提升能力,但这也引入了一个重要的安全盲点:有害目标可以被分解为局部合理的子任务,使得恶意意图能够规避单个智能体的检测。这种失效模式在涉及敏感信息或关键工具的场景中尤为危险,可能导致未授权披露或危险操作。本文认为,这一问题本质上是语义信息流问题,而非单轮提示分类任务。为此,作者提出了SafeFlow,一种针对多智能体系统的防御框架,将恶意跨智能体传播形式化为语义信息流控制问题。SafeFlow为根请求附加结构化语义污点,通过动态协作图传播,并在不可逆操作执行前执行工作流级验证以重建全局风险上下文。在四个基准测试(包括提示注入、基于越狱的不安全工具使用、危险代码执行和有害网页代理行为)上,SafeFlow相比无防御基线和外部防御降低了攻击成功率,同时保持了高良性任务完成率和成对的安全-有害成功率。实验表明,多智能体系统仍缺乏跨委托边界保持风险语义的机制,这一缺口可能导致隐私损害或危险行为。SafeFlow在整个工作流中保持风险可见性,从而在危害发生前阻止恶意传播。本文适合关注LLM安全、多智能体系统安全的研究者和安全工程师阅读。

💡 推荐理由: 多智能体系统在委托任务时存在安全盲区,恶意意图可被碎片化传递。SafeFlow提出的语义信息流控制方法填补了这一空白,为构建安全的自主代理系统提供了理论支撑和实用框架。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kunyang Li, Kyle Domico, Jonathan Gregory, Patrick McDaniel

本文针对多智能体系统(MAS)中智能体间通信信道面临的未知攻击面问题,提出了一种名为MESA的标签无关框架。研究背景是MAS在自动化复杂分布式工作流中日益普及,但智能体间通信链路引入的新攻击面缺乏有效防御手段。作者观察到,不同通信链路(边)的攻击影响极不均匀:单条被攻陷的边可导致高达75%的攻击成功。因此,如何在没有历史攻击记录的情况下,优先保护最脆弱的通信信道成为关键问题。MESA框架融合了六种图论指标(如中心性、介数等)和两种动态探测技术(消融与掩蔽),无需攻击痕迹即可对每条边进行安全关键性排序。实验在三个不同MAS场景、八种网络拓扑以及Qwen、Llama、Gemma系列的五种开源大语言模型上,针对动态错误信息攻击管线进行了评估。结果表明,MESA排序与每条边的实证攻击成功率高度相关,平均斯皮尔曼相关系数ρ=+0.60(最高+0.73)。在资源受限的防御部署中,监控MESA排名前10%的边可拦截约3倍于随机分配的成功攻击。此外,本文还测试了MESA在不同攻击者/防御者模型以及LangGraph工作流下的表现,并分析了其在自适应攻击和高冗余图下的局限性。总体而言,研究证实MAS中边级风险往往集中且可预测,为主动加固多智能体基础设施提供了可行方法。本工作适合安全研究人员、MAS开发人员以及关注AI系统安全性的从业者阅读。

💡 推荐理由: 为多智能体系统提供了一种主动识别最脆弱通信链路的无监督方法,显著提升有限安全资源的利用效率。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)