#information-flow-control

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Haowen Dai, Zonghao Ying, Wenfeng Li, Xiangfan Wu, Yisong Xiao, Tianyuan Zhang, Jiaye Lin, Lei Wei, Guangyuan Dong, Xitong Ling, Xixun Lin, Quanchen Zou, Xiangzheng Zhang

多智能体系统通过任务分解和角色专业化提升能力,但这也引入了一个重要的安全盲点:有害目标可以被分解为局部合理的子任务,使得恶意意图能够规避单个智能体的检测。这种失效模式在涉及敏感信息或关键工具的场景中尤为危险,可能导致未授权披露或危险操作。本文认为,这一问题本质上是语义信息流问题,而非单轮提示分类任务。为此,作者提出了SafeFlow,一种针对多智能体系统的防御框架,将恶意跨智能体传播形式化为语义信息流控制问题。SafeFlow为根请求附加结构化语义污点,通过动态协作图传播,并在不可逆操作执行前执行工作流级验证以重建全局风险上下文。在四个基准测试(包括提示注入、基于越狱的不安全工具使用、危险代码执行和有害网页代理行为)上,SafeFlow相比无防御基线和外部防御降低了攻击成功率,同时保持了高良性任务完成率和成对的安全-有害成功率。实验表明,多智能体系统仍缺乏跨委托边界保持风险语义的机制,这一缺口可能导致隐私损害或危险行为。SafeFlow在整个工作流中保持风险可见性,从而在危害发生前阻止恶意传播。本文适合关注LLM安全、多智能体系统安全的研究者和安全工程师阅读。

💡 推荐理由: 多智能体系统在委托任务时存在安全盲区,恶意意图可被碎片化传递。SafeFlow提出的语义信息流控制方法填补了这一空白,为构建安全的自主代理系统提供了理论支撑和实用框架。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)