推荐 5.5
Conf: 50%
该论文提出了一种针对大语言模型(LLM)智能体的新型攻击方法FragFuse,揭示了长期记忆机制引入的安全漏洞。LLM智能体日益依赖长期记忆来支持复杂任务执行、用户个性化与领域适配,同时研究者也开始探索访问控制机制以阻止违反策略的请求。然而,论文发现攻击者可以利用记忆操作的时间通道:将触发访问控制拦截的禁止内容拆分成多个片段,以无害形式分别存入长期记忆,然后在后续查询中通过记忆检索重组这些片段,从而绕过访问控制。FragFuse攻击包含三个阶段:第一阶段,通过黑盒自适应查询与片段掩码技术识别出哪些内容片段会触发拒绝响应;第二阶段,使用标记载体查询将这些片段注入长期记忆;第三阶段,通过后续攻击查询检索并融合存储的片段。为了避免针对每个智能体手动构造攻击,论文进一步提出了基于代理的优化方案,自动调优融合指令和标记设计,且不违反攻击者的威胁模型假设。在四种代表性智能体设置和任务域上,针对三种最先进的访问控制机制进行评估,FragFuse实现了平均86.3%的绕过成功率和41.1%的端到端有害任务成功率,仅比无访问控制时平均任务成功率下降4.4%。此外,现有的提示注入检测器和困惑度检测器等防御手段均无法有效应对该攻击。该研究适合LLM安全研究人员、智能体应用开发者以及访问控制设计者阅读。
💡 推荐理由: 该工作首次揭示LLM智能体长期记忆机制可被利用绕过访问控制,攻击成功率极高且现有防御无效,对依赖记忆的Agent应用构成实际威胁。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)