大型语言模型(LLM)代理系统正越来越多地集成记忆子系统,以实现持久化的个性化和交互连续性。然而,这一便捷功能可能引入新的安全漏洞。本文提出了一种名为 InjecMEM 的新型记忆注入攻击范式,攻击者仅需一次交互(无需对记忆存储进行读取或编辑访问),即可在未来相关查询中诱导代理生成预设输出。该攻击利用记忆系统“检索后生成”的工作机制,精心构造注入内容,其中包含一个“检索器无关锚点”和一个“对抗性命令”。锚点包含高召回率的主题线索,确保下游检索始终将该记录与目标主题关联;命令则是一段经过梯度坐标搜索优化得到的短文本序列,在不确定的融合上下文、可变插入位置和长提示条件下仍能保持有效性,一旦被检索即可可靠引导输出。研究者还通过合成提示模板和插入位置进行训练,并将优化扩展至跨主干模型的联合学习,以研究迁移性。实验覆盖多个记忆系统和主干模型,结果表明 InjecMEM 能够实现可靠的按主题检索与定向生成,在记忆漂移场景下依然有效,且不影响非目标查询。该工作揭示记忆系统作为新攻击面的风险,并提供了一个可复现的研究框架,为后续防御研究奠定了基础。
💡 推荐理由: 该研究展示了一种仅靠单次交互即可长期操纵 LLM 代理记忆输出攻击手法,威胁到依赖记忆进行持久个性化与连续决策的各类应用。对于部署了代理记忆系统的组织,这是一项需要密切关注的新攻击面。
🎯 建议动作: 研究跟进