推荐 5.7
Conf: 50%
本文提出了一种基于行为轨迹签名的LLM代理内存投毒攻击检测方法。作者发现在持久化内存投毒攻击场景下,存在一个行为不变性:在通过可观察的内存工具调用检索路由信息的架构中,成功的攻击必须依次调用 `memory_recall_fact` 和 `email_send_email`,而非外泄会话几乎不会出现这种转换。该不变性源于攻击的信息检索依赖,而非经验相关性,且抑制它会破坏攻击。基于此简单规则即可达到 AUC=0.9563;使用随机森林在 19 个轨迹特征上进一步优化至 AUC=0.9904(BCa 95% CI [0.987, 0.993],N=10000 次重采样)。签名具有过定性:移除所有与回忆相关的特征(一半特征集)后 AUC 仍为 0.990,说明内存投毒会留下分布式的轨迹签名而非单一可观测异常。跨模型保留测试在 9 个模型(7B-120B 参数)上进行,6/9 的保留分割上 AUC=1.000,三个例外均有机理解释。该不变性可零训练迁移至前沿模型(GPT-4.1、GPT-4o)。仅使用前缀的变体也能达到 AUC=0.934,表明实时拦截可行且性能损失有限。边界在取证上很有用:绕过内存的提示注入攻击会产生不同的轨迹(分数 0.541),使事件响应者可以仅通过工具调用日志区分内存通道攻击与提示注入攻击。论文实验充分,证明了方法的鲁棒性和泛化能力。
💡 推荐理由: 为LLM代理内存投毒攻击提供了首个基于轨迹行为不变性的高精度检测方法,可区分内存攻击与提示注入,且无需重新训练即可迁移至前沿模型,对防御方极具实用价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)