#memory

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Jinghan Xu, Yiyong Xiao, Wanru Shao, Hankai Liu, Xinjin Li

本文研究大型语言模型(LLM)智能体的长期记忆机制引入的新安全风险:记忆来源清洗(memory provenance laundering)。在LLM智能体中,长期记忆允许智能体重用之前的偏好和工作流程,但同时也将不可信的观测内容转化为持久的行动上下文。作者发现,在基于LLM的记忆整合过程中,外部观测可能被改写为看似用户历史记录或工作流支持的内容,从而保留动作触发器但抹去了低信任来源,而来源本应限制该动作的权限。现有提示过滤器、内容清洗工具和工具守卫均无法在损失性记忆整合之后强制执行来源权威不放大(source-authority non-amplification)的边界。作者形式化了该边界,并实现为保留来源的记忆防火墙(Provenance-Preserving Memory Firewall, PPMF),一种轻量级记忆中间件,它保留平台维护的来源信息,并通过将动作风险与相关记忆的权威级别匹配来授权工具调用。在基于固定风险策略的schema化评估中,易受攻击的整合记忆攻击成功率(ASR)高达1.000;而在保留完整平台来源、确认信息和风险标签的情况下,所有未授权的危险动作均无法通过PPMF门控,同时已确认的良性动作和受控的低风险记忆使用仍可执行。该论文适合研究LLM智能体安全、记忆系统设计以及安全中间件开发的从业者和研究者阅读。

💡 推荐理由: LLM智能体长期记忆的信任边界缺失可能导致未授权操作,该研究揭示了一种新型的提示注入变体,并提供了实用防御中间件,对构建安全代理架构有直接借鉴意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Minseok Choi, Seungbin Yang, Dongjin Kim, Subin Kim, Jungmin Son, Yunseung Lee, Jaegul Choo, Youngjun Kwak

本文提出了一种名为Membrane的自我演化防护栏,用于增强大型语言模型(LLM)智能体防御不断演化的越狱攻击。当前的安全对齐方法难以适应新型攻击,而基于微调的安全分类器无法实时更新,基于记忆的防护栏又容易对良性查询过度拒绝。Membrane通过构建对比安全记忆(CSM)来解决该问题:每个记忆单元记录阻止有害查询的条件,同时保留允许与之表面相似的良性查询的条件,从而形成对比对。无需重新训练模型,Membrane在每次有害交互后,将该交互及其良性对照物蒸馏为一个对比单元,并按攻击策略索引,使得同一单元能泛化至该策略下不同主题的变体。推理时,检索到的单元作为安全决策的上下文依据。在模型级安全基准HarmBench和智能体级安全基准AgentHarm上,Membrane在所有六种越狱攻击上取得最高F1分数。尤为重要的是,在AgentHarm上良性拒绝率仅为7-14%,远低于先前方法的28-85%。此外,记忆单元在跨攻击迁移下仍保持87-88%的F1,且对记忆投毒攻击具有稳定性。该方法适合LLM安全研究者、智能体系统开发者及蓝队防御工程师关注。

💡 推荐理由: Membrane提出了一种无需重训练的自适应防护方案,有效平衡了有害拦截与良性放行,特别适合需要动态防御的LLM智能体场景。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)