#long-term-memory

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Jong Wook Kim, Byoungjae Min, Kennedy Edemacu, Yoonhyuk Choi, Sae-Hong Cho, Beakcheol Jang

本文针对长期记忆型大语言模型(LLM)代理中的隐私泄露问题展开研究。作者指出,虽然用户从未明确陈述受保护属性(如健康状况、政治倾向等),但代理在多次交互中基于长期记忆生成的条件响应,可能累积性地泄露这些属性。作者将该威胁形式化为“自适应转录隐私”(adaptive transcript privacy),即攻击者通过观察整个交互转录,不断调整先验信念,最终推断出敏感属性。为缓解这一风险,论文提出 DP-MemView——一个面向内存接口的差分隐私层,其核心思想是:不把原始记忆直接暴露给响应 LLM,而是通过一个受差分隐私保护的“视图选择”机制,仅向响应模型提供用于生成公开响应的条件视图。每个视图选择都会针对其读取集合所覆盖的每个受保护属性组进行“记账”(即扣除隐私预算);每个属性账本一旦超过预置上限,后续相关选择会被阻止,并返回一个固定的通用视图,从而在机制上限制累积泄露。作者在显式接口契约下证明了整个自适应转录满足纯 B_a-DP(一种针对贝叶斯攻击者的差分隐私变体),并将结论扩展到多个受保护组存在差异的存储场景,同时给出了观测转录对攻击者先验几率改变的上界。实验部分使用三个不同的响应 LLM,在受控的相邻存储基准和公共语料迁移测试上进行评估,验证了在线与预分配两种模式。结果表明,两种模式都能将转录可分性压低到接近随机猜测,同时保持目标所需的个性化和整体响应质量。进一步的诊断实验显示,若移除关键保护机制(如账本计费、视图约束等),会导致输出支持不匹配、缺失账本计费、暴露侧信道或产生长程泄露累积。总体而言,该工作为长期记忆 LLM 代理提供了一种可证明隐私保障的接口设计,对隐私保护型代理系统的开发具有重要参考价值。

💡 推荐理由: 长期记忆 LLM 代理的隐私泄露是现实且难以察觉的风险;本文首次将差分隐私引入记忆视图接口,为在保持个性化能力的同时提供可证明的隐私保证提供了新思路,对安全工程师设计隐私合规的智能代理有直接启发。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yuchen Chen, Wei Cheng, Yuan Xiao, Zhou Yang, Weifeng Sun, Chunrong Fang, Xiang Chen, Baowen Xu, David Lo, Zhenyu Chen

本研究首次系统性地实证探讨了基于大语言模型(LLM)的代码生成系统中长期记忆(Long-Term Memory)存储不安全编码偏好对安全性的影响。长期记忆旨在提升跨会话的连续性,但一旦不安全的编码偏好被存储,可能会在后续生成中潜移默化地影响安全关键决策。研究评估了四种LLM(ChatGPT、Gemini、Qwen、Grok)和五种编程语言(Python、C、C++、Go、JavaScript)。实验表明,不安全的记忆使生成漏洞代码的风险增加2.7-50.3个百分点,并产生5.4-14.0个百分点的风险-警告差距,即漏洞率上升速度远超警告率。进一步分析发现,不安全记忆难以通过正常交互覆盖,且在不同措辞的提示下仍能广泛影响输出。论文评估了三种缓解策略:安全需求附加和记忆存储可将漏洞率降低19.7-33.6个百分点,但可能使功能正确性下降最多15.9个百分点;记忆级安全过滤能在评估的风险记忆条目上实现100%检测率,并使生成行为恢复到无记忆基线。基于这些发现,作者为改进LLM代码生成中长期记忆的安全性提供了可操作建议。该研究对AI安全研究人员、LLM应用开发者以及使用LLM辅助编程的团队具有重要参考价值。

💡 推荐理由: 首次揭示LLM长期记忆可能成为持续注入不安全编码偏好的载体,影响代码安全,需要新的防护机制。

🎯 建议动作: 研究并评估论文提出的缓解策略,尤其是记忆级安全过滤,考虑整合到现有LLM代码生成管道。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)