本研究首次系统性地实证探讨了基于大语言模型(LLM)的代码生成系统中长期记忆(Long-Term Memory)存储不安全编码偏好对安全性的影响。长期记忆旨在提升跨会话的连续性,但一旦不安全的编码偏好被存储,可能会在后续生成中潜移默化地影响安全关键决策。研究评估了四种LLM(ChatGPT、Gemini、Qwen、Grok)和五种编程语言(Python、C、C++、Go、JavaScript)。实验表明,不安全的记忆使生成漏洞代码的风险增加2.7-50.3个百分点,并产生5.4-14.0个百分点的风险-警告差距,即漏洞率上升速度远超警告率。进一步分析发现,不安全记忆难以通过正常交互覆盖,且在不同措辞的提示下仍能广泛影响输出。论文评估了三种缓解策略:安全需求附加和记忆存储可将漏洞率降低19.7-33.6个百分点,但可能使功能正确性下降最多15.9个百分点;记忆级安全过滤能在评估的风险记忆条目上实现100%检测率,并使生成行为恢复到无记忆基线。基于这些发现,作者为改进LLM代码生成中长期记忆的安全性提供了可操作建议。该研究对AI安全研究人员、LLM应用开发者以及使用LLM辅助编程的团队具有重要参考价值。
💡 推荐理由: 首次揭示LLM长期记忆可能成为持续注入不安全编码偏好的载体,影响代码安全,需要新的防护机制。
🎯 建议动作: 研究并评估论文提出的缓解策略,尤其是记忆级安全过滤,考虑整合到现有LLM代码生成管道。