#ai-defense

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Ayan Roy, Kaustuvi Basu

本文针对Agentic AI系统引入的持久内存攻击面,提出了一种名为MemSentry的防御框架。Agentic AI系统通过持久记忆保存用户交互和系统状态,但攻击者可以向长期记忆中注入对抗性内容,即内存投毒(Memory Poisoning),从而在后续任务中暗中操纵AI行为,例如压制安全警报、辅助特权提升、篡改信任关系或绕过安全策略,且无需修改模型权重或系统提示词。MemSentry是一个配置驱动的正式框架,位于AI系统与持久内存之间,拦截每一次写入操作,并产生确定性的三种决策:接受(Accept)、审查(Review)或隔离(Quarantine)。该框架综合评估五个维度:源的信任等级、语义风险评分、基于组件依赖DAG的攻击半径、访问控制风险,以及反映操作是否削弱或增强安全态势的带符号安全状态增量。为了评估MemSentry,作者构建了一个包含20个资产和随机依赖DAG的仿真环境,以及一个10×20的用户访问控制矩阵,并使用分层70/30划分的1,000个GPT-4生成场景进行测试。语义分类被设计为可插拔组件,文中对比了四种代表性方法:基于规则的Regex、TF-IDF+SVM、SBERT+LR和SetFit。实验结果显示,SBERT+LR在整体性能上最佳,准确率达到91.7%,宏F1得分为0.908;所有四种方法都能100%检测外部来源的隔离类威胁。对于已验证的内部人员(源信任T=1),MemSentry不会自动隔离危险操作,而是将其升级为人工审查,此时语义分类的准确性对于理解内部人员意图至关重要。本工作为Agentic AI系统提供了第一道形式化的持久内存写入防御屏障,适合AI安全研究人员、LLM应用开发者以及从事AI威胁检测的蓝队人员参考。

💡 推荐理由: Agentic AI的持久记忆正在成为真实攻击面,而现有防护大多集中在提示注入或权重安全,缺乏针对内存投毒的系统性防御。MemSentry提供了可解释、配置驱动的拦截框架,使安全团队能够在AI代理层部署细粒度的写入控制,值得从事AI安全防御的从业者深入研究。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)