推荐 5.5
Conf: 50%
本文针对大型语言模型(LLM)代理面临的提示注入(prompt injection)威胁,提出了一种基于自适应免疫原理的防御框架 AgentAntibody。研究背景是:现有防御方法将每个任务视为孤立问题,缺乏对先前遭遇的学习能力;而实际用户请求往往描述不完整,仅说明期望结果,未完全指定可接受行为,攻击者可利用这种语义漏洞,诱导代理在合法任务中执行有害操作。AgentAntibody 的核心创新在于:将用户对安全边界的动态理解编码为一个持续演进的“抗体库”。在运行时,该库检测可能威胁安全边界的请求模式,并触发相应的免疫响应;在多次交互中,系统根据用户反馈和结果自动更新抗体,增强对未来攻击的抵御能力。作者在三个基准数据集和四个不同规模的骨干 LMM(如 GPT 系列等)上进行了实验,结果表明,与现有防御方法相比,AgentAntibody 在阻止有害行为的同时能更好地保留合法任务的完成率,即使有害与合法行为都与用户陈述的任务表面兼容。该工作揭示了将免疫记忆机制引入 LLM 代理安全的潜力,为构建自适应、可持续进化的 AI 防御体系提供了新思路。
💡 推荐理由: 提示注入是 LLM 代理面临的主要安全风险,现有防御缺乏跨任务的学习能力。AgentAntibody 通过模拟生物免疫系统,使代理能够从每次交互中学习用户的安全边界并动态调整防御,这一思路对提升 AI 代理在动态环境下的鲁棒性具有重要参考价值,值得安全从业者关注并跟进验证。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)