#adaptive-attack

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Xinhang Ma, Taoran Li, Chaowei Xiao, Zhiyuan Yu, Ning Zhang, Yevgeniy Vorobeychik

该论文聚焦于大型语言模型(LLM)驱动的智能体面临的主要安全威胁——间接提示注入(IPI),即攻击者通过外部内容(如网页、文档)向智能体植入恶意指令。现有防御措施可分为三类:基于提示的(通过提示工程阻止智能体执行恶意指令)、基于检测的(识别并过滤恶意指令)和系统级的(利用控制流和数据隔离等系统手段)。然而,常见的防御评估基准(如AgentDojo)是静态的,仅使用固定分布的IPI攻击,无法有效评估防御面对自适应攻击的鲁棒性。为此,作者提出了AutoDojo,一个对AgentDojo的自适应扩展框架,能够针对给定防御优化IPI攻击。AutoDojo采用迭代优化方法,利用前沿LLM生成并改进注入文本,以绕过目标防御。在三个任务套件和五个目标模型上,作者对多种先进IPI防御进行了评估,发现两个关键结论:第一,许多防御仅提供有限的保护——一种廉价的、黑盒的自适应攻击(使用前沿LLM迭代优化注入)能够将攻击成功率(ASR)提升至远超静态注入的水平。例如,针对一个能将静态ASR降至0%的过滤器,AutoDojo实现了28%的整体ASR,在action-open任务上甚至达到64%。第二,对于基于提示和基于过滤器的防御,在“action-open”任务(即用户请求将操作本身委托给攻击者控制的内容)上的ASR显著高于精确指定的任务。这是一个结构性限制:在这类任务中,注入可以伪装成普通数据而非显式指令,从而绕过依赖检测指令类文本的防御。AutoDojo公开发布在GitHub上,为评估和提升LLM Agent防御的鲁棒性提供了有效工具。

💡 推荐理由: 揭示了当前LLM Agent防御在面对自适应攻击时的脆弱性,特别是针对action-open任务的固有缺陷,促使安全社区重新评估防御策略。

🎯 建议动作: 建议安全团队关注AutoDojo方法,将其用于内部Agent防御评估,并考虑在action-open任务场景加强防御。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)