#indirect-prompt-injection

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Xingwei Zhong, Varun Sharma, Kar Wai Fok, Vrizlynn L. L. Thing

本文提出 DE-FIVE,一种无需重新训练的全新框架,用于检测针对视觉语言模型(VLM)的恶意图像提示。VLM 结合视觉和文本模态,但视觉模态的引入扩大了攻击面,例如对抗扰动和间接提示注入攻击,这些攻击通过精心构造的恶意图像提示诱导模型产生意外输出。现有防御方法通常需要大量数据集重新训练或部署额外复杂分类器,且缺乏专门针对间接提示注入的防御机制。DE-FIVE 利用傅里叶域特征和视觉编码器的隐藏状态表示(图像向量嵌入)实现混合检测策略:黑盒检测器基于傅里叶域特征,白盒检测器利用少量恶意样本导出的图像向量嵌入。实验结果表明,DE-FIVE 在检测恶意图像提示方面持续优于现有最先进基线。主要贡献包括:提出一种无训练、高效的检测框架;融合傅里叶特征和嵌入特征;设计黑盒和白盒双检测器;在标准数据集上验证有效性。本文适合从事 VLM 安全、对抗攻击防御和提示注入检测的研究人员阅读。

💡 推荐理由: 恶意图像提示攻击对 VLMs 构成严重威胁,现有防御不足。DE-FIVE 提供无需训练、高效的检测方案,填补了间接提示注入防御的空白。

🎯 建议动作: 研究跟进,评估框架在自身VLM环境中的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xinhang Ma, Taoran Li, Chaowei Xiao, Zhiyuan Yu, Ning Zhang, Yevgeniy Vorobeychik

该论文聚焦于大型语言模型(LLM)驱动的智能体面临的主要安全威胁——间接提示注入(IPI),即攻击者通过外部内容(如网页、文档)向智能体植入恶意指令。现有防御措施可分为三类:基于提示的(通过提示工程阻止智能体执行恶意指令)、基于检测的(识别并过滤恶意指令)和系统级的(利用控制流和数据隔离等系统手段)。然而,常见的防御评估基准(如AgentDojo)是静态的,仅使用固定分布的IPI攻击,无法有效评估防御面对自适应攻击的鲁棒性。为此,作者提出了AutoDojo,一个对AgentDojo的自适应扩展框架,能够针对给定防御优化IPI攻击。AutoDojo采用迭代优化方法,利用前沿LLM生成并改进注入文本,以绕过目标防御。在三个任务套件和五个目标模型上,作者对多种先进IPI防御进行了评估,发现两个关键结论:第一,许多防御仅提供有限的保护——一种廉价的、黑盒的自适应攻击(使用前沿LLM迭代优化注入)能够将攻击成功率(ASR)提升至远超静态注入的水平。例如,针对一个能将静态ASR降至0%的过滤器,AutoDojo实现了28%的整体ASR,在action-open任务上甚至达到64%。第二,对于基于提示和基于过滤器的防御,在“action-open”任务(即用户请求将操作本身委托给攻击者控制的内容)上的ASR显著高于精确指定的任务。这是一个结构性限制:在这类任务中,注入可以伪装成普通数据而非显式指令,从而绕过依赖检测指令类文本的防御。AutoDojo公开发布在GitHub上,为评估和提升LLM Agent防御的鲁棒性提供了有效工具。

💡 推荐理由: 揭示了当前LLM Agent防御在面对自适应攻击时的脆弱性,特别是针对action-open任务的固有缺陷,促使安全社区重新评估防御策略。

🎯 建议动作: 建议安全团队关注AutoDojo方法,将其用于内部Agent防御评估,并考虑在action-open任务场景加强防御。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)