#indirect-prompt-injection

共收录 6 条相关安全情报。

← 返回所有主题
👥 作者: Wujie Xiong, Rabimba Karanjai, Yang Lu, Weidong Shi, Lei Xu

该论文针对大语言模型(LLM)智能体在间接提示注入攻击下的能力约束问题展开研究。攻击者可将恶意内容注入外部技能的输出,这些输出随后被放入智能体的执行上下文中,从而影响后续的敏感操作。现有防御手段主要分为两类:对不可信内容进行分类(如 Spotlighting)或对操作权限进行授权(如 CaMeL、AttriGuard),但并未直接解决“不可信数据一旦进入智能体状态,其未来的能力边界应如何动态收缩”这一核心问题。论文提出 SkillGuard,一种驻留在系统层(harness-level)的强制约束机制,将不可信数据的进入视为“污染”事件,并在此基础上限制智能体未来的调用能力,使其状态无法到达部署者定义的禁止状态。SkillGuard 依赖可靠的技能摘要与安全策略,构建“技能影响图”(Skill Impact Graph)来描述涉及安全关键的状态迁移;通过“可转向性签名”指定对技能参数的允许控制方式;并以内联引用监视器对每一次技能调用进行实时仲裁。一旦检测到污染,SkillGuard 不再调用辅助 LLM 进行推断,而是采用二元限制、分数限制或分数流限制策略,计算加权的能力削减方案。评估在 AgentDojo 的四个套件上开展,后端使用 Gemini 2.5 Flash 和 Llama3.3-70B,对比纯 LLM 无防御基线以及 Spotlighting、CaMeL、AttriGuard 三种不同系统层次的防御。实验还构造了一种组合式攻击基准,其中每个单一观察不足以触发目标违规,但组合后可达成攻击。结果显示,在 AgentDojo 的 Tool Knowledge 攻击下,SkillGuard 在两个后端上几乎完全消除了四个套件中的三个的攻击成功,Slack 套件上的攻击成功率分别降至 4.8% 和 14.3%。在组合式攻击下,SkillGuard 在 Llama 后端上优于所有基线,在 Gemini 上匹配最强基线并保持更高良性效用。与二元限制相比,分数流限制在同等的攻击成功率下保留了显著更多的可用能力。此外,SkillGuard 在两个场景中均不增加模型调用次数或 token 开销。该工作适合关注 LLM 智能体安全、AI 系统防御机制以及安全策略自动化的研究者与工程人员阅读。

💡 推荐理由: 间接提示注入是当前 LLM 智能体面临的实际威胁,而现有防御未能在系统层面动态收窄能力边界。SkillGuard 提供一种不依赖额外模型推理的轻量强制手段,为构建可证安全的智能体运行时提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md Habibur Rahman, Jaeho Kim

本文研究工具型 LLM 代理在面对间接提示注入攻击时的防御失效问题。所谓间接提示注入,是指代理在读取攻击者控制的网页内容时,这些内容可能诱使代理泄露其持有的机密信息。作者在安全合成实验室环境中(包含金丝雀机密、模拟工具以及匹配的干净/投毒指标)发现了“框架缺口”(framing gap):在六个模型上,十种显式注入类别均被拒绝(gpt-4o 拒绝率为 0%),但将相同的泄露行为重新包装为必须的完整性签名、配置字段或外观可信的“受信任”主机时,gpt-4o 的失败率从 0% 升至 100%。该攻击成本低廉,其成本分为三个层级:对已知机制进行改写是微不足道的(3 种措辞下成功率为 96%);在已知有效模板内交换字段也较为廉价(成功率最高 60%);而围绕新机制创作全新页面则很困难(0/130)——因此可复用的资产是模板,而非机制。消融实验表明,该机制是指令/数据混淆,而非对齐被破坏:移除保密策略后,基础攻击仍为 0%,仅将重框攻击的成功率从 31.9% 移至 38.1%。能弥合该缺口的是与负载无关的检查:目标允许列表(当目标被封闭时为 0%)和隔离能力的规划器/读取器分离(0%)。在行动模型上添加“任何形式”的广泛策略条款也能将其降至 0%,但该策略脆弱(删除兜底条款后重新开放至 48.8%)。已发布的微调防御(SecAlign, CCS 2025)无法在工具代理上关闭该缺口(32.5%,经阳性对照验证),通道分离也不行(38.8%);输出规范化守卫无法抵御保留编码(ROT13,100%)。鲁棒性来自于约束目标或隔离能力,而非行动模型识别攻击本身。

💡 推荐理由: 该研究揭示了表面防御(如拒绝显式泄露指令)在间接提示注入下的失效,证明重框攻击可轻易绕过现有防护,对依赖工具型 LLM 代理的安全设计具有直接警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

本文对DeepSeek Harness (DSH) 这一大语言模型智能体框架进行了系统性的间接提示注入安全评估。研究团队使用自研的AI-Infra-Guard (A.I.G) 工具链构建测试用例,通过受控污点注入、执行DSH、采集执行轨迹并判定结果的方式,对DSH在多种间接内容通道下的安全性进行了大规模量化测试。实验覆盖了14,560次受控执行,涉及16种间接内容通道、文本与文件两种载体模式、35种载荷目标、一个未修改的基线以及12种攻击方法。实验设计保留了DSH的智能体循环、工具注册表、模型适配器和会话事件路径,并将源工具与敏感接收器设置为本地夹具,从而在不产生外部副作用的前提下记录所有尝试性操作。每个执行轨迹均通过确定性规则裁判(RuleJudge)和基于语义的LLM裁判(LLMJudge)进行双重评估。最强的攻击成功率表现为:在文本模式下,伪造完成攻击在LLMJudge下的成功率为17.0%;在文件模式下,隐藏Unicode攻击在RuleJudge下的成功率为25.5%;在文件模式下,技能通道攻击在RuleJudge下的成功率为16.0%。此外,LLMJudge相比RuleJudge更倾向于判定部分合规(7.3%对比2.0%)。论文进一步分析了这些结果与DSH对工具结果、附加上下文和工具调用策略钩子的处理方式之间的关联,并提出了应在不可信内容与敏感操作之间部署的防护控制措施。该研究对于理解LLM智能体框架的间接提示注入风险具有重要价值,代码已开源在GitHub上。适合大语言模型应用开发者、安全研究人员及蓝队成员阅读。

💡 推荐理由: 该研究首次对DeepSeek Harness进行了大规模、系统化的间接提示注入安全评估,揭示了实际攻击成功率及高风险通道,为LLM智能体框架的安全加固提供了量化依据和可复用的测试方法。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Buzhao Liu, Xinhang Ma, Yevgeniy Vorobeychik

该论文聚焦于大型语言模型(LLM)在代理(agent)场景下所面临的间接提示注入(Indirect Prompt Injection, IPI)攻击。现代LLM具备出色的指令跟随能力,常被用作自主完成复杂任务的代理,但这也使其易受嵌入在文本中的恶意指令攻击。核心防御任务是将给定文本分割为良性句子与恶意句子,然而现有检测器大多缺乏查询感知(query-relative)的段级检测能力,也未能针对代理执行中可现实化的自适应逃逸攻击进行加固。作者首先提出一种同时利用上下文与查询信息的恶意句子分类方法,实现对每个句子是良性或恶意的鲁棒判定。随后,为提升分类器抵抗逃逸攻击的能力,设计了两种对抗训练(AT)方案:第一种是特征空间对抗训练,通过投影梯度法在嵌入空间中近似逃逸样例;第二种是在训练循环中利用LLM进行改写以模拟现实中可行的逃逸攻击。两种方案均包含参数化设计,可在实用性与攻击鲁棒性之间进行平滑折衷。大量实验基于间接提示注入基准,结果表明所提方法在静态攻击下优于现有IPI防御基线;在面对自适应攻击时,AT变体能够显著提升效用并降低攻击成功率,或两者兼得。研究还发现最佳AT参数可能高度依赖具体应用域,因此实际部署时针对不同领域的检测器调参可能是必要的。代码已开源。该工作为LLM代理的恶意指令检测提供了更可靠且可防御自适应攻击的解决方案。

💡 推荐理由: LLM代理正被应用于自动化任务,间接提示注入是其核心安全威胁。本文提出的上下文和查询感知检测器及对抗训练方法,为蓝队提供了更鲁棒的防御思路,有助于防护代理场景下的恶意指令注入攻击。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xingwei Zhong, Varun Sharma, Kar Wai Fok, Vrizlynn L. L. Thing

本文提出 DE-FIVE,一种无需重新训练的全新框架,用于检测针对视觉语言模型(VLM)的恶意图像提示。VLM 结合视觉和文本模态,但视觉模态的引入扩大了攻击面,例如对抗扰动和间接提示注入攻击,这些攻击通过精心构造的恶意图像提示诱导模型产生意外输出。现有防御方法通常需要大量数据集重新训练或部署额外复杂分类器,且缺乏专门针对间接提示注入的防御机制。DE-FIVE 利用傅里叶域特征和视觉编码器的隐藏状态表示(图像向量嵌入)实现混合检测策略:黑盒检测器基于傅里叶域特征,白盒检测器利用少量恶意样本导出的图像向量嵌入。实验结果表明,DE-FIVE 在检测恶意图像提示方面持续优于现有最先进基线。主要贡献包括:提出一种无训练、高效的检测框架;融合傅里叶特征和嵌入特征;设计黑盒和白盒双检测器;在标准数据集上验证有效性。本文适合从事 VLM 安全、对抗攻击防御和提示注入检测的研究人员阅读。

💡 推荐理由: 恶意图像提示攻击对 VLMs 构成严重威胁,现有防御不足。DE-FIVE 提供无需训练、高效的检测方案,填补了间接提示注入防御的空白。

🎯 建议动作: 研究跟进,评估框架在自身VLM环境中的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xinhang Ma, Taoran Li, Chaowei Xiao, Zhiyuan Yu, Ning Zhang, Yevgeniy Vorobeychik

该论文聚焦于大型语言模型(LLM)驱动的智能体面临的主要安全威胁——间接提示注入(IPI),即攻击者通过外部内容(如网页、文档)向智能体植入恶意指令。现有防御措施可分为三类:基于提示的(通过提示工程阻止智能体执行恶意指令)、基于检测的(识别并过滤恶意指令)和系统级的(利用控制流和数据隔离等系统手段)。然而,常见的防御评估基准(如AgentDojo)是静态的,仅使用固定分布的IPI攻击,无法有效评估防御面对自适应攻击的鲁棒性。为此,作者提出了AutoDojo,一个对AgentDojo的自适应扩展框架,能够针对给定防御优化IPI攻击。AutoDojo采用迭代优化方法,利用前沿LLM生成并改进注入文本,以绕过目标防御。在三个任务套件和五个目标模型上,作者对多种先进IPI防御进行了评估,发现两个关键结论:第一,许多防御仅提供有限的保护——一种廉价的、黑盒的自适应攻击(使用前沿LLM迭代优化注入)能够将攻击成功率(ASR)提升至远超静态注入的水平。例如,针对一个能将静态ASR降至0%的过滤器,AutoDojo实现了28%的整体ASR,在action-open任务上甚至达到64%。第二,对于基于提示和基于过滤器的防御,在“action-open”任务(即用户请求将操作本身委托给攻击者控制的内容)上的ASR显著高于精确指定的任务。这是一个结构性限制:在这类任务中,注入可以伪装成普通数据而非显式指令,从而绕过依赖检测指令类文本的防御。AutoDojo公开发布在GitHub上,为评估和提升LLM Agent防御的鲁棒性提供了有效工具。

💡 推荐理由: 揭示了当前LLM Agent防御在面对自适应攻击时的脆弱性,特别是针对action-open任务的固有缺陷,促使安全社区重新评估防御策略。

🎯 建议动作: 建议安全团队关注AutoDojo方法,将其用于内部Agent防御评估,并考虑在action-open任务场景加强防御。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)