本文针对大语言模型(LLM)面临的提示注入(Prompt Injection)攻击提出了一种新的防御思路。研究指出,当前模型仅能感知输入的令牌(tokens),虽然服务端清楚每个文本片段属于用户输入、工具输出还是指令,但模型自身却需要自行追踪这些跨度(span)的身份,容易因混淆而被攻击者利用——攻击者可以构造看似指令的文本,诱使模型执行非预期操作。为此,作者提出一种名为“语义覆盖”(Semantic Overlays)的通用引导技术:在冻结的模型残差流上,针对选择的预填充位置应用小型可学习适配器(adapters),从而为特定文本跨度附加一个带外(out-of-band)注释通道,这个通道无法通过令牌本身伪造。与传统的引导向量(steering vectors)不同,语义覆盖是经过训练的、可选择性应用且具有组合性的。它能够编码复杂的语义,改变模型对标记跨度的感知方式——例如,在一个声称代码属于另一编程语言的覆盖下要求模型复制该代码,模型会忠实改写为声称的语言。此外,覆盖还可以携带可执行的指令,并能标记“不可执行”跨度,从而抵御在不可信上下文中添加指令的广泛提示注入攻击。实验在多个基准上取得了显著效果:SEP分离准确率从24.3%提升至96.5%,且原有工具调用能力保持不变;TensorTrust攻击成功率从34.8%降至6.6%;PIArena的全部四个攻击家族合规率均降至0%。同时,标记跨度仍保持可读(精确复制率92.5%)。论文还修正了已发布评分器中的一个缺陷。该研究为LLM安全提供了新的防御维度,适合AI安全研究人员、红蓝队人员以及大模型应用开发者阅读。
💡 推荐理由: 提示注入是当前LLM应用面临的核心安全威胁,该研究提出一种不改变模型权重即可使用的可学习带外注释技术,显著降低攻击成功率且不影响原有功能,为防守方提供了一种实用的新防御手段。
🎯 建议动作: 研究跟进