该论文针对语言模型中指令与数据共享同一token流导致难以防御提示注入的问题,提出了一种可组合的信任模型。核心思想是将决策权外置于模型之外,由代码根据输入源的信任等级决定操作执行权限:低信任源可以提供信息但不能覆盖高信任源的指令。论文设计了一个确定性的流水线,对输入按源完整性排序,并通过一个固定的非模型监视器(monitor)仅从可信输入中选择操作和外部动作。为了评估对注入的抵抗性,研究者对模型进行了提示微调(prompt-tuning),并在未修改的Gemma 4 26B模型上进行单次保留集测试。实验表明,通过钝化(passivation)和包装器(cascade)组合,防御后的真实泄露率从27%提升至94%,且干净质量损失仅为约4%(Q_rel=0.96)。在自适应红队测试下,证明的边界无条件成立,实测防御率仍保持在87%。此外,cascade机制能够将低信任源的事实归因而不是丢弃,使归因率从0%提升至92%,并在发生冲突时遵循高信任源。论文的主要贡献是提供了一个可证明安全边界与可测量防御效果相结合的方法,为语言模型的安全调用提供了工程化方案。适合安全研究人员、LLM应用开发者阅读。
💡 推荐理由: 针对LLM提示注入这一关键安全问题,提出了兼具理论证明与工程实测的防御框架,实用价值高。
🎯 建议动作: 研究跟进