该研究针对 LLM 代理在指令仲裁中的安全边界问题。LLM 代理需要同时处理系统提示、用户输入、记忆和工具等来源的指令,但研究发现模型对指令来源的仲裁不能保证强制信任边界,存在一种'识别-执行差距':模型激活中可以线性解码出源格式特征(如角色模板位置、通道元数据、格式提示),并且模型在被明确提示时能够识别伪造的权威来源,但在某些配置下仍然会执行冲突的工具调用。通过交叉探针实验证明,这种识别能力并非统一的抽象信任表示,而是分散的特征。差距并非模型权重的固有属性:限制性策略和多样化提示可以消除执行问题,而宽松配置和特定提示-模型组合则会产生确定性失败。在涵盖 6 个供应商共 46 个模型端点(包括开放权重模型)的权威欺骗测试和 48 个模型的记忆冲突测试中,平均执行率为 1.21%(95% CI 0.5-2.1%,基于 29 个模型的 14,294 次欺骗试验),但漏洞集中在可复现的单元中,并随部署窗口显著波动(窗口内每个指纹范围最高达 47 个百分点)。提示层防御无法跨模型和自适应形式泛化。因此,该研究主张将模型自我仲裁视为能力而非安全边界,并提出一种外部参考监视器,结合认证源路由与能力门控工具执行,能够确定性拒绝所有测试的伪造、篡改、重放和未签名请求,同时保留合法操作。独立的对抗性红队测试仅发现一个实现缺陷(时钟偏差准入,已修补),并非密码学绕过。最终结论:安全代理需要外部强制机制,而非仅仅依赖更好的识别能力。
💡 推荐理由: 该研究指出了 LLM 代理安全中的一个根本盲区:模型能够识别恶意指令来源,却仍可能执行它们,特别是'识别-执行差距'具有配置相关性和跨部署不稳定性。SOC 和工程师在构建安全代理时,不能信任模型自身的指令仲裁,必须嵌入外部参考监视器、认证源路由和能力门控,以强制执行信任边界。该发现直接影响 Agent 类应用的威胁建模和加固方案。
🎯 建议动作: 研究跟进