工具调用型语言代理在与外部服务交互时,常需要动态委派和撤销权限。以往的安全机制往往只关注当前权限集合或可达性关系,但本文揭示了仅依赖这些快照信息可能不足。作者通过构造示例证明:两个历史可能具有完全相同的当前权限和全对可达性,但在同一直接边撤销发生后,后续授权决定却必须相反——即历史中的某些残余信息会影响未来安全决策。为了捕捉这种信息,作者形式化定义了“残余授权状态”,并分析与授权状态相关的理论边界:随着委派冗余的变化,精确监视器所需的状态量存在紧密的渐近界,且指数级多的未来不同状态可能共享一个固定传递闭包。为了在实证层面验证,作者构建ResidualAuth框架,将上述构造转换为成对语言代理任务,并评估多款开放权重模型的决策能力。结果表明,仅提供固定256 token摘要时,模型几乎无法解决任务;而提供“认证的当前查询读取”(即经过认证的当前状态查询信息)时,准确率大幅提升至15-16/16;零认知的“假阅读”则毫无帮助。另一组在线记忆诊断中,精确的账本序列化可解决所有测试实例,但模型自行撰写的受限于预定义截止点的记忆却几乎无效。最后,引入“硬门”机制可在不改变先前尝试的情况下将观察到的未授权影响减至零。这些结果厘清了授权决策所需的“状态”、“可靠决策所需的证据”、“在线状态维护”和“影响控制”四层概念,为构建工具使用型语言代理的运行时安全监视器提供了理论与实证基础。
💡 推荐理由: 针对语言代理的权限委派与撤销场景,本文证明仅监控当前权限或可达性可能遗漏关键历史信息,导致撤销后的决策出现相反判断。安全团队在构建AI代理监控与审计时,需重视残余授权状态的维护,以提升权限生命周期管理的可靠性。
🎯 建议动作: 研究跟进