本文提出 SAGE-Fin,一个面向金融场景智能体(agent)的运行时治理框架,核心论点是“上下文不等于授权”。作者指出,金融智能体在对话或任务执行中可能将正确的上下文错误地转化为未经授权的实际动作,例如做出客户承诺、执行交易或部署策略。为此,SAGE-Fin 设计了一种金融专用的权威交接(authority-handoff)契约,将控制对象从文本本身转移到“提议的效果”(proposed effect)。具体而言,SAGE-Fin 将智能体输出编译为类型化的、与适配器绑定的候选动作;记录缺失或过时的机构义务作为“覆盖债务”(coverage debt);根据当前市场状态、账户状态、策略和对话状态对权威进行约束;并要求返回一个精确工件(artifact)收据,其名义类型必须与消费响应、执行或策略适配器匹配。系统强调:证据和工作流进度不能取代效果权威,且在任何状态变更后必须重新检查先前授权。实验部分,作者构建了包含 616 个案例的目录,五个确定性规范生成 3,080 个输出;通过标签隔离的测试工具实现 616/616 的二进制参考原型一致性(其中包括 3/3 的命名响应门固定装置),并有 22 个测试覆盖选定路径。作者明确表示这些结果证明的是可执行的一致性,而非独立的安全准确率。此外,SAGE-Fin 的响应门在一个保密数字资产平台处理了真实生产请求,独立于实现团队的操作团队给出了强正向的部署后评价,最终用户反馈也积极。由于保密限制,披露仅包含审查独立性、利益相关者类别、评估维度和方向性结论,因此属于定性现场佐证而非聚合效应估计。作者还分析了三个不同的去标识化先前失败案例,独立确认 0/3 拦截率,用以说明重复发射漂移、过时账户证据和缺失升级状态等问题的存在,但未估计流行率或处理效应。本文适合金融领域大模型安全、智能体治理、AI 合规与运行时控制方向的研究人员和工程团队阅读。
💡 推荐理由: 金融智能体一旦将上下文误用为授权,可能导致合规事故或资金损失。SAGE-Fin 提供了一种结构化运行时治理思路,将“效果”作为控制对象,对 Agent 安全落地具有直接参考价值。
🎯 建议动作: 研究跟进