#execution-time-alignment

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Seth Dobrin, Łukasz Chmiel

本论文针对可逃逸AI系统(即拥有足够权限影响自身运行时的AI系统,例如可调用工具和API的AI代理)提出了一种执行时AI对齐方法。作者指出,当前主流安全控制方法(如系统提示、输出过滤、护栏库)均位于代理自身运行时内,易受输入影响而被绕过。为此,论文定义了架构控制必须满足的四个属性:进程分离、在结构唯一路径上的动作前强制、请求级和系统级的故障关闭、以及可在受控系统信任边界外验证的外部化签名证据。作者将此层定位为执行时AI对齐,补充训练时对齐(RLHF、Constitutional AI)和推理时对齐。他们实现了名为“Unfireable Safety Kernel”的Rust参考实现,满足所有四个属性。其故障关闭不变量在机器层面进行了两层验证:SMT定理(Z3)和生产决策函数的穷举有界模型检查证明(Kani)。Python到Rust的迁移基于字节等价(1000/1000 fixture,17/17对抗类)进行门控。作者评估了该内核在真实可逃逸AI系统(一个确定性的、自我改进的世界模型)上的表现,面对试图利用其真实自我修改接口的逃逸对手:在1000次自我修改中,所有704次针对安全关键核心的尝试均被拒绝,未发生逃逸;另外300次操作员终止开关下的尝试也被拒绝。独立的6240次授权往返测试中无成功绕过。与三个声称拥有代理控制平面的当代系统相比,代理可以调用控制;而在此系统中,代理缺乏这种选择。

💡 推荐理由: 提供了一种从架构层面解决AI Agent安全问题的方案,通过进程隔离和强制控制,避免依赖运行时内部软控制,具有理论严谨性和实践验证。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)