#runtime-safety

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Shawn Ray

该论文研究使用工具(tool-using)的智能体在运行时安全领域的可执行性(enforceability)理论。现有运行时防护栏(runtime guardrails)在不可逆的工具调用前进行干预,但它们的保证取决于可表示的策略状态、裁判(judge)的观测能力以及干预是否改变未来行为。本文分离出三个核心问题:第一,相对于固定的预言谓词(oracle predicates),确定性门控(deterministic gate)恰好能执行那些其寄存器模型能够识别的良好前缀(good prefixes)的非空安全策略;当使用两个可递减计数器时,策略非平凡性(nontriviality)不可判定,但对于可分离的单调片段(separable monotone fragment)则属于PSPACE。第二,在固定的外生规律(exogenous law)下,Neyman-Pearson引理给出了精确的误拦截/漏报前沿(false-block/miss frontier),而共形校准(conformal calibration)给出了有限样本的边际保证(finite-sample marginal certificate),可能需要通过全拦截(block-all)实现。第三,一旦拦截改变了未来的提议,静态分数与非门控轨迹(ungated trajectories)无法识别闭环前沿;一个指定的有限控制模型(finite controlled model)可以产生占用程序(occupancy program)。有界表示攻击(bounded representation attacks)引入了鲁棒性裕度,因此仅凭良性校准(benign calibration)无法迁移。实验通过静态诊断、控制模型枚举、表示重写以及配对的闭环重运行来区分这些不同方面。该论文为智能体运行时安全提供了形式化理论基础,适合安全研究者、形式化方法学者以及AI安全工程师阅读。

💡 推荐理由: 该论文为智能体运行时安全提供了可执行性理论,帮助理解防护栏的局限与能力,对设计安全可靠的AI智能体系统具有指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)