#loop-safety

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

本文研究自主大语言模型(LLM)代理以循环方式长期运行时的安全性问题。在这种系统中,代理从一个人类目标出发,反复进行任务发现、规划、执行工具调用、验证结果,并在多次无人监督的迭代中持续保存状态。然而,当前广泛使用的代理安全机制通常定义在单条轨迹上,其安全状态会在下一条轨迹开始时重新初始化。作者指出,这并非实现细节,而是安全属性无法组合的根本性失败。核心理论结果是一个分离定理:针对证据碎片化分布在多次迭代中的攻击,任何仅基于单条轨迹的监控器,其真正例率等于假正例率,无论监控器多强,因为所需证据从未出现在其可见窗口内;而保留跨迭代状态的监控器则能完美区分攻击与正常行为。进一步,作者证明简单的"几何衰减风险评分"修复方案不足,因为耐心攻击者需要等待的冷却期是常数,不随总步数 N 增长。为此,作者提出 LoopHarness 框架,在循环层面恢复持久且非衰减的安全状态。在受控提交和仲裁器检测下限 δ_M 的假设下,未授权不可逆动作的期望数量被限制为 B+m-1+m/δ_M,这是与 N 无关的常数,其中 B+m-1 项由与模型无关的规则决定,因此即使验证者完全合谋也无法绕过。作者还提供了完整的评估协议,使用原生 Agent-SafetyBench 任务并配对干净与攻击场景,设计了仅在跨迭代时存在关键证据的外层状态攻击套件,进行逐模块消融,并执行自适应白盒红队测试。该工作适合 LLM 代理安全研究者、AI 系统安全工程师以及关注自主代理可靠性的部署方阅读。

💡 推荐理由: 自主LLM代理的长期运行已成为现实场景,但现有安全监控器仅覆盖单条轨迹,存在根本性盲区。本研究首次在理论上证明该缺陷无法通过更强大的轨迹级监控器弥补,并提供循环级持久状态的解决思路,对安全架构设计有直接指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)