推荐 3.5
Conf: 50%
本文针对AI代理在复杂数字环境中的安全策略验证问题,提出了一种高效且合理的概率验证框架。现有运行时监控方法通常基于Datalog等形式语言制定确定性策略,但在实际场景中,许多安全策略涉及概率性因素,例如PII检测器或解分类器在每次调用时存在一定失败概率。此外,先前的工作依赖于独立性假设进行概率推理,这在实践中难以满足。因此,作者引入了基于分布鲁棒优化的方法,能够在不知道谓词之间相关性的情况下,计算策略违反概率的严格上界。该方法不假设独立性,仅利用边际概率信息,通过求解线性规划问题获得可证明的上界。在终端代理和工具调用代理的标准基准测试上,实验结果表明该方法优于现有技术,在保证策略违反概率严格界限的同时,改善了安全与效用的权衡。该工作为AI代理在不确定环境下的安全保证提供了新的理论工具和实用方案。
💡 推荐理由: 现有AI代理安全监控仅支持确定性策略,无法处理PII检测器、分类器等的概率性失败。本文首次在无需独立性假设下实现概率策略的严格验证,直接提升了实际部署中AI代理的安全保障能力。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)