推荐 5.5
Conf: 50%
随着大型语言模型(LLM)智能体越来越多地调用外部工具并与真实世界系统交互,不安全的行为可能对外部状态、用户数据和下游服务造成不可逆的后果。现有的运行时防护栏(runtime guardrails)通过在动作执行之前进行检查来缓解此类风险,但其中许多方法仍然是反应式的:它们主要评估当前动作的表观安全性,缺乏对风险如何在轨迹中演变的显式建模。这一局限导致长期风险(long-horizon risks)出现盲区——单个看似良性的动作可能逐渐将智能体引向危险状态。为此,论文提出 DreamGuard,一种面向 LLM 智能体的主动式防护栏,其核心是风险感知的世界模型(risk-aware world model)。该世界模型在轨迹上维护一个紧凑的循环潜在状态,并预测未来的潜在状态,从中提取即时危险(immediate-hazard)和前序风险(prefix-risk)证据,进而在动作执行前融合多时间尺度的信号做出干预决策。实验在四个基准和一个在线防护栏评估中进行,结果显示 DreamGuard 优于通用、反应式和主动式防护栏基线,在安全性-效用权衡上取得最佳平衡,并且每次调用的端到端平均延迟仅为 25 毫秒,具备实际部署的可行性。该研究适合 LLM 安全、AI 智能体防护、运行时监控和系统安全方向的研究人员及工程师阅读。
💡 推荐理由: LLM 智能体长期风险难以通过单步检测发现,DreamGuard 提出可预测轨迹风险的世界模型,为安全防护栏设计提供了新思路,值得关注。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)