随着大语言模型(LLM)从独立助手演化为自主智能体,其安全挑战已从单点风险转向长时序轨迹中的风险演化。在多轮交互中,恶意意图可以被拆解到多个看似无害的轮次,再通过交互轨迹逐步重组,最终引发安全故障。现有防御手段大多是反应式的,只能检测已经发生的违规,无法预测潜在风险的演化过程并实现预防性拦截。针对这一局限,本文提出 Recast,一个安全风险预测框架,将LLM安全防护从轮次级的违规检测提升到轨迹级的风险预测。Recast 首先通过双尺度轨迹视图,从短期对话进展和长期历史上下文中检索与风险相关的证据;随后建模组合式风险演化,捕获当前风险配置及其时间动态;最后利用因果时序编码器学习潜在风险演化模式,预测未来风险出现的轮次分布。在7类风险上的大量实验表明,Recast 能够以平均2.41轮的前置时间预测88.3%的未来安全故障,同时保持12.3%的误报率,展示了轨迹级预测在安全违规发生前识别新兴风险的有效性。本文的贡献在于:提出了一种新的风险预测范式,从被动检测转向主动预警;设计了双尺度证据检索与组合式演化建模方法;并在多类别风险上验证了框架的通用性和有效性。适合关注LLM智能体安全、红队评估和主动防御机制的研究人员阅读。
💡 推荐理由: 该研究为LLM智能体安全提供了从轮次级检测转向轨迹级预测的新思路,能提前2.41轮预警风险,对构建预防性安全机制具有重要参考价值,尤其适用于多轮交互场景下的风险管控。
🎯 建议动作: 研究跟进