#multi-turn

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Shi Lin, Peng Qian, Dinghao Liu, Renjie Sun, Sifan Wu, Dezhang Kong, Chenpei Wang, Xun Wang

随着大语言模型(LLM)从独立助手演化为自主智能体,其安全挑战已从单点风险转向长时序轨迹中的风险演化。在多轮交互中,恶意意图可以被拆解到多个看似无害的轮次,再通过交互轨迹逐步重组,最终引发安全故障。现有防御手段大多是反应式的,只能检测已经发生的违规,无法预测潜在风险的演化过程并实现预防性拦截。针对这一局限,本文提出 Recast,一个安全风险预测框架,将LLM安全防护从轮次级的违规检测提升到轨迹级的风险预测。Recast 首先通过双尺度轨迹视图,从短期对话进展和长期历史上下文中检索与风险相关的证据;随后建模组合式风险演化,捕获当前风险配置及其时间动态;最后利用因果时序编码器学习潜在风险演化模式,预测未来风险出现的轮次分布。在7类风险上的大量实验表明,Recast 能够以平均2.41轮的前置时间预测88.3%的未来安全故障,同时保持12.3%的误报率,展示了轨迹级预测在安全违规发生前识别新兴风险的有效性。本文的贡献在于:提出了一种新的风险预测范式,从被动检测转向主动预警;设计了双尺度证据检索与组合式演化建模方法;并在多类别风险上验证了框架的通用性和有效性。适合关注LLM智能体安全、红队评估和主动防御机制的研究人员阅读。

💡 推荐理由: 该研究为LLM智能体安全提供了从轮次级检测转向轨迹级预测的新思路,能提前2.41轮预警风险,对构建预防性安全机制具有重要参考价值,尤其适用于多轮交互场景下的风险管控。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hanwool Lee, Dasol Choi, Bokyeong Kim, Seung Geun Kim, Haon Park

本文提出了NRT-Bench,一个用于多轮红队测试LLM代理在安全关键系统中鲁棒性的基准。研究背景是LLM代理越来越多地被提议作为安全关键系统的监督组件,但它们在持续自适应对抗压力下的鲁棒性尚未充分表征。作者将场景实例化为一个模拟的核电站控制室,其中包含一个由五个角色组成的操作员团队,每个角色由可配置的LLM支持,管理一个受六项关键安全功能(CSFs)约束的核电站。攻击者通过四个通道在有限多轮会话中注入消息,每轮有反馈。危害是一个客观信号,而非LLM评判的文本:一旦任何CSF丢失,运行立即终止,并归因于导致该情况的消息。通过固定攻击配对重放协议评估了四种前沿操作员模型,发现自适应多轮攻击可靠地将操作员团队推过安全极限:在四种模型上,8.7%到12.1%的攻击会话以失去关键安全功能告终。尽管四种模型在此聚合率上看起来几乎同样鲁棒,但它们的失败几乎不重叠:在149次会话中,没有一次击败所有四种模型,而三分之一击败至少一种,因此漏洞在不同模型间几乎不相交而非嵌套。添加防御的效果强烈依赖于模型:相同的护栏堆栈或安全顾问智能体可能会降低一种模型的攻击成功率,却提高另一种模型的成功率。作者发布了模拟场地、攻击数据集和重放工具,用于LLM代理的可重复安全评估。

💡 推荐理由: 该研究首次系统评估了LLM代理在安全关键核设施场景下对抗多轮自适应攻击的鲁棒性,揭示了不同LLM模型的漏洞几乎不重叠,且防御效果高度模型相关,对安全关键系统部署LLM代理具有重要警示意义。

🎯 建议动作: 纳入内部评估,考虑在模拟环境中复现基准以测试现有LLM代理系统的鲁棒性。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)

提出一种名为Transient Turn Injection (TTI)的新型多轮攻击技术,通过跨隔离交互分布恶意意图来利用大语言模型的无状态审核漏洞。

💡 推荐理由: 该攻击突破了传统越狱依赖持久对话上下文的限制,揭示了商用和开源LLM在面对多轮分散攻击时的脆弱性,尤其在医疗等高危领域,为安全防御提出了新挑战。

🎯 建议动作: 研究跟进

排序因子: 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)