#multi-turn-attack

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Feitong Qiao, Liren Peng, Shiming Ren, Aishwarya Jadhav, Arghavan Bahadorinejad, Marinette Chen, Muhan Zhang, Abdulaziz Suria, Gennevi Lu, Anish Das Sarma

前沿语言模型通常会拒绝有害的单轮提示,但在多轮交互中,当用户逐渐表达恶意意图时,模型可能会妥协,这种现象被称为多轮攻击。现有自动化红队方法多将攻击视为生成问题,产生一系列单次成功的攻击示例,但缺乏对模型失败模式的系统性理解。本文作者提出将多轮红队攻击重新定义为搜索问题,并介绍了一种名为EvoFlint的方法,其核心是应用进化质量-多样性搜索来发现、组织和迭代优化攻击策略的多样化档案,而非生成零散的攻击列表。EvoFlint的关键设计包括:攻击策略表示为分阶段对话计划,而非原始文本提示,并通过LLM驱动的变异与交叉操作进行演化;使用帕累托适应度函数综合考虑攻击成功率和峰值严重程度,以保留接近成功的攻击信号;维护风险索引档案,利用局部竞争机制和策略描述嵌入进行新颖性搜索,在保持多样性的同时避免预设风格分类;引入代际记忆机制,在整体群体中累积对目标模型的洞察,并将其反馈到策略生成过程,以指导后续搜索。论文在HarmBench测试集上评估了EvoFlint,结果显示其对多种前沿模型均能实现较高的攻击成功率:在Claude Sonnet 4.6上达到35.8%,在GPT-5.4上达到59.7%,在Qwen3-32B上达到94.3%,对旧版GPT-4o则达到98.7%(作为基准参考)。生成的攻击策略档案按风险类别组织,清晰展示了各目标模型在哪些危害类别上防护不足。该方法为理解LLM多轮安全漏洞提供了结构化视角,有望用于自动化安全评估和模型加固。

💡 推荐理由: 多轮攻击是LLM安全研究中的盲区,EvoFlint将零散攻击探索转化为结构化风险图谱,有助于企业安全团队在模型上线前系统识别自身模型在不同危害类别上的防护缺口,并为红队自动化评估提供新思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

本文针对工具型大语言模型(LLM)智能体在多轮交互中的安全风险提出了一种新的防御方法。传统安全防护主要关注生成文本中的恶意内容,但工具型智能体能够执行影响外部系统的动作,安全风险范围因此扩展至动作序列。多轮分解攻击(multi-turn decomposition attacks)将有害目标拆解到多个单独看似合理的请求和工具调用中,只有从累计的交互轨迹中才能显现真实意图。现有的防御方法要么依赖额外的在线推理来恢复长期安全证据,要么在动作生成后再评估,导致推理成本增加或依赖特定运行时的动作表示。为此,作者提出生成时防御方法 ReDiR(Reassembling Distributed Risk),在动作生成之前,将当前轨迹压缩为紧凑的潜在安全表示,并将其注入冻结的基础模型。该表示通过同一模型的跨视图监督学习得到:显式任务视图中的安全行为提供监督信号,用于从原始多轮轨迹中恢复分布式的安全证据。ReDiR 无需独立的动作级安全模块,即可在生成过程中直接整合跨轮安全信息。作者在三个模型家族、八个保留工具域的两个智能体安全基准上进行评估,结果表明 ReDiR 将攻击成功率降至 8% 以下,能够迁移到未见过的工具域,同时保持良性的保真度并引入较低的计算开销。这篇论文面向 LLM 智能体安全研究者和安全防御工程师,提供了一种轻量级、生成阶段即可生效的防护思路。

💡 推荐理由: 该工作解决了多轮工具调用智能体难以检测分布式恶意意图的痛点,提供生成时轻量防御,且不依赖外部安全模块,适合集成到现有智能体系统中以降低跨轮攻击风险。

🎯 建议动作: 研究跟进,评估该方法在自身智能体业务场景中的适用性与额外的安全收益。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)