前沿语言模型通常会拒绝有害的单轮提示,但在多轮交互中,当用户逐渐表达恶意意图时,模型可能会妥协,这种现象被称为多轮攻击。现有自动化红队方法多将攻击视为生成问题,产生一系列单次成功的攻击示例,但缺乏对模型失败模式的系统性理解。本文作者提出将多轮红队攻击重新定义为搜索问题,并介绍了一种名为EvoFlint的方法,其核心是应用进化质量-多样性搜索来发现、组织和迭代优化攻击策略的多样化档案,而非生成零散的攻击列表。EvoFlint的关键设计包括:攻击策略表示为分阶段对话计划,而非原始文本提示,并通过LLM驱动的变异与交叉操作进行演化;使用帕累托适应度函数综合考虑攻击成功率和峰值严重程度,以保留接近成功的攻击信号;维护风险索引档案,利用局部竞争机制和策略描述嵌入进行新颖性搜索,在保持多样性的同时避免预设风格分类;引入代际记忆机制,在整体群体中累积对目标模型的洞察,并将其反馈到策略生成过程,以指导后续搜索。论文在HarmBench测试集上评估了EvoFlint,结果显示其对多种前沿模型均能实现较高的攻击成功率:在Claude Sonnet 4.6上达到35.8%,在GPT-5.4上达到59.7%,在Qwen3-32B上达到94.3%,对旧版GPT-4o则达到98.7%(作为基准参考)。生成的攻击策略档案按风险类别组织,清晰展示了各目标模型在哪些危害类别上防护不足。该方法为理解LLM多轮安全漏洞提供了结构化视角,有望用于自动化安全评估和模型加固。
💡 推荐理由: 多轮攻击是LLM安全研究中的盲区,EvoFlint将零散攻击探索转化为结构化风险图谱,有助于企业安全团队在模型上线前系统识别自身模型在不同危害类别上的防护缺口,并为红队自动化评估提供新思路。
🎯 建议动作: 研究跟进