推荐 5.5
Conf: 50%
本文介绍了 GPT-Red,一个用于自动红队评估的大语言模型智能体,其核心目标是自动发现针对前沿大语言模型的提示注入攻击。研究背景是随着 LLM 在真实生产系统中的广泛应用,提示注入等安全威胁日益严峻,而传统人工红队效率低、覆盖有限,因此需要可扩展的自动化方案。作者设计了一种可扩展的自博弈(self-play)训练算法:攻击者模型被训练去攻击一组同时训练的、多样化的防御者模型(defender agents),通过持续对抗迭代提升攻击能力。该模型在接近大型 RL 后训练的算力规模下进行训练,在真实的红队环境中训练,作者称之为迄今记录中最大规模的 LLM 安全训练运行。实验结果显示,GPT-Red 能够可靠地攻破过去发布的模型(最高至 GPT-5.5),其成功攻击数量高于人类红队人员,并能泛化到未见过的环境、防御模型与测试框架。该方法被用于对抗性训练 GPT-5.6,据称使其成为对提示注入最鲁棒的模型。作者预期随着模型鲁棒性提升,防御者会为更强的攻击者提供更好学习信号,形成自我改进的飞轮效应。这篇论文主要面向 LLM 安全研究员、红队工程师与模型部署方,展示了规模化自动化红队的技术路线与潜力。
💡 推荐理由: 提示注入是当前 LLM 应用面临的核心安全风险。本文提出了一种可扩展的自动化红队框架,通过自博弈方式发现攻击,并能直接用于对抗性训练模型,对生产系统安全评估和防御加固有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)