大型语言模型(LLM)的自动化红队攻击与蓝队防御技术正在快速发展,但现有的攻击者和防御者通常被孤立地构建和测试,导致评测分数难以反映真实对抗能力。为解决这一问题,本文提出了 ACEA(Adversarial Co-Evolution Arena,对抗性共进竞技场),一个将可插拔的红队适配器和蓝队适配器连接到共享目标 LLM 的平台,并通过 LLM 裁判对双方进行攻击率和防御率的评分。ACEA 的贡献包含四个部分:第一,一个可插拔、模型无关的竞技场。任何红队或蓝队项目只需通过最小化 HTTP 协议(称为 ASAP 标准适配协议)即可接入,且不限制编程语言;只要暴露该协议即可成为完整参与者。第二,一套为对抗轮次设计的评估方法。通过用规范秘密(canonical secrets)对目标进行种子注入,可获得可验证的 ground truth,从而区分真实泄露与模型幻觉。同时,即使防御成功,攻击样本仍会被发送到目标,以独立衡量攻击的原始威力(raw potency),不受是否被拦截的影响。这些机制共同构成了每一轮攻击强度与防御效果的分解指标。第三,实时的游戏式可视化界面及详细的战后报告,能够定位每一次失败的具体原因,使评估成为改进红队或蓝队项目的可操作信号。第四,一个可选的上下文改进循环,将每轮结果转化为下一轮的建议提示(advisory hints)。适配器无需保持状态即可跨轮次适应,只需读取这些提示即可。文章详细描述了 ACEA 的设计,以及红蓝双方在对抗中如何进行头对头评分。该研究适用于 LLM 安全评估人员、红队攻防研究者及安全工具开发者,旨在提供更可信、可分解的对抗评测框架。
💡 推荐理由: 现有LLM红蓝对抗评测互相隔离,分数可信度低。ACEA提供了可插拔的头对头共进评测平台,能精准区分攻击威力与防御效果,为红蓝队迭代提供可操作信号。
🎯 建议动作: 研究跟进