当前大语言模型(LLM)的安全性评估主要依赖单轮攻击数据集和单一评分器,这低估了自适应多轮攻击者带来的风险,并且报告的成功率无法区分部分可操作的输出与包含完整操作细节的输出。本文提出AMT-X(自适应多轮利用)框架,一种阶段结构化的多轮红队测试方法。与以往依赖临时升级或自由形式每目标计划的多轮攻击不同,AMT-X将攻击建模为一个显式的、可复现的多阶段状态机,由受害者模型的语义信号驱动,并用多角色评审团取代单一评分器,评审团通过阶段条件检查表来判定是否达到可操作危害。实验在六种前沿LLM(使用默认安全对齐,无额外调节层)和七个内容审核子类别上进行。在宽松阈值下,AMT-X的攻击成功率达到97.6-100%;但在要求完整、真实且可操作的严格阈值下,成功率降至66.7-78.6%,两者差距高达33个百分点。这表明现有评估可能严重高估了防护能力,因为大量成功攻击仅产生部分可操作信息,而真正的完整危害要少得多。该工作为LLM安全评估提供了一种更精细、更具挑战性的基准,有助于揭示模型在多轮对抗下的真实脆弱性。
💡 推荐理由: 该工作揭示了当前LLM安全评估的重大盲区:单轮测试和单一评分无法反映多轮自适应攻击中事实上的可操作危害。AMT-X提供更严格的评估标准,帮助防御者识别哪些攻击真的需要紧急应对,避免被虚假的“成功”误导。
🎯 建议动作: 研究跟进