本文研究了大语言模型(LLM)防御体系的分层堆叠效果。实践中,防御者常通过叠加多层防御来增强安全性,但堆叠是否真正有效取决于一个关键条件:各防御层必须在不同的失败样本上出错,即失败独立性。然而,LLM安全文献虽推荐这一假设,却从未实际测量。为此,作者提出了两个工具框架:一是Adversary Access-Tier Model(AATM),按攻击者拥有的访问权限分级,从仅系统访问(A0)到能影响训练数据(A4),用以刻画攻击者能力;二是成本模型,将防御按推理时开销分为五类,由于其中两类需要训练权重或读取激活值,因此防御者本身也存在能力分级。基于这两个模型,作者推导出堆叠防御的整体行为,并发现防御者关心的指标存在分化:分层覆盖在同一访问等级内趋于饱和,成本随类别上升,误拒率以并集方式累积,剩余攻击成功率仅在独立性条件下呈乘法下降。为了验证独立性,作者对七层防御堆叠实施了一个自适应攻击者,测量了所有十五个可比较防御层对之间的失败相关性。结果显示,所有对的相关性均为正,φ值介于0.30到0.75之间,联合剩余风险比乘法预测最高高出0.172。按行为难度分层后,大部分关联消失,表明依赖性主要源于共同原因(即被包装的底层模型),但这种相关性在排列推断、多数投票标签和外部校准阈值下仍然稳健。此外,该堆叠在误拒率上拒绝了五分之四的正常良性提示,但在统计上与最强单层防御不可区分。作者认为,相关性是架构性的而非采样性的:防御层通过它们共同包裹的模型相互关联,因此扩大防御层池无法削弱这种相关性。结论是,多样性有助于选择防御成员,但无法预测组装后堆叠的实际效果,必须端到端进行测量。
💡 推荐理由: 首次实证测量了LLM多层防御之间的失败相关性,证明堆叠防御并不像假设的那样独立叠加,且误拒率极高,对蓝队设计多层防护体系有直接警示意义。
🎯 建议动作: 研究跟进