这篇论文指出,当前语言模型安全评估普遍以“单次交互”为单位,即判断某一条请求/响应是否有害;而这种评估范式忽略了一个结构性缺口:能力可以被拆分、外借并在本地重新组合。作者提出并命名了这种攻击范式为“能力洗白(capability laundering)”。其核心思路是:一个较弱、未对齐(或对齐较弱)的本地模型充当“编排者”,把一个本身有害的总体任务拆解成若干单独看上去无害的子问题,然后把这个子问题分别、独立地提交给更强且对齐良好的前沿模型(论文中称为“咨询者/顾问”),最后在本地把各子问题的回答合并、组装回原始的完整答案。与传统的越狱(jailbreak)不同,这里的每一次交互、每一条响应都不是一个有害任务,因此现有基于单次响应内容的安全过滤器很难判定违规。 作者提出了量化这种“咨询增益(consultation-aided uplift)”的实验范式:使用那些“原始前沿模型能解、但经对齐的前沿模型会拒答、而未获协助的本地编排者无法完成”的任务集合,来度量本地模型在借助外部咨询后能力提升的幅度。实验在三个方向上展开:CyBench、BountyBench,以及有害的 CBRN(化生放核)请求。作为“咨询者”的前沿模型包括 GPT-5.5、Claude Opus 4.8、Grok-4.3,本地编排者则有四款本地模型。 主要实验结果显示:在 CyBench 上,Gemma-4-31B 借助 GPT-5.5 恢复了 14 个候选中的 8 个,借助 Opus 恢复 9 个中的 7 个;作为对照,较弱的 Gemma-4-12B 仅为 21 个中 2 个和 15 个中 4 个。在 BountyBench 上,Gemma-4-31B 分别恢复 9 个中的 3 个与 3 个中的 2 个,而 Muse-Glimmer-30B 在 22 个与 13 个候选中一个都未能恢复。在 CBRN 方向,作者沿一条假想的生物武器攻击链的八个步骤进行评分,发现咨询行为使 Gemma-4-31B 的平均评分从 62.3 提升到 83.1(满分 100)。 结论是:拒绝一个有害任务,并不能阻止前沿模型的能力通过大量“各自均被允许”的交互被转移与组装。这暴露了当前防御体系在会话级、任务级、以及跨模型调用链上的监测盲区,对模型提供方、Agent 编排框架设计者和安全评估方法论都提出了新的要求。
💡 推荐理由: 它表明单轮内容审核与拒答策略存在结构性盲区:攻击者可把有害目标拆成多个无害子查询,跨模型拼接能力,绕过基于单次响应的防护。任何对外提供模型 API 或自建 Agent 编排的团队都需重新评估威胁模型。
🎯 建议动作: 研究跟进,并将多轮、跨模型的“任务分解与能力组合”场景纳入内部 LLM 安全评估与检测规则设计。