本文研究推理时扩展(Inference-time Scaling)中安全模型与奖励模型组合产生的安全漏洞。典型推理时流水线会采样多个候选输出,通过一个学习的安全代理过滤掉不安全的输出,然后从剩余“代理可行”集合中选择学习奖励最高的输出。作者发现这种组合会导致两阶段失效:第一阶段,不完美的安全代理会错误地将一些不安全输出认定为可行,从而污染可行集;第二阶段,奖励最大化会倾向于选择尾部更高的不安全输出,从而放大残留污染。作者将这种“通过安全代理筛选却违反真实安全标准”的输出选择过程定义为“安全黑客(Safety Hacking)”。针对受约束的Best-of-N采样,作者推导了有限N下的风险上界,该上界由可行集中安全与不安全输出的联合奖励上尾决定。如果“不安全但被误判可行”的输出具有更重的尾部,那么随着N增大,安全黑客发生的概率将渐近趋于1,即使安全代理的假阳性率极低,平均安全/奖励预测误差任意小也无法避免。进一步,作者证明在卡方散度有界的策略分布下,存在与N无关的安全黑客上界,并据此提出约束悲观采样作为覆盖控制策略。然而,覆盖控制只能限制放大效应,无法修复已被污染的可行集;被错误允许的不安全输出可能仍然被偏好,且正则化选择并不总是比普通约束Best-of-N更安全。作者在玩具模型和语言模型实验中验证了污染和奖励尾部放大的现象,揭示了依赖学习安全模型进行推理时扩展的固有困难。该研究为AI安全对齐提供了重要理论警示,建议部署此类系统时需谨慎。
💡 推荐理由: 该研究从理论上证明:在推理时扩展中,即使安全代理看起来准确,奖励最大化也可能系统性放大其漏报,导致不安全内容被选中。这对依赖学习安全模型过滤的LLM应用构成严峻风险,提醒安全团队必须重新审视推理时采样流程的安全性。
🎯 建议动作: 研究跟进