投机解码是一种加速自回归生成的技术,通过一个小型草稿模型生成候选 token 序列,再由大型目标模型并行验证。然而,传统的投机解码仍需要在每个草稿块上调用验证器,这成为性能瓶颈。特别地,投机扩散解码(SDD)通过离散扩散模型并行生成整个草稿块,进一步消除了顺序起草,但每个块仍然需要验证。本文提出“验证器跳过”(verifier skipping)方法,这是一种有损策略,即直接将草稿块的某个前缀提交为生成结果,而不经过验证器。核心研究问题是如何选择调度跳过决策的置信度信号。作者发现,更好的 token 预测器并不必然带来更好的跳过调度,因为跳过需要连续的高置信度前缀,而短跳转可能导致额外的起草轮次。为了解决这种不匹配,他们在相同策略下比较了原始置信度、学习到的边际生存分数和条件生存分数,并以严格 SDD、宽容(lenience)和 top-k 接受作为基线。在 HumanEval 基准上使用 DiffuCoder-7B-Instruct 和 Qwen3-32B 作为目标模型,实验表明所有三种置信度信号在保持相同 pass@1 的前提下,节省了 9.6% 到 13.5% 的验证器调用。令人惊讶的是,原始置信度节省最多;边际生存的每个位置 AUROC 在多数位置上高于原始置信度,但两者在在线评估中都没有一致的统治力。作者的分析表明,验证器跳过是一个有用的新有损维度,其关键挑战在于前缀调度而非单纯的 token 预测。
💡 推荐理由: 对安全运营而言,LLM 推理效率优化并不直接产生漏洞,但理解此类有损机制有助于评估模型输出完整性风险,以及推理服务的成本与可靠性。该研究揭示验证环节可能被有意或无意跳过,值得在审计模型服务时关注。
🎯 建议动作: 研究跟进