本论文针对推测性解码在零温度下的安全性问题进行了系统研究。推测性解码通过让草稿模型生成候选令牌并由目标模型验证,从而加速推理,但可能引入安全风险——草稿模型的输出行为是否会在温度为零时泄漏到最终安全评分输出中?作者提出了典型接受不变性筛选(TAIS),一种行为等价性检测方法,用于比较仅目标模型输出与推测性解码输出在同一安全测试集上的表现。TAIS要求字节级完全匹配、TOST等价性(±3个百分点偏差)以及每个任务的Cohen's h低于校准的零假设阈值(|h|<0.1)。实验基于16,783样本的确认核心集和44,066匹配扩展样本(涵盖fp16/bf16精度、标准草稿与DPO对抗草稿、GPTQ-4bit量化草稿、两种随机种子及四个安全基准),结果表明:在零温度下,vLLM堆栈在TAIS检测中未发现可测安全差异。最大Cohen's h为0.024,约为传统微小效应阈值的十分之一;27个任务TOST对比中有25个通过±3pp边界;两个未通过案例是能力域Wald-CI边界情况,并非真正的非等价。DPO对抗草稿在4,006样本上与标准草稿输出字节完全相同。bf16精度虽改变36%-53%的输出字节,但未使任何任务安全率超出等价范围。此外,对70B规模模型进行4,006样本探测(因缺少匹配的70B仅目标模型组而未计入TAIS通过),在700个AdvBench完成中拒绝率为0.839(95% Wilson CI [0.809, 0.864])。论文明确声明不涉及其他采样温度、未测试框架、未测试模型族或树推测变体(如EAGLE、Medusa)。该研究为LLM推理加速组件的安全性评估提供了可复用的方法论。
💡 推荐理由: 首个系统研究推测性解码在零温度下安全性的工作,提出的TAIS方法可检测推理加速引入的安全偏差,对LLM服务部署中的安全审核有直接指导价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)