#speculative-decoding

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Run Wang, Chaoyi Zhou, Xi Liu, Yi Zhu, Amir Salarpour, Pedram MohajerAnsari, Zhi-Qi Cheng, Feng Luo, Siyu Huang, Mert D. Pesé

推测解码是一种无损加速方案,通过草稿模型与目标模型之间的动态token级对齐实现推理加速。然而,这种语义等价的保证隐藏着严重的操作漏洞:草稿-目标对齐可被系统性攻击。本文提出ADSD,据我们所知,这是首个通过推动草稿概率质量朝向目标模型不太可能接受的token来破坏验证器接受的提示后缀攻击。ADSD使用Soft-Collapse——一种基于非对称推测接受规则推导出的验证器对齐替代目标,以及一个防止明显任务破坏的目标保持目标。ADSD成功生成了高效的对抗后缀。在GSM8K数据集上,我们的攻击使平均样本时间增加62.3%,同时保持了任务质量。我们进一步证明该漏洞存在于不同领域、推测解码策略和模型架构中。

💡 推荐理由: 推测解码被广泛用于加速大语言模型推理,但该研究揭示了其安全假设的脆弱性。攻击者可能通过精心构造的提示后缀,在不明显降低任务质量的情况下,显著增加推理延迟,为服务稳定性带来威胁。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sahil Kadadekar

本论文针对推测性解码在零温度下的安全性问题进行了系统研究。推测性解码通过让草稿模型生成候选令牌并由目标模型验证,从而加速推理,但可能引入安全风险——草稿模型的输出行为是否会在温度为零时泄漏到最终安全评分输出中?作者提出了典型接受不变性筛选(TAIS),一种行为等价性检测方法,用于比较仅目标模型输出与推测性解码输出在同一安全测试集上的表现。TAIS要求字节级完全匹配、TOST等价性(±3个百分点偏差)以及每个任务的Cohen's h低于校准的零假设阈值(|h|<0.1)。实验基于16,783样本的确认核心集和44,066匹配扩展样本(涵盖fp16/bf16精度、标准草稿与DPO对抗草稿、GPTQ-4bit量化草稿、两种随机种子及四个安全基准),结果表明:在零温度下,vLLM堆栈在TAIS检测中未发现可测安全差异。最大Cohen's h为0.024,约为传统微小效应阈值的十分之一;27个任务TOST对比中有25个通过±3pp边界;两个未通过案例是能力域Wald-CI边界情况,并非真正的非等价。DPO对抗草稿在4,006样本上与标准草稿输出字节完全相同。bf16精度虽改变36%-53%的输出字节,但未使任何任务安全率超出等价范围。此外,对70B规模模型进行4,006样本探测(因缺少匹配的70B仅目标模型组而未计入TAIS通过),在700个AdvBench完成中拒绝率为0.839(95% Wilson CI [0.809, 0.864])。论文明确声明不涉及其他采样温度、未测试框架、未测试模型族或树推测变体(如EAGLE、Medusa)。该研究为LLM推理加速组件的安全性评估提供了可复用的方法论。

💡 推荐理由: 首个系统研究推测性解码在零温度下安全性的工作,提出的TAIS方法可检测推理加速引入的安全偏差,对LLM服务部署中的安全审核有直接指导价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)