#speculative-decoding

共收录 4 条相关安全情报。

← 返回所有主题
推荐 5.5
Conf: 50%
👥 作者: Rui Wen, Ahmed Salem, Andrew Paverd, Mark Russinovich, Zheng Li

该论文关注大语言模型供应链中的后门风险:模型常被第三方微调、共享或直接下载,因此实际部署的模型可能在良性输入下表现完全正常,一旦出现攻击者预设的秘密触发器,就切换为攻击者控制的行为。部署前的静态审计虽然有效,但对于持续更新、频繁重新微调或热替换权重的模型,运行时监控仍然必不可少。然而 LLM 推理服务对延迟极其敏感,已有的推理时后门检测器存在两类局限:一是依赖对触发器形式的先验假设(例如假设触发器是固定短串或特定 token),面对隐蔽、自适应设计的攻击容易失效;二是需要在推理路径上引入额外的模型计算,例如对输入做扰动、多次前向或额外执行一遍生成,带来明显的吞吐与延迟代价。 作者提出 SpecGuard,一个推理时后门检测器,其核心思路是复用投机解码(speculative decoding)这一常见的推理加速机制,从而在不增加任何额外模型计算成本的前提下获得检测能力。投机解码的工作方式是:由一个小型草稿模型一次性提议多个候选 token,再由目标模型并行验证并决定是否接受,以加快生成。论文观察到,这个验证过程本身就隐含了一个有价值的安全信号:当后门被触发时,目标模型的行为会向攻击者期望的方向偏移,而干净的草稿模型并不会预测出这种偏移,因此草稿 token 的接受率会出现可观测的变化(相对良性输入下的基线发生偏离)。作者进一步形式化刻画了该信号在什么条件下会出现,并给出分析表明:攻击者若想刻意压制这一信号,就必须同时削弱后门本身的效力,即检测能力与后门强度之间存在内在权衡。 实验上,作者在多种后门类型与多个模型家族上评估 SpecGuard,结果显示它能够可靠地检测出被触发的后门行为,其中包括那些输入层过滤手段完全失效的隐蔽攻击情形;同时它不需要像现有运行时检测器那样付出额外的生成开销。论文由此得出结论:投机解码除了加速推理之外,还可以同时充当一个免费、常开(always-on)的检测信号,用于发现被植入后门的 LLM 行为。

💡 推荐理由: 第三方微调与频繁更新的模型很难仅靠上线前审计覆盖,而运行时检测普遍受制于延迟成本。该工作提示一种零额外推理开销、可常开的后门监控信号,并与输入层过滤形成互补,适合推理服务与模型托管方纳入评估。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Haoxuan Luo, Jameson Sandler, Ferdinando Fioretto

投机解码是一种加速自回归生成的技术,通过一个小型草稿模型生成候选 token 序列,再由大型目标模型并行验证。然而,传统的投机解码仍需要在每个草稿块上调用验证器,这成为性能瓶颈。特别地,投机扩散解码(SDD)通过离散扩散模型并行生成整个草稿块,进一步消除了顺序起草,但每个块仍然需要验证。本文提出“验证器跳过”(verifier skipping)方法,这是一种有损策略,即直接将草稿块的某个前缀提交为生成结果,而不经过验证器。核心研究问题是如何选择调度跳过决策的置信度信号。作者发现,更好的 token 预测器并不必然带来更好的跳过调度,因为跳过需要连续的高置信度前缀,而短跳转可能导致额外的起草轮次。为了解决这种不匹配,他们在相同策略下比较了原始置信度、学习到的边际生存分数和条件生存分数,并以严格 SDD、宽容(lenience)和 top-k 接受作为基线。在 HumanEval 基准上使用 DiffuCoder-7B-Instruct 和 Qwen3-32B 作为目标模型,实验表明所有三种置信度信号在保持相同 pass@1 的前提下,节省了 9.6% 到 13.5% 的验证器调用。令人惊讶的是,原始置信度节省最多;边际生存的每个位置 AUROC 在多数位置上高于原始置信度,但两者在在线评估中都没有一致的统治力。作者的分析表明,验证器跳过是一个有用的新有损维度,其关键挑战在于前缀调度而非单纯的 token 预测。

💡 推荐理由: 对安全运营而言,LLM 推理效率优化并不直接产生漏洞,但理解此类有损机制有助于评估模型输出完整性风险,以及推理服务的成本与可靠性。该研究揭示验证环节可能被有意或无意跳过,值得在审计模型服务时关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Run Wang, Chaoyi Zhou, Xi Liu, Yi Zhu, Amir Salarpour, Pedram MohajerAnsari, Zhi-Qi Cheng, Feng Luo, Siyu Huang, Mert D. Pesé

推测解码是一种无损加速方案,通过草稿模型与目标模型之间的动态token级对齐实现推理加速。然而,这种语义等价的保证隐藏着严重的操作漏洞:草稿-目标对齐可被系统性攻击。本文提出ADSD,据我们所知,这是首个通过推动草稿概率质量朝向目标模型不太可能接受的token来破坏验证器接受的提示后缀攻击。ADSD使用Soft-Collapse——一种基于非对称推测接受规则推导出的验证器对齐替代目标,以及一个防止明显任务破坏的目标保持目标。ADSD成功生成了高效的对抗后缀。在GSM8K数据集上,我们的攻击使平均样本时间增加62.3%,同时保持了任务质量。我们进一步证明该漏洞存在于不同领域、推测解码策略和模型架构中。

💡 推荐理由: 推测解码被广泛用于加速大语言模型推理,但该研究揭示了其安全假设的脆弱性。攻击者可能通过精心构造的提示后缀,在不明显降低任务质量的情况下,显著增加推理延迟,为服务稳定性带来威胁。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sahil Kadadekar

本论文针对推测性解码在零温度下的安全性问题进行了系统研究。推测性解码通过让草稿模型生成候选令牌并由目标模型验证,从而加速推理,但可能引入安全风险——草稿模型的输出行为是否会在温度为零时泄漏到最终安全评分输出中?作者提出了典型接受不变性筛选(TAIS),一种行为等价性检测方法,用于比较仅目标模型输出与推测性解码输出在同一安全测试集上的表现。TAIS要求字节级完全匹配、TOST等价性(±3个百分点偏差)以及每个任务的Cohen's h低于校准的零假设阈值(|h|<0.1)。实验基于16,783样本的确认核心集和44,066匹配扩展样本(涵盖fp16/bf16精度、标准草稿与DPO对抗草稿、GPTQ-4bit量化草稿、两种随机种子及四个安全基准),结果表明:在零温度下,vLLM堆栈在TAIS检测中未发现可测安全差异。最大Cohen's h为0.024,约为传统微小效应阈值的十分之一;27个任务TOST对比中有25个通过±3pp边界;两个未通过案例是能力域Wald-CI边界情况,并非真正的非等价。DPO对抗草稿在4,006样本上与标准草稿输出字节完全相同。bf16精度虽改变36%-53%的输出字节,但未使任何任务安全率超出等价范围。此外,对70B规模模型进行4,006样本探测(因缺少匹配的70B仅目标模型组而未计入TAIS通过),在700个AdvBench完成中拒绝率为0.839(95% Wilson CI [0.809, 0.864])。论文明确声明不涉及其他采样温度、未测试框架、未测试模型族或树推测变体(如EAGLE、Medusa)。该研究为LLM推理加速组件的安全性评估提供了可复用的方法论。

💡 推荐理由: 首个系统研究推测性解码在零温度下安全性的工作,提出的TAIS方法可检测推理加速引入的安全偏差,对LLM服务部署中的安全审核有直接指导价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)