#inference-optimization

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Haoxuan Luo, Jameson Sandler, Ferdinando Fioretto

投机解码是一种加速自回归生成的技术,通过一个小型草稿模型生成候选 token 序列,再由大型目标模型并行验证。然而,传统的投机解码仍需要在每个草稿块上调用验证器,这成为性能瓶颈。特别地,投机扩散解码(SDD)通过离散扩散模型并行生成整个草稿块,进一步消除了顺序起草,但每个块仍然需要验证。本文提出“验证器跳过”(verifier skipping)方法,这是一种有损策略,即直接将草稿块的某个前缀提交为生成结果,而不经过验证器。核心研究问题是如何选择调度跳过决策的置信度信号。作者发现,更好的 token 预测器并不必然带来更好的跳过调度,因为跳过需要连续的高置信度前缀,而短跳转可能导致额外的起草轮次。为了解决这种不匹配,他们在相同策略下比较了原始置信度、学习到的边际生存分数和条件生存分数,并以严格 SDD、宽容(lenience)和 top-k 接受作为基线。在 HumanEval 基准上使用 DiffuCoder-7B-Instruct 和 Qwen3-32B 作为目标模型,实验表明所有三种置信度信号在保持相同 pass@1 的前提下,节省了 9.6% 到 13.5% 的验证器调用。令人惊讶的是,原始置信度节省最多;边际生存的每个位置 AUROC 在多数位置上高于原始置信度,但两者在在线评估中都没有一致的统治力。作者的分析表明,验证器跳过是一个有用的新有损维度,其关键挑战在于前缀调度而非单纯的 token 预测。

💡 推荐理由: 对安全运营而言,LLM 推理效率优化并不直接产生漏洞,但理解此类有损机制有助于评估模型输出完整性风险,以及推理服务的成本与可靠性。该研究揭示验证环节可能被有意或无意跳过,值得在审计模型服务时关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yifei Wang, Tianlin Li, Xiaohan Zhang, Yida Yang, Xiaoyu Zhang, Li Pan

该论文首次揭示了LLM推理优化(尤其是编译优化)中存在的安全漏洞,并提出了一种新型后门攻击——优化触发后门。作者指出,尽管编译优化在部署LLM时广泛使用,且默认假设编译后的计算图与原始计算图语义等价,但编译过程中的数值副作用可能被恶意利用,从而在LLM中植入隐蔽后门。论文提出了两种互补的攻击策略:一种针对特定输入,在模型被编译时才触发预测翻转;另一种使用通用触发器,在未编译执行时保持休眠,一旦应用编译优化则劫持任意输入。两种攻击均能绕过未启用编译的标准安全评估。实验在四个主流开源LLM和四个任务上进行,平均攻击成功率达90%,同时干净准确率在几乎所有设置下保持接近100%。该研究揭示了一个位于LLM部署流水线中优化与安全交叉点的新攻击面,并探讨了实用的防御措施。适合LLM安全研究人员、部署工程师以及编译器开发者阅读。

💡 推荐理由: 该工作揭示了LLM部署中一个被忽视的攻击面——编译优化本身可被武器化植入后门,对安全审计和合规部署构成威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)