本文研究多租户大语言模型(LLM)推理场景中 KV 缓存引发的时序侧信道泄露问题。KV 缓存是现代 LLM 推理的关键吞吐优化手段,通过跨请求复用前缀来加速生成;但在多租户部署中,该缓存被多个租户共享,攻击者可以利用缓存命中延迟差异,重建其他租户的私有提示词。已有三种攻击(PROMPTPEEK、EarlyBird、InputSnatch)利用了这一通道,在未防护的 vLLM 和 SGLang 上最高可达 100% 的攻击成功率,具体成功率取决于缓存架构和提示词结构。作者提出 KVGov,一个统一的治理层,专门应对这三类攻击的前缀缓存路径。其核心机制是为每个主体(租户)引入独立的盐值 sigma_p = HMAC_K(secret, principal_id),并以此作为块哈希链的种子,使不同主体之间的缓存键在密码学意义上互不相交。消融实验(N=1000 次试验,固定随机种子,确定性评估)证明该盐值是阻断攻击的必要且充分条件。KVGov 还包含 ORIGAMI,一种基于 Stackelberg 博弈的水填充审计调度器,在现实租户异质性(基尼系数 0.63)下将攻击者的期望效用降低 12.6%;演化稳定性分析给出 31.6% 的攻击者流行度临界点,低于该阈值时全局缓存保持稳定。在真实硬件(Qwen2.5-7B-Instruct、vLLM 0.26.0、NVIDIA A100)上,作者测量得到经过门控验证的冷/热 TTFT 比例为 0.22,确认了生产规模下该通道的可利用性;防御效果在与测量校准的模拟环境中评估。作者还在独立技术栈(Apple Metal 上的 llama.cpp)复现了该通道,比例为 0.093。最后,文章指出隔离与缓存效率并不必然冲突:识别信息只存在于提示词分叉处,因此在分叉边界注入盐值而非在链根处注入,可以在不产生跨主体信号的前提下保留约 93% 的前缀缓存收益。
💡 推荐理由: 该研究揭示了多租户 LLM 推理中 KV 缓存共享带来的严重隐私泄露风险,并给出了可落地的防御机制,对使用 vLLM/SGLang 等推理框架的云服务商和模型托管方具有直接参考价值,有助于在设计阶段规避时序侧信道。
🎯 建议动作: 研究跟进