该论文研究多租户大语言模型(LLM)服务场景下,共享KV缓存(key-value cache)重用所引发的定时侧信道攻击在真实并发负载下的可靠性问题。尽管已有工作表明此类攻击可行,但在实际多租户竞争环境中其稳定性尚未被充分理解。作者在真实共享LLM服务系统上设计了七组实验,使用vLLM服务器部署DeepSeek-R1-Distill-Llama-8B模型于NVIDIA GB10平台进行验证。实验发现,当没有合成工作负载时平均Cohen's d值为0.7789,当增加两个工作进程时该值降至0.2109(t=8.412),而进一步增加工作进程数量并未导致统计上显著的额外衰减;120次稀疏重叠实验将最佳断点置于测量范围边界(tau=0, 95% CI [0.000,0.113]),表明存在环境负载与满载之间的状态转换,而非内部物理阈值。AUROC从环境负载下的0.650降至接近61%重叠时的0.531,并在饱和时部分恢复至0.574。并发深度方差是效应量(r=-0.416)和命中一致性(r=-0.637)最强的实测相关因素。交错对照实验保持了相同的非单调排序。在真实的两节点、双GPU张量并行vLLM配置中重演了主要崩溃现象,平均d值从3.418降至0.511(p<0.01)。两个SGLang试点实验在统计上无法得出结论。总体而言,KV缓存定时侧信道的可靠性强烈依赖于负载状态和服务堆栈,在安静系统上进行的测量可能会高估实际部署中的攻击可靠性。
💡 推荐理由: 该研究直接评估KV缓存侧信道在真实多租户高并发下的可靠性,表明安静环境中的测量会高估攻击风险,对蓝队评估LLM共享基础设施的泄露风险有重要参考价值。
🎯 建议动作: 研究跟进