#kv-cache

共收录 6 条相关安全情报。

← 返回所有主题
👥 作者: Rana Abu Bakar

该论文研究多租户大语言模型(LLM)服务场景下,共享KV缓存(key-value cache)重用所引发的定时侧信道攻击在真实并发负载下的可靠性问题。尽管已有工作表明此类攻击可行,但在实际多租户竞争环境中其稳定性尚未被充分理解。作者在真实共享LLM服务系统上设计了七组实验,使用vLLM服务器部署DeepSeek-R1-Distill-Llama-8B模型于NVIDIA GB10平台进行验证。实验发现,当没有合成工作负载时平均Cohen's d值为0.7789,当增加两个工作进程时该值降至0.2109(t=8.412),而进一步增加工作进程数量并未导致统计上显著的额外衰减;120次稀疏重叠实验将最佳断点置于测量范围边界(tau=0, 95% CI [0.000,0.113]),表明存在环境负载与满载之间的状态转换,而非内部物理阈值。AUROC从环境负载下的0.650降至接近61%重叠时的0.531,并在饱和时部分恢复至0.574。并发深度方差是效应量(r=-0.416)和命中一致性(r=-0.637)最强的实测相关因素。交错对照实验保持了相同的非单调排序。在真实的两节点、双GPU张量并行vLLM配置中重演了主要崩溃现象,平均d值从3.418降至0.511(p<0.01)。两个SGLang试点实验在统计上无法得出结论。总体而言,KV缓存定时侧信道的可靠性强烈依赖于负载状态和服务堆栈,在安静系统上进行的测量可能会高估实际部署中的攻击可靠性。

💡 推荐理由: 该研究直接评估KV缓存侧信道在真实多租户高并发下的可靠性,表明安静环境中的测量会高估攻击风险,对蓝队评估LLM共享基础设施的泄露风险有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chao Yao, Yangbo Wei, Zhen Huang, Junhong Qian, Chenle Chen, Shaoqiang Lu, Chen Wu, Lei He

本文针对长时运行的有状态 LLM 智能体(agent)提出“执行状态遗忘”(execution-state unlearning)问题。这类智能体不仅保存对话记录,还累积了压缩摘要、明文记忆、待执行的工具计划,以及每次服务 API 下的 KV 缓存。现有的“遗忘”操作通常只是删除一条明文记忆记录即停止,导致由被撤销信息派生出的所有产物(如缓存中的隐式表示、后续推理结果)依然保留,无法真正实现“像从未见过该目标一样”的行为。作者将智能体运行时建模为确定性转移系统,严格证明了三个关键事实:一是目标注入前的轨迹前缀与反事实世界共享,无需重算;二是目标注入后的后缀在缺少 token 级归因的情况下必然被污染;三是精确遗忘至少需要 T-τ+1 次重算转移(τ 为目标注入步)。基于此理论下界,文章提出“来源引导的选择性重放”(Provenance-Guided Selective Replay, PGSR),作为一种跨层契约,同时作用于提示词、压缩记忆和 KV 缓存:通过来源图定位注入点,用检查点恢复裁剪 KV 缓存,再用净化后的重放重新生成反事实后缀。实验在三个智能体套件、九个基线和三个模型家族上进行,采用诱导、随机和无字符串行为测试评估。结果表明:仅删除记忆的基线无法降低泄漏;基于指令的遗忘在诱导测试下完全失败(Leak@probes=1.00);源文本删除仍会在 80% 的回合中影响被撤销的偏好;而选择性重放与完全重置难以区分,并且重算 token 数最多降低 9 倍。研究贡献在于形式化定义有状态 LLM 智能体的精确遗忘、证明计算下界,并提供一种高效的跨层实现方法。适合关注 LLM 隐私合规、智能体安全与记忆管理的安全研究员和工程师阅读。

💡 推荐理由: 有状态 LLM 智能体的记忆删除不彻底会带来严重隐私与合规风险;本文首次给出执行状态遗忘的形式化下界与可行实现,对设计真正可遗忘的智能体系统具有指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Tejasvi C. Addagada

本文研究多租户大语言模型(LLM)推理场景中 KV 缓存引发的时序侧信道泄露问题。KV 缓存是现代 LLM 推理的关键吞吐优化手段,通过跨请求复用前缀来加速生成;但在多租户部署中,该缓存被多个租户共享,攻击者可以利用缓存命中延迟差异,重建其他租户的私有提示词。已有三种攻击(PROMPTPEEK、EarlyBird、InputSnatch)利用了这一通道,在未防护的 vLLM 和 SGLang 上最高可达 100% 的攻击成功率,具体成功率取决于缓存架构和提示词结构。作者提出 KVGov,一个统一的治理层,专门应对这三类攻击的前缀缓存路径。其核心机制是为每个主体(租户)引入独立的盐值 sigma_p = HMAC_K(secret, principal_id),并以此作为块哈希链的种子,使不同主体之间的缓存键在密码学意义上互不相交。消融实验(N=1000 次试验,固定随机种子,确定性评估)证明该盐值是阻断攻击的必要且充分条件。KVGov 还包含 ORIGAMI,一种基于 Stackelberg 博弈的水填充审计调度器,在现实租户异质性(基尼系数 0.63)下将攻击者的期望效用降低 12.6%;演化稳定性分析给出 31.6% 的攻击者流行度临界点,低于该阈值时全局缓存保持稳定。在真实硬件(Qwen2.5-7B-Instruct、vLLM 0.26.0、NVIDIA A100)上,作者测量得到经过门控验证的冷/热 TTFT 比例为 0.22,确认了生产规模下该通道的可利用性;防御效果在与测量校准的模拟环境中评估。作者还在独立技术栈(Apple Metal 上的 llama.cpp)复现了该通道,比例为 0.093。最后,文章指出隔离与缓存效率并不必然冲突:识别信息只存在于提示词分叉处,因此在分叉边界注入盐值而非在链根处注入,可以在不产生跨主体信号的前提下保留约 93% 的前缀缓存收益。

💡 推荐理由: 该研究揭示了多租户 LLM 推理中 KV 缓存共享带来的严重隐私泄露风险,并给出了可落地的防御机制,对使用 vLLM/SGLang 等推理框架的云服务商和模型托管方具有直接参考价值,有助于在设计阶段规避时序侧信道。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 5.6
Conf: 50%
👥 作者: Yichi Zhang, Zhiqi Wang, Huan Zhang, Yuchen Yang

本文揭示了大型语言模型(LLM)中位置无关KV缓存重用机制引入的一种新安全威胁——KV缓存劫持(KV Cache Hijacking)。传统的基于前缀的KV缓存重用精确匹配token和位置,缓存命中率低。为提升效率,近期系统优化提出位置无关的KV重用,允许相同文本块(无论位置)复用缓存。然而,这种设计存在隐患:KV缓存通过token匹配检索,但编码了原始计算时的上下文。因此,一个看似良性的token chunk所关联的KV可能隐含攻击者控制的前缀。当该KV被复用到受害者查询中时,会静默劫持模型行为,即使输入中不含攻击者控制的文本。作者提出首个系统性攻击框架HIJACKKV,通过优化攻击者控制的前缀,使得后续常见良性文本的KV编码攻击者目标,而文本本身保持不变以命中缓存。实验表明,HIJACKKV单次攻击平均成功率达94%;在低缓存命中率(10%)和频繁重新计算(50%)等现实约束下仍然有效;可跨多轮交互持久化,并在黑盒场景下跨模型迁移。论文进一步给出了构建安全KV重用系统的设计思路。

💡 推荐理由: 该攻击利用LLM系统优化中未被注意的安全盲点,可静默操控模型输出,对部署了KV缓存加速的LLM服务构成实际威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Gabriel Garcia

本文研究了在共享全局上限的解码时(decode-time)场景下,多种KV缓存逐出策略(LRU, H2O, SnapKV, StreamingLLM, Ada-KV, QUEST, Random)的表现。作者发现,这些策略存在一个共同的漏洞:缺乏结构保护(structural protection)时,在六个纯Transformer模型上性能几乎崩溃(F1≤0.064)。通过在每次边界保留10%的缓存,在7个LongBench模型上,缓存上限C=256(仅保留13%的缓存)时恢复了69-90%的参考上限(C=2048)质量;在十个模型面板上恢复68-98%。注意力质量实验(Qwen2.5-3B, N=30)揭示了原因:位置0的sink token持有约75%的prefix质量,而其他边界token接近均匀期望的0.41倍,因此注意力评分器会保留sink token,但仍会丢弃结构上关键的token。有了保护,简化的评分隔离变体在K=32时与LRU等效(Δ=0.02),在K=8时注意力策略彼此收敛但在C=256和C=512时仍比LRU高0.011-0.021 F1。忠实实现的Ada-KV/QUEST在Mistral-7B和Phi-3.5上比简化变体额外提升约0.03-0.04 F1。在NIAH-32K长上下文场景(Qwen3-4B, C∈{512,2048})下,保护提升效果几乎相同(比率0.99-1.00)。在64K长度时,保护有帮助但恢复有限;仅在模型本身无需逐出即可支持强64K检索时,忠实每头评分才能在6.3%保留率下匹配全缓存上限(Gemma-3-4B)。总体结论:结构保护占主导地位;一旦边界得到保护,评分差异是次要的;每头分配带来额外的适度提升。该研究揭示了当前缓存逐出策略的脆弱性,并强调了保护prompt边界的重要性,对LLM推理效率与质量平衡有重要指导意义。

💡 推荐理由: 本文揭示了主流KV缓存逐出策略在全局共享上限下的系统性缺陷,提出简单的结构保护即可大幅恢复性能,对于部署长上下文LLM的工程团队具有直接实践价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhifan Luo, Shuo Shao 0002, Su Zhang, Lijing Zhou, Yuke Hu, Chenxu Zhao, Zhihao Liu, Zhan Qin

本文研究了大型语言模型(LLM)推理过程中键值缓存(KV-cache)带来的隐私风险。KV-cache是LLM中用于加速自回归解码的关键组件,它会存储中间注意力层的键和值张量。作者发现,KV-cache中可能残留用户输入的敏感信息,例如个人身份、医疗记录或金融数据。通过分析KV-cache的数据生命周期,攻击者若获得缓存访问权限(如通过共享内存、侧信道攻击或模型托管环境中的越权访问),可重建部分用户输入,导致隐私泄露。论文提出了一种基于差分隐私的缓存扰动机制,在KV-cache写入内存前添加精心设计的噪声,使得攻击者无法准确恢复原始数据,同时最小化对推理质量和性能的影响。实验在多个主流LLM(如LLaMA、GPT类模型)上验证了方法的有效性:隐私保护强度可调节,且模型困惑度下降不超过2%,推理延迟增加小于5%。此外,论文还讨论了与现有内存加密和访问控制技术的互补性。该研究首次系统性地披露了KV-cache作为LLM隐私攻击面的可能性,并提供了实用的防御思路。

💡 推荐理由: KV-cache是LLM推理的标配优化技术,但其隐私风险此前未被重视。该研究揭示了新的攻击面,对使用共享推理基础设施(如云端API、边缘设备)的场景有直接威胁。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)