本文提出一种名为 Comet 的高效隐私推理系统,旨在加速基于云平台的大语言模型(LLM)推理服务,同时缓解用户对敏感信息泄露的担忧。当前主流方案采用安全多方计算(MPC)保护推理过程中的数据隐私,但 MPC 需要频繁的服务器间通信,导致显著性能开销。作者观察到 LLM 中普遍存在激活稀疏性——即经过非线性激活函数后,大多数神经元未被激活,其输出为零。基于此观察,Comet 设计了一种准确且快速的预测器,用于预测激活函数输出的稀疏分布;同时引入新的隐私推理协议,利用预测得到的稀疏分布空间局部性,高效且安全地跳过涉及零值的计算。由于这种计算回避策略会破坏 KV 缓存条目的时空连续性,作者提出一种低通信开销的缓存重填策略,合并未命中请求并引入预取机制予以解决。实验基于四种常见 LLM,并与六种最先进的隐私推理系统比较,Comet 实现了 1.87 倍至 2.63 倍的加速以及 1.94 倍至 2.64 倍的通信量减少。本文面向隐私计算、LLM 推理优化以及系统安全领域的研究者与工程师,重点展示了如何利用模型结构特性增强 MPC 方案的实用性。
💡 推荐理由: 为 LLM 隐私推理的性能瓶颈提供了新颖的稀疏感知优化方向,显著降低 MPC 通信开销,对云上安全推理服务的实际落地具有重要参考价值。
🎯 建议动作: 研究跟进