本文针对大语言模型(LLM)服务框架在共享基础设施上处理大量含敏感用户数据时的隔离问题展开研究。现有LLM服务通常将CPU侧框架与GPU加速器结合使用,但同一服务框架内的不同用户之间,以及用户与GPU上的LLM操作者之间,缺乏强隔离机制,可能导致隐私泄露。为此,作者提出GIFT(GPU信息流跟踪系统),通过GPU侧的信息流跟踪来强制执行用户数据隔离,同时保持极低的性能开销。GIFT的设计高度非侵入性,允许CPU侧服务框架自由演进,其核心基于两个关键洞察:第一,加密即隔离——CPU组件仅负责协调数据流而非内容操作,因此采用按用户加密的方式即可在无需修改服务逻辑的前提下实现隔离;第二,GPU内核的信息流模式有限且可预测,能够进行静态流分析。GIFT为每个内核预计算信息流规则,并采用解耦的流跟踪机制,避免了对GPU进行插桩或造成GPU停顿。此外,作者将GIFT扩展为GIFT-CC,集成机密计算技术,以抵御不受信任的操作系统和虚拟机监控器(即LLM服务提供商)的威胁。通过在vLLM和DistServe上的实现,GIFT和GIFT-CC在保持相同延迟水平的同时,仅带来4%-10.7%的吞吐量开销,证明了其高效性和实用性。该研究为LLM服务中的数据隔离提供了一种新颖且可行的硬件辅助方案,适合系统安全、LLM基础设施和隐私计算领域的研究人员及工程师阅读。
💡 推荐理由: LLM服务中用户数据隔离是隐私保护的关键,GIFT通过GPU信息流跟踪实现了低开销的强制隔离,且不侵入现有架构,为多租户LLM服务提供了切实可行的安全增强方向,值得安全从业者关注。
🎯 建议动作: 研究跟进