该论文针对CPU侧大语言模型(LLM)分词器在机密计算环境(结合CPU和GPU可信执行环境)中存在的安全漏洞进行了深入研究。分词器通过表驱动查找将提示词转换为token,其内存访问模式会泄露用户输入的侧信道信息。已有工作证明,在Intel TDX上可以完整恢复用户提示词。直接使用树形不经意随机存取存储器(如PathORAM)虽然能防止访问模式泄露,但会导致分词器延迟增加约13倍,使首Token时间(TTFT)上升10%-58%。为此,本文提出OTRO(Oblivious Tokenization Path with Square-Root ORAM),一种针对延迟敏感的LLM服务的高效、无泄露的分词路径方案。OTRO基于平方根ORAM实现快速单次访问查找,但通过三项关键创新避免了平方根ORAM每√N次访问所需的昂贵的O(N log²N)重构开销:第一,利用分词器表的只读特性,提供一组复制的平方根ORAM实例池;第二,基于epoch的轮换策略将访问与重构解耦,并在每个epoch边界填充假访问以最小化可观测信息;第三,分块KV缓存感知的分词进一步将重构与GPU预填重叠,并最小化实例数量。在HuggingFace Tokenizers和nano-vLLM中实现,并运行于NVIDIA H100 GPU的TDX使能CVM中,OTRO将TTFT开销限制在最多4.5%,分词器引起的延迟低于总TTFT的10%,额外内存开销小于0.5GB,同时显著降低了分词器在不同模型系列和规模下的可观测泄露。研究贡献:提出一种实用的、针对LLM分词器的无泄露路径方案,在保持安全性的同时极大提升了性能,适合机密计算和隐私保护推理场景的研究人员及工程人员阅读。
💡 推荐理由: LLM服务中CPU侧分词器的侧信道泄露是机密计算场景下的关键安全隐患,OTRO提供了首个高性能且可部署的防御方案,对保护用户输入隐私至关重要。
🎯 建议动作: 研究跟进