本研究提出 Bifrost,一种融合可信执行环境(TEE)与全同态加密(FHE)的混合推理架构,旨在解决云端 Transformer 和大语言模型(LLM)推理中的用户隐私保护问题。当前云端推理存在直接机密性风险:用户提示可能包含敏感代码、业务数据、个人信息或受监管文件,但远程服务会将中间状态暴露给云端软件栈和加速器运行时。全同态加密(FHE)能在加速器端保持纯密文执行,但端到端 LLM 推理因线性层与非线性、缓存状态和刷新敏感算子交错而成本高昂。CPU 可信执行环境(TEE)可原生执行这些算子,但单独的 CPU TEE 无法定义不可信加速器如何参与。Bifrost 的核心思路是将秘密仅提供给经过认证的 CPU TEE,而加速器、设备内存、驱动/运行时栈和主机软件均不在可信计算基内。它利用 FHE 作为安全委托机制,在加速器支持的 CKKS 上执行投影和前馈线性层,同时非线性算子、注意力侧控制逻辑、KV 状态转换以及解密-再加密刷新均在 CPU TEE 内部执行。进一步地,Bifrost+ 应用了预填充/解码分离:提示侧 KV 状态在 CPU TEE 内构建,仅解码侧状态进入混合密文路径。在采用 Euston 方法论进行估计风格对比时,Bifrost 在 GPT-2(1.5B)上预测延迟降低 9.25 倍,在 LLaMA 3(8B)上降低 9.91 倍。在直接 CKKS/FHE 部署中,Bifrost+ 在 GPT-2(124M)上将首词延迟(TTFT)降低 14.6-45.8 倍,在 Qwen3(0.6B)上降低 15.3-53.4 倍。本工作的系统教训是选择性加密执行:仅在需要加速器纯密文委托时使用 FHE,而将非线性、刷新和提示侧工作保留在 CPU TEE 内。该研究适合关注隐私保护推理、TEE 与 FHE 混合方案的安全工程师和研究人员。
💡 推荐理由: 该方案针对云端LLM推理的隐私保护痛点,提出一种实用且高性能的混合架构,为安全从业者提供了在不牺牲性能的前提下保护用户数据的思路。
🎯 建议动作: 研究跟进