本文针对大语言模型(LLM)在云环境部署中面临的敏感数据泄露和完整性风险,系统研究了利用CPU与GPU可信执行环境(TEE)实现端到端机密AI工作流的可行性与性能开销。当前主流云服务(Azure、GCP、AWS)依赖集中式基础设施,用户必须共享训练代码和敏感数据,而传统TEE(如Intel SGX/TDX、AMD SEV-SNP)主要保护CPU侧,NVIDIA H100/H200 GPU TEE虽已推出,但缺乏对端到端工作流(CPU+GPU组合)的全面评估。论文提出了一个集成CPU TEE(Intel TDX和AMD SEV-SNP)与GPU TEE(NVIDIA H200)的参考架构,在虚拟机级和应用级分别设计机密性与完整性保护机制。特别指出了Kubernetes管理员可能利用特权访问机密虚拟机内容的潜在攻击面。实验采用行业基准(如MLPerf)评估性能开销,重点分析了TDX+H200配置下的推理与训练延迟。主要贡献包括:1)首次公开评估CPU+GPU TEE端到端工作流的性能与安全性;2)识别出Kubernetes管理员层面的信任边界漏洞;3)提出应用级完整性保护方案以防止VM级旁路。该工作为云环境中机密LLM部署提供了设计参考,但尚未解决GPU TEE的远程证明标准化问题。
💡 推荐理由: 当前LLM云部署缺乏CPU+GPU TEE端到端安全评估,本文首次系统评估了Intel TDX与NVIDIA H200 GPU TEE组合的性能与安全性,并指出K8s管理员可窃取机密VM内容,对安全架构师和云服务商有直接参考价值。
🎯 建议动作: 研究跟进