推荐 5.5
Conf: 50%
该论文针对在NVIDIA Blackwell B200 GPU上运行大语言模型(LLM)推理与训练时,使用可信执行环境(TEE)所带来的性能开销进行了系统测量。研究基于Intel Trust Domain Extensions(TDX)机密虚拟机与NVIDIA Confidential Computing(CC)功能,在同一物理主机上通过仅切换GPU CC位和TDX guest对象,构造了成对的机密/非机密对照实验。核心发现是:当软件栈配置正确时,Blackwell上的机密推理吞吐量开销仅为个位数百分比(约1-3%);而常见的默认推理栈由于存在可避免的配置问题,会带来30-40%的额外开销。作者指出,开销不能简单地用一个单一数值概括,而是受两个独立维度支配:一是固定的每主机操作成本,该成本随批处理大小增大而摊销;二是与NVLink流量相关的成本,该成本与步骤中加密集合通信所占比例成正比。哪个维度占主导取决于具体工作负载和软件实现。论文将每种开销定位到特定的加密边界,并提出了一个微基准测试,能够准确预测服务化场景下的性能损失(误差在若干次提交以内)。最后,文章给出了具体的部署指南。实验还表明,启用CC不会影响GPU计算能力、功耗或可用内存容量。这项工作为需要保护LLM工作负载但又担心性能损失的从业者提供了宝贵的量化依据,并强调了配置优化在机密计算中的关键作用。适合云服务商、AI基础设施团队以及机密计算平台开发者阅读。
💡 推荐理由: 该论文为TEE在GPU上的实际性能开销提供了首个量化基准,纠正了“机密计算必然带来高开销”的误解,对计划部署机密LLM服务的蓝队与基础设施团队具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)