推荐 3.5
Conf: 50%
该论文提出了一种用于云GPU租户对物理加速器进行软件认证的原始方法。当前云GPU租户只能获得模型名称和区域,无法直接检查运行其任务的物理加速器。作者利用CUDA探针测量SM(流多处理器)与内存区域之间的延迟矩阵,通过物理SM标签和依赖的全局加载实现。一个流式归约器将足够的统计信息、配置、代码哈希、网络证据以及压缩的原始数据归档提交到证书中,验证者无需GPU即可检查该证书。该证书支持三个主张:第一,每个SM的延迟图是稳定的物理指纹。在RTX 5090满载运行六小时的情况下,其中位时间抖动为0.09个周期,而仅形状的留一法分类以100.0%的准确率区分不同的Blackwell芯片。第二,绕过缓存的HBM扫描能够恢复跨代的硬件级拓扑,包括统一的Volta V100内存域、两路Hopper H200 L2拆分以及Blackwell B200双芯片NV-HBI封装,其74/74 SM分区存在30个周期(15.5纳秒)的跨芯片惩罚。第三,公共网络地标将同一证书绑定到粗略位置。在B200运行中,169个RIPE Atlas探测器将服务器定位于其声称的数据中心44公里范围内,并拒绝了所有11个诱饵站点。总之,这些测量无需特权访问或供应商密钥即可检查云GPU的身份、类别和粗略位置。该方法适用于安全分析师、云租户以及对硬件信任根有需求的场景。
💡 推荐理由: 提供了一种无需供应商密钥或特权访问的云GPU远程认证手段,解决了租户无法验证物理加速器真实性的信任缺口,对云端安全审计和合规有重要价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)