#hardware-fingerprinting

共收录 2 条相关安全情报。

← 返回所有主题
推荐 3.5
Conf: 50%
👥 作者: Faruk Alpay, Taylan Alpay

该论文提出了一种用于云GPU租户对物理加速器进行软件认证的原始方法。当前云GPU租户只能获得模型名称和区域,无法直接检查运行其任务的物理加速器。作者利用CUDA探针测量SM(流多处理器)与内存区域之间的延迟矩阵,通过物理SM标签和依赖的全局加载实现。一个流式归约器将足够的统计信息、配置、代码哈希、网络证据以及压缩的原始数据归档提交到证书中,验证者无需GPU即可检查该证书。该证书支持三个主张:第一,每个SM的延迟图是稳定的物理指纹。在RTX 5090满载运行六小时的情况下,其中位时间抖动为0.09个周期,而仅形状的留一法分类以100.0%的准确率区分不同的Blackwell芯片。第二,绕过缓存的HBM扫描能够恢复跨代的硬件级拓扑,包括统一的Volta V100内存域、两路Hopper H200 L2拆分以及Blackwell B200双芯片NV-HBI封装,其74/74 SM分区存在30个周期(15.5纳秒)的跨芯片惩罚。第三,公共网络地标将同一证书绑定到粗略位置。在B200运行中,169个RIPE Atlas探测器将服务器定位于其声称的数据中心44公里范围内,并拒绝了所有11个诱饵站点。总之,这些测量无需特权访问或供应商密钥即可检查云GPU的身份、类别和粗略位置。该方法适用于安全分析师、云租户以及对硬件信任根有需求的场景。

💡 推荐理由: 提供了一种无需供应商密钥或特权访问的云GPU远程认证手段,解决了租户无法验证物理加速器真实性的信任缺口,对云端安全审计和合规有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Faruk Alpay, Baris Basaran

本论文首次揭示了NVIDIA L40 GPU的L2缓存延迟并非传统认为的全局一致,而是随执行加载指令的流式多处理器(SM)的不同而显著变化。作者设计了一种基于轮询和SMID解析的探测方法,能够单次启动即可测量全部142个SM的L2命中延迟。测量结果显示,延迟并非恒定在约279周期,而是分布在222至339周期之间(跨度达52%),且每次重复的噪声低于0.01周期。通过加法模型L = μ + a(SM) + b(slice)可解释R²=0.87(加入一个秩一项后达0.98),其中SM项呈现二重对称性(两个72 SM半区的相关系数r=0.999),与AD102的GPC布局一致。独立访问模式在SM间的一致性达r=1.000,证明该效应是物理层面的。同样的探测在Blackwell RTX 5090上验证具有通用性,但每个芯片的模式是设备特定的。将该映射作为指纹,单次用户级探测即可在92%的准确率下识别设备内的SM,并且两个物理相同的L40设备可被100%区分(尽管平均延迟几乎相同,每SM图相关系数仅0.63),表明这是每芯片的硬件身份而非时钟抖动。这一发现构成了自定位与指纹识别原语:内核读取自身位置和设备信息,而非受害者数据,也不提取秘密数据。该映射稳定,在两台设备上满负荷运行一小时后仍未改变。作为应用,根据该映射分配延迟敏感型工作负载可将完成时间缩短高达11%。此外,还展示了单线程容量、行标签、预取修改器和持久L2等控制实验。论文附带了种子数据、原始观测、训练模型和再生脚本。

💡 推荐理由: 本工作颠覆了GPU缓存延迟均匀的传统认知,首次揭示SM级延迟差异可作为硬件指纹,但明确不涉及信息泄露。对于安全领域,它提供了一种无扰的设备指纹识别方法,并可能启发架构级侧信道防御研究。

🎯 建议动作: 研究跟进,评估在自有GPU基础设施中利用该现象进行负载优化或设备识别的可行性,并关注后续可能的安全影响。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)