#nvidia-l40

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Faruk Alpay, Baris Basaran

本论文首次揭示了NVIDIA L40 GPU的L2缓存延迟并非传统认为的全局一致,而是随执行加载指令的流式多处理器(SM)的不同而显著变化。作者设计了一种基于轮询和SMID解析的探测方法,能够单次启动即可测量全部142个SM的L2命中延迟。测量结果显示,延迟并非恒定在约279周期,而是分布在222至339周期之间(跨度达52%),且每次重复的噪声低于0.01周期。通过加法模型L = μ + a(SM) + b(slice)可解释R²=0.87(加入一个秩一项后达0.98),其中SM项呈现二重对称性(两个72 SM半区的相关系数r=0.999),与AD102的GPC布局一致。独立访问模式在SM间的一致性达r=1.000,证明该效应是物理层面的。同样的探测在Blackwell RTX 5090上验证具有通用性,但每个芯片的模式是设备特定的。将该映射作为指纹,单次用户级探测即可在92%的准确率下识别设备内的SM,并且两个物理相同的L40设备可被100%区分(尽管平均延迟几乎相同,每SM图相关系数仅0.63),表明这是每芯片的硬件身份而非时钟抖动。这一发现构成了自定位与指纹识别原语:内核读取自身位置和设备信息,而非受害者数据,也不提取秘密数据。该映射稳定,在两台设备上满负荷运行一小时后仍未改变。作为应用,根据该映射分配延迟敏感型工作负载可将完成时间缩短高达11%。此外,还展示了单线程容量、行标签、预取修改器和持久L2等控制实验。论文附带了种子数据、原始观测、训练模型和再生脚本。

💡 推荐理由: 本工作颠覆了GPU缓存延迟均匀的传统认知,首次揭示SM级延迟差异可作为硬件指纹,但明确不涉及信息泄露。对于安全领域,它提供了一种无扰的设备指纹识别方法,并可能启发架构级侧信道防御研究。

🎯 建议动作: 研究跟进,评估在自有GPU基础设施中利用该现象进行负载优化或设备识别的可行性,并关注后续可能的安全影响。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)