#gpu

共收录 11 条相关安全情报。

← 返回所有主题
👥 作者: Shixuan Zhao 0002, Zhongshu Gu, Salman Ahmed 0001, Enriquillo Valdez, Hani Jamjoom, Zhiqiang Lin 0001

本文提出了一种名为 GPU Travelling 的新型机制,旨在解决机密协作机器学习(Confidential Collaborative ML)中因模型和数据集规模快速增长而导致的通信开销过大的问题。在传统的多方联合训练场景中,多个互不信任的数据持有方需要共同训练一个模型,同时保护各自私有数据的机密性。然而,现有方法通常需要在训练过程中通过较慢的常规网络频繁交换模型参数和梯度,当训练对象为大规模语言模型(LLM)等现代工作负载时,通信成本急剧上升,成为性能瓶颈。GPU Travelling 的核心思想是利用新兴的机密 GPU 技术(如 Intel TDX 和 NVIDIA H100 机密计算能力),让 GPU 以安全的方式“移动”到某个数据持有方处,直接将数据集加载到 GPU 的受保护内存中,然后再返回计算节点进行训练,从而完全避免了原始数据的网络传输,同时将机密性保障提升到数据中心级别。作者基于 Intel TDX 和 NVIDIA H100 构建了原型系统,并在基于 CUDA 的 LLM 训练项目 llm.c 上进行了性能评估。实验结果表明,与传统的传输方式相比,在传输 512 MiB 数据块时,GPU Travelling 实现了至少 4 倍的加速,同时保持了较强的安全保证。该研究为隐私保护下的协作训练提供了一种新的硬件辅助思路,尤其适用于模型和数据集规模庞大的场景,但也面临硬件依赖、数据中心内信任边界以及调度复杂性等挑战。

💡 推荐理由: 为 LLM 等大规模协作训练提供了硬件级隐私保护方案,可显著降低 TEE 场景下的通信瓶颈,对联合学习、多方计算等需要数据隔离的 ML 系统设计具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Simone Gargiulo, Gabriel Kulp

该论文研究如何利用物理侧信道(GPU功耗)进行AI工作负载识别,为AI治理中的计算验证提供技术基础。作者指出,AI计算验证是国际AI治理政策中第一个可落地、可操作的关键点。监管机构若要判断前沿实验室或其他操作方是否遵守相关协议,需要能辨别其GPU计算资源的具体用途(如训练、推理或其它非AI计算)。与可被欺骗或重放的片上NVML遥测不同,物理功耗通道原则上可以在操作者不配合的情况下被外部独立观测。作者在NVIDIA H200 GPU上记录了930条约10 MHz采样率的5秒功耗迹线,涵盖17个开源大语言模型(LLM)家族和25种非AI工作负载。基于该语料库,他们以97%的准确率和0.955的宏平均F1分数,成功将训练、推理与非AI计算区分开来,且评估采用的模型家族在训练中从未出现过。频谱分析表明,AI工作负载的功耗成分主要低于20 kHz,其中训练过程因显存受限的优化器更新而具有特别显著的特征。为进一步验证方法的健壮性,作者将GPU操作者视为对抗性攻击者,允许其重塑物理计算过程,并测试了四种将训练伪装为推理的逃避策略,共生成680条对抗性迹线。经对抗性强化训练的检测器(保留被测试策略)对其中三种策略的捕获率不低于99%;对于第四种“稀释的低秩自适应(LoRA)”策略,强化分类器的检测率在48%到88%之间,但添加额外的救援规则后可将检测率提升至98%以上。作者声明,这些攻击测试并非对对抗性行为的全面评估,但提供了超越真实活动场景的初步洞见,并公开了数据集,以促进更强逃避机制的研究与检测模型的开发。整体而言,该研究展示了外部物理信道用于AI合规监控的可行性与对抗性挑战,对AI治理、GPU资源审计和基础设施安全均有重要参考价值。

💡 推荐理由: 该研究首次证明仅凭外部功耗观测即可高精度区分AI训练、推理与非AI负载,为AI治理合规监控提供了不依赖内部遥测的独立验证通道;同时揭示攻击者可利用LoRA等策略逃避检测,对建设AI计算审计体系有直接警示作用。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xiaochen Zou, Juefei Pu, Arrdya Srivastav, Jonathan Cox, Zhengchuan Liang, Yuan Tan, Xingyu Li, Yilin Zhu, Zhiyun Qian

本文(arXiv 论文,题目为《StepStone: LLM-Based GPU Kernel Driver Fuzzing via User-Space Libraries》)提出了一种基于大语言模型(LLM)的 GPU 内核驱动模糊测试方法。研究背景:随着 GPU 在计算和 AI 领域的广泛应用,其内核驱动暴露面增大,安全问题不容忽视。然而,GPU 内核驱动与用户态库交互频繁,传统模糊测试难以生成既满足驱动接口语义又能跨边界触达内核漏洞的输入。核心方法:作者提出了 StepStone 框架,利用用户态库中的丰富语义信息(如 API 调用序列、对象生命周期、上下文依赖等)作为推理基础,引导 LLM 构造更有效的测试用例,进而驱动内核侧的执行路径。主要贡献可能包括:设计了一种将外部库知识转化为 LLM 可理解中间表示的方法;提出了针对内核驱动模糊测试的反馈循环或覆盖引导机制;在真实 GPU 驱动(如 AMD/GPU 或 ARM Mali 等)上验证了该方法的有效性,但具体实验数据在本摘要中无法获得。适合阅读对象:从事内核安全、漏洞挖掘、模糊测试研究的安全工程师以及 GPU 驱动开发者。需要说明:由于本次输入未提供完整摘要,上述内容为基于标题的合理推断,正式结论请参考论文全文。

💡 推荐理由: GPU 内核驱动漏洞可导致权限提升、内存破坏等严重安全问题,且传统 fuzzing 难以覆盖。LLM 与用户态库结合开辟了新的研究思路,有望提升 GPU 驱动漏洞的发现效率,对依赖 GPU 的云环境和 AI 基础设施有直接安全意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Behnam Omidi, Ahmad Tahmasivand, Husam Alsyouri, Saba Al-Sayouri, Chongzhou Fang, Ihsen Alouani, Khaled N. Khasawneh

卷积神经网络(CNN)面临对抗攻击脆弱性和训练成本高昂的双重挑战。对抗训练虽有效但计算开销巨大,尤其在向能量受限的边缘设备迁移时更为突出。本文提出在训练过程中对 GPU 进行欠压(undervolting)处理,通过降低供电电压引入随机故障扰动,这些扰动作为隐式正则化,在提升模型对抗鲁棒性的同时降低功耗。作者在位级别对欠压引起的故障进行表征,随后在 MNIST 和 CIFAR-10 数据集上,采用标准训练和对抗训练两种模式,分别训练 LeNet、VGG-6 和 MobileNetV3,并在标称电压和欠压电压下评估所有模型对各种对抗攻击的鲁棒性。实验结果表明,在两种训练模式下,欠压模型相比标称电压模型始终获得更高的对抗准确率,说明硬件引入的故障不仅能增强标准训练的鲁棒性,还能进一步增强对抗训练的效果。由于动态功耗与供电电压成二次方关系,这些鲁棒性提升伴随着显著的能源节省。因此,GPU 欠压是一种极易部署的硬件级防御手段,无需改动任何算法,为同时提升鲁棒性和能效提供了新方向。该研究适合硬件安全、对抗机器学习和边缘 AI 研究人员阅读。

💡 推荐理由: 该研究提出利用硬件欠压作为隐式正则化,在提升 CNN 对抗鲁棒性的同时大幅降低能耗,为硬件级防御提供了全新思路,尤其适合边缘 AI 和资源受限场景下的安全模型训练。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zihao Zhan, Zhenkai Zhang 0002, Sisheng Liang, Fan Yao 0001, Xenofon D. Koutsoukos

该论文首次研究了现代GPU存在的电磁侧信道漏洞,发现NVIDIA和AMD的多种GPU会通过电磁辐射泄露敏感信息。研究人员指出,动态电压频率调整(DVFS)特性是这一漏洞的根本原因。通过两个案例研究——网站指纹识别和键盘击键时序推断攻击——证明了该漏洞可以被实际利用,从远处窃听邻近用户的GPU活动。论文还发现,简单地禁用DVFS并非有效防御,因为这会引入另一种高度可被利用的电磁侧信道。研究强调了在共享计算环境中(如云服务器、公共计算设施)GPU侧信道攻击的潜在风险,并呼吁开发更安全的GPU设计或防御机制。该工作为物理侧信道攻击在非共享GPU上的远程实施提供了首个实证。

💡 推荐理由: 该研究揭示了GPU电磁辐射可被远程利用窃听邻居活动,威胁云环境、多租户场景的隐私安全,对安全架构师和硬件设计师有重要警示。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Robert Schambach, Quoc Do Le, Sergei Arnautov, Christof Fetzer

本文针对大语言模型(LLM)在云环境部署中面临的敏感数据泄露和完整性风险,系统研究了利用CPU与GPU可信执行环境(TEE)实现端到端机密AI工作流的可行性与性能开销。当前主流云服务(Azure、GCP、AWS)依赖集中式基础设施,用户必须共享训练代码和敏感数据,而传统TEE(如Intel SGX/TDX、AMD SEV-SNP)主要保护CPU侧,NVIDIA H100/H200 GPU TEE虽已推出,但缺乏对端到端工作流(CPU+GPU组合)的全面评估。论文提出了一个集成CPU TEE(Intel TDX和AMD SEV-SNP)与GPU TEE(NVIDIA H200)的参考架构,在虚拟机级和应用级分别设计机密性与完整性保护机制。特别指出了Kubernetes管理员可能利用特权访问机密虚拟机内容的潜在攻击面。实验采用行业基准(如MLPerf)评估性能开销,重点分析了TDX+H200配置下的推理与训练延迟。主要贡献包括:1)首次公开评估CPU+GPU TEE端到端工作流的性能与安全性;2)识别出Kubernetes管理员层面的信任边界漏洞;3)提出应用级完整性保护方案以防止VM级旁路。该工作为云环境中机密LLM部署提供了设计参考,但尚未解决GPU TEE的远程证明标准化问题。

💡 推荐理由: 当前LLM云部署缺乏CPU+GPU TEE端到端安全评估,本文首次系统评估了Intel TDX与NVIDIA H200 GPU TEE组合的性能与安全性,并指出K8s管理员可窃取机密VM内容,对安全架构师和云服务商有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yingchen Wang, Riccardo Paccagnella, Zhao Gang, Willy R. Vasquez, David Kohlbrenner, Hovav Shacham, Christopher W. Fletcher

该论文研究了硬件图形数据压缩的侧信道安全隐患,重点关注 GPU 中集成的无损压缩模块(如 Display Stream Compression 或类似机制)如何意外地成为信息泄露的渠道。研究者发现,由于压缩算法对输入数据的统计特性敏感,其压缩率(从而压缩时间)会随数据内容变化而产生可观测的差异。跨进程攻击者可以通过共享 GPU 缓冲区或观察渲染时序,推断出受害进程的图形数据中是否存在特定模式或秘密信息。论文提出了一种新的侧信道模型,基于压缩后数据大小的变化或渲染帧率的波动来提取信息。实验证明,在现代 GPU 上,该信道可以达到足以泄露像素值或文本内容的带宽。研究强调,即使图形数据本身不被内核直接共享,压缩的副作用也可能破坏隔离性。该工作首次系统性地评估了 GPU 图形压缩作为侧信道的风险,为未来的硬件安全设计提供了警示。

💡 推荐理由: GPU 图形压缩的侧信道可被本地恶意进程利用,绕过进程隔离泄露屏幕内容或敏感图形数据,影响桌面虚拟化、云游戏等场景的安全假设。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kunal Jain, Seokjin Go, Divya Mahajan

本文针对第三方共享加速器基础设施上部署大型基础模型面临的模型窃取风险,提出了一种纯软件的内存混淆框架CloakLM。在现有服务部署中,模型提供者控制虚拟机或裸金属服务栈,但无法控制底层硬件(如主机到GPU互连、加速器结构、相邻基础设施组件),这些组件已被证明可被利用。例如,Hermes通过被动PCIe观察实现无损DNN重建,TunnelS通过驱动级访问以高吞吐量窃取HBM内容而不干扰推理,共租户VM可访问内存映射接口或错误配置的RDMA区域。这些攻击利用ML系统的一个共同特性:模型权重以大型、连续且反复访问的内存区域存储,使得截获的PCIe传输和HBM转储足以揭示模型结构和参数。CloakLM通过三种机制消除这种结构规律性:PCIe流量塑形、层内和层间权重混洗、以及物理HBM页面重映射。授权执行保留有效的虚拟内存布局并带来可忽略的开销,而未授权观察者则看到碎片化和语义不一致的状态。CloakLM集成vLLM和PyTorch,无需硬件改动,并补充了机密计算。在LLaMA和Qwen模型上的分布式推理评估显示,性能接近原生,同时显著增加了对PCIe嗅探和HBM转储攻击的抵抗力,使推理时的模型窃取变得不切实际。该研究适合安全工程师、AI基础设施团队和机密计算研究人员阅读,以了解如何在不依赖硬件信任根的情况下防御模型窃取。

💡 推荐理由: 本文提出的CloakLM是一种纯软件防御方案,填补了现有硬件信任边界之外的模型机密性保护空白,对保护云端大模型权重免遭侧信道泄露具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sisheng Liang, Zihao Zhan, Fan Yao 0001, Long Cheng 0005, Zhenkai Zhang 0002

该论文提出了一种名为Clairvoyance的新型侧信道攻击方法,利用图形处理器(GPU)在执行深度神经网络(DNN)任务时产生的远场电磁辐射,在距离数米甚至穿过障碍物(如墙壁)的情况下窃取DNN模型的架构信息(如层数、每层宽度、卷积核大小等)。现有研究表明,GPU的电磁辐射可被远距离捕获,但之前的工作仅能识别简单的计算模式。本文首次证明,通过分析高频电磁信号,可以反推出复杂DNN模型的内部结构。作者设计了一套信号处理与机器学习流程:首先使用天线接收GPU的电磁泄漏信号,然后通过时频分析和特征提取将信号映射到DNN算子(如矩阵乘法、卷积),最后利用分类器推断每层的类型和参数。实验在多种典型DNN架构(如VGG、ResNet、Transformer)上验证,攻击成功率超过90%。该研究揭示了硬件电磁侧信道在AI模型保密性方面的新威胁,表明即使物理隔离或使用墙遮挡也无法完全保护模型架构。

💡 推荐理由: 该攻击突破了传统物理隔离和障碍物限制,远距离窃取DNN模型架构,对模型知识产权保护提出严峻挑战。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Weimin Chen, Xiapu Luo

该论文提出了 MEVisor,一个利用 GPU 并行性在去中心化交易所(DEXs)中高效发现最大可提取价值(MEV)机会的系统。MEV 是区块链环境中通过操纵交易顺序获得的利润,对 DEX 安全构成威胁。传统方法由于需要扫描大量交易组合而计算开销巨大。MEVisor 通过将 MEV 发现问题建模为图上的路径搜索,并利用 GPU 的并行计算能力加速搜索过程。系统首先将 DEX 交易对构建为图结构,然后使用 GPU 并行执行多种搜索策略(如循环检测、套利路径搜索),以识别潜在的 MEV 机会。实验表明,MEVisor 相比 CPU 基线实现了数量级的吞吐量提升,能够在更短时间内发现更多 MEV 机会。这项工作为区块链安全中的 MEV 监控提供了高效工具,有助于防御者及时识别和缓解 MEV 攻击。

💡 推荐理由: MEV 攻击对 DEX 用户和协议造成重大财务损失,现有检测手段效率低下。MEVisor 利用 GPU 加速大幅提升 MEV 发现速度,有助于安全团队实现实时监控和快速响应。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.4
Conf: 50%
👥 作者: Jiayi Hu, Qi Tang, Xingkai Wang, Jinmeng Zhou, Rui Chang, Wenbo Shen

该论文提出了一种名为 PhantomMap 的新型攻击方法,利用现代 GPU 的并行计算能力和内存特性来辅助 Linux 内核漏洞的利用。传统的内核利用通常依赖 CPU 侧的漏洞触发和内存操作,而 PhantomMap 通过 GPU 设备映射(mmap)将内核内存暴露给 GPU,并利用 GPU 的内核执行环境进行内存扫描、堆喷射、侧信道信息泄露等操作。论文详细介绍了 GPU 辅助的内核利用原语,包括如何通过 GPU 线程实现高效的内存布局探测、地址空间布局随机化(ASLR)绕过,以及利用 GPU 的共享内存和原子操作进行同步。实验在多个版本的 Linux 内核上验证了该方法,成功提权并稳定利用。该工作揭示了 GPU 作为攻击面的新风险,对内核安全防御提出了新的挑战。

💡 推荐理由: 首次系统性地研究利用 GPU 辅助内核利用,突破了传统 CPU-only 攻击的局限性,可能引发针对 GPU 内存隔离机制的安全审查。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)