#performance-optimization

共收录 5 条相关安全情报。

← 返回所有主题
👥 作者: Kurt M Wilson, Mohaiminul Al Nahian, Abeer Matar A. Almalky, Sadat Shahriyar, Souvik Kundu, Zhishan Guo, Abdullah Al Arafat, Adnan Siraj Rakin

本文提出 TEE-X,一个面向可信执行环境(TEE)的加速框架,旨在解决大型视觉模型(如 Vision Transformer, ViT)在边缘设备上部署时面临的内存限制和计算延迟问题。研究背景是:机器学习模型,尤其是视觉应用,容易受到多种安全威胁;白盒与黑盒威胁模型的差异影响攻击有效性。使用 TEE 可以通过保护模型机密性和执行完整性,将执行环境从白盒侧转移到黑盒侧,从而增强安全性。然而,将大型视觉模型完全放入 TEE 会带来显著的内存和延迟开销,尤其在安全性和隐私至关重要的实时边缘应用中。TEE-X 的核心方法包括:1) 灵敏度感知的模块化技术,将模型分解为不同敏感度级别的模块,以实现更精细的 TEE 内执行;2) 在 TEE 推理中引入向量化,提高计算效率。该框架在 OP-TEE(Arm TrustZone)上实现,并在 NVIDIA Jetson AGX Xavier 上针对 ViT 模型进行了性能优化。实验结果表明,TEE-X 能够在保证模型准确性和低延迟的前提下,实现安全快速的边缘推理,有效平衡了精度与性能。该工作为在资源受限的边缘设备上安全部署大型视觉模型提供了一种可行的加速方案。适合对 TEE、边缘 AI 安全、模型机密性和性能优化感兴趣的研究人员和工程师阅读。

💡 推荐理由: 为边缘端大视觉模型提供TEE内高效推理方案,在保障模型机密性与执行完整性的同时缓解延迟瓶颈,对自动驾驶、医疗影像等实时安全敏感场景有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Weize Wang, Chutong Wang, Yu Wu, Qifan Xue, Jieyu Zheng, Yunlei Zhao

该论文针对现代同源密码系统(如 SQIsign)在有限域、椭圆曲线和高维同源运算中大量计算开销的问题,提出了一种通过暴露 SIMD 并行性来加速的方法。传统做法尝试直接向量化域乘法,但受限于 Montgomery 梯子等循环依赖结构以及点运算、配对和 theta 坐标公式中不规则的细粒度并行性,效果有限。作者的关键洞察是:不应孤立地向量化域乘法,而应重新组织更高层原语的算术依赖图,从而恢复大量 SIMD 并行。他们基于 AVX-512IFMA 指令集实现了 SQIsign 的端到端优化,在大部分曲线侧计算中保持数据处于基为 2^51 的向量表示。具体优化包括:投影坐标下的 xDBLADD 调度、多种坐标系中的批量点倍、向量化双标量阶梯、融合立方运算的配对步骤,以及批量的一维和二维同源求值。与参考 C 实现相比,在 NIST level I 参数下,密钥生成、签名和验证分别获得 1.76 倍、1.71 倍和 3.18 倍的端到端加速;结合 Qlapoti 后,密钥生成和签名加速比进一步提升至 2.90 倍和 2.69 倍。此外,作者将相同的方法应用于 CORAL——一种基于二维 2-同源的近期后量子非交互密钥交换方案,在五组参数下,密钥生成实现 1.28–1.40 倍加速,共享密钥计算实现 1.92–2.46 倍加速。这些结果提供了跨方案证据,表明算法级 SIMD 调度是高维同源密码学中可复用的优化维度。适合对后量子密码实现性能优化、SIMD 并行编程以及同源密码算法加速感兴趣的密码工程研究人员阅读。

💡 推荐理由: 该研究展示了针对同源后量子密码的实用性能优化方向,对推动 SQIsign、CORAL 等方案的实际部署有积极意义;但作为算法实现优化,不涉及漏洞或攻击,安全从业者可将其视为性能情报参考。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ruida Wang, Jincheol Ha, Xuan Shen, Xianhui Lu, Chunling Chen, Kunpeng Wang 0001, Jooyoung Lee 0001

本文提出了一种改进的 TFHE 层级同态评估方案。TFHE 是一种基于环面的全同态加密方案,支持快速自举(bootstrapping),其核心评估机制包括门自举和可编程自举(PBS),后者能够在刷新噪声的同时计算函数。PBS 对于小规模电路高效且易用,但随着电路深度增加,自举操作次数呈指数增长,导致大规模电路的评估效率显著下降。为应对这一挑战,Chillotti 等人在 Asiacrypt 2017 中引入了层级同态评估(LHE)模式,将电路评估与自举解耦,相比 PBS 方法实现了数百倍的加速。然而,剩余的电路自举(CBS)操作尽管频率与电路深度成线性关系,仍然成为性能瓶颈。本文对该 LHE 模式进行精细化改进,重点优化 CBS 的执行效率。具体而言,作者重新设计了自举密钥的表示和密文刷新流程,利用更紧凑的密钥切换技术和预计算表来减少计算开销,同时保持了原有方案的安全性。实验部分基于标准参数集对多种典型电路进行评估,结果表明改进后的方案在 CBS 阶段的计算时间显著降低,整体评估性能较原始 LHE 模式有大幅提升。该工作适用于需要高效评估大型布尔电路或算术电路的同态加密应用场景,如隐私保护机器学习推理、私有信息检索等,为实际部署提供了更优的性能选择。

💡 推荐理由: 对于关注同态加密落地性能的蓝队和安全架构师,本文提出优化同态加密大规模电路评估的方案,可降低隐私计算场景的计算延迟和资源消耗,有助于未来安全产品中集成更高效的密文计算能力。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Samuel Dittmer, Karim Eldefrawy, Stéphane Graham-Lengrand, Steve Lu 0001, Rafail Ostrovsky, Vitor Pereira 0002

本文针对高保证密码学协议形式化验证实现中存在的性能瓶颈问题,提出了一套通用的优化方法。以 Line-Point 零知识证明(LPZK)协议为案例,首先在 EasyCrypt 中实现了一个形式化验证的 LPZK 实现(未考虑性能),然后通过三步优化获得高达 3000 倍的加速,最终性能与手动优化版本 lpzkv2 相当。三步优化包括:修改算法规范以减少计算复杂度、采用可证明安全的并行执行模型、以及优化内存访问结构。每一步优化都在 EasyCrypt 中形式化验证,并自动合成可执行代码。论文详细分析了每步优化带来的性能提升,并讨论了自动化安全证明和代码合成面临的挑战。该工作表明,通过系统的形式化优化,可以在不牺牲安全性保证的前提下显著提升验证密码学实现的性能,为高保证密码学的大规模应用提供了可行的技术路径。

💡 推荐理由: 形式化验证的密码学实现通常性能极差,阻碍了在实际系统中的部署。本文展示了一套通用优化框架,在保持安全性证明的同时实现数量级的性能提升,使高保证密码学更接近实用,对安全关键应用(如区块链、隐私计算)有重要价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hang Yin, Kevin Wang

本文研究了在 Blackwell GPU 机密计算(GPU-CC)环境下,LLM 推理服务性能显著下降的根本原因。作者在 NVIDIA RTX Pro 6000 和 B300 HGX 两个平台上进行了实验,发现性能瓶颈并非来自 GPU 计算本身(B300 上 BF16 矩阵乘法性能几乎无损失),而是来自机密虚拟机与 GPU 之间的通信桥接。在 Intel TDX 和 GPU-CC 的联合部署下,LLM 服务吞吐量损失 13-27%,KV-cache 恢复延迟增加一倍以上。通过深入分析,作者指出 GPU-CC 将主机与设备之间的数据传输变成了一个串行化、高设置开销的通道:安全拷贝无法获得 CUDA 流内的并发性,异步传输在运行时边界阻塞,小规模数据交换需要固定的开销。这与现代推理运行时(如 vLLM)依赖廉价、并发、异步 DMA 的假设相悖。在 vLLM 密集解码场景中,差距主要来自 44 倍更慢的小分配和拷贝操作;通过针对性补丁排除了其他原因。作者提出了一种调度标志(恢复 57% 的差距)和工作线程排空(在高并发下最多恢复 92% 的差距)两种方法。同样的桥接模型也解释了 KV 恢复惩罚增加 131% 和模型加载速度减慢 34 倍的现象。此外,论文还验证了 Blackwell 平台上多 GPU 机密租户(包括 CVM 内 510 GB/s NVLink P2P 和并发隔离租户)的能力,并指出了生产级机密 AI 平台尚需解决的远程证明缺口。本文适合系统安全工程师、AI 基础设施开发者和云服务提供商阅读。

💡 推荐理由: 揭示了机密计算下LLM推理性能瓶颈不在GPU而在主机-设备桥接,为优化机密推理基础设施提供关键方向,直接影响云服务商部署机密AI服务的成本与效率。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)