#hardware-acceleration

共收录 8 条相关安全情报。

← 返回所有主题
👥 作者: Jiangrui Yu, Ye Yu, Si Chen, Chenqi Lin, Wenxuan Zeng, Junfeng Fan, Mingyu Gao, Meng Li

该论文关注基于混合同态加密(HE)与多方安全计算(MPC)的私有深度神经网络推理。此类方案能为用户数据提供形式化隐私保证,但HE运算带来的延迟开销极大。已有的定制HE加速器虽能对单个HE算子实现数量级加速,作者却发现将其直接用于当前主流HE-MPC框架时端到端收益十分有限:这些框架在每次HE操作后都需要通过无线网络传输输入与输出密文,形成严重的网络通信瓶颈。为此,作者提出OptiPrime,一个协议与硬件协同优化的私有DNN推理框架。其核心是设计了一种面向卷积的新型HE协议,大幅减少需传输的输出密文数量,从而缓解带宽瓶颈;但新协议以更少的输出密文换取更复杂的计算,导致大量权重明文与中间密文带来新的访存挑战。针对这点,作者进一步提出轻量级权重明文压缩系统(将内存流量降低约10倍),以及专用数据流以最大化中间密文的片上复用。实验显示,该框架在CPU上相对Cheetah基线最高提速5.7倍,配合加速器时提速4.2倍。论文完整给出了协议层与硬件层协同设计的方法论,适合隐私计算、同态加密加速器与安全推理系统方向的研究者与工程师阅读。

💡 推荐理由: 隐私推理落地长期受HE通信与访存瓶颈制约。该工作指出单纯加速单个HE算子无法带来端到端收益,必须协议与硬件协同优化,为安全推理系统的性能评估与选型提供了新视角。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Chao Wang, Shubing Yang, Xiaoyan Sun, Yan Bai, Jun Dai, Dongfang Zhao

该论文聚焦于「对加密数据做细粒度安全计算」这一长期难题。像素级图像(如肿瘤分割、异常检测)等细粒度数据要求每个像素都可参与运算并保持高精度,而现有隐私计算范式各有硬伤:多方安全计算(MPC)需要交互通信、延迟高;差分隐私(DP)只能保护聚合统计量、无法支持逐像素运算;部分同态加密(PHE)只支持加法或乘法其中一种运算,缺少乘法(或加法)支持,无法表达任意函数。全同态加密(FHE)是唯一能在密文像素上执行任意运算的技术,但其计算开销极大,对软件实现与硬件加速器都构成瓶颈,尤其是新密文生成与数论变换(NTT)带来的负载。作者提出 PixCrypt——一种面向细粒度全同态加密的基于缓存的加速机制。其核心思路是把「昂贵的新鲜密文生成」替换为「缓存检索 + 系数级运算」,并统一适配 CKKS、BFV、BGV 三类主流 FHE 方案;为避免缓存复用导致密文重复从而破坏语义安全,PixCrypt 设计了随机化重构机制,保证每次得到的密文都不相同。此外,该设计的噪声增长近似线性,从而减少了对自举(bootstrapping)的依赖,并降低 NTT 运算负载,进而提升硬件加速器的利用效率。作者声称该方案可实现最高约 35 倍的细粒度加密加速,同时保持 IND-CPA(选择明文攻击下的不可区分性)安全性。实验在五个真实世界的像素级图像处理任务上进行,结果表明 PixCrypt 显著提升了 FHE 在隐私保护分析场景中的实用性。整体上,这是一项偏向系统与密码工程优化的研究工作,适合隐私计算、同态加密硬件加速及隐私保护机器学习方向的研究者与工程师阅读。

💡 推荐理由: FHE 一直因性能问题难以落地到像素级/细粒度隐私分析。若缓存式密文重构能在保持 IND-CPA 的同时带来数量级加速并降低自举与 NTT 开销,将直接影响隐私保护医疗影像、联邦分析类产品的可行性评估。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhihan Xu, Jayashree Adivarahan, Rajgopal Kannan, Viktor K. Prasanna

本文针对全同态加密(FHE)在云端隐私保护计算中的性能瓶颈展开研究。FHE 允许云端在密文上直接计算,是实现隐私保护云服务的关键技术,但其计算开销极大,必须依赖硬件加速才能实用。在 FHE 的各类算子中,密钥切换(key-switching)是主要性能瓶颈之一。近期密码学进展提出了一种新的密钥切换方法 KLSS,它降低了部分运算复杂度,但对计算精度的要求高于传统的混合密钥切换方法 HKS。这一取舍使两种方法在计算量与访存需求上呈现明显差异,因此 KLSS 与 HKS 的相对时延高度依赖于硬件并行度、FHE 安全参数以及片上存储容量——在 FPGA 平台上尤为突出,因为 FPGA 的存储资源与并行度必须精细权衡。为此,作者首先提出一种访存高效的 KLSS 数据通路,消除了片外密文搬运;随后构建性能模型,对 KLSS 与 HKS 的开销进行建模与对比分析,分析表明在 FHE 计算过程中,同时支持两种方法的自适应方案比静态单一方法的总体时延更低。基于该性能模型的指导,作者设计了一款自适应 FPGA FHE 加速器,能够在计算过程中动态选择 HKS 或 KLSS。该加速器在 Alveo U280 上实现,并在多个 FHE 基准上评测,结果显示:相比当前最先进的 FPGA 加速器,自举(bootstrapping)时延加速 1.84–3.31 倍,安全图像分类加速 1.66–2.52 倍。论文属于体系结构与密码硬件加速方向,适合关注隐私计算、FHE 硬件实现、FPGA 架构与同态加密工程化的研究者与工程师阅读。

💡 推荐理由: FHE 是隐私保护云计算的关键底座,而密钥切换是其最大性能瓶颈。本文提出按运行时条件在 KLSS 与 HKS 之间自适应切换的 FPGA 方案,显著降低自举时延,对机密计算与隐私推理的工程落地有直接参考价值。

🎯 建议动作: 研究跟进,纳入隐私计算硬件加速方向的内部技术评估

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Pengzhi Huang, Kiwan Maeng, G. Edward Suh

函数秘密共享(FSS)是安全推理、私有信息检索(PIR)等隐私保护系统中的核心构建模块,但其在密钥生成、通信和数据移动方面开销显著。本文提出分布式函数加速器(DFA),一种针对FSS中主导原语——分布式点函数(DPF)生成与评估的硬件加速方案。DFA结合了基于AES的高吞吐固定功能伪随机数生成引擎,以及用于协议特定逻辑的轻量可编程单元。在非可信模式下,DFA作为DPF评估的纯加速器,在不改变协议的前提下提升吞吐量和能量效率;在可信模式下,DFA支持本地即时密钥生成,消除了密钥分发,并降低了存储和数据移动开销。针对代表性工作负载,DFA实现了安全推理端到端延迟降低10倍、通信量降低最多20倍、能耗降低超过5倍;对于PIR,吞吐量提升5倍、能耗降低10倍,而硬件成本适中。本文的核心贡献在于设计了一种兼顾固定功能引擎和可编程单元的混合架构,以低开销突破FSS系统性能瓶颈,适用于对隐私计算性能敏感的场景。适合硬件安全、隐私计算、系统架构以及安全推理和PIR应用的研究人员阅读。

💡 推荐理由: FSS是隐私计算的重要基础,但其开销阻碍了实际部署。DFA通过硬件加速大幅提升性能,为构建实用化的安全推理和私有信息检索提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Malik Imran, Ayesha Khalid, Ciara Rafferty, Safiullah Khan, Muhammad Rashid, Maire O'Neill

该论文针对后量子密码(PQC)中迭代数论变换(NTT)加速器的可扩展性问题,提出了一种内存并行化策略和优化架构PIP-NTT。现有NTT加速器通常采用乒乓存储方案和与分圆环大小匹配的大容量存储器,导致效率受限。作者提出将n大小的存储器拆分为四个n/4大小的独立存储器,在保持总存储面积不变的前提下实现内存并行化,从而提升数据吞吐量。同时,为逆NTT设计了无乘法重缩放架构,避免了传统重缩放中的乘法操作,降低硬件开销。在此基础上,论文对统一的Cooley-Tukey和Gentleman-Sande蝶形单元进行了全面的硬件设计空间探索,评估了粗粒度和细粒度流水线策略,并最终优化出一个高效的蝶形单元。PIP-NTT加速器集成了两个这样的优化蝶形单元和内存并行化方案,在严格的面积约束下大幅提升计算吞吐量。在FPGA平台上的实验结果表明,与现有最面积优化和高速NTT加速器相比,PIP-NTT在平均面积-时间乘积上分别实现了2.67倍和1.48倍的效率提升。该设计可扩展至不同基数的蝶形单元,并能适配其他PQC方案,为未来加密硬件的通用化提供了可行方案。

💡 推荐理由: PQC标准化在即,NTT是格基密码的核心操作,硬件加速效率直接影响实际部署性能。PIP-NTT在面积约束下显著提升吞吐量,对资源受限设备和云服务器的PQC迁移均具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: George Alexakis, Dimitrios Schoinianakis, Giorgos Dimitrakopoulos

全同态加密(FHE)能够保障数据隐私,但计算开销极大。在AI硬件(如TPU)上加速FHE具有潜力,却面临精度不匹配的根本限制:TPU优化用于8位算术,而FHE及其关键组件数论变换(NTT)需要高精度。现有方法通过矩阵分解在低精度矩阵引擎上执行NTT计算,但重建全精度结果需要移位加累加,这与矩阵乘法的数据流不匹配,迫使将全精度重建从矩阵引擎卸载到向量处理器,破坏了矩阵乘法的数据流,造成严重性能瓶颈。为解决此问题,本文提出一种最小修改的多精度脉动阵列,能够在阵列内部以统一数据流原生地执行全精度输出重建,同时进行低精度矩阵乘法。基于7nm工艺使用OpenRoad综合,设计带来的硬件开销可忽略不计。使用SCALE-Sim的周期精确仿真表明,在128x128矩阵引擎上对2^12到2^16大小的变换,所提架构原生执行NTT可实现至少1.33倍的加速,成功使标准AI硬件支持高精度FHE加速。

💡 推荐理由: 该研究解决了FHE在现有AI加速器上部署的关键硬件障碍,有望大幅降低FHE的计算开销,推动隐私计算在云和边缘的实用化,对安全从业者意味着更可行的数据保护技术。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sarabjeet Singh, Shreyas Singh, Sumanth Gudaparthi, Xiong Fan, Rajeev Balasubramonian

本文提出 Hyena,一个针对同态加密(HE)下深度神经网络推理进行优化的硬件-软件协同框架。针对云服务中用户数据隐私保护需求,HE 允许在加密数据上直接计算,但计算和数据移动开销巨大。Hyena 采用混合 HE 与多方计算(MPC)方案,相比纯全同态加密(FHE)更实用。主要贡献包括:(1) 新的数据打包技术,降低数据移动量;(2) 新的数据流,增加复用,减少旋转、密钥切换、NTT 转换等昂贵操作;(3) 在平衡流水线架构上评估,高效处理上述原语。实验表明,与广泛使用的 Channel-packing 相比,Hyena 实现 38 倍加速和 162 倍能耗降低,ResNet20 推理端到端延迟仅 11.4 毫秒,加速器面积 163 mm²,功耗 16.75 W。本文适用的读者包括隐私计算、硬件加速、安全推理领域的研究者和工程师。

💡 推荐理由: 同态加密推理是保护用户数据隐私的关键技术,但性能瓶颈严重。Hyena 通过软硬件协同优化,显著提升了加密推理的效率和能效,对推动隐私保护 AI 服务的实际部署有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Adiwena Putra, Cuong Manh Duong, Anh Quang Pham, Joo-Young Kim

零知识证明(ZKP)允许证明者在不泄露私有数据的情况下向验证者证明计算正确性,兼顾隐私与可验证性。然而,证明生成过程计算密集,主要涉及多项式(POLY)和椭圆曲线(EC)运算。这两类工作负载对硬件加速提出两个关键挑战:高效支持多种大精度模乘运算,以及在动态切换的 POLY 和 EC 阶段之间保持高利用率。现有可重构加速器仅部分解决这些问题,在精度可扩展性、算法灵活性和资源效率方面仍有限。为克服这些局限,本文提出 ZK-Flex,一个灵活可扩展的软硬件协同设计框架。软件层包含 POLY 和 EC 优化器,通过硬件和工作负载感知的算法选择减少计算量;硬件层集成 TCore(基于 Toom-Cook 的多精度核),配备灵活的网络互连和链表内存机制,在有限内存容量下提高并行度。在代表性 ZKP 基准测试中,ZK-Flex 相比现有技术实现 5 到 11 倍加速,面积效率提升高达 3.8 倍,为高性能可重构 ZKP 加速奠定新基础。

💡 推荐理由: ZKP 加速将推动隐私保护技术在区块链、身份认证、数据共享等场景的落地,提升安全方案的实际性能与可用性。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)