#hardware-acceleration

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Malik Imran, Ayesha Khalid, Ciara Rafferty, Safiullah Khan, Muhammad Rashid, Maire O'Neill

该论文针对后量子密码(PQC)中迭代数论变换(NTT)加速器的可扩展性问题,提出了一种内存并行化策略和优化架构PIP-NTT。现有NTT加速器通常采用乒乓存储方案和与分圆环大小匹配的大容量存储器,导致效率受限。作者提出将n大小的存储器拆分为四个n/4大小的独立存储器,在保持总存储面积不变的前提下实现内存并行化,从而提升数据吞吐量。同时,为逆NTT设计了无乘法重缩放架构,避免了传统重缩放中的乘法操作,降低硬件开销。在此基础上,论文对统一的Cooley-Tukey和Gentleman-Sande蝶形单元进行了全面的硬件设计空间探索,评估了粗粒度和细粒度流水线策略,并最终优化出一个高效的蝶形单元。PIP-NTT加速器集成了两个这样的优化蝶形单元和内存并行化方案,在严格的面积约束下大幅提升计算吞吐量。在FPGA平台上的实验结果表明,与现有最面积优化和高速NTT加速器相比,PIP-NTT在平均面积-时间乘积上分别实现了2.67倍和1.48倍的效率提升。该设计可扩展至不同基数的蝶形单元,并能适配其他PQC方案,为未来加密硬件的通用化提供了可行方案。

💡 推荐理由: PQC标准化在即,NTT是格基密码的核心操作,硬件加速效率直接影响实际部署性能。PIP-NTT在面积约束下显著提升吞吐量,对资源受限设备和云服务器的PQC迁移均具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: George Alexakis, Dimitrios Schoinianakis, Giorgos Dimitrakopoulos

全同态加密(FHE)能够保障数据隐私,但计算开销极大。在AI硬件(如TPU)上加速FHE具有潜力,却面临精度不匹配的根本限制:TPU优化用于8位算术,而FHE及其关键组件数论变换(NTT)需要高精度。现有方法通过矩阵分解在低精度矩阵引擎上执行NTT计算,但重建全精度结果需要移位加累加,这与矩阵乘法的数据流不匹配,迫使将全精度重建从矩阵引擎卸载到向量处理器,破坏了矩阵乘法的数据流,造成严重性能瓶颈。为解决此问题,本文提出一种最小修改的多精度脉动阵列,能够在阵列内部以统一数据流原生地执行全精度输出重建,同时进行低精度矩阵乘法。基于7nm工艺使用OpenRoad综合,设计带来的硬件开销可忽略不计。使用SCALE-Sim的周期精确仿真表明,在128x128矩阵引擎上对2^12到2^16大小的变换,所提架构原生执行NTT可实现至少1.33倍的加速,成功使标准AI硬件支持高精度FHE加速。

💡 推荐理由: 该研究解决了FHE在现有AI加速器上部署的关键硬件障碍,有望大幅降低FHE的计算开销,推动隐私计算在云和边缘的实用化,对安全从业者意味着更可行的数据保护技术。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sarabjeet Singh, Shreyas Singh, Sumanth Gudaparthi, Xiong Fan, Rajeev Balasubramonian

本文提出 Hyena,一个针对同态加密(HE)下深度神经网络推理进行优化的硬件-软件协同框架。针对云服务中用户数据隐私保护需求,HE 允许在加密数据上直接计算,但计算和数据移动开销巨大。Hyena 采用混合 HE 与多方计算(MPC)方案,相比纯全同态加密(FHE)更实用。主要贡献包括:(1) 新的数据打包技术,降低数据移动量;(2) 新的数据流,增加复用,减少旋转、密钥切换、NTT 转换等昂贵操作;(3) 在平衡流水线架构上评估,高效处理上述原语。实验表明,与广泛使用的 Channel-packing 相比,Hyena 实现 38 倍加速和 162 倍能耗降低,ResNet20 推理端到端延迟仅 11.4 毫秒,加速器面积 163 mm²,功耗 16.75 W。本文适用的读者包括隐私计算、硬件加速、安全推理领域的研究者和工程师。

💡 推荐理由: 同态加密推理是保护用户数据隐私的关键技术,但性能瓶颈严重。Hyena 通过软硬件协同优化,显著提升了加密推理的效率和能效,对推动隐私保护 AI 服务的实际部署有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Adiwena Putra, Cuong Manh Duong, Anh Quang Pham, Joo-Young Kim

零知识证明(ZKP)允许证明者在不泄露私有数据的情况下向验证者证明计算正确性,兼顾隐私与可验证性。然而,证明生成过程计算密集,主要涉及多项式(POLY)和椭圆曲线(EC)运算。这两类工作负载对硬件加速提出两个关键挑战:高效支持多种大精度模乘运算,以及在动态切换的 POLY 和 EC 阶段之间保持高利用率。现有可重构加速器仅部分解决这些问题,在精度可扩展性、算法灵活性和资源效率方面仍有限。为克服这些局限,本文提出 ZK-Flex,一个灵活可扩展的软硬件协同设计框架。软件层包含 POLY 和 EC 优化器,通过硬件和工作负载感知的算法选择减少计算量;硬件层集成 TCore(基于 Toom-Cook 的多精度核),配备灵活的网络互连和链表内存机制,在有限内存容量下提高并行度。在代表性 ZKP 基准测试中,ZK-Flex 相比现有技术实现 5 到 11 倍加速,面积效率提升高达 3.8 倍,为高性能可重构 ZKP 加速奠定新基础。

💡 推荐理由: ZKP 加速将推动隐私保护技术在区块链、身份认证、数据共享等场景的落地,提升安全方案的实际性能与可用性。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)