该论文提出了一种名为MOSAIC的方法,用于解决安全且高效地外包AI计算的问题。具体场景是:一个可信但计算能力较弱的客户端拥有输入数据和模型参数,希望将推理计算外包给一个功能强大的不可信服务器,同时要求服务器无法获知输入数据和模型中的任何敏感信息。这一挑战在大型语言模型(LLM)推理中尤为突出,因为现代模型包含数十亿参数,计算量巨大。MOSAIC的核心是一个新颖的矩阵乘法掩蔽协议,相比之前的工作,它可以扩展到规模更大的矩阵,从而支持如大型Transformer推理等现代工作负载。该协议通过向乘法结果中引入少量噪声来放松正确性要求,从而实现了最优的渐近客户端开销,并且实际运行时间比此前方法快几个数量级。其安全性归约到判定性LWE(Learning with Errors)和LPN(Learning Parity with Noise)假设。由于在Transformer的众多层中噪声会累积,一个关键技术挑战是控制误差增长;MOSAIC通过基于随机Hadamard旋转的误差缩放机制解决了这一问题。在70B参数的大型Transformer模型上,MOSAIC的困惑度与流行的量化方法相当,甚至在HumanEval任务上匹配了全精度BF16推理的效果。论文还给出了端到端实现,说明了MOSAIC如何为现代数据中心的大规模机密AI铺平道路。现有的非机密推理已经采用分阶段(prefill/decode)、分层和时间维度上的分布式部署,以最大化异构硬件利用率,并使用类似RDMA的网络在节点间迁移激活值、缓存的KV值和权重。MOSAIC通过保持可信计算基(TCB)较小,并将大部分AI计算外包给不可信的加速器,实现了机密计算的扩展。这项工作为在不可信基础设施上安全运行大模型推理提供了一条新的技术路径,对于隐私敏感的应用场景具有重要意义。
💡 推荐理由: 随着大模型推理广泛部署于云端,模型与输入数据的隐私保护成为关键需求。MOSAIC提出的掩蔽协议允许在不可信GPU/服务器上执行推理而不泄露模型和用户数据,为安全外包、机密AI和多租户场景提供了高性能方案,兼具理论保证与实际可用性,值得安全架构师和AI平台团队关注。
🎯 建议动作: 研究跟进