该论文面向一个日益突出的现实矛盾:开源大模型(LLM)在能力上已可与闭源模型竞争,并且允许用户在不把输入暴露给服务商的前提下本地推理,但大规模模型对本地算力要求极高,因此大量用户仍不得不租用第三方算力,从而重新引入隐私泄露与计算结果被篡改(正确性)两类风险。现有解决方案要么给服务端带来巨大的计算与通信开销,要么依赖额外的信任假设(如可信硬件、可信第三方或重量级密码学设置),难以在真实部署中落地。作者提出 Maverick:一种基于「矩阵-向量乘法委托」协议的私有且可验证的 LLM 推理方案。之所以选矩阵-向量乘法,是因为它是 LLM 推理中占据主导地位的算子,把这一原语做扎实,就能以模块化方式覆盖整体推理流程。Maverick 的核心贡献,据作者所述,是首个针对矩阵-向量乘法委托的、具有信息论级可靠性(information-theoretically sound)的验证协议,其特点包括:透明预处理(transparent preprocessing,即不需要可信初始化或秘密陷门)、高效的批量验证,以及几乎不增加服务端开销。在隐私方面,作者把该验证原语与基于 LPN(Learning Parity with Noise)难题的伪随机掩码结合,为客户端输入提供隐私保护——即服务端在计算过程中无法获知用户真实输入,而用户仍能验证返回结果的正确性。作者实现了该矩阵-向量委托原语,并据此搭建了 Maverick 的端到端原型,在 Qwen3-4B 模型上以每秒 token 数(throughput)为指标进行评测,覆盖 1 至 8 个客户端线程的配置。实验结果显示:在单客户端线程、服务端为最多 128 线程的 CPU 场景下,相比本地推理,掩码在线生成时吞吐最高提升 17 倍,掩码预计算时为 45 倍,仅做验证时为 44 倍;在四客户端线程下,对应提升分别为 13 倍、18 倍和 17 倍。当服务端算力不再是瓶颈时,作者用带模拟网络延迟的客户端微基准测试进一步测量,得到 12 倍至 20 倍、34 倍至 135 倍、38 倍至 157 倍的加速区间。该工作适合关注隐私保护推理、可验证计算、密码学协议工程以及 LLM 服务化基础设施的研究者与安全工程师阅读。
💡 推荐理由: 它把「外包 LLM 推理」的隐私与结果正确性两个痛点,用不依赖可信硬件、服务端几乎零额外开销的密码学协议同时解决,并给出真实模型上的吞吐数据,为不愿把提示词与数据交给服务商的场景提供了可评估的替代路径。
🎯 建议动作: 研究跟进