该论文研究了对等网络(P2P)分布式大语言模型(LLM)推理的完整性保证问题。在P2P分布式推理场景中,LLM的层被分散到多个节点上,每个请求依次经过由不同独立方拥有和控制的节点。任何恶意的节点都有可能篡改其负责的层的输出,从而破坏最终结果。已有的完整性检查方法,如已知答案陷阱和密码学承诺,只能检测精确的正确性,无法容忍良性节点间由硬件噪声引起的正常激活值波动。为此,作者提出了一种基于激活值漂移的完整性检测方法。其核心思想是:一个想要使用网络的用户选择一小批秘密的“金丝雀”输入(canary inputs),这些输入的正确激活值已知,并将它们混合在正常流量中。由于其他节点无法区分金丝雀查询和真实查询,任何篡改节点都会同样破坏金丝雀的输出。通过比较金丝雀的实际激活值与已知参考值的偏差,可以识别恶意节点:良性节点仅表现出由硬件噪声引起的微小漂移,而篡改节点的漂移显著更大。作者将恶意节点识别建模为一种概率测试,该测试区分两个漂移分布,而不依赖于固定阈值。在408种配置下进行了实验,所有指标和成功标准在实验前确定;检测器在所有配置下的每个金丝雀上都达到了AUROC 1.0,正确地将恶意分片排在所有良性分片之上。该工作首次在P2P分布式LLM推理中解决了对普通硬件噪声鲁棒的完整性验证问题。
💡 推荐理由: 随着分布式LLM推理在去中心化环境中的普及,确保推理结果的完整性至关重要。该论文提出了一种轻量级、无需可信硬件的验证方法,能够有效检测恶意节点篡改,为构建可信的P2P推理网络提供了关键技术。
🎯 建议动作: 研究跟进