本文提出 PANDA,一个基于零知识证明(ZKP)的可扩展系统,用于在保护神经网络模型参数私密性的同时,形式化地证明模型的鲁棒性和公平性。随着机器学习模型在安全关键和法律合规场景中的部署日益增多,模型的鲁棒性和公平性保证变得重要,但模型参数常被视为商业机密,不能直接暴露给审计方或终端用户。PANDA 构建在 CROWN 这一高效的鲁棒性认证框架之上,CROWN 已被许多最先进的神经网络形式化验证工具使用。PANDA 的核心贡献是提出一种新的算法,用于证明非线性激活层的线性松弛界,从而生成简单且轻量的证明。实验表明,PANDA 能够在 5 分钟内为超过 290 万参数的神经网络生成局部鲁棒性证明,并在 10 秒内完成验证。相比之下,之前基于 ZKP 的鲁棒性系统依赖指数时间算法,无法扩展到有意义的网络规模。PANDA 的证明生成和验证复杂度在神经元数量上呈多项式增长,因此能够支持的神经网络规模比之前方法大 4 个数量级,同时显著降低证明者的开销。该研究面向机器学习安全、形式化验证和密码学交叉领域的研究人员,尤其适合关注模型完整性证明和隐私保护下的认证技术的安全从业者。
💡 推荐理由: 该工作解决了模型公平性与鲁棒性认证中参数保密的矛盾,为隐私保护下的模型审计提供了可扩展方案,对安全合规场景有直接价值。
🎯 建议动作: 研究跟进