推荐 5.5
Conf: 50%
该论文针对大语言模型(LLM)在部署后被篡改而常规输出基本不变的问题,提出一种基于 zk-SNARK 的隐私保护审计框架。该框架通过构造“对抗性探针”(adversarial probes)来放大已批准模型与修改后部署之间的 logit 漂移,从而在不暴露模型权重的前提下检测行为改变。论文设计了三类互补的探针族:基于 token 的探针(黑盒,仅需输入接口、分词器和词表)、基于 embedding 的探针(灰盒,需访问 embedding 接口)、以及压力探针(依赖额外接口能力但无需完全白盒)。这种分层设计允许根据敏感性、访问需求和部署成本进行权衡。实验评估覆盖多种 LLM 架构、后部署攻击场景和 GPU 平台,结果显示基于 token 的探针在各类模型和平台上始终提供最强的平均敏感性,尽管其运行于黑盒设置。此外,作者实现了 Groth16 zk-SNARK 工作流,在探针规模从 1 扩展到 50 时,证明时间仅从 1.02 秒增加到 1.78 秒,验证时间保持约 0.84 秒,证明大小恒定,展现出良好的可扩展性。该工作为 AI 治理中的模型完整性验证提供了一种兼顾隐私与实用性的技术路径,尤其适用于模型权重专有的商业部署场景。
💡 推荐理由: 面向蓝队与安全审计,提供一种不泄露模型权重即可检测部署后篡改的新方法,有助于解决专有 LLM 的供应链完整性与合规验证难题。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)