本文提出 MeMark,一种面向脉冲神经网络(SNN)模型水印的新方法,专门针对模型检查点复用(checkpoint-reuse)场景。现有 SNN 水印通常将标识嵌入输出层,攻击者只需替换输出头即可移除验证证据。MeMark 将多比特标识嵌入选定泄漏积分-触发(LIF)神经元的内部膜电位状态:通过秘密输入驱动每个选定神经元阈值的一侧,并在验证时利用同一阈值恢复比特,无需学习式解码器。作者在循环、卷积、残差及 transformer 结构 SNN 上评估,包括 2.154 亿参数的 SpikeGPT 检查点。实验显示:20 个独立 64 位密钥均通过 51/64 验证规则,而 30000 个随机密钥全部被拒绝;微调、90% 剪枝、int8 量化和输出头替换后,所有权证据仍存活。自适应攻击可削弱但无法完全移除水印。同时研究了错误所有权声明、密钥感知/不可知移除、部分密钥披露、回滚及知识蒸馏攻击。结果表明 MeMark 能提供检查点衍生模型的证据,同时抵抗主流攻击和完全头部替换。适合关注模型知识产权保护、AI 安全研究的读者。
💡 推荐理由: SNN 模型作为预训练检查点广泛复用,现有水印易被输出头替换绕过。MeMark 首次在膜电位层面嵌入水印,为 SNN 所有权验证提供鲁棒方案,对模型泄露溯源和知识产权保护有直接价值。
🎯 建议动作: 研究跟进