本文针对人脸识别系统中的模型逆向攻击(Model Inversion Attacks, MIAs)提出了一种新的两阶段白盒攻击方法——Steering Flow Model Inversion (SFMI)。模型逆向攻击旨在从训练好的识别模型中重建目标身份的典型训练样本,从而暴露敏感隐私信息。现有方法通常依赖间接或高度随机的引导,难以稳定地优化生成轨迹以逼近目标人脸图像。SFMI 将逆向问题重新定义为轨迹引导任务,分为两步:第一步,学习一个通用的流匹配先验(Flow Matching Prior),通过预训练一个无条件的流匹配模型来编码人脸流形,作为稳健的先验;第二步,使用渐进式引导调度器(Progressive Guidance Scheduler, PGS),在采样过程中注入随时间变化的目标特定梯度。通过反向传播目标模型,从中间生成状态获取梯度,PGS 逐步将自适应引导信号注入向量场,从而将生成流从随机噪声有效引导至目标类别的高密度区域。在 CelebA 数据集上采用身份不相交的交叉评估设置,以 ArcFace 为目标模型时,SFMI 达到了 0.9248 的准确率(ACC)、22.61 的 FID 和 0.3874 的 LPIPS。多个目标模型上的大量实验表明,在白盒协议下,SFMI 在攻击成功率和视觉保真度上均达到了具有竞争力的最新水平。该研究揭示了流匹配生成模型在模型逆向攻击中的潜力,同时也提醒防御者关注此类新型攻击对隐私安全的威胁。适合计算机视觉、人工智能安全以及隐私保护领域的研究人员阅读。
💡 推荐理由: 该研究提出了一种更稳定高效的白盒模型逆向攻击,显著提升了从人脸识别模型中重建隐私图像的成功率和保真度,提醒防御者关注流匹配等生成模型可能被利用于隐私破解。
🎯 建议动作: 研究跟进