该论文针对视觉语言模型(VLM)在隐私敏感与带宽受限场景下的视觉问答(VQA)任务,提出名为 QPriv-VL 的「问题引导式、隐私感知」视觉 token 剪枝框架。研究背景是:联邦学习(FL)、拆分学习(SL)与 U 型拆分学习(USL)虽然能保持原始数据本地化,但跨模型分区传输全部视觉 token 依然带来高昂通信开销,并可能通过中间表示泄露隐私信息;而现有固定比例剪枝方案不区分任务相关性与隐私敏感性,容易在压缩的同时保留敏感区域或误删回答所需的关键图像块。核心方法上,QPriv-VL 在传输前对视觉 token 进行剪枝,其关键组件是轻量级动态阈值预测器(DTP),能在单次前向传播中同时估计「样本级剪枝比例」与「token 级保留掩码」。DTP 融合两类信号:一是问题相关性,通过视觉 patch 与池化后的问题嵌入之间的跨模态相似度计算得到;二是敏感性信号,由冻结的 DINOv2 特征导出。二者结合使模型在无需敏感性标注的前提下,抑制潜在敏感区域,同时保留对回答问题有用的图像块。作者在 GQA、OK-VQA、VQAv2、SLAKE、VQA-RAD、PathVQA 六个数据集上,针对四类隐私攻击(FSHA、FORA、iDLG 以及属性推断型成员推断攻击 MIA)进行了评测。实验结果显示:DTP 在传输显著更少 token 的情况下,达到或超过固定比例剪枝的效果;在 VQA-RAD 上把成员推断攻击成功率从 0.99 降至 0.76–0.79;相对固定比例剪枝降低了 FSHA 与 FORA 的重建 PSNR;在仅使用约 40% 原始视觉 token 预算的前提下仍保持有竞争力的 VQA 准确率。此外,敏感性排除比达到 1.20±0.18,表明模型优先剔除隐私敏感图像块;可解释性分析进一步表明保留策略会随问题语义自适应调整,而非简单依据通用视觉显著性。适合拆分学习/联邦学习系统设计者、VLM 隐私保护与模型压缩方向的研究人员阅读。
💡 推荐理由: 拆分/联邦 VLM 推理中,跨分区传输的视觉 token 是通信成本与隐私泄露的双重来源。该工作给出无需敏感性标注即可在单次前向完成「任务相关性 + 隐私敏感性」联合剪枝的思路,并量化了对成员推断与重建类攻击的抑制效果,为隐私-效用-带宽三方权衡提供了可复用基线。
🎯 建议动作: 研究跟进:纳入内部隐私工程与拆分学习架构评估,复现其在自有 VQA/医疗影像数据集上的隐私-效用-带宽权衡曲线,再考虑试点部署。