随着越来越多模型服务以“公共基础模型 + 私有参数高效微调(PEFT)适配”的方式部署,一种新型的差分信息泄露风险逐渐显现:审计者或攻击者可以在本地运行公开的基础模型,并对比受害者服务的输出,从而推断出私有 PEFT 适配的结构。本文提出 VectorHijack-SR,一种系统性的测量方法,将成对的受害者/基础模型残差转换为经过校准的结构边界,覆盖 PEFT 家族、层局部性以及粗粒度秩,并区分元数据可见性、开放世界有效性与操作可利用性。该方法通过聚合查询级幅度、排序、熵、边际、长度、模板、局部性和频谱统计,形成服务级表示;利用服务不相交的分类器量化结构证据,并通过交叉拟合的分层拒绝器判断受害者样本是否落在校准的 LoRA 流形之外。实验在多个分类骨干上验证:家族泄露显著超过随机机会,例如 BERT/MNLI 上 8/12、RoBERTa/MNLI 上 21/24、DeBERTa-v3 在 MNLI 上 12/18 与 AG News 上 15/18;秩推断则呈现任务依赖性,BERT/MNLI 与 DeBERTa/AG News 达到 8/9,而 DeBERTa/MNLI 仅 4/9,经校正后与随机机会兼容。在十个种子的 BERT 开放集网格上,拒绝器达到池化 AUROC 0.804(95% CI [0.660, 0.927])和已知准确率 0.956,但对结构接近的 DoRA 和 LoRA+head 变体泛化有限。五个留出 LoRA-r64 服务的精确版本链接 AUC 达到 0.940。此外,实验揭示“可见性—可利用性”差距:两阶段恢复无法带来公平预算下的查询节省,后验选择的 PEFT 性能低于蒸馏后转换的 PEFT(0.356 对比 0.517),自由运行生成仍接近随机。整体结论是:在基础模型已知且输出信息丰富的情况下,PEFT 服务可能泄露可操作的结构与版本信息;但仅凭闭集置信度并不能确证通用的适配器恢复能力。该研究适用于模型服务提供商、安全审计者以及从事 PEFT 隐私风险研究的人员。
💡 推荐理由: 该研究首次系统量化了黑盒条件下 PEFT 适配的结构信息泄露风险,提示使用公共基座+私有微调的服务可能被逆向出家族、层位置甚至版本信息,直接影响模型知识产权与数据隐私,值得所有部署此类服务的蓝队关注。
🎯 建议动作: 研究跟进