#hessian

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Munawar Hasan, Apostol Vassilev

本文提出一种针对光滑 Transformer 前馈网络(FFN)的结构性模型提取攻击方法,揭示了黑盒场景下二阶信息泄露内部参数几何的新通道。作者假设攻击者拥有对 FFN 分支的“选定输入-原始输出”(chosen-input raw-output)访问权限,即可以自由选择输入并获取未经过离散化或扰动的连续输出,但无法访问参数、梯度或内部激活。在此假设下,对于使用 GELU 或 SiLU 等光滑激活函数的 Transformer FFN,攻击者可通过构造特定输入并计算投影输入 Hessian 矩阵,观察到由 FFN 输入权重决定的隐藏对称秩一因子的混合信息。论文将收集到的 Hessian 集合形式化为部分对称分解问题,证明了局部可辨识性和稳定性条件,并利用向量输出模板复用技术将结构化查询成本降低 16 倍。在独立训练的 CIFAR-10 视觉 Transformer 上,仅需 16 个投影 Hessian(对应 8193 次黑盒查询)即可恢复隐藏 FFN 方向,平均绝对余弦对齐度超过 0.94,其中 GELU 和 SiLU 分别有 95.1% 和 91.9% 的方向对齐度超过 0.90。该恢复在多个独立训练的模型、重复提取实验以及所有 Transformer 块中均保持高度一致。进一步地,恢复出的结构可用于功能性提取:保持恢复方向固定,仅拟合剩余 FFN 参数,可获得超过 93% 的 top-1 一致性的高保真替代模型,测试准确率与原始模型仅相差 0.90%(GELU)和 0.62%(SiLU)。实验还表明,输出舍入和高斯噪声在固定攻击配置下能显著降低恢复效果,但攻击者通过自适应调整有限差分步长可将平均对齐度重新提升至 0.9603(GELU)和 0.9398(SiLU)。这项研究展示了从黑盒二阶观测到隐层结构恢复再到功能替换的完整攻击路径,证明光滑 FFN 的曲率特性泄露了仅靠行为模仿无法揭示的内部参数几何,对模型知识产权保护构成实质性威胁。

💡 推荐理由: 该研究揭示了 Transformer 模型在光滑激活函数下存在二阶信息泄露通道,攻击者无需内部访问即可高保真提取模型结构并进行功能替代。对于部署了 Transformer 模型的防御方,这意味着仅靠隐藏参数和梯度并不足以保护模型 IP,需要关注黑盒查询的输入模式与输出精度。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)