推荐 3.5
Conf: 50%
本文研究从黑盒输入输出访问中学习多头softmax注意力机制的问题。在给定查询token序列的情况下,学习者只能观察到最终token的标量输出。以往的工作提出了使用O(d^2)次值查询恢复单头注意力参数(W,v)的算法,但对于多头注意力,已有可识别性结果依赖于头之间成对正交子空间的假设,且应用单头算法需要已知子空间基。本文提出了一种无需这些假设的算法,通过合并具有相同W_h的头并对v_h求和,若和为零则丢弃该合并头,从而恢复规范表示。算法通过改变token副本数量获得有理函数的样本,利用插值分离规范头,并通过添加选定的token向量在不同查询间匹配同一头。在精确oracle输出的情况下,随机选择查询向量能以概率1恢复规范对{(W_h,v_h):h∈[H]},直至置换。当H已知时,算法使用4Hd^2-2H+1次值查询,最大长度2H+1;若仅知上界H_0,则使用4H_0d^2-2H_0+1次查询。对于近似输出,论文给出了参数误差受输出误差乘以模型和查询相关常数控制的条件。最后,研究扩展至一层Transformer,包括多头注意力后接无偏ReLU前馈网络,在附加条件下无需单独学习前馈网络的算法即可恢复功能等价的Transformer。这项工作为理解Transformer的可识别性和可学习性提供了理论保证,并可能对模型窃取和可解释性研究有启发。
💡 推荐理由: 该研究展示了从黑盒查询中恢复多参数注意力模型的可能性,揭示了Transformer内部表示的可识别性边界。对安全从业者而言,这意味着模型参数可能通过巧妙的查询被逆向工程,引发对模型知识产权保护和API访问控制的担忧,同时也为可解释性分析提供了新思路。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)