#black-box-inference

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Christopher Ellis, Shreyas Chaudhari, Mei-Yu Wang, Leighton Barnes, Giulia Fanti, José M. F. Moura

这篇论文研究了在API访问受到严格限制的情况下,如何推断大语言模型(LLM)的底层架构属性。当前大多数商业LLM供应商不再公开模型架构细节,且API只返回每个解码token的单一logit值,不再提供logit偏置功能。作者提出了NightVision攻击方法,利用这种限制性黑盒API来估计LLM的隐藏维度、深度和参数量。NightVision的核心创新包括一种共同集提示技术:通过多个提示暴露相同输出token集合的对数概率,然后对这些结果进行光谱分析以推断隐藏维度。此外,利用端到端到第一个token的时间(TTFT)测量值,结合估计的隐藏维度,进一步估计深度和参数量。实验在32个开源LLM上进行,结果表明隐藏维度的平均相对误差为23%(在MoE模型上为9%),对于超过30亿参数的模型,深度和参数量的估计误差在53%以内。广泛的消融实验展示了这些精度如何随token预算和模型属性变化。总体而言,研究证实了当前LLM API的限制不足以完全隐藏模型的架构细节,为模型窃取和逆向工程提供了新的攻击面。该论文适合安全研究员、LLM服务提供商以及关注模型知识产权保护的研究者阅读。

💡 推荐理由: 该工作揭示了即使在最严格的API限制下,攻击者仍能推断LLM的核心架构参数,威胁模型知识产权和商业保密。对安全从业者而言,这表明现有API保护措施不足,需设计更强健的防御机制。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)