#inference-verification

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Nikita Kezins

本文研究基于 Gumbel 的推理验证方法在面对对抗性提示分布时的安全性。在大型语言模型(LLM)的部署场景中,防止模型权重被攻击者通过推理输出隐式外泄是一个重要课题。基于 Gumbel 的推理验证机制通过约束模型输出的 token 选择,仅允许那些在 GPU 非确定性下可能出现的合理选择,从而限制隐写信道的容量。在良性用户提示流量下,该机制可将隐写攻击者的信息传输速率降低 200 倍以上。然而,该防御设计隐含地假设攻击者仅被动接收输出,不干预输入提示。本文的研究表明,当攻击者能够控制输入提示的分布时,该防御的强度会显著下降。其根本原因在于,验证器所判定的可接受 token 集合大小直接与模型自身的输出熵相关。攻击者若构造刻意扰乱语法和子词结构的提示(例如生僻字符、随机词序或混合语言),将促使模型输出更分散的概率分布,从而扩大可接受 token 集,为隐蔽信息提供更大的编码空间。作者在六个指令微调模型(参数量从 1B 到 32B)和三个随机种子上进行了系统实验,其最强攻击(字符与脚本层面破坏)可将每 token 泄露的比特数相对于良性提示加倍,使防御的减速因子从 200 余倍降至 60-118 倍。这些结果揭示了静态的、以良性流量校准的阈值无法适应多变输入环境,并为改进防御指明了方向:即依据局部 token 熵动态校准抖动宽恕阈值。这项工作对于 LLM 安全防护、推理链路验证以及反隐写研究的从业者具有重要参考意义。

💡 推荐理由: 该研究揭示现有基于 Gumbel 的推理验证防御在对抗性提示下存在严重退化,LLM 安全防御不能依赖静态阈值;提示熵的动态校准是提升鲁棒性的关键。对部署 LLM 推理验证或有隐写防护需求的团队具有直接警示和指导作用。

🎯 建议动作: 研究跟进,评估动态阈值校准方法的可行性

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chen Gong, Beijie Liu, Mengyuan Li

随着大型语言模型(LLM)规模不断扩大并主要由远程平台提供服务,验证推理执行的忠实性(即确保提供商确实执行了广告中的模型和计算负载,而不是篡改或缩小版本)变得至关重要。零知识(ZK)LLM推理提供了一种有前景的方法,它承诺公开可验证性,并通过证明输出与在承诺的私有权重下执行公共架构一致,提供每个实例的等式正确性保证。然而,本文表明这种验证并未绑定产生输出所花费的计算量。作者形式化了这个被忽视的'工作量差距',并引入了一种攻击——Hollow-LLM攻击,其中不诚实的提供商保留声明的架构和参数数量,但嵌入'幽灵权重',其代数结构抵消了有效计算。这些见证满足验证电路并产生有效证明,即使证明者(即不诚实的模型所有者)执行的计算仅相当于一个远小于声明公共架构的模型。这创造了一种有利可图的平衡:提供商以小型模型的成本交付可证明正确的输出,同时夸大模型规模。为此,作者刻画了与标准Transformer块组合的特定幽灵权重族,并表明这类'空心部署'在相同验证电路下显著降低服务成本,且质量损失为零。这些发现强调,正确推理的证明并非大模型执行的证明,需要额外的保护将正确性绑定到可验证的计算工作。

💡 推荐理由: 该攻击破坏了ZK验证在LLM推理中的信任基础,使不诚实的提供商可以夸大模型规模而仍通过验证,从而影响依赖ZK证明的验证系统的可靠性。安全从业者需要意识到,验证计算工作量本身是独立属性,需额外机制保障。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)