本文揭示了大型语言模型(LLM)提供商在客户端保存加密推理轨迹所引入的严重安全漏洞。许多主流提供商(如 Anthropic、OpenAI、Google)为避免泄露模型内部推理过程(即思维链),通常将推理步骤以加密块形式返回给客户端,并要求客户端在后续请求中原样携带这些加密块。研究人员发现,这些加密块在提供商生态内完全兼容且可互换,不受会话、用户或模型限制。利用这一架构缺陷,攻击者可将某一模型(如强安全模型)的加密推理轨迹注入到同一提供商旗下防护较弱的模型中,诱导该弱模型解密并明文输出推理内容,从而在不直接破解强模型的情况下提取其隐藏推理。该漏洞衍生出四类攻击场景:第一,绕过反蒸馏机制,使对手能够提取专有模型的推理过程,已在多家主流提供商上成功演示;第二,大规模窃取私有数据——开发者常公开分享会话日志却不知其中加密块敏感,研究者从公共仓库中收集的 315320 个推理块中恢复了 367 条个人身份信息(PII)和 182 个凭据;第三,即便模型最终安全地拒绝恶意请求,其隐藏推理过程中也可能暴露有害信息;第四,攻击者可将恶意载荷完全嵌入加密块,执行隐形提示注入,污染自主智能体系统。作者在负责任披露后提出了加密和系统层面的缓解措施,以保障客户端推理数据的安全。
💡 推荐理由: 该漏洞直接威胁主流 LLM 提供商的模型知识产权和用户隐私,可被用于大批量提取私有推理数据、绕过安全防护,并对基于 Agent 的自动化系统发起隐蔽攻击。安全团队需要了解此类客户端加密机制的风险并评估自身供应链。
🎯 建议动作: 研究跟进