#reasoning-trace

共收录 2 条相关安全情报。

← 返回所有主题
推荐 5.7
Conf: 50%
👥 作者: Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko

本文揭示了大型语言模型(LLM)提供商在客户端保存加密推理轨迹所引入的严重安全漏洞。许多主流提供商(如 Anthropic、OpenAI、Google)为避免泄露模型内部推理过程(即思维链),通常将推理步骤以加密块形式返回给客户端,并要求客户端在后续请求中原样携带这些加密块。研究人员发现,这些加密块在提供商生态内完全兼容且可互换,不受会话、用户或模型限制。利用这一架构缺陷,攻击者可将某一模型(如强安全模型)的加密推理轨迹注入到同一提供商旗下防护较弱的模型中,诱导该弱模型解密并明文输出推理内容,从而在不直接破解强模型的情况下提取其隐藏推理。该漏洞衍生出四类攻击场景:第一,绕过反蒸馏机制,使对手能够提取专有模型的推理过程,已在多家主流提供商上成功演示;第二,大规模窃取私有数据——开发者常公开分享会话日志却不知其中加密块敏感,研究者从公共仓库中收集的 315320 个推理块中恢复了 367 条个人身份信息(PII)和 182 个凭据;第三,即便模型最终安全地拒绝恶意请求,其隐藏推理过程中也可能暴露有害信息;第四,攻击者可将恶意载荷完全嵌入加密块,执行隐形提示注入,污染自主智能体系统。作者在负责任披露后提出了加密和系统层面的缓解措施,以保障客户端推理数据的安全。

💡 推荐理由: 该漏洞直接威胁主流 LLM 提供商的模型知识产权和用户隐私,可被用于大批量提取私有推理数据、绕过安全防护,并对基于 Agent 的自动化系统发起隐蔽攻击。安全团队需要了解此类客户端加密机制的风险并评估自身供应链。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Yu-An Lu, Ci-Yang Tsai, Yu-Lin Tsai, Raluca Ada Popa, Chia-Mu Yu

本文研究了大型语言模型(LLM)推理痕迹的暴露风险。虽然许多部署系统通过界面层隐藏原始推理痕迹,只向用户暴露摘要或最终答案,以防止能力转移,但作者提出了一种轻量级的上下文引导方法——推理暴露提示(REP)。REP利用影子模型生成的示范,以辅助代码格式包装,诱导目标模型在回答中泄露内部推理痕迹。实验在常见推理数据集、不同目标模型和学生模型蒸馏场景下进行,结果表明REP能显著提高暴露痕迹与原始内部痕迹的相似度,同时保留有用的推理信号。该研究揭示了当前界面级隐藏策略的不足,表明用户仍可通过特定提示技术获取原本不可见的推理过程,从而对LLM的安全性、隐私保护和能力控制构成潜在威胁。

💡 推荐理由: 该研究揭示了LLM推理痕迹即使在界面层隐藏后仍可通过提示泄露,对模型能力保护、隐私泄露和滥用控制具有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)