该论文研究了一个此前被忽视的安全问题:能否通过黑盒API交互,从前沿专有大型推理模型(LRM)中近乎逐字地提取隐藏的思维链(Chain-of-Thought, CoT)。隐藏CoT被视为模型的核心资产,尤其是商业模型内部的推理过程,过去普遍认为直接提取不可行。作者发现了一个工具调用之间的‘推理重放面’(reasoning replay surface),并据此设计了EchoCoT——一种多阶段攻击方法。该方法利用API返回的保真度信号(例如生成token的logits或长度信息)作为反馈,迭代式地调整注入轨迹,从而逐步逼近并还原隐藏的CoT。为了提升通用性,作者还构建了一个基于LLM的自动优化框架,能够在不同数据集上自动搜索有效的通用注入轨迹。实验在三个开源LRM和五个前沿专有LRM上进行。在开源模型上,EchoCoT实现了最高66.4%的近乎逐字提取成功率,且提取出的轨迹长度与目标相差不超过10%,至少90%的token与目标CoT完全匹配。同一注入轨迹还能泛化到未见数据集,在相同标准下达到80%的成功率。对于专有模型,提取出的CoT与提供商报告的推理长度及现有CoT摘要高度吻合;尤其对Gemini-2.5,成功提取了目标为32,948 token的CoT中的33,463个token(长度超过目标,说明存在过度生成)。这些结果证明隐藏CoT提取是一个实际安全风险,凸显了保护模型思维链资产的紧迫性。适合关注LLM安全、模型资产保护和AI对抗性攻击的研究者与安全工程师阅读。
💡 推荐理由: 首次系统性地证明黑盒专有LRM的隐藏思维链可被近乎逐字提取,直接威胁模型核心知识产权与推理隐私,对依赖CoT商业价值的厂商构成紧迫安全警示。
🎯 建议动作: 研究跟进