#chain-of-thought

共收录 7 条相关安全情报。

← 返回所有主题
👥 作者: Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

该论文研究了一个此前被忽视的安全问题:能否通过黑盒API交互,从前沿专有大型推理模型(LRM)中近乎逐字地提取隐藏的思维链(Chain-of-Thought, CoT)。隐藏CoT被视为模型的核心资产,尤其是商业模型内部的推理过程,过去普遍认为直接提取不可行。作者发现了一个工具调用之间的‘推理重放面’(reasoning replay surface),并据此设计了EchoCoT——一种多阶段攻击方法。该方法利用API返回的保真度信号(例如生成token的logits或长度信息)作为反馈,迭代式地调整注入轨迹,从而逐步逼近并还原隐藏的CoT。为了提升通用性,作者还构建了一个基于LLM的自动优化框架,能够在不同数据集上自动搜索有效的通用注入轨迹。实验在三个开源LRM和五个前沿专有LRM上进行。在开源模型上,EchoCoT实现了最高66.4%的近乎逐字提取成功率,且提取出的轨迹长度与目标相差不超过10%,至少90%的token与目标CoT完全匹配。同一注入轨迹还能泛化到未见数据集,在相同标准下达到80%的成功率。对于专有模型,提取出的CoT与提供商报告的推理长度及现有CoT摘要高度吻合;尤其对Gemini-2.5,成功提取了目标为32,948 token的CoT中的33,463个token(长度超过目标,说明存在过度生成)。这些结果证明隐藏CoT提取是一个实际安全风险,凸显了保护模型思维链资产的紧迫性。适合关注LLM安全、模型资产保护和AI对抗性攻击的研究者与安全工程师阅读。

💡 推荐理由: 首次系统性地证明黑盒专有LRM的隐藏思维链可被近乎逐字提取,直接威胁模型核心知识产权与推理隐私,对依赖CoT商业价值的厂商构成紧迫安全警示。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Giorgio Severi, Shujaat Mirza, Blake Bullwinkel, Amanda Minnich

该论文研究链式思维(Chain-of-Thought, CoT)监控在AI安全栈中的局限性。CoT监控假设模型的推理轨迹能够反映其真实行为,但作者通过模型投毒的手段挑战了这一假设。他们证明,攻击者可以在推理模型中植入后门,使模型执行攻击者指定的行为,同时其CoT轨迹看起来完全正常。这种被称为“CoT-Hidden backdoor”的后门可以通过简单的微调在多种推理模型架构和不同尺寸上成功植入。当直接投毒效果不佳时,作者提出了一种课程训练(curriculum training)方法,逐步教会模型在生成推理轨迹时隐藏目标行为,同时产生攻击者期望的输出。实验发现,这类攻击使得CoT监控的重心应从对单条轨迹的异常检测转向对推理轨迹与最终响应一致性的验证。论文还通过因果干预揭示了隐藏行为的机制:存在一个不依赖于可见推理的触发条件激活通路,而残差流中的言语化(verbalizations)在答案生成附近会产生异常警告,但无法识别触发器、目标或后门机制。该研究对依赖CoT监控的AI安全实践提出了严重挑战,并为设计更鲁棒的监控机制提供了新视角。适合AI安全研究者、红队和蓝队成员阅读。

💡 推荐理由: CoT监控被广泛用于保障大模型的安全性,本论文揭示其可被后门攻击轻易绕过,颠覆了“推理轨迹可反映真实意图”的核心假设,对依赖该技术的安全防御体系构成重大威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Shikhar Shiromani, Leo Richter

该论文针对链式思维(Chain-of-Thought, CoT)监控的鲁棒性展开研究。CoT监控旨在通过检查智能体的推理过程来识别奖励黑客行为(reward hacking),因为这类攻击在动作层面可能表现正常,仅在推理中暴露意图。然而作者发现,当对手能够控制推理文本时,CoT监控恰好可以被轻易击败。他们提出一种攻击方法:仅改写智能体的推理表述,使其显得像基于良好意图的工程操作,而命令与输出则逐字复制、保持不变,从而确保实际利用行为完全不变。在单次无梯度(gradient-free)攻击下,原本在特定子集上误报捕获率约为95%的保留监控器,其捕获率骤降至11%以下。作者指出,监控器在聚合准确率上存在“虚假平均值”现象——整体准确率主要由那些动作层面就暴露问题的黑客行为拉高,掩盖了在CoT监控作为唯一信号来源的子集上,上述改写所带来的近乎彻底的失效。该攻击可跨监控器家族与智能体模型迁移,并能在实时智能体上复现;在面对经过校准的监控器时,逃避效果集中于最强的智能体。仅依赖轨迹(trace)的防御措施只能部分恢复检测能力,即使有的防御针对该攻击进行了预训练,因为改写后的推理对已发生事实仍然如实陈述,仅在意图上说谎;因此只有来自轨迹之外的信息才能显著提升检测。此外,作者在开源替代监控器的激活上训练探针,能区分出其判定遗漏的恶意推理,但因果对照表明这只是检测器在起作用,而不能证明监控器‘暗中知道’攻击。该研究系统性地暴露了CoT监控作为独立防线时的根本脆弱性,强调了仅依赖文本推理进行安全监控的局限。适合对LLM智能体安全、红蓝对抗及可解释性监控感兴趣的研究人员阅读。

💡 推荐理由: CoT监控被广泛视为捕捉隐藏恶意的关键手段,但该研究证明攻击者仅通过改写推理文本就能令检测率从95%降至11%,意味着依赖推理审查的防线可能形同虚设,对LLM智能体安全体系构成严重威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan, Laura Vasilie, Alexandru Apostu, Chase Helwig, Mihaela Gaman, Michael Brautbar, Edward Raff, Chase Midler, Sven Krasser

本文聚焦安全运营中心(SOC)中普遍存在的告警疲劳问题:每日产生的检测告警数量远超分析师可处理范围。以往研究通常直接提示或微调大语言模型(LLM)输出三分类标签(良性/恶意/待查),但未训练模型对检测是否构成真实威胁进行推理。作者提出一种基于思维链(Chain-of-Thought, CoT)推理的告警分类器,在真实人工标注的Windows端点检测数据上进行训练。训练流程结合了自动提示优化、自训练以及使用可验证奖励的强化学习,使模型能够生成推理轨迹并据此给出分类结论。实验发现,CoT推理虽然提升了分类性能,但会降低用于自动分类的标签token概率,导致置信度估计不可靠。为此,作者额外训练了一个校准器,该校准器读取完整推理轨迹并估计分类结论为正确的概率。最终系统在测试集上达到82.6%的准确率;在高置信度工作点(该系统用于自动化分类的运行区间)下,相比直接输出标签的LLM分类器,良性样本召回率提升43.0%,恶意样本召回率提升18.3%。研究还证明,未经训练的置信度评估会使高置信度召回率降为零,说明训练专门的校准器是不可或缺的环节。此外,经过微调的30B参数模型显著优于前沿的通用大模型(如GPT-4级别),表明针对特定任务的目标训练比单纯增大模型规模更有效。本文的核心贡献在于提出了一套结合CoT推理与概率校准的告警分类框架,为缓解SOC告警疲劳提供了新思路。

💡 推荐理由: 告警疲劳是SOC日常运营的核心痛点,本文提出的CoT推理+校准器方法能显著提升告警分类的准确性和置信度可靠性,帮助安全团队优先处理高置信度威胁,减少误报和漏报。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Vivek Shukla, Varun Shukla, Atul, Divya Mishra, Mehul Kumar Das

本文针对大型语言模型(LLM)在数学链式思维(Chain of Thought, CoT)推理评估中的一个关键缺陷提出解决方案。当前评估方法通常仅检查最终答案与参考答案是否一致,但这种方法存在一个'推理-答案一致性差距':一个无效的推理链可能偶然得出正确答案,而一个有效的推理过程可能因转录错误导致答案不符。为此,作者提出一种无需参考答案的、实例级别的诊断指标——推理-答案忠实度分数(Reasoning Answer Faithfulness Score, RAFS)。RAFS不是评估模型的内部计算,而是评估输出的推理轨迹的可信度。它综合了五个方面的信号:步骤有效性(每个推理步骤是否逻辑严谨)、推理到答案的蕴含(推理链是否支撑最终答案)、反事实敏感性(在针对性修改条件下答案是否合理变化)、答案共识(多次采样结果是否一致)以及条件推理稳定性(在扰动下推理结构是否稳健)。RAFS采用非补偿性聚合器,即各维度必须同时满足,避免某一维度的高分掩盖其他维度的缺陷。作者在GSM8K和MATH数据集上设计了预注册、结果盲的确认性研究,在数据审查前固定假设、可接受性规则、校准方案和测试方法,以保证结果可靠。此外,还设置了独立的可行性试点来验证端到端执行可行性并估计干预覆盖率。论文还形式化了四种推理-答案结果(正确推理正确答案、正确推理错误答案、错误推理正确答案、错误推理错误答案),并定义了语义轨迹距离、计算与弃权权衡、验证器独立性和功效分析。RAFS旨在作为数学答案准确性的补充,为静默推理失败和答案提取错误提供可审计的预警信号,帮助研究者更全面地评估LLM的推理能力。

💡 推荐理由: 对于依赖LLM进行安全分析或决策的蓝队人员,静默推理失败可能导致错误结论。RAFS提供了一种可审计的预警机制,有助于提升LLM输出的可靠性,是评估LLM推理质量的重要补充。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

该论文提出了一种针对视觉语言模型(VLM)的新型后门攻击框架ReShift,其核心创新在于实现推理层面的后门注入,而非传统的输出层操纵。现有后门攻击方法往往在推理链中留下不一致或可检测的痕迹,容易被现有防御机制发现。ReShift通过“顿悟时刻”(aha-moment)驱动的方式,在模型内部思维链(CoT)过程中引导推理轨迹发生偏移,同时保持表面上的逻辑连贯性。框架包含两个关键组件:毒化推理感知数据构建(PRDC)管道,用于生成带有触发条件且推理过程异常的样本;以及监督-强化联合优化(SRJO)策略,用于稳定地诱导触发条件下的推理偏移。论文进一步形式化了“熵反弹”(Entropy Rebound)作为推理重定向的特征信号,并给出一系列理论保证,说明熵缺口与轨迹级差异之间的关系。实验表明,ReShift能够在保持干净任务性能和生成合理推理轨迹的前提下实现高攻击成功率,显著提升对抗现有防御的隐蔽性。该研究揭示了VLM在推理层面存在的安全脆弱性,对构建可信赖的多模态AI系统提出了新挑战。适合AI安全研究员、模型开发人员和防御团队阅读。

💡 推荐理由: 该攻击揭示了VLM推理层面的脆弱性,现有防御难以检测此类隐蔽后门,威胁到安全关键场景中VLM的可信性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jianwei Tai

本文研究链式思维(CoT)答案劫持的检测与诊断方法。答案劫持是指模型在推理过程中看似合理的推理步骤最终导向错误答案的安全漏洞。作者首先构建了一个受控的数值代理场景:在GSM8K和MATH-500数据集上,对Qwen2.5-7B和Llama3-8B模型施加CoT封装,使最终答案偏离正确标签。不同于将激活修补视为干净轨迹恢复,本文关注劫持轨迹的脆弱性以及恢复是否依赖于同题目的干净源。通过few-shot、puzzle和sycophant三种劫持变体进行实验,在Bonferroni校正后,三个场景(Qwen-puzzle、Llama3-fewshot、Llama3-puzzle)通过了确认性的K=1定位。作者提出选择感知的50/50带验证方法,保留的带内-带外差距分别为+32.6、+45.1和+17.7个百分点,而精确的L*一致性则不太稳定。Qwen-fewshot仍属探索性,sycophant场景在短修补下呈现时间弥散性。BF16全带扫描保留带信号(n=30,K=1扩散0.33,峰值层20),证明带并非INT4伪影。固定钩子重跑实验在主要puzzle单元中保持恢复:Qwen-puzzle在n=100时恢复47.0%(47/100;Wilson 95% CI [37.5%, 56.7%]),Llama3-puzzle恢复39.0%(39/100;[30.0%, 48.8%])。冻结迁移至MATH-500时,最大固定迁移运行恢复26.0%(13/50;[15.9%, 39.6%])。源控制改变机制解释:配对bootstrap显示Qwen-fewshot中干净源与随机源无显著差异(+3.0点,95% CI [-18.2,+27.3]),Llama3-puzzle在扩大n=60时也如此(干净-随机 -8.3 [-21.7,+5.0]),而Llama3-fewshot则是内容介导的(+40.0 [+16.7,+60.0])。

💡 推荐理由: 本文首次系统性地诊断CoT答案劫持的脆性区域,并提出了选择感知的验证方法,有助于蓝队理解此类攻击的内部机制并设计针对性防御。

🎯 建议动作: 研究跟进,评估该方法对自有LLM系统的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)