#chain-of-thought

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan, Laura Vasilie, Alexandru Apostu, Chase Helwig, Mihaela Gaman, Michael Brautbar, Edward Raff, Chase Midler, Sven Krasser

本文针对安全运营中心(SOC)中常见的告警疲劳问题展开研究。在实际环境中,安全检测系统每天产生的大量告警远超分析人员可处理的范围,因此自动化的告警分诊(triage)至关重要。现有方法通常直接提示或微调大语言模型(LLM)输出分诊标签,但并未训练模型对检测结果是否为真实威胁进行推理。作者提出了一种结合思维链(Chain-of-Thought, CoT)推理能力的分诊分类器,使用真实的人工标注的Windows端点检测数据,通过自动化提示优化、自训练和带可验证奖励的强化学习来训练模型。研究发现,CoT推理会降低标签token的概率,从而影响依赖该概率的自动化分诊判断,为此作者额外训练了一个校准器(calibrator),读取完整推理轨迹并估计判定正确的概率。最终系统在测试集上达到82.6%的准确率;在高置信度阈值下,相比直接输出标签的LLM分类器,良性告警的召回率提升了43.0%,恶意告警的召回率提升了18.3%。实验还表明,训练校准器是必要的——未训练的置信度评估器会导致高置信度召回率降为零;此外,微调后的30B模型显著优于前沿通用模型,说明针对任务进行专门训练比单纯扩大模型规模更有效。本文贡献在于提出了一种可推理的告警分诊方法,并解决了推理带来的置信度校准问题,为SOC自动化分诊提供了新的思路。适合从事安全自动化、LLM应用及告警管理的研究人员和工程师阅读。

💡 推荐理由: 该研究直接解决SOC告警疲劳的痛点,通过可推理的LLM和校准器提升分诊准确性,显著优于直接标签分类,为安全运营自动化提供了可靠且可落地的方案。

🎯 建议动作: 研究跟进,评估其方法在内部SOC告警数据上的效果。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Vivek Shukla, Varun Shukla, Atul, Divya Mishra, Mehul Kumar Das

本文针对大型语言模型(LLM)在数学链式思维(Chain of Thought, CoT)推理评估中的一个关键缺陷提出解决方案。当前评估方法通常仅检查最终答案与参考答案是否一致,但这种方法存在一个'推理-答案一致性差距':一个无效的推理链可能偶然得出正确答案,而一个有效的推理过程可能因转录错误导致答案不符。为此,作者提出一种无需参考答案的、实例级别的诊断指标——推理-答案忠实度分数(Reasoning Answer Faithfulness Score, RAFS)。RAFS不是评估模型的内部计算,而是评估输出的推理轨迹的可信度。它综合了五个方面的信号:步骤有效性(每个推理步骤是否逻辑严谨)、推理到答案的蕴含(推理链是否支撑最终答案)、反事实敏感性(在针对性修改条件下答案是否合理变化)、答案共识(多次采样结果是否一致)以及条件推理稳定性(在扰动下推理结构是否稳健)。RAFS采用非补偿性聚合器,即各维度必须同时满足,避免某一维度的高分掩盖其他维度的缺陷。作者在GSM8K和MATH数据集上设计了预注册、结果盲的确认性研究,在数据审查前固定假设、可接受性规则、校准方案和测试方法,以保证结果可靠。此外,还设置了独立的可行性试点来验证端到端执行可行性并估计干预覆盖率。论文还形式化了四种推理-答案结果(正确推理正确答案、正确推理错误答案、错误推理正确答案、错误推理错误答案),并定义了语义轨迹距离、计算与弃权权衡、验证器独立性和功效分析。RAFS旨在作为数学答案准确性的补充,为静默推理失败和答案提取错误提供可审计的预警信号,帮助研究者更全面地评估LLM的推理能力。

💡 推荐理由: 对于依赖LLM进行安全分析或决策的蓝队人员,静默推理失败可能导致错误结论。RAFS提供了一种可审计的预警机制,有助于提升LLM输出的可靠性,是评估LLM推理质量的重要补充。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

该论文提出了一种针对视觉语言模型(VLM)的新型后门攻击框架ReShift,其核心创新在于实现推理层面的后门注入,而非传统的输出层操纵。现有后门攻击方法往往在推理链中留下不一致或可检测的痕迹,容易被现有防御机制发现。ReShift通过“顿悟时刻”(aha-moment)驱动的方式,在模型内部思维链(CoT)过程中引导推理轨迹发生偏移,同时保持表面上的逻辑连贯性。框架包含两个关键组件:毒化推理感知数据构建(PRDC)管道,用于生成带有触发条件且推理过程异常的样本;以及监督-强化联合优化(SRJO)策略,用于稳定地诱导触发条件下的推理偏移。论文进一步形式化了“熵反弹”(Entropy Rebound)作为推理重定向的特征信号,并给出一系列理论保证,说明熵缺口与轨迹级差异之间的关系。实验表明,ReShift能够在保持干净任务性能和生成合理推理轨迹的前提下实现高攻击成功率,显著提升对抗现有防御的隐蔽性。该研究揭示了VLM在推理层面存在的安全脆弱性,对构建可信赖的多模态AI系统提出了新挑战。适合AI安全研究员、模型开发人员和防御团队阅读。

💡 推荐理由: 该攻击揭示了VLM推理层面的脆弱性,现有防御难以检测此类隐蔽后门,威胁到安全关键场景中VLM的可信性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jianwei Tai

本文研究链式思维(CoT)答案劫持的检测与诊断方法。答案劫持是指模型在推理过程中看似合理的推理步骤最终导向错误答案的安全漏洞。作者首先构建了一个受控的数值代理场景:在GSM8K和MATH-500数据集上,对Qwen2.5-7B和Llama3-8B模型施加CoT封装,使最终答案偏离正确标签。不同于将激活修补视为干净轨迹恢复,本文关注劫持轨迹的脆弱性以及恢复是否依赖于同题目的干净源。通过few-shot、puzzle和sycophant三种劫持变体进行实验,在Bonferroni校正后,三个场景(Qwen-puzzle、Llama3-fewshot、Llama3-puzzle)通过了确认性的K=1定位。作者提出选择感知的50/50带验证方法,保留的带内-带外差距分别为+32.6、+45.1和+17.7个百分点,而精确的L*一致性则不太稳定。Qwen-fewshot仍属探索性,sycophant场景在短修补下呈现时间弥散性。BF16全带扫描保留带信号(n=30,K=1扩散0.33,峰值层20),证明带并非INT4伪影。固定钩子重跑实验在主要puzzle单元中保持恢复:Qwen-puzzle在n=100时恢复47.0%(47/100;Wilson 95% CI [37.5%, 56.7%]),Llama3-puzzle恢复39.0%(39/100;[30.0%, 48.8%])。冻结迁移至MATH-500时,最大固定迁移运行恢复26.0%(13/50;[15.9%, 39.6%])。源控制改变机制解释:配对bootstrap显示Qwen-fewshot中干净源与随机源无显著差异(+3.0点,95% CI [-18.2,+27.3]),Llama3-puzzle在扩大n=60时也如此(干净-随机 -8.3 [-21.7,+5.0]),而Llama3-fewshot则是内容介导的(+40.0 [+16.7,+60.0])。

💡 推荐理由: 本文首次系统性地诊断CoT答案劫持的脆性区域,并提出了选择感知的验证方法,有助于蓝队理解此类攻击的内部机制并设计针对性防御。

🎯 建议动作: 研究跟进,评估该方法对自有LLM系统的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)