本文针对大型语言模型(LLM)在数学链式思维(Chain of Thought, CoT)推理评估中的一个关键缺陷提出解决方案。当前评估方法通常仅检查最终答案与参考答案是否一致,但这种方法存在一个'推理-答案一致性差距':一个无效的推理链可能偶然得出正确答案,而一个有效的推理过程可能因转录错误导致答案不符。为此,作者提出一种无需参考答案的、实例级别的诊断指标——推理-答案忠实度分数(Reasoning Answer Faithfulness Score, RAFS)。RAFS不是评估模型的内部计算,而是评估输出的推理轨迹的可信度。它综合了五个方面的信号:步骤有效性(每个推理步骤是否逻辑严谨)、推理到答案的蕴含(推理链是否支撑最终答案)、反事实敏感性(在针对性修改条件下答案是否合理变化)、答案共识(多次采样结果是否一致)以及条件推理稳定性(在扰动下推理结构是否稳健)。RAFS采用非补偿性聚合器,即各维度必须同时满足,避免某一维度的高分掩盖其他维度的缺陷。作者在GSM8K和MATH数据集上设计了预注册、结果盲的确认性研究,在数据审查前固定假设、可接受性规则、校准方案和测试方法,以保证结果可靠。此外,还设置了独立的可行性试点来验证端到端执行可行性并估计干预覆盖率。论文还形式化了四种推理-答案结果(正确推理正确答案、正确推理错误答案、错误推理正确答案、错误推理错误答案),并定义了语义轨迹距离、计算与弃权权衡、验证器独立性和功效分析。RAFS旨在作为数学答案准确性的补充,为静默推理失败和答案提取错误提供可审计的预警信号,帮助研究者更全面地评估LLM的推理能力。
💡 推荐理由: 对于依赖LLM进行安全分析或决策的蓝队人员,静默推理失败可能导致错误结论。RAFS提供了一种可审计的预警机制,有助于提升LLM输出的可靠性,是评估LLM推理质量的重要补充。
🎯 建议动作: 研究跟进