能力评估与局限 前沿 约 22 分钟 更新 2026-10-02

推理能力与思维链:从 CoT 到测试时计算

学习状态:
未学

一句话定义

思维链(Chain-of-Thought,CoT)让模型在给出答案前先产出中间推理步骤,大幅提升多步任务表现;由此延伸的「测试时计算」路线主张:推理时多想(更多步、多路径、自我验证)可以替代部分训练规模的提升。

为什么重要

推理能力是 LLM 从「文字接龙」走向「解决问题」的关键,也是 2024 年以来最活跃的方向(推理模型的商品化竞争)。理解 CoT 的机制边界——它提升的是「计算预算」还是「逻辑能力」——决定了你对「AI 会推理吗」这一问题的判断质量。

前置知识

核心概念

原理与机制

Transformer 单次前向的计算深度固定,复杂多步问题在「一步到位」的预算内难以解出;CoT 把中间步骤写进上下文,等效为模型获得「按需扩展的串行计算」——每多生成一步,可用计算就多一分。这是「多想 vs 更大网络」的权衡:测试时计算让小模型 + 长思考在特定领域逼近大模型。过程监督进一步把训练信号从「只看最终答案」细化到每一步,显著降低推理链中的中间错误积累。局限:CoT 不保证逻辑有效性(可能一本正经地错),幻觉可以出现在推理链中。

公式或模型

自洽性(Self-Consistency)的形式化:

ŷ = mode{ sample_i(P(y | CoT提示, x)) , i = 1..k }

对同一问题采样 k 条推理链,取多数票答案。

图示

直接回答:  问题 ────────────────▶ 答案        (一步,常错)
CoT:       问题 ─▶ 步骤1 ─▶ 步骤2 ─▶ 步骤3 ─▶ 答案 (计算预算随步数扩展)
自洽性:    3 条链 ─▶ 投票 ─▶ 高一致答案

直观类比

像「心算 vs 打草稿」:让普通人立即口答三位数乘法错误率高(一次性前向),给他纸笔逐步算(CoT)正确率大增;多位学生各算一遍再对答案(自洽性),比单算更可靠。但草稿本身也可能算错——过程监督相当于老师逐行批改草稿。

实例或案例

Wei 等(2022)在 GSM8K 等数学基准上用 CoT 让大模型性能成倍提升,且呈现规模阈值(小模型 CoT 无效);Lightman 等(2023)证明过程奖励模型显著优于结果奖励;2024 年起「推理模型」品类(以长思维链与验证奖励训练为特征)成为行业竞争焦点,测试时计算从论文概念变成产品参数(具体模型与成绩时效性强,以最新评测为准)。

常见误区

与其他知识点的关系

自测题

  1. 从「计算预算」角度解释 CoT 为什么有效。
    答案要点:中间步骤把上下文变成草稿纸,等效按需扩展串行计算深度。
  2. 自洽性如何工作?成本代价是什么?
    答案要点:多次采样推理链取多数票;推理成本约放大 k 倍。
  3. 过程监督相比结果监督的优势?
    答案要点:对每一步给反馈,抑制「答案碰巧对、过程不可靠」,推理链更可信。

延伸阅读