一句话定义
思维链(Chain-of-Thought,CoT)让模型在给出答案前先产出中间推理步骤,大幅提升多步任务表现;由此延伸的「测试时计算」路线主张:推理时多想(更多步、多路径、自我验证)可以替代部分训练规模的提升。
为什么重要
推理能力是 LLM 从「文字接龙」走向「解决问题」的关键,也是 2024 年以来最活跃的方向(推理模型的商品化竞争)。理解 CoT 的机制边界——它提升的是「计算预算」还是「逻辑能力」——决定了你对「AI 会推理吗」这一问题的判断质量。
前置知识
- kp-021(ICL 与涌现)
核心概念
- 思维链(CoT):提示中包含或引导产出逐步推理("让我们一步步思考")。
- 零样本 CoT:不给我示例、只给一句引导语即可触发(Kojima 等,2022)。
- 自洽性(Self-Consistency):多次采样推理路径,投票选最一致答案。
- 过程监督(Process Supervision):对每一步推理(而非仅最终答案)给反馈训练,抑制「答案对过程错」。
- 测试时计算(Test-time Compute):推理阶段投入更多计算(更长思维链、多路径并行、自我修正)换取准确率。
- 可验证奖励(Verifiable Reward):数学、代码等有客观判分的领域成为推理训练的主战场。
原理与机制
Transformer 单次前向的计算深度固定,复杂多步问题在「一步到位」的预算内难以解出;CoT 把中间步骤写进上下文,等效为模型获得「按需扩展的串行计算」——每多生成一步,可用计算就多一分。这是「多想 vs 更大网络」的权衡:测试时计算让小模型 + 长思考在特定领域逼近大模型。过程监督进一步把训练信号从「只看最终答案」细化到每一步,显著降低推理链中的中间错误积累。局限:CoT 不保证逻辑有效性(可能一本正经地错),幻觉可以出现在推理链中。
公式或模型
自洽性(Self-Consistency)的形式化:
对同一问题采样 k 条推理链,取多数票答案。
图示
直接回答: 问题 ────────────────▶ 答案 (一步,常错)
CoT: 问题 ─▶ 步骤1 ─▶ 步骤2 ─▶ 步骤3 ─▶ 答案 (计算预算随步数扩展)
自洽性: 3 条链 ─▶ 投票 ─▶ 高一致答案
直观类比
像「心算 vs 打草稿」:让普通人立即口答三位数乘法错误率高(一次性前向),给他纸笔逐步算(CoT)正确率大增;多位学生各算一遍再对答案(自洽性),比单算更可靠。但草稿本身也可能算错——过程监督相当于老师逐行批改草稿。
实例或案例
Wei 等(2022)在 GSM8K 等数学基准上用 CoT 让大模型性能成倍提升,且呈现规模阈值(小模型 CoT 无效);Lightman 等(2023)证明过程奖励模型显著优于结果奖励;2024 年起「推理模型」品类(以长思维链与验证奖励训练为特征)成为行业竞争焦点,测试时计算从论文概念变成产品参数(具体模型与成绩时效性强,以最新评测为准)。
常见误区
- 「CoT = 模型真的在逻辑推理」:它可能只是模仿训练分布中「看起来像推理」的文本,链路可以不真但答案碰巧对(也可能相反)。
- 「思维链越长越好」:超长链会累积错误、增加成本,且可能「过度思考」简单问题。
- 「推理能力对所有任务均衡提升」:在有验证信号(数学/代码)的领域收益最大,开放性主观任务收益有限。
与其他知识点的关系
自测题
- 从「计算预算」角度解释 CoT 为什么有效。答案要点:中间步骤把上下文变成草稿纸,等效按需扩展串行计算深度。
- 自洽性如何工作?成本代价是什么?答案要点:多次采样推理链取多数票;推理成本约放大 k 倍。
- 过程监督相比结果监督的优势?答案要点:对每一步给反馈,抑制「答案碰巧对、过程不可靠」,推理链更可信。
延伸阅读
- Chain-of-Thought Prompting(Wei 等,2022)
- Let's Verify Step by Step(Lightman 等,2023):过程监督