能力评估与局限 核心 约 18 分钟 更新 2026-10-02

上下文学习与涌现能力

学习状态:
未学

一句话定义

上下文学习(In-Context Learning,ICL)指模型不更新参数、仅凭提示中的少量示例就学会新任务;「涌现能力」则描述某些能力在小模型上近于零、跨过规模阈值后骤然显现的现象——其真实性仍是活跃争议。

为什么重要

ICL 是 LLM 区别于传统「训练一次用一处」范式的核心:任务适应从「重新训练」变成「写好提示」(这正是提示工程专题站的方法论根基)。涌现之争则关系到如何解读 Scaling Law 与行业投入逻辑,是领域内最重要的科学辩论之一。

前置知识

核心概念

原理与机制

GPT-3(2020)系统展示 ICL:在提示中给出 2 至 8 个「输入→输出」示例,模型即可在未见任务上达到可观准确率——参数不更新,学习发生在前向传播内部。机制解释的主流图景是「隐式贝叶斯/梯度」:注意力把示例当作条件信息,定位任务模式并推断输出规则(存在多种竞争性理论,尚未定论)。涌现争议的双方共识是:换用连续指标后许多「跃升」变平缓;分歧在于这是否推翻「质性新能力」的存在。

公式或模型

ICL 的形式化:给定示例序列 S = (x1,y1,...,xk,yk) 与新输入 x:

P(y | S, x) —— 模型在「拼接后的上下文」上做常规下一词预测

涌现的度量式定义:Metric = 0(小模型)→ 跃升点后快速上升;争议即在于 Metric 的选择。

图示

提示 = [示例1: 英→法] [示例2: 英→法] [新输入: "apple"] →  "pomme"
       (参数零更新,全靠注意力利用上下文)
涌现曲线(争议中):
准确率│            ╭───── ← 精确匹配指标下"跳变"
      │      ╭─────╯
      │___╱                      ← 换连续指标后可能变平滑
      └──────────────────▶ 模型规模

直观类比

ICL 像「看两个例题就会做题的学生」:没人给他补课(无训练),例题本身把解题格式与规律「演示」清楚了。涌现像「水量到某刻度才溢出的杯子」:看起来是突然溢出,也可能只是你的量杯刻度太粗(指标太粗糙)。

实例或案例

GPT-3 论文的少样本实验是 ICL 的奠基证据;Wei 等(2022)汇总多项「跨阈值跃升」能力(多步算术、指令泛化等);Schaeffer 等(2023)以多项任务证明换用连续评分后跃升消失,引发广泛讨论。实践侧,示例选择(与输入相似、格式一致、顺序敏感)已成为提示工程的核心技巧(方法论详见提示与上下文工程专题站)。

常见误区

与其他知识点的关系

自测题

  1. ICL 与微调的本质区别?
    答案要点:ICL 不改参数、条件于上下文、会话即弃;微调持久改变权重。
  2. 「涌现是度量假象」论证的核心论据?
    答案要点:非线性指标(精确匹配)把渐进进步渲染成跳变;换连续指标后曲线平滑。
  3. 少样本示例的哪三个因素影响效果?
    答案要点:质量(正确性与代表性)、与测试输入的相关性、排列顺序。

延伸阅读