一句话定义
上下文学习(In-Context Learning,ICL)指模型不更新参数、仅凭提示中的少量示例就学会新任务;「涌现能力」则描述某些能力在小模型上近于零、跨过规模阈值后骤然显现的现象——其真实性仍是活跃争议。
为什么重要
ICL 是 LLM 区别于传统「训练一次用一处」范式的核心:任务适应从「重新训练」变成「写好提示」(这正是提示工程专题站的方法论根基)。涌现之争则关系到如何解读 Scaling Law 与行业投入逻辑,是领域内最重要的科学辩论之一。
前置知识
核心概念
- 零样本 / 少样本(Zero/Few-shot):提示中给 0 或 k 个示例,模型直接完成任务。
- ICL 的隐式机制:注意力在上下文内做「模式匹配与补全」,相当于隐式的临时学习(无梯度更新)。
- 涌现能力(Emergent Abilities):Wei 等(2022)定义——小模型随机水平、大模型跃升的能力。
- 度量假象质疑:Schaeffer 等(2023)主张「涌现」可能是非线性指标(如精确匹配)造成的视觉假象。
- 任务向量 / 示例选择:示例的顺序、数量、质量显著影响 ICL 效果。
原理与机制
GPT-3(2020)系统展示 ICL:在提示中给出 2 至 8 个「输入→输出」示例,模型即可在未见任务上达到可观准确率——参数不更新,学习发生在前向传播内部。机制解释的主流图景是「隐式贝叶斯/梯度」:注意力把示例当作条件信息,定位任务模式并推断输出规则(存在多种竞争性理论,尚未定论)。涌现争议的双方共识是:换用连续指标后许多「跃升」变平缓;分歧在于这是否推翻「质性新能力」的存在。
公式或模型
ICL 的形式化:给定示例序列 S = (x1,y1,...,xk,yk) 与新输入 x:
涌现的度量式定义:Metric = 0(小模型)→ 跃升点后快速上升;争议即在于 Metric 的选择。
图示
提示 = [示例1: 英→法] [示例2: 英→法] [新输入: "apple"] → "pomme"
(参数零更新,全靠注意力利用上下文)
涌现曲线(争议中):
准确率│ ╭───── ← 精确匹配指标下"跳变"
│ ╭─────╯
│___╱ ← 换连续指标后可能变平滑
└──────────────────▶ 模型规模
直观类比
ICL 像「看两个例题就会做题的学生」:没人给他补课(无训练),例题本身把解题格式与规律「演示」清楚了。涌现像「水量到某刻度才溢出的杯子」:看起来是突然溢出,也可能只是你的量杯刻度太粗(指标太粗糙)。
实例或案例
GPT-3 论文的少样本实验是 ICL 的奠基证据;Wei 等(2022)汇总多项「跨阈值跃升」能力(多步算术、指令泛化等);Schaeffer 等(2023)以多项任务证明换用连续评分后跃升消失,引发广泛讨论。实践侧,示例选择(与输入相似、格式一致、顺序敏感)已成为提示工程的核心技巧(方法论详见提示与上下文工程专题站)。
常见误区
- 「ICL 在更新权重」:没有任何梯度更新;「学习」完全发生在一次前向计算内,会话结束即失效。
- 「涌现已被证实/已被证伪」:真相依赖指标选择与任务定义,2023 年后的文献共识是「部分为度量假象,整体仍开放」。
- 「示例越多越好」:示例过多挤占窗口且引入噪声,质量与相关性比数量重要。
与其他知识点的关系
自测题
- ICL 与微调的本质区别?答案要点:ICL 不改参数、条件于上下文、会话即弃;微调持久改变权重。
- 「涌现是度量假象」论证的核心论据?答案要点:非线性指标(精确匹配)把渐进进步渲染成跳变;换连续指标后曲线平滑。
- 少样本示例的哪三个因素影响效果?答案要点:质量(正确性与代表性)、与测试输入的相关性、排列顺序。
延伸阅读
- Language Models are Few-Shot Learners(Brown 等,2020):GPT-3
- Are Emergent Abilities of Large Language Models a Mirage?(Schaeffer 等,2023)