一句话定义
从 1950 年代 Shannon 的字符概率模型,到 2003 年 Bengio 的神经语言模型,再到 2017 年 Transformer 与 2020 年 GPT-3 的规模跃迁,LLM 的历史是「概率建模 × 架构突破 × 算力增长」三条线交织合流的历史。
为什么重要
历史给概念以坐标:知道 n-gram 为什么被淘汰、Transformer 为什么出现、Scaling Law 为什么改写行业,你就获得了评价任何「新架构、新范式」的参照系——大多数「革命性宣称」都能在历史中找到原型与结局。
前置知识
- kp-001(LLM 是什么)
核心概念
(本知识点以时间线组织核心概念)
- 1950-1980 统计时代:Shannon(1948/1951)确立语言的概率视角;n-gram 与平滑技术统治数十年。
- 1990-2010 神经萌芽:Bengio 等(2003)提出神经概率语言模型与词嵌入(kp-004 的源头);RNN/LSTM 处理序列但难以并行。
- 2017 架构革命:Transformer(Vaswani 等)以全注意力取代循环,并行化打开规模之门(kp-010)。
- 2018 预训练范式:GPT-1(生成式)与 BERT(掩码式)确立「预训练 + 微调」;两条路线之争(见 kp-005)。
- 2020 规模觉醒:GPT-3(175B)展示少样本能力,ICL 惊艳(kp-021);Kaplan 等 Scaling Laws 给规模化以理论。
- 2022 双重引爆:Chinchilla 修正算力配方(kp-007);InstructGPT/ChatGPT 把 RLHF 对齐(kp-016/018)变成消费产品,LLM 出圈。
- 2023 至今 生态竞争:开放权重生态(kp-031)、长上下文竞赛(kp-014)、多模态、推理模型与测试时计算(kp-024)成为主战场。
原理与机制
三条主线的合流逻辑:统计线索提供了目标函数(最大似然)与评估(困惑度);架构线索从词向量、RNN 演进到 Transformer,解决了表示与并行问题;算力线索(GPU 集群、分布式训练,见 kp-008)把「想得到的想法」变成「训得起的实验」。范式切换的判据是「谁能在同等算力下更低损失/更高下游收益」——n-gram 输给神经网络、RNN 输给 Transformer、BERT 式理解路线在生成应用时代让位于 GPT 式生成路线,均是同一判据的裁决。
公式或模型
本节不适用:历史脉络以时间线与因果论证呈现;各节点的关键公式与模型已分置于对应知识点(kp-002/005/007/010/011)。
图示
1948 Shannon 概率语言观
2003 Bengio 神经语言模型 ──词嵌入
2017 Transformer ────────────────并行化
2018 GPT-1 / BERT ───────────────预训练+微调
2020 GPT-3 / Scaling Laws ───────规模与少样本
2022 Chinchilla / ChatGPT ───────配方修正 + 对齐出圈
2023+ 开放生态 / 长上下文 / 推理模型
直观类比
像三次工业革命的叠加:概率理论是「蒸汽机原理」(知道语言可以用概率描述),Transformer 是「内燃机」(可量产的动力装置),Scaling Law 与 GPU 集群是「流水线与能源网络」(把动力放大到工业级)。缺少任何一条线,都没有「GPT 时代」。
实例或案例
对照读法示例:读懂 2020 年 GPT-3 论文需要 kp-021(ICL);读懂 2022 年 Chinchilla 需要 kp-007(算力配方);读懂 ChatGPT 的技术栈需要 kp-016/017/018(三阶段)。反过来,任何新技术报告的第一节几乎都在与这条时间线对话——历史素养直接等于阅读效率。
常见误区
- 「LLM 是从 ChatGPT 才开始的」:语言建模有七十余年谱系,ChatGPT 是对齐与产品化的引爆点而非起点。
- 「Transformer 是凭空发明的」:注意力机制此前已在 seq2seq 中出现,2017 年的贡献是「让注意力成为全部」。
- 「BERT 路线失败了」:它赢得了理解类任务并长期服役,只是未成为生成助手的主干。
与其他知识点的关系
自测题
- 画出 LLM 简史的五个关键节点并各配一个知识点。
- Transformer 胜出 RNN 的判据是什么?答案要点:同等算力下训练效率与损失表现更优(并行化 + 长程建模)。
- 为什么说 2022 年是「双重引爆」?答案要点:Chinchilla 改写训练配方(科学侧),ChatGPT 完成对齐产品化(应用侧)。
延伸阅读
- Attention Is All You Need(Vaswani 等,2017)
- Language Models are Few-Shot Learners(Brown 等,2020)
- 《深度学习》(Goodfellow 等):表示学习的历史注脚