治理安全与历史 入门 约 18 分钟 更新 2026-10-02

大语言模型简史:从统计模型到 GPT 时代

学习状态:
未学

一句话定义

从 1950 年代 Shannon 的字符概率模型,到 2003 年 Bengio 的神经语言模型,再到 2017 年 Transformer 与 2020 年 GPT-3 的规模跃迁,LLM 的历史是「概率建模 × 架构突破 × 算力增长」三条线交织合流的历史。

为什么重要

历史给概念以坐标:知道 n-gram 为什么被淘汰、Transformer 为什么出现、Scaling Law 为什么改写行业,你就获得了评价任何「新架构、新范式」的参照系——大多数「革命性宣称」都能在历史中找到原型与结局。

前置知识

核心概念

(本知识点以时间线组织核心概念)

原理与机制

三条主线的合流逻辑:统计线索提供了目标函数(最大似然)与评估(困惑度);架构线索从词向量、RNN 演进到 Transformer,解决了表示与并行问题;算力线索(GPU 集群、分布式训练,见 kp-008)把「想得到的想法」变成「训得起的实验」。范式切换的判据是「谁能在同等算力下更低损失/更高下游收益」——n-gram 输给神经网络、RNN 输给 Transformer、BERT 式理解路线在生成应用时代让位于 GPT 式生成路线,均是同一判据的裁决。

公式或模型

本节不适用:历史脉络以时间线与因果论证呈现;各节点的关键公式与模型已分置于对应知识点(kp-002/005/007/010/011)。

图示

1948 Shannon 概率语言观
2003 Bengio 神经语言模型 ──词嵌入
2017 Transformer ────────────────并行化
2018 GPT-1 / BERT ───────────────预训练+微调
2020 GPT-3 / Scaling Laws ───────规模与少样本
2022 Chinchilla / ChatGPT ───────配方修正 + 对齐出圈
2023+ 开放生态 / 长上下文 / 推理模型

直观类比

像三次工业革命的叠加:概率理论是「蒸汽机原理」(知道语言可以用概率描述),Transformer 是「内燃机」(可量产的动力装置),Scaling Law 与 GPU 集群是「流水线与能源网络」(把动力放大到工业级)。缺少任何一条线,都没有「GPT 时代」。

实例或案例

对照读法示例:读懂 2020 年 GPT-3 论文需要 kp-021(ICL);读懂 2022 年 Chinchilla 需要 kp-007(算力配方);读懂 ChatGPT 的技术栈需要 kp-016/017/018(三阶段)。反过来,任何新技术报告的第一节几乎都在与这条时间线对话——历史素养直接等于阅读效率。

常见误区

与其他知识点的关系

自测题

  1. 画出 LLM 简史的五个关键节点并各配一个知识点。
    答案要点:Shannon(kp-002)→ Bengio(kp-004)→ Transformer(kp-010)→ GPT-3/Scaling(kp-021/007)→ ChatGPT 对齐(kp-016/018)。
  2. Transformer 胜出 RNN 的判据是什么?
    答案要点:同等算力下训练效率与损失表现更优(并行化 + 长程建模)。
  3. 为什么说 2022 年是「双重引爆」?
    答案要点:Chinchilla 改写训练配方(科学侧),ChatGPT 完成对齐产品化(应用侧)。

延伸阅读