一句话定义
大语言模型(Large Language Model,LLM)是在海量文本上以「预测下一个词」为核心目标训练出来的超大规模神经网络,它把语言压缩成参数中的统计结构,从而能生成、改写、翻译、总结文本并表现出对话与推理等通用能力。
为什么重要
LLM 是当前人工智能应用层的通用底座:搜索、编程助手、客服、写作、数据分析都在其上构建。理解它「是什么、不是什么」,是避免神化或轻视的第一步——它不是数据库,不是搜索引擎,也不是推理机的完美实现,而是一个强大的条件概率生成器加上对齐层。几乎所有后续知识点(预训练、对齐、评估、幻觉)都建立在这个准确定义之上。
前置知识
- 无硬性前置,本知识点是全库入口。
核心概念
- 参数规模:通常以十亿(Billion,B)计的神经网络权重数量,2020 年代主流模型从数 B 到数千 B 不等(数字快速过时,仅作量级参考)。
- 基础模型(Base Model):只做预训练的「裸」模型,擅长续写文本但不会对话。
- 对话模型(Chat Model):经过后训练(见 kp-016)的助手形态,能遵循指令、多轮对话。
- 多模态:除文本外还能处理图像、音频输入的扩展形态。
- 上下文窗口:模型一次能「看到」的文本长度上限(见 kp-023)。
原理与机制
LLM 的能力来自三层叠加:一是预训练,在海量文本上做下一个词预测,把语法、事实、推理模式编码进参数;二是后训练对齐,用指令数据与人类偏好把基础模型塑造成助手;三是推理时的解码与上下文,模型根据提示词(Prompt)条件化地生成。它没有内置数据库检索,"知识"以分布式权重形式存储,调用时逐词生成。
公式或模型
LLM 的本质是一个条件概率模型,对给定上下文预测下一个词元的分布:
P(x_t | x_1, x_2, ..., x_{t-1}; θ)
其中 θ 是全部模型参数。整段文本的概率是各词条件概率的连乘,训练目标就是最大化该连乘积的对数(详见 kp-002 与 kp-005)。
图示
海量文本 ──预训练──▶ 基础模型 ──SFT/RLHF──▶ 对话模型 ──提示──▶ 回答
(互联网/书籍/代码) (会续写) (会对话) (上下文) (逐词生成)
直观类比
把基础模型想象成一个「读过整个互联网但只会接话的模仿者」:你说上半句它接下半句;对话模型则像给这位模仿者上了一轮「职业培训」,教它何时提问、何时拒答、如何组织答案。
实例或案例
2022 年底 ChatGPT 上线后两个月内用户破亿,成为消费级应用增速纪录之一,说明「基础模型 + 对齐 + 对话界面」的组合首次让普通用户感知到通用语言能力。开发者侧,各类模型 API 将 LLM 变成按 token 计费的基础设施(模型版本与能力时效性强,以官方文档为准)。
常见误区
- 「LLM 会搜索知识」:预训练后知识冻结在权重里,需要检索增强(见 kp-029)才能引用新信息。
- 「参数越大一定越好」:数据质量与训练配方同样关键(见 kp-007)。
- 「它会像人一样理解」:其「理解」是统计关联意义上的,行为类比可用,机制等同则不成立(见 kp-033)。
与其他知识点的关系
自测题
- 基础模型与对话模型的核心差别是什么?答案要点:是否经过后训练对齐;基础模型擅长续写,对话模型会遵循指令、多轮交互。
- 为什么说 LLM 的知识有「冻结时间」?答案要点:知识来自预训练语料,训练完成后权重不再更新,新事件需外部检索补充。
- LLM 与搜索引擎在信息获取机制上有何不同?答案要点:搜索引擎是索引匹配与检索;LLM 是参数化生成,可能编造,需 RAG 等手段补充事实性。
延伸阅读
- GPT-4 Technical Report(OpenAI,2023):以系统报告形式给出能力评测版图
- 《深度学习》(Goodfellow、Bengio、Courville):神经网络基础