一句话定义
预训练目标定义了模型在海量无标注文本上「自学」的任务:自回归的下一词预测(GPT 系)、双向的掩码语言模型(BERT 系)与打乱顺序还原的排列语言模型(XLNet 系),目标选择决定了模型的生成与理解倾向。
为什么重要
「预训练在优化什么」是理解 LLM 的第一性原理。生成式目标让模型天然具备续写能力,成为 GPT 路线胜出的基石;理解目标差异,才能解释为什么 BERT 不擅长自由生成、为什么 GPT 能规模化到对话助手。
前置知识
核心概念
- 自回归语言建模(AR,Autoregressive):从左到右逐词预测,训练与生成方式一致。
- 掩码语言建模(MLM,Masked Language Modeling):随机遮盖部分词元,用双向上下文预测被遮词,擅长理解任务。
- 排列语言建模(PLM,Permutation Language Modeling):以随机因子分解顺序兼顾双向信息与自回归形式(XLNet)。
- Span 损坏 / 前缀语言建模:T5 的 span 填空与多目标变体,属折中路线。
- 教师强制(Teacher Forcing):训练时输入真实前文而非模型自己的生成,稳定且并行高效。
原理与机制
AR 目标对每个位置计算交叉熵并对全序列求平均,一次前向即可对所有位置并行计算损失(因果掩码防止偷看未来)。MLM 只在被遮盖的少数位置计损失,双向注意力允许利用后文,但破坏了概率链式分解,采样生成需要循环调用。经验上,AR 目标配合大规模数据与足够参数,能力上限更高——生成、上下文学习、推理都能从同一目标中「长」出来。
公式或模型
AR 目标的负对数似然(与 kp-002 的交叉熵一致):
L_AR(θ) = - Σ_t log P_θ(x_t | x_<t)
MLM 目标(M 为被遮位置集合):
L_MLM(θ) = - Σ_{t ∈ M} log P_θ(x_t | x_\\masked)
图示
AR : 我 ▶ 爱 ▶ 北 ▶ 京 逐位预测右侧
MLM: 我 [MASK] 北 [MASK] 双向预测被遮位
PLM: 顺序打乱后仍按某排列自回归 兼顾双向
直观类比
AR 像「只许顺着读、边读边猜下一句的读者」;MLM 像「完形填空考生,试卷前后都可见」;PLM 像「打乱段落顺序仍能理清逻辑的读者」。
实例或案例
GPT-1(2018)证明生成式预训练 + 微调可迁移到多任务;BERT(2018)用 MLM 刷新理解类基准,主导了此后数年的判别式应用;T5(2019)统一为「文本到文本」。2020 年 GPT-3 后,社区与产业主流回到 AR 路线,因其与生成应用天然契合。
常见误区
- 「MLM 过时了所以 BERT 没用」:理解/检索/排序场景 BERT 类模型仍是高效选择。
- 「预训练目标决定一切」:数据规模与质量、参数量同样关键(见 kp-007)。
- 「训练时模型会看到自己生成的词」:教师强制机制下训练输入是真实语料,与推理时自回归不同。
与其他知识点的关系
自测题
- 为什么 AR 训练可以高度并行,而生成不能?答案要点:训练时所有位置的输入均为真实前文,因果掩码保证互不偷看,可一次算全序列损失;生成必须等上一词产出。
- MLM 为什么不便于自由生成?答案要点:破坏了概率链式分解,缺少自然的从左到右逐步采样方式。
- 后训练与预训练在损失函数上有什么异同?答案要点:同为交叉熵/负对数似然;差异在数据分布(指令、偏好)与目标加权,而非损失形式本身。
延伸阅读
- Improving Language Understanding by Generative Pre-Training(Radford 等,2018):GPT-1
- BERT: Pre-training of Deep Bidirectional Transformers(Devlin 等,2019)
- Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(Raffel 等,2020):T5