预训练 核心 约 20 分钟 更新 2026-10-02

预训练目标:下一词预测、掩码语言模型与排列语言模型

学习状态:
未学

一句话定义

预训练目标定义了模型在海量无标注文本上「自学」的任务:自回归的下一词预测(GPT 系)、双向的掩码语言模型(BERT 系)与打乱顺序还原的排列语言模型(XLNet 系),目标选择决定了模型的生成与理解倾向。

为什么重要

「预训练在优化什么」是理解 LLM 的第一性原理。生成式目标让模型天然具备续写能力,成为 GPT 路线胜出的基石;理解目标差异,才能解释为什么 BERT 不擅长自由生成、为什么 GPT 能规模化到对话助手。

前置知识

核心概念

原理与机制

AR 目标对每个位置计算交叉熵并对全序列求平均,一次前向即可对所有位置并行计算损失(因果掩码防止偷看未来)。MLM 只在被遮盖的少数位置计损失,双向注意力允许利用后文,但破坏了概率链式分解,采样生成需要循环调用。经验上,AR 目标配合大规模数据与足够参数,能力上限更高——生成、上下文学习、推理都能从同一目标中「长」出来。

公式或模型

AR 目标的负对数似然(与 kp-002 的交叉熵一致):

L_AR(θ) = - Σ_t log P_θ(x_t | x_<t)

MLM 目标(M 为被遮位置集合):

L_MLM(θ) = - Σ_{t ∈ M} log P_θ(x_t | x_\\masked)

图示

AR :  我  ▶ 爱  ▶ 北  ▶ 京        逐位预测右侧
MLM:  我 [MASK] 北 [MASK]         双向预测被遮位
PLM:  顺序打乱后仍按某排列自回归     兼顾双向

直观类比

AR 像「只许顺着读、边读边猜下一句的读者」;MLM 像「完形填空考生,试卷前后都可见」;PLM 像「打乱段落顺序仍能理清逻辑的读者」。

实例或案例

GPT-1(2018)证明生成式预训练 + 微调可迁移到多任务;BERT(2018)用 MLM 刷新理解类基准,主导了此后数年的判别式应用;T5(2019)统一为「文本到文本」。2020 年 GPT-3 后,社区与产业主流回到 AR 路线,因其与生成应用天然契合。

常见误区

与其他知识点的关系

自测题

  1. 为什么 AR 训练可以高度并行,而生成不能?
    答案要点:训练时所有位置的输入均为真实前文,因果掩码保证互不偷看,可一次算全序列损失;生成必须等上一词产出。
  2. MLM 为什么不便于自由生成?
    答案要点:破坏了概率链式分解,缺少自然的从左到右逐步采样方式。
  3. 后训练与预训练在损失函数上有什么异同?
    答案要点:同为交叉熵/负对数似然;差异在数据分布(指令、偏好)与目标加权,而非损失形式本身。

延伸阅读