一句话定义
Transformer 是完全基于注意力机制的序列建模架构(Vaswani 等,2017),抛弃了循环与卷积;现代 LLM 几乎全部采用其中的「仅解码器(Decoder-only)」形态,叠加因果掩码做自回归生成。
为什么重要
Transformer 是 LLM 的物理载体:可大规模并行训练的特性直接开启了 Scaling Law 时代。读懂架构总览,才能理解后续的注意力细节、位置编码、归一化等技术为什么存在、解决什么问题。
前置知识
核心概念
- 原始三分支:编码器(双向理解)、解码器(自回归生成)、编码器-解码器(Seq2Seq 翻译)。
- Decoder-only:只保留解码器堆叠,加因果掩码;GPT 系及当代主流 LLM 均为此形态。
- 残差连接(Residual Connection):每子层输出与输入相加,保障深层梯度流通。
- 前馈网络(FFN,Feed-Forward Network):逐位置的的两层 MLP(现多用 SwiGLU,见 kp-013),容纳大部分参数。
- 因果掩码(Causal Mask):注意力矩阵上三角置负无穷,保证位置 t 只能看见 t 之前的内容。
- 整体前向:词元嵌入 + 位置信息 → N 层(注意力 + FFN)→ 末端归一化 → 输出投影到词表。
原理与机制
相较 RNN 逐词递推、长程依赖衰减,Transformer 一次前向即可让任意两位置直接交互(复杂度 O(T²)),且训练时全序列并行——这正是它取代 RNN 的根本原因。Decoder-only 在 Seq2Seq 任务上通过提示学习同样可达成,且训练/生成形式统一,让同一模型从预训练平滑走到对话;「只有一套架构、一种损失」的简洁性是它在规模化竞赛中胜出的工程与科学双重原因。
公式或模型
因果掩码作用于注意力分数(详细 QKV 见 kp-011):
A_tj = 0 (j > t),即位置 t 的注意力只允许流向 j ≤ t
单层输出的残差形式:
h ← h + Sublayer(Norm(h))
图示
输入词元 id → [嵌入 + 位置编码] → ×N 层:
├─ 掩码多头自注意力(见 kp-011)
└─ 前馈网络 FFN(见 kp-013)
(每子层带残差与归一化)
→ 末端归一化 → 线性投影 → 词表 logits → softmax → 下一词分布
直观类比
RNN 像传话游戏,信息经多人转述逐渐失真;Transformer 像圆桌会议,每个人(词元)都能同时听到其他所有人的发言(注意力),因果掩码相当于规定「只能引用先发言者的内容」。
实例或案例
GPT-2(2019)以约 15 亿参数的 Decoder-only 模型生成连贯长文,引发「仅解码器够不够」的讨论;GPT-3(2020)以 175B 参数证实该形态的规模上限远未触及,此后主流模型均沿用此架构并做细节改良(演进见 kp-013)。
常见误区
- 「Encoder 比 Decoder 高级/低级」:二者是任务分工不同;生成型 LLM 选 Decoder-only 是训练效率与形式统一的权衡结果。
- 「O(T²) 复杂度是致命缺陷」:长上下文确实受限(见 kp-014、kp-023),但工程手段已把可用窗口推到实用规模。
- 「残差连接可有可无」:没有残差的深网络几乎无法训练,它是深度可训性的基石。
与其他知识点的关系
自测题
- Transformer 取代 RNN 的两大关键优势?答案要点:任意位置直接交互(长程依赖)与全序列并行训练。
- 因果掩码解决什么问题?答案要点:保证自回归性质——训练时位置 t 不能看到未来词元,使训练与生成条件一致。
- Decoder-only 为什么成为 LLM 主流?答案要点:与生成目标/采样方式统一、实现简洁、便于无限扩展规模,且理解任务可由提示承担。
延伸阅读
- Attention Is All You Need(Vaswani 等,2017):架构原论文