架构与关键技术 核心 约 22 分钟 更新 2026-10-02

Transformer 总览与仅解码器架构

学习状态:
未学

一句话定义

Transformer 是完全基于注意力机制的序列建模架构(Vaswani 等,2017),抛弃了循环与卷积;现代 LLM 几乎全部采用其中的「仅解码器(Decoder-only)」形态,叠加因果掩码做自回归生成。

为什么重要

Transformer 是 LLM 的物理载体:可大规模并行训练的特性直接开启了 Scaling Law 时代。读懂架构总览,才能理解后续的注意力细节、位置编码、归一化等技术为什么存在、解决什么问题。

前置知识

核心概念

原理与机制

相较 RNN 逐词递推、长程依赖衰减,Transformer 一次前向即可让任意两位置直接交互(复杂度 O(T²)),且训练时全序列并行——这正是它取代 RNN 的根本原因。Decoder-only 在 Seq2Seq 任务上通过提示学习同样可达成,且训练/生成形式统一,让同一模型从预训练平滑走到对话;「只有一套架构、一种损失」的简洁性是它在规模化竞赛中胜出的工程与科学双重原因。

公式或模型

因果掩码作用于注意力分数(详细 QKV 见 kp-011):

A_tj = 0 (j > t),即位置 t 的注意力只允许流向 j ≤ t

单层输出的残差形式:

h ← h + Sublayer(Norm(h))

图示

输入词元 id → [嵌入 + 位置编码] → ×N 层:
                                   ├─ 掩码多头自注意力(见 kp-011)
                                   └─ 前馈网络 FFN(见 kp-013)
                                   (每子层带残差与归一化)
→ 末端归一化 → 线性投影 → 词表 logits → softmax → 下一词分布

直观类比

RNN 像传话游戏,信息经多人转述逐渐失真;Transformer 像圆桌会议,每个人(词元)都能同时听到其他所有人的发言(注意力),因果掩码相当于规定「只能引用先发言者的内容」。

实例或案例

GPT-2(2019)以约 15 亿参数的 Decoder-only 模型生成连贯长文,引发「仅解码器够不够」的讨论;GPT-3(2020)以 175B 参数证实该形态的规模上限远未触及,此后主流模型均沿用此架构并做细节改良(演进见 kp-013)。

常见误区

与其他知识点的关系

自测题

  1. Transformer 取代 RNN 的两大关键优势?
    答案要点:任意位置直接交互(长程依赖)与全序列并行训练。
  2. 因果掩码解决什么问题?
    答案要点:保证自回归性质——训练时位置 t 不能看到未来词元,使训练与生成条件一致。
  3. Decoder-only 为什么成为 LLM 主流?
    答案要点:与生成目标/采样方式统一、实现简洁、便于无限扩展规模,且理解任务可由提示承担。

延伸阅读