术语表
按主题分组;释义为机制级一句话,「详见」列可跳转对应知识点。
# 术语表
按主题分组的全库术语速查。释义保持机制级一句话,深入理解请跳转对应知识点。
基础与建模
| 术语 | 英文 | 释义 | 详见 |
|---|
| 大语言模型 | Large Language Model (LLM) | 海量文本上以预测下一词为目标训练的超大规模神经网络 | kp-001 |
| 自回归 | Autoregressive | 逐词生成并把已生成内容拼回输入的循环方式 | kp-002 |
| 条件概率 | Conditional Probability | 给定前文下下一词的分布,语言模型的学习对象 | kp-002 |
| 困惑度 | Perplexity | 交叉熵的指数,直觉为「每步在多少个选项里犹豫」 | kp-002 |
| 交叉熵 | Cross-Entropy | 衡量预测分布与真实下一词距离的损失 | kp-002, kp-005 |
| 词元 | Token | 分词器输出的最小处理单元,模型真正「读写的字」 | kp-003 |
| 词元化 | Tokenization | 把文本切成词元 id 序列的过程 | kp-003 |
| 字节对编码 | Byte-Pair Encoding (BPE) | 迭代合并高频字节对构建词表的主流算法 | kp-003 |
| 词表 | Vocabulary | 模型可输出词元的全集 | kp-003 |
| 嵌入 | Embedding | 词元 id 到低维连续向量的映射 | kp-004 |
| 余弦相似度 | Cosine Similarity | 衡量向量方向一致性的度量 | kp-004, kp-029 |
预训练与训练工程
| 术语 | 英文 | 释义 | 详见 |
|---|
| 预训练 | Pre-training | 海量无标注文本上的自监督学习阶段 | kp-005 |
| 掩码语言模型 | Masked Language Modeling (MLM) | 遮盖部分词元并用双向上下文预测的目标 | kp-005 |
| 教师强制 | Teacher Forcing | 训练时输入真实前文而非模型自身生成 | kp-005 |
| 数据配比 | Data Mixture | 各来源语料的混合权重,决定能力分布先验 | kp-006 |
| 去重 | Deduplication | 用哈希/MinHash 移除重复语料,降记忆化 | kp-006 |
| 数据污染 | Contamination | 评测题混入训练集导致分数失真 | kp-006, kp-020 |
| Scaling Law | Scaling Laws | 损失随参数/数据/算力幂律下降的规律 | kp-007 |
| 计算最优 | Compute-Optimal | 给定算力下损失最小的参数-数据配比 | kp-007 |
| 数据并行 | Data Parallelism (DP) | 多卡持完整模型、切分数据、梯度同步 | kp-008 |
| 张量并行 | Tensor Parallelism (TP) | 单个矩阵乘切分到多卡 | kp-008 |
| 流水线并行 | Pipeline Parallelism (PP) | 按层分段、micro-batch 流水执行 | kp-008 |
| ZeRO | Zero Redundancy Optimizer | 切分优化器状态/梯度/参数消除冗余显存 | kp-008 |
| 混合精度 | Mixed Precision | BF16 计算 + FP32 主本/累加的数值策略 | kp-008 |
| 学习率预热 | Warmup | 初期从极小学习率线性升至峰值 | kp-009 |
| 余弦衰减 | Cosine Decay | 学习率按余弦曲线下降的常见调度 | kp-009 |
| 损失尖峰 | Loss Spike | 训练中损失的骤升,需隔离数据或回滚处置 | kp-009 |
| 梯度裁剪 | Gradient Clipping | 按全局范数截断过大梯度 | kp-009 |
架构与关键技术
| 术语 | 英文 | 释义 | 详见 |
|---|
| Transformer | Transformer | 全注意力式序列架构,LLM 的物理载体 | kp-010 |
| 仅解码器 | Decoder-only | 只用解码器堆叠 + 因果掩码的主流形态 | kp-010 |
| 残差连接 | Residual Connection | 子层输出与输入相加,保障深层梯度流通 | kp-010 |
| 因果掩码 | Causal Mask | 阻止注意力看到未来位置的掩码 | kp-010, kp-011 |
| 自注意力 | Self-Attention | QKV 相关度加权聚合的跨位置通信算子 | kp-011 |
| 多头注意力 | Multi-Head Attention | 多组 QKV 并行捕捉不同关系模式 | kp-011 |
| 旋转位置编码 | RoPE | 对 Q/K 按位置旋转,点积只依赖相对位置 | kp-012 |
| ALiBi | Attention with Linear Biases | 按距离线性衰减的注意力偏置,易外推 | kp-012 |
| 位置插值 | Position Interpolation | 压缩位置坐标回训练范围以扩窗 | kp-012 |
| Pre-Norm | Pre-LayerNorm | 归一化置于子层输入侧,深层更稳定 | kp-013 |
| RMSNorm | Root Mean Square Norm | 去掉均值中心化的简化归一化 | kp-013 |
| SwiGLU | SwiGLU | 门控双分支前馈结构,现代 FFN 默认 | kp-013 |
| KV 缓存 | KV Cache | 缓存历史 K/V 的增量生成机制 | kp-014 |
| 多查询注意力 | Multi-Query Attention (MQA) | 所有 Q 头共享一份 K/V | kp-014 |
| 分组查询注意力 | Grouped-Query Attention (GQA) | Q 头分组共享 K/V 的折中主流 | kp-014 |
| FlashAttention | FlashAttention | 分块 + 在线 softmax 的精确注意力加速 | kp-014 |
| 混合专家 | Mixture-of-Experts (MoE) | 路由器为词元选 top-k 专家的稀疏激活 | kp-015 |
| 负载均衡损失 | Load Balancing Loss | 防止路由塌缩的辅助损失 | kp-015 |
后训练与对齐
| 术语 | 英文 | 释义 | 详见 |
|---|
| 后训练 | Post-Training | 预训练之后的行为塑形阶段总称 | kp-016 |
| 对齐 | Alignment | 让模型有用、诚实、无害的过程 | kp-016 |
| 对齐税 | Alignment Tax | 对齐导致的通用能力轻微下降 | kp-016, kp-018 |
| 监督微调 | Supervised Fine-Tuning (SFT) | 指令-回答对上的监督训练 | kp-017 |
| 对话模板 | Chat Template | 角色与轮次的特殊词元格式约定 | kp-017, kp-026 |
| 人类反馈强化学习 | RLHF | 奖励模型 + 强化学习的偏好优化 | kp-018 |
| 奖励模型 | Reward Model | 拟合人类偏好、输出标量分的代理模型 | kp-018 |
| 近端策略优化 | PPO | 限制单步更新幅度的策略梯度算法 | kp-018 |
| KL 惩罚 | KL Penalty | 约束策略不偏离参考模型的正则项 | kp-018 |
| 奖励作弊 | Reward Hacking | 钻奖励模型空子获高分但质量差 | kp-016, kp-018 |
| 直接偏好优化 | DPO | 把 RLHF 目标改写为监督式损失的简化路线 | kp-019 |
能力、评估与局限
| 术语 | 英文 | 释义 | 详见 |
|---|
| 基准测试 | Benchmark | 固定题集与判分规则的标准评估 | kp-020 |
| LLM 评审 | LLM-as-a-Judge | 用强模型给回答打分的评估方式 | kp-020 |
| 上下文学习 | In-Context Learning (ICL) | 不更新参数、凭提示示例学会任务 | kp-021 |
| 少样本 | Few-shot | 提示中给出少量示例的使用方式 | kp-021 |
| 涌现能力 | Emergent Abilities | 小模型近零、跨规模阈值后骤现的能力 | kp-021 |
| 幻觉 | Hallucination | 流畅但与事实或材料不符的编造 | kp-022 |
| 忠实性 | Faithfulness | 输出与给定材料的一致程度 | kp-022, kp-029 |
| 校准 | Calibration | 输出置信度与真实正确率的匹配度 | kp-022 |
| 上下文窗口 | Context Window | 单次推理可处理的词元上限 | kp-023 |
| 迷失中间 | Lost in the Middle | 窗口中部信息利用效率下降的 U 型现象 | kp-023 |
| 思维链 | Chain-of-Thought (CoT) | 先产出中间推理步骤再作答 | kp-024 |
| 自洽性 | Self-Consistency | 多路径采样 + 投票的推理增强 | kp-024 |
| 过程监督 | Process Supervision | 对每步推理给反馈的训练信号 | kp-024 |
| 测试时计算 | Test-time Compute | 推理阶段投入更多计算换取准确率 | kp-024 |
应用与生态
| 术语 | 英文 | 释义 | 详见 |
|---|
| 解码策略 | Decoding Strategy | 从概率分布选词的规则(贪心/采样/束搜索) | kp-025 |
| 温度 | Temperature | logits 缩放系数,控制分布尖锐度 | kp-025 |
| 核采样 | Top-p / Nucleus Sampling | 按累积概率截断候选集的自适应采样 | kp-025 |
| 系统提示 | System Prompt | 设定全局行为锚点的角色消息 | kp-026 |
| 工具调用 | Tool / Function Calling | 模型输出结构化调用、外部执行的回路 | kp-027 |
| ReAct | ReAct | 思考-行动-观察交替的智能体范式 | kp-027 |
| 约束解码 | Constrained Decoding | 采样时屏蔽非法词元保证格式合法 | kp-028 |
| 检索增强生成 | RAG | 先检索外部片段再生成,开卷考试 | kp-029 |
| 向量检索 | Vector Retrieval | 以嵌入相似度召回相关片段 | kp-004, kp-029 |
| 重排 | Rerank | 用更强模型对候选精排 | kp-029 |
安全、治理与历史
| 术语 | 英文 | 释义 | 详见 |
|---|
| 越狱 | Jailbreak | 绕过安全行为的提示攻击技巧 | kp-030 |
| 提示注入 | Prompt Injection | 藏在数据中的指令劫持模型行为 | kp-030 |
| 红队测试 | Red Teaming | 攻击者视角的系统性漏洞挖掘 | kp-030 |
| 对抗后缀 | Adversarial Suffix | 自动搜索出的触发有害输出的字符串 | kp-030 |
| 宪法式 AI | Constitutional AI | 以成文原则驱动自我批评与修正 | kp-030 |
| 开放权重 | Open Weights | 参数可下载自托管但未必全开源的发布形态 | kp-031 |
| 可接受使用政策 | Acceptable Use Policy (AUP) | 许可附带的使用边界条款 | kp-031 |
| n-gram | n-gram | 只看前 n-1 词的统计语言模型 | kp-002, kp-032 |
| 苦涩教训 | The Bitter Lesson | 通用方法 + 算力长期胜过人类先验的历史规律 | kp-033 |