术语表

按主题分组;释义为机制级一句话,「详见」列可跳转对应知识点。

# 术语表

按主题分组的全库术语速查。释义保持机制级一句话,深入理解请跳转对应知识点。

基础与建模

术语英文释义详见
大语言模型Large Language Model (LLM)海量文本上以预测下一词为目标训练的超大规模神经网络kp-001
自回归Autoregressive逐词生成并把已生成内容拼回输入的循环方式kp-002
条件概率Conditional Probability给定前文下下一词的分布,语言模型的学习对象kp-002
困惑度Perplexity交叉熵的指数,直觉为「每步在多少个选项里犹豫」kp-002
交叉熵Cross-Entropy衡量预测分布与真实下一词距离的损失kp-002, kp-005
词元Token分词器输出的最小处理单元,模型真正「读写的字」kp-003
词元化Tokenization把文本切成词元 id 序列的过程kp-003
字节对编码Byte-Pair Encoding (BPE)迭代合并高频字节对构建词表的主流算法kp-003
词表Vocabulary模型可输出词元的全集kp-003
嵌入Embedding词元 id 到低维连续向量的映射kp-004
余弦相似度Cosine Similarity衡量向量方向一致性的度量kp-004, kp-029

预训练与训练工程

术语英文释义详见
预训练Pre-training海量无标注文本上的自监督学习阶段kp-005
掩码语言模型Masked Language Modeling (MLM)遮盖部分词元并用双向上下文预测的目标kp-005
教师强制Teacher Forcing训练时输入真实前文而非模型自身生成kp-005
数据配比Data Mixture各来源语料的混合权重,决定能力分布先验kp-006
去重Deduplication用哈希/MinHash 移除重复语料,降记忆化kp-006
数据污染Contamination评测题混入训练集导致分数失真kp-006, kp-020
Scaling LawScaling Laws损失随参数/数据/算力幂律下降的规律kp-007
计算最优Compute-Optimal给定算力下损失最小的参数-数据配比kp-007
数据并行Data Parallelism (DP)多卡持完整模型、切分数据、梯度同步kp-008
张量并行Tensor Parallelism (TP)单个矩阵乘切分到多卡kp-008
流水线并行Pipeline Parallelism (PP)按层分段、micro-batch 流水执行kp-008
ZeROZero Redundancy Optimizer切分优化器状态/梯度/参数消除冗余显存kp-008
混合精度Mixed PrecisionBF16 计算 + FP32 主本/累加的数值策略kp-008
学习率预热Warmup初期从极小学习率线性升至峰值kp-009
余弦衰减Cosine Decay学习率按余弦曲线下降的常见调度kp-009
损失尖峰Loss Spike训练中损失的骤升,需隔离数据或回滚处置kp-009
梯度裁剪Gradient Clipping按全局范数截断过大梯度kp-009

架构与关键技术

术语英文释义详见
TransformerTransformer全注意力式序列架构,LLM 的物理载体kp-010
仅解码器Decoder-only只用解码器堆叠 + 因果掩码的主流形态kp-010
残差连接Residual Connection子层输出与输入相加,保障深层梯度流通kp-010
因果掩码Causal Mask阻止注意力看到未来位置的掩码kp-010, kp-011
自注意力Self-AttentionQKV 相关度加权聚合的跨位置通信算子kp-011
多头注意力Multi-Head Attention多组 QKV 并行捕捉不同关系模式kp-011
旋转位置编码RoPE对 Q/K 按位置旋转,点积只依赖相对位置kp-012
ALiBiAttention with Linear Biases按距离线性衰减的注意力偏置,易外推kp-012
位置插值Position Interpolation压缩位置坐标回训练范围以扩窗kp-012
Pre-NormPre-LayerNorm归一化置于子层输入侧,深层更稳定kp-013
RMSNormRoot Mean Square Norm去掉均值中心化的简化归一化kp-013
SwiGLUSwiGLU门控双分支前馈结构,现代 FFN 默认kp-013
KV 缓存KV Cache缓存历史 K/V 的增量生成机制kp-014
多查询注意力Multi-Query Attention (MQA)所有 Q 头共享一份 K/Vkp-014
分组查询注意力Grouped-Query Attention (GQA)Q 头分组共享 K/V 的折中主流kp-014
FlashAttentionFlashAttention分块 + 在线 softmax 的精确注意力加速kp-014
混合专家Mixture-of-Experts (MoE)路由器为词元选 top-k 专家的稀疏激活kp-015
负载均衡损失Load Balancing Loss防止路由塌缩的辅助损失kp-015

后训练与对齐

术语英文释义详见
后训练Post-Training预训练之后的行为塑形阶段总称kp-016
对齐Alignment让模型有用、诚实、无害的过程kp-016
对齐税Alignment Tax对齐导致的通用能力轻微下降kp-016, kp-018
监督微调Supervised Fine-Tuning (SFT)指令-回答对上的监督训练kp-017
对话模板Chat Template角色与轮次的特殊词元格式约定kp-017, kp-026
人类反馈强化学习RLHF奖励模型 + 强化学习的偏好优化kp-018
奖励模型Reward Model拟合人类偏好、输出标量分的代理模型kp-018
近端策略优化PPO限制单步更新幅度的策略梯度算法kp-018
KL 惩罚KL Penalty约束策略不偏离参考模型的正则项kp-018
奖励作弊Reward Hacking钻奖励模型空子获高分但质量差kp-016, kp-018
直接偏好优化DPO把 RLHF 目标改写为监督式损失的简化路线kp-019

能力、评估与局限

术语英文释义详见
基准测试Benchmark固定题集与判分规则的标准评估kp-020
LLM 评审LLM-as-a-Judge用强模型给回答打分的评估方式kp-020
上下文学习In-Context Learning (ICL)不更新参数、凭提示示例学会任务kp-021
少样本Few-shot提示中给出少量示例的使用方式kp-021
涌现能力Emergent Abilities小模型近零、跨规模阈值后骤现的能力kp-021
幻觉Hallucination流畅但与事实或材料不符的编造kp-022
忠实性Faithfulness输出与给定材料的一致程度kp-022, kp-029
校准Calibration输出置信度与真实正确率的匹配度kp-022
上下文窗口Context Window单次推理可处理的词元上限kp-023
迷失中间Lost in the Middle窗口中部信息利用效率下降的 U 型现象kp-023
思维链Chain-of-Thought (CoT)先产出中间推理步骤再作答kp-024
自洽性Self-Consistency多路径采样 + 投票的推理增强kp-024
过程监督Process Supervision对每步推理给反馈的训练信号kp-024
测试时计算Test-time Compute推理阶段投入更多计算换取准确率kp-024

应用与生态

术语英文释义详见
解码策略Decoding Strategy从概率分布选词的规则(贪心/采样/束搜索)kp-025
温度Temperaturelogits 缩放系数,控制分布尖锐度kp-025
核采样Top-p / Nucleus Sampling按累积概率截断候选集的自适应采样kp-025
系统提示System Prompt设定全局行为锚点的角色消息kp-026
工具调用Tool / Function Calling模型输出结构化调用、外部执行的回路kp-027
ReActReAct思考-行动-观察交替的智能体范式kp-027
约束解码Constrained Decoding采样时屏蔽非法词元保证格式合法kp-028
检索增强生成RAG先检索外部片段再生成,开卷考试kp-029
向量检索Vector Retrieval以嵌入相似度召回相关片段kp-004, kp-029
重排Rerank用更强模型对候选精排kp-029

安全、治理与历史

术语英文释义详见
越狱Jailbreak绕过安全行为的提示攻击技巧kp-030
提示注入Prompt Injection藏在数据中的指令劫持模型行为kp-030
红队测试Red Teaming攻击者视角的系统性漏洞挖掘kp-030
对抗后缀Adversarial Suffix自动搜索出的触发有害输出的字符串kp-030
宪法式 AIConstitutional AI以成文原则驱动自我批评与修正kp-030
开放权重Open Weights参数可下载自托管但未必全开源的发布形态kp-031
可接受使用政策Acceptable Use Policy (AUP)许可附带的使用边界条款kp-031
n-gramn-gram只看前 n-1 词的统计语言模型kp-002, kp-032
苦涩教训The Bitter Lesson通用方法 + 算力长期胜过人类先验的历史规律kp-033