语言模型基础 入门 约 12 分钟 更新 2026-10-02

大语言模型是什么:定义、能力版图与边界

学习状态:
未学

前置知识

无

一句话定义

大语言模型(Large Language Model,LLM)是在海量文本上以「预测下一个词」为核心目标训练出来的超大规模神经网络,它把语言压缩成参数中的统计结构,从而能生成、改写、翻译、总结文本并表现出对话与推理等通用能力。

为什么重要

LLM 是当前人工智能应用层的通用底座:搜索、编程助手、客服、写作、数据分析都在其上构建。理解它「是什么、不是什么」,是避免神化或轻视的第一步——它不是数据库,不是搜索引擎,也不是推理机的完美实现,而是一个强大的条件概率生成器加上对齐层。几乎所有后续知识点(预训练、对齐、评估、幻觉)都建立在这个准确定义之上。

前置知识

核心概念

原理与机制

LLM 的能力来自三层叠加:一是预训练,在海量文本上做下一个词预测,把语法、事实、推理模式编码进参数;二是后训练对齐,用指令数据与人类偏好把基础模型塑造成助手;三是推理时的解码与上下文,模型根据提示词(Prompt)条件化地生成。它没有内置数据库检索,"知识"以分布式权重形式存储,调用时逐词生成。

公式或模型

LLM 的本质是一个条件概率模型,对给定上下文预测下一个词元的分布:

P(x_t | x_1, x_2, ..., x_{t-1}; θ)

其中 θ 是全部模型参数。整段文本的概率是各词条件概率的连乘,训练目标就是最大化该连乘积的对数(详见 kp-002 与 kp-005)。

图示

  海量文本 ──预训练──▶ 基础模型 ──SFT/RLHF──▶ 对话模型 ──提示──▶ 回答
   (互联网/书籍/代码)      (会续写)        (会对话)      (上下文)   (逐词生成)

直观类比

把基础模型想象成一个「读过整个互联网但只会接话的模仿者」:你说上半句它接下半句;对话模型则像给这位模仿者上了一轮「职业培训」,教它何时提问、何时拒答、如何组织答案。

实例或案例

2022 年底 ChatGPT 上线后两个月内用户破亿,成为消费级应用增速纪录之一,说明「基础模型 + 对齐 + 对话界面」的组合首次让普通用户感知到通用语言能力。开发者侧,各类模型 API 将 LLM 变成按 token 计费的基础设施(模型版本与能力时效性强,以官方文档为准)。

常见误区

与其他知识点的关系

自测题

  1. 基础模型与对话模型的核心差别是什么?
    答案要点:是否经过后训练对齐;基础模型擅长续写,对话模型会遵循指令、多轮交互。
  2. 为什么说 LLM 的知识有「冻结时间」?
    答案要点:知识来自预训练语料,训练完成后权重不再更新,新事件需外部检索补充。
  3. LLM 与搜索引擎在信息获取机制上有何不同?
    答案要点:搜索引擎是索引匹配与检索;LLM 是参数化生成,可能编造,需 RAG 等手段补充事实性。

延伸阅读