预训练 核心 约 18 分钟 更新 2026-10-02

预训练数据工程:收集、清洗、去重与配比

学习状态:
未学

一句话定义

预训练数据工程把互联网、书籍、代码等原始语料加工成「干净、多样、按比例混合」的训练集——在 Scaling Law 时代,数据质量与配比对最终能力的影响不亚于参数量。

为什么重要

「垃圾进,垃圾出」在 LLM 上尤其成立:低质数据直接教会模型幻觉与口癖;重复数据既浪费算力又导致记忆化;配比失衡会让模型偏科。近年多项研究表明,用更少但更干净的数据能训练出更强模型(如 RefinedWeb 的结论),数据工程已成为模型竞争的核心壁垒。

前置知识

核心概念

原理与机制

典型流水线:原始抓取 → 文本抽取(剥离 HTML、广告、导航栏)→ 语言识别与过滤 → 启发式质量过滤 → 模型打分过滤 → 去重 → 敏感内容与隐私处理(PII 去除)→ 配比混洗 → 词元化打包。关键机制有二:一是模糊去重显著降低记忆化与幻觉率;二是配比即先验——代码数据提升推理与结构化能力,数学数据提升计算能力,多语言数据决定语言能力分布。

公式或模型

数据配比的形式化:设各来源数据集 D_i 及权重 w_i,训练分布为混合分布:

D_mix = Σ_i w_i · D_i , Σ_i w_i = 1

实践中还要考虑「重复轮数(epoch)」:有限数据重复多轮仍有益但边际收益递减(数据受限场景下的重复训练研究,2023)。

图示

Common Crawl(原始网) ─▶ 抽取 ─▶ 质量过滤 ─┐
书籍/论文/百科 ──────▶ 清洗 ──────────────┤
代码库 ─────────────▶ 过滤 ──────────────┼─▶ 去重(MinHash) ─▶ 配比混洗 ─▶ 训练集
                            PII/敏感处理 ─┘

直观类比

像做一锅高汤:网页语料是「生水」,必须反复过滤去渣(清洗去重);书籍是「浓缩汤底」,少量即可提鲜(高质量低权重占位);配比就是配方——配方错了,再贵的材料也熬不出好汤。

实例或案例

The Pile(2020)公开了分来源组织的数据集,成为早期研究的标准语料;Falcon 团队的 RefinedWeb(2023)证明仅用清洗到位的网页数据、不依赖人工策展集,也能支撑强模型;多家实验室把代码比例提高到两位数百分比以换取推理能力提升(具体比例各家未完全公开,属时效性信息)。

常见误区

与其他知识点的关系

自测题

  1. 模糊去重与精确去重的区别及其各自作用?
    答案要点:精确用哈希找完全相同文档;模糊用 MinHash/LSH 找近似重复,能捕捉改写式重复,降低记忆化。
  2. 为什么在预训练语料中混入代码与数学数据?
    答案要点:提升逻辑推理、结构化生成与指令遵循相关能力,即使应用场景不含编程。
  3. 数据污染为什么必须在数据工程阶段处理?
    答案要点:训练后无法补救,评测结果会失真,模型看似强实则背题(见 kp-020)。

延伸阅读