一句话定义
预训练数据工程把互联网、书籍、代码等原始语料加工成「干净、多样、按比例混合」的训练集——在 Scaling Law 时代,数据质量与配比对最终能力的影响不亚于参数量。
为什么重要
「垃圾进,垃圾出」在 LLM 上尤其成立:低质数据直接教会模型幻觉与口癖;重复数据既浪费算力又导致记忆化;配比失衡会让模型偏科。近年多项研究表明,用更少但更干净的数据能训练出更强模型(如 RefinedWeb 的结论),数据工程已成为模型竞争的核心壁垒。
前置知识
- kp-005(预训练目标)
核心概念
- 数据收集:网页爬取(Common Crawl 类)、书籍电子化、开源代码库、百科与论文。
- 质量过滤:基于规则(语言检测、标点/链接密度)与基于模型(困惑度过滤、质量分类器)双管齐下。
- 去重:精确去重(哈希)与模糊去重(MinHash + 局部敏感哈希 LSH),后者能发现「改写式重复」。
- 数据配比:网页、代码、数学、多语言、书籍等来源的混合权重,常以消融实验或 scaling law 外推确定。
- 污染防控:把评测集从训练集中剔除,防止「背题」(见 kp-020)。
原理与机制
典型流水线:原始抓取 → 文本抽取(剥离 HTML、广告、导航栏)→ 语言识别与过滤 → 启发式质量过滤 → 模型打分过滤 → 去重 → 敏感内容与隐私处理(PII 去除)→ 配比混洗 → 词元化打包。关键机制有二:一是模糊去重显著降低记忆化与幻觉率;二是配比即先验——代码数据提升推理与结构化能力,数学数据提升计算能力,多语言数据决定语言能力分布。
公式或模型
数据配比的形式化:设各来源数据集 D_i 及权重 w_i,训练分布为混合分布:
D_mix = Σ_i w_i · D_i , Σ_i w_i = 1
实践中还要考虑「重复轮数(epoch)」:有限数据重复多轮仍有益但边际收益递减(数据受限场景下的重复训练研究,2023)。
图示
Common Crawl(原始网) ─▶ 抽取 ─▶ 质量过滤 ─┐
书籍/论文/百科 ──────▶ 清洗 ──────────────┤
代码库 ─────────────▶ 过滤 ──────────────┼─▶ 去重(MinHash) ─▶ 配比混洗 ─▶ 训练集
PII/敏感处理 ─┘
直观类比
像做一锅高汤:网页语料是「生水」,必须反复过滤去渣(清洗去重);书籍是「浓缩汤底」,少量即可提鲜(高质量低权重占位);配比就是配方——配方错了,再贵的材料也熬不出好汤。
实例或案例
The Pile(2020)公开了分来源组织的数据集,成为早期研究的标准语料;Falcon 团队的 RefinedWeb(2023)证明仅用清洗到位的网页数据、不依赖人工策展集,也能支撑强模型;多家实验室把代码比例提高到两位数百分比以换取推理能力提升(具体比例各家未完全公开,属时效性信息)。
常见误区
- 「数据越多越好」:去重后多轮重复的收益快速递减,质量过滤常比堆量更划算。
- 「去重只影响效率」:它同时影响泛化与记忆化风险,是安全相关操作。
- 「配比可以拍脑袋」:主流做法是小模型消融外推 + 训练中动态调整,成本敏感且影响巨大。
与其他知识点的关系
自测题
- 模糊去重与精确去重的区别及其各自作用?答案要点:精确用哈希找完全相同文档;模糊用 MinHash/LSH 找近似重复,能捕捉改写式重复,降低记忆化。
- 为什么在预训练语料中混入代码与数学数据?答案要点:提升逻辑推理、结构化生成与指令遵循相关能力,即使应用场景不含编程。
- 数据污染为什么必须在数据工程阶段处理?答案要点:训练后无法补救,评测结果会失真,模型看似强实则背题(见 kp-020)。
延伸阅读
- The Pile: An 800GB Dataset of Diverse Text(Gao 等,2020)
- The RefinedWeb Dataset for Falcon LLM(Penedo 等,2023)