一句话定义
LLM 评估以标准化基准(如 MMLU 的多选题、代码与数学测评)和人类偏好对比为核心手段,配合自动指标与竞技场式投票;其最大威胁是数据污染与「为榜而优化」导致的分数失真。
为什么重要
「模型 A 强于模型 B」几乎全部来自评估。读不懂评估口径,就无法判断技术报告与宣传的可信度;踩不避污染与过拟合评测的坑,自建评估就会得出错误结论。评估素养是区分「会用」与「会用好」的分水岭。
前置知识
- kp-001(LLM 是什么)
核心概念
- 静态基准:固定题集与判分规则,如 MMLU(多学科选择)、HumanEval(代码功能正确性)、GSM8K(数学应用题)等。
- 人类偏好评估:成对比较或竞技场(Arena)投票,弥合自动指标与真实体验的差距。
- 自动指标:选择题准确率、通过率(单元测试)、以及 BLEU/ROUGE 等重叠类指标(对生成任务已渐边缘化)。
- LLM 评审(LLM-as-a-Judge):用强模型给回答打分,可扩展但有评审偏差。
- 数据污染(Contamination):评测题混入训练语料,分数变成「背题率」。
- 基准饱和与 Goodhart 定律:题目难度跟不上模型进步,指标一旦成为目标就开始失真。
原理与机制
静态基准的结构性弱点有三:一是题目固定可被爬取混入训练集;二是选择题可被格式先验(选项分布)与提示措辞影响数个百分点;三是饱和后区分度消失。因此当代评估转向多维度(知识、推理、代码、安全、多语言分列)与动态化(新题、私测集、持续更新的竞技场)。实践准则:报告分数必须附评估配置(提示模板、少样本数、判分方式),配置不同分数不可直接比较。
公式或模型
污染的极端量化直觉:若测试集被完整记忆,准确率逼近其记忆保留率;健康模型的分数上界由「真实能力 + 记忆贡献」构成,二者在公开题上不可分离:
Score_observed ≈ Score_ability + Contamination_gain(不可分解)
图示
评估金字塔:
自动指标(便宜/快/可复现) ── ▲ 大规模回归测试
LLM 评审(中等成本) ── ▲▲ 生成类质量粗筛
人类偏好/竞技场(贵/慢) ── ▲▲▲ 最终裁决
+ 污染防控贯穿所有层
直观类比
像用「历年真题库」考学生:只要题库公开,刷题就能刷高分(污染);用久了题目被摸透,区分度下降(饱和)。解法是每年换新题、加面试环节(人类评估)并密封部分试卷(私测集)。
实例或案例
MMLU(2021)成为知识维度的默认基准,随后多年饱和;GSM8K 等数学集因公开可爬,社区转向更难的升级版以维持区分度;竞技场式人类投票(如 Chatbot Arena 模式)因抗污染与贴近真实体验而权重上升。技术报告普遍开始披露污染检测步骤(n-gram 重叠检测等),这是读懂报告的新必修项。
常见误区
- 「榜单排名 = 产品体验排名」:静态榜与真实任务分布错位,需结合垂直场景自测。
- 「换个提示模板重测无妨」:模板、少样本数、判分器任一变化都会显著改变分数,比较必须同配置。
- 「自己出题就不用管污染」:只要出题素材来自公开网络且训练数据未做隔离,污染风险依然存在。
与其他知识点的关系
自测题
- 数据污染为什么使分数失真?如何缓解?答案要点:模型记住题与答案,测的是记忆非能力;缓解靠去重过滤、私测集、动态题库与污染检测披露。
- 为什么两个模型的 MMLU 分数不能直接比?答案要点:提示模板、few-shot 数量、判分方式、污染状态都可能不同,配置不一致则比较无效。
- LLM 评审有什么系统性偏差?答案要点:偏好长答案、偏好与自己同风格输出、位置偏差等;需用校准与轮换取缓解。
延伸阅读
- Measuring Massive Multitask Language Understanding(Hendrycks 等,2021):MMLU
- Holistic Evaluation of Language Models(Liang 等,2022):多维评估框架