能力评估与局限 核心 约 18 分钟 更新 2026-10-02

评估体系:基准测试、排行榜与数据污染

学习状态:
未学

一句话定义

LLM 评估以标准化基准(如 MMLU 的多选题、代码与数学测评)和人类偏好对比为核心手段,配合自动指标与竞技场式投票;其最大威胁是数据污染与「为榜而优化」导致的分数失真。

为什么重要

「模型 A 强于模型 B」几乎全部来自评估。读不懂评估口径,就无法判断技术报告与宣传的可信度;踩不避污染与过拟合评测的坑,自建评估就会得出错误结论。评估素养是区分「会用」与「会用好」的分水岭。

前置知识

核心概念

原理与机制

静态基准的结构性弱点有三:一是题目固定可被爬取混入训练集;二是选择题可被格式先验(选项分布)与提示措辞影响数个百分点;三是饱和后区分度消失。因此当代评估转向多维度(知识、推理、代码、安全、多语言分列)与动态化(新题、私测集、持续更新的竞技场)。实践准则:报告分数必须附评估配置(提示模板、少样本数、判分方式),配置不同分数不可直接比较。

公式或模型

污染的极端量化直觉:若测试集被完整记忆,准确率逼近其记忆保留率;健康模型的分数上界由「真实能力 + 记忆贡献」构成,二者在公开题上不可分离:

Score_observed ≈ Score_ability + Contamination_gain(不可分解)

图示

评估金字塔:
  自动指标(便宜/快/可复现) ── ▲ 大规模回归测试
  LLM 评审(中等成本)       ── ▲▲  生成类质量粗筛
  人类偏好/竞技场(贵/慢)    ── ▲▲▲ 最终裁决
           + 污染防控贯穿所有层

直观类比

像用「历年真题库」考学生:只要题库公开,刷题就能刷高分(污染);用久了题目被摸透,区分度下降(饱和)。解法是每年换新题、加面试环节(人类评估)并密封部分试卷(私测集)。

实例或案例

MMLU(2021)成为知识维度的默认基准,随后多年饱和;GSM8K 等数学集因公开可爬,社区转向更难的升级版以维持区分度;竞技场式人类投票(如 Chatbot Arena 模式)因抗污染与贴近真实体验而权重上升。技术报告普遍开始披露污染检测步骤(n-gram 重叠检测等),这是读懂报告的新必修项。

常见误区

与其他知识点的关系

自测题

  1. 数据污染为什么使分数失真?如何缓解?
    答案要点:模型记住题与答案,测的是记忆非能力;缓解靠去重过滤、私测集、动态题库与污染检测披露。
  2. 为什么两个模型的 MMLU 分数不能直接比?
    答案要点:提示模板、few-shot 数量、判分方式、污染状态都可能不同,配置不一致则比较无效。
  3. LLM 评审有什么系统性偏差?
    答案要点:偏好长答案、偏好与自己同风格输出、位置偏差等;需用校准与轮换取缓解。

延伸阅读