**一句话结论:评测基准是消耗品——它的区分力会被自己测出来的进步吃掉。**模型越训越强、越训越会「应试」,基准就按「饱和 → 污染质疑 → 退役」的剧本走到头。读懂这条生命周期,比记住任何单个榜单的名次都有用:你能一眼判断一个分数是「前沿信号」还是「化石指标」。
一个基准的一生
几乎所有 LLM 基准都在重复同一条曲线:
flowchart LR
A[出生<br>区分力强] --> B[刷分期<br>针对基准优化]
B --> C[饱和<br>人人 90%+,失去区分度]
C --> D[污染质疑<br>考题进了训练数据?]
D --> E[退役<br>由更难的继任]
E -.新的基准.-> A
每个阶段的机制不一样,分开看。
第一站:饱和——分数挤到天花板,榜单变成并列第一
饱和的机制很朴素:基准的题目难度固定,模型的能力在涨。跑到某一点,所有前沿模型都逼近满分,榜单顶端变成一排 9x.x% 的并列——区分度归零,基准事实死亡。
教科书案例是 MMLU(多选题知识测试):前沿模型已经集体站上 90% 以上,继续比 MMLU 分数不再能区分强弱。业界的应对是出更难的继任版:MMLU-Pro(选项从 4 个加到 10 个、题目更偏推理)能把前沿模型拉开几分的差距;更难的 GPQA Diamond(博士级科学题)、HLE(Humanity's Last Exam)、ARC-AGI 接棒成为新的前沿标尺。注意这个模式:继任基准的诞生本身就是前任饱和的官方讣告。看到某家公司的发布材料还在拿一个 2020 年的基准当主打卖点,基本可以判断它拿不出新基准上的好数字。
第二站:污染——考题泄漏进训练数据,分数在测记忆力
比饱和更致命的是污染质疑:基准是公开的,公开的数据就爬得进预训练语料。模型可能没学会算术,只是背过了 GSM8K 的 8000 道题。
2024 年 Scale AI 与 CAIS 的 GSM1k 实验把这个怀疑做成了可测量的科学(Zhang et al.,arXiv:2405.00332,NeurIPS 2024):他们重新手工出了一千多道与 GSM8K 风格、难度对齐的新题(GSM1k,1253 道),同一批模型在新旧两套题上各考一次。逻辑是:如果分数来自真本事,两场成绩应该接近;如果来自背题,新题上会掉分。
结果分层很清楚:
- 部分开源模型家族出现了显著过拟合信号(Mistral、Phi 系列掉分最明显,个别模型在特定规模上掉分远超平均);
- 前沿模型(GPT-4、Claude、Gemini 一代)也有平均约 8% 以内的掉分,但幅度小且跨规模一致——更像真实能力波动而非背题。
这项研究的价值不在「抓到谁作弊」,而在给出了检测方法论:平行出新题集(重写式对照)、按规模看掉分一致性、对比训练数据时间线。此后「是否做了污染检查」成为新基准的标配问答。
第三站:刷分——Goodhart 定律的 AI 版
Goodhart 定律:**当一个指标变成目标,它就不再是好指标。**评测驱动开发(benchmark-driven development)本身没错——模型确实是对着基准训练的——但这意味着基准测的渐渐不是「能力」,而是「对这类题目的适配度」。三个常见形态:
- 训练数据混入测试集:网页上的题解、GitHub 上的 eval 代码、论文附录里的原题,都在预训练语料的捕获范围内(与污染的差别:污染可能是无意的,刷分常常是有意的);
- 基准特化微调:在测试集同类分布上额外训练,榜单分数涨、通用能力原地踏步;
- 评测口径择优:跑多次取最高、挑有利的使用版本、少报上下文设置——本站《大模型评测基准的坑》专门盘过这些操作。
读分数的自查清单
下次看到「模型 X 在 Y 基准上取得 SOTA」,过一遍这五问:
- 基准饱和了吗:前沿模型是否已挤在 90%+?是的话这个 SOTA 没有信息量;
- 有没有污染检查:发布方是否做过平行题集对照或 n-gram 重叠扫描?
- 样本量与置信区间:小样本基准上 1 分的差距可能毫无统计意义(置信区间的读法见本站《一篇读懂 ELO》);
- 口径是否可比:同样的 few-shot 设置、同样的评测 harness、同样的模型快照吗?
- 有对照组吗:最好同时看人类基线与随机基线,确认数字有意义。
小结
基准失效不是丑闻,是进步的副产品——没有模型变强,就没有基准退休。真正要警惕的是把「分数」当「能力」的同义词:饱和的基准告诉你昨日谁强,污染的基准谁也告诉不了你。看懂一个基准的一生,你就在大多数榜单新闻面前拥有了免疫力。
参考资料
- Zhang et al., A Careful Examination of LLM Performance on Grade School Arithmetic(GSM1k,arXiv:2405.00332)(2024-04,NeurIPS 2024,污染对照实验方法论)
- MMLU-Pro: More Reasoning, Few Distractors, 加难版基准(2024,MMLU 饱和后的继任者)
- GPQA: A Google-Proof Q&A Benchmark(arXiv:2311.12022)(博士级科学难题,前沿新标尺之一)
- Hendrycks et al., Measuring Massive Multitask Language Understanding(MMLU 原论文,arXiv:2009.03300)(2020)
- Scale AI GSM1k 评测代码与数据:github.com/scaleapi/gsm1k_eval
读者留言
COMMENTS 暂无还没有留言,来说第一句?