大模型评测基准的坑:Leaderboard 分数为什么会骗人

为什么人人都看 Leaderboard

大模型迭代太快,选型时逐个实测的成本又高,公开基准跑分于是成了行业通用的「硬通货」:直观、可比、随时能查。但「榜单排名靠前、业务里不好用」的抱怨同样普遍——同一个模型,评测分数领先,落到自己的客服、代码或文档场景却不如上一代。这种错位不是错觉。截至 2026-10-07 的公开研究显示,它至少来自四类系统性的坑:数据污染、面向榜单的刷分、评测方法本身不稳、静态基准的饱和失效。挨个拆开看。

坑一:数据污染——考题漏进了复习资料

机制很朴素:预训练语料来自全网爬取,公开多年的基准(MMLU、GSM8K 这类)的题目与答案会随网页、问答站、代码仓库进入训练数据。模型背过题,考分自然虚高。

这不是猜测。Benchmarking Benchmark Leakage in Large Language Models 用困惑度加 n-gram 命中率两条线索,对 31 个模型在 GSM8K 与 MATH 上做检测,发现约一半模型疑似把基准的训练集用进了训练:Aquila2-7B 在 GSM8K 上的 train–test 指标差约 75%,MATH 上约 159%;Aquila2-34B 的官方文档甚至自己承认「意外接触了整个 GSM8K 测试集」。论文的对照实验更直白:仅用 1000 条 GSM8K 样本微调,模型对见过样本的 5-gram 命中率就从 17.06% 涨到 48.22%——见过,就是不一样。

检测也有天花板。n-gram 重叠只能抓「原格式、原措辞」的泄漏:题目被改写或重排版就漏检(论文中的 ChatGLM-2 案例疑似训练于重排版数据);连答案格式反常这类线索(模型把 GSM8K 标准的 #### 答案头写成了别的格式)它也无能为力。所以更现实的态度是《How Much Can We Forget about Data Contamination?》(ICML 2025)给出的:污染不是一个「有/无」的开关,影响取决于遗忘动态——它无法根治,只能靠换新题、定期检测、透明披露来缓解。

坑二:面向榜单的训练——Goodhart 定律

当一个指标变成优化目标,它就不再是好指标。

榜单分数公开、可比,天然成为训练的靶子:只在评测任务分布上强化、针对性训练,社区称之为 benchmark hacking。《The Leaderboard Illusion》(2025)对 Chatbot Arena 的分析提供了机制性证据:Meta 在 Llama-4 发布前私下测试了 27 个私有变体、择优公开;少数厂商还能拿到不成比例的对战数据——OpenAI 约 20.4%、Google 约 19.2%,而 83 个开放权重模型合计只有约 29.7%。论文估算,在 Arena 数据分布上多训练,可带来最高 112% 的相对提升——涨的是「Arena 分布上的分数」,未必是通用能力。近年来社区对各类榜单刷分争议的讨论也屡见不鲜,Goodhart 定律在评测这件事上几乎从不缺席。

坑三:评测方法本身就不稳

就算题目干净、没人作弊,跑分这把尺子自己也有刻度误差。lm-eval 评测框架团队的《Lessons from the Trenches on Reproducible Evaluation of Language Models》系统记录了这些:

  • 提示词敏感:同一模型同一任务,换提示风格,部分情况下分数波动超过 20 个百分点。ARC-Easy 上 GPT-NeoX 用完形填空式提示得 72.4,换 MMLU 考卷式提示只有 26.5,相差约 46 个点;ARC-C 上 Mixtral 两种格式是 56.7 对 81.3。
  • 实现不同、结果不同:HELM、lm-eval 与 MMLU 原版三套实现给出不同分数,甚至会改变模型排名顺序;仅「按题平均还是按学科平均」就差好几个百分点。
  • 判分环节:regex 抽取对输出格式敏感,LLM-as-judge 又引入裁判模型自身的偏差(这也是 LiveBench 坚持客观可验证答案的原因);few-shot 示例选哪几条、选项如何排列,同样会动分数。
  • 小样本方差:GPQA 这类小数据集,单次运行与 10 次运行的置信区间给出的排名结论可以完全不同。
  • 复现差异:论文核对发现,部分模型技术报告里的 ARC 分数疑似用了未在报告中说明的 MMLU-style 25-shot 提示。

人工偏好榜也逃不掉。LMSYS 官方博客《Disentangling Style and Substance in Chatbot Arena》的分析显示,回答长度是最大的风格因素(回归系数 0.249,远高于 markdown 标题、加粗、列表);开启 style control 后排名明显变动:gpt-4o 从第 5 升到第 2,grok-2-mini 从第 6 掉到第 18。不开风格修正,你看到的可能部分是「谁更能写」,而不是「谁更会答」。

坑四:饱和与失效的循环

静态公开基准还有个宿命式循环:新基准发布 → 关注度引来刷榜与污染 → 头部模型分数挤在一起分不出高下(饱和)→ 只好造更难的新基准 → 下一轮循环。MMLU、GSM8K 这批基准今天的主要价值更多是回归测试而非能力分水岭;更难的后来者(如 Humanity's Last Exam)大概率也在重复这个生命周期。

应对思路是让评测「动起来」,但三种方案各有代价:

  • 动态公开基准(如 LiveBench):基于新论文、新闻等定期出新题,发布时按月更新,截至 2026-10-07 官网显示改为每半年刷新一批;用客观可验证答案避开裁判偏差。代价是持续运营成本,题目覆盖面也有限。
  • 人工偏好评测(Chatbot Arena/LMArena):题面真实、天然动态,但受回答风格影响(见坑三),也存在 The Leaderboard Illusion 指出的数据不对称问题。
  • 私有一致性评测集:企业自建、题库不公开,几乎无污染、最贴自己的场景,但覆盖窄、维护贵,也缺跨模型的历史可比性。
坑 典型信号 读者对策
数据污染 老基准上小模型「超神」 看污染检测报告,优先新题基准
刷分过拟合 榜单分涨、实测不涨;变体扎堆 多个独立榜单交叉,再加实测
方法不稳 名次差距小于置信区间 只信配置透明的评测
饱和循环 头部并列接近满分 换未饱和基准,关注区分度

读榜 7 条防坑检查

  1. 可复现吗:是否公开精确提示词、评测代码与原始输出;只给一个分数、什么都查不到的,折扣先打一半。
  2. 模型口径:是否区分 base 与 instruct 模型,few-shot 数量与示例来源是否写明。
  3. 污染处理:有没有污染检测报告或去污染说明;基准发布多久了,越老越要警惕。
  4. 统计纪律:报没报置信区间与多次运行方差;两个名次之间的差距是否超出区间。
  5. 场景匹配:评测任务与你的场景对得上吗——MMLU 高分不等于客服、代码或长文档场景好用。
  6. 风格修正:人工偏好榜是否提供 style control 口径,开关前后排名差多少。
  7. 交叉验证:用自己的一小套评测集或真实任务抽样实测,与榜单结论互证后再拍板。

边界与立场

以上不是「不要看跑分」。分数仍是重要的必要信息:它能低成本排除明显不合格的模型、追踪能力趋势。但它不是充分信息——选型决策应当是「榜单初筛 + 场景实测」的两段式。把 Leaderboard 当地图用,别把它当领土。

参考资料

  1. Benchmarking Benchmark Leakage in Large Language Models
  2. Lessons from the Trenches on Reproducible Evaluation of Language Models
  3. The Leaderboard Illusion
  4. Disentangling Style and Substance in Chatbot Arena(LMSYS 官方博客)
  5. LiveBench: A Challenging, Contamination-Free LLM Benchmark
  6. How Much Can We Forget about Data Contamination?(ICML 2025)
← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?