Test-Time Scaling:让模型「多想一步」的三种姿势与一个天坑

Scaling Laws 时代的默认姿势是「训练时堆算力」:更多参数、更多数据、更多 GPU。2024 年 o1 发布后,业界补上了第二个坐标轴——推理时算力(test-time compute):回答问题时多花时间和 token,同样能换准确率。这条轴正是推理模型(reasoning model)的技术本质。但它不是免费的午餐:算力往上堆,收益曲线有形状,堆过头还会倒扣分。本文梳理三条主要路线与已知边界(相关背景可先读站内的《思维链为什么有效》与《推理模型怎么用》)。

路线一:self-consistency,最朴素的「多想几次」

最直接的测试时扩展是采样多条推理链、投票取多数答案——self-consistency(Wang et al., 2022)。模型对同一道题采样 N 次(比如温度调高跑 20 遍),每条链各自得出一个最终答案,数数最多的当选。它至今仍是各种推理基准的标配评测技巧,原因很简单:实现只需一行循环,收益与采样数大体对数增长。

代价也直接:成本乘以 N,延迟也要等最慢的那条链。工程上的变体是把「全量投票」改成「早停」——已有某答案拿到明显多数就终止剩余采样。

路线二:过程奖励模型(PRM),给推理步骤打分

结果投票只看终点,不看过程。**过程奖励模型(Process Reward Model, PRM)**学的是给推理的每一步打分:OpenAI 的《Let's Verify Step by Step》(Lightman et al., 2023)人工标注了 80 万步级别的过程数据(PRM800K),证明用 PRM 引导「从 N 条候选里挑过程最靠谱的」显著优于只看最终答案的结果奖励模型——尤其在数学这类可分步验证的领域。Math-Shepherd 等后续工作则用自动构造的方式降低了标注成本。

PRM 路线的自然延伸是搜索:把推理当成树,PRM 当启发函数,做束搜索或 MCTS。它带来真正的「算法级」收益,但两个工程难点至今没完全解决:一是标注过程数据贵且难(什么算「好的一步」高度主观);二是 PRM 本身会被「钻空子」——模型学会写出 PRM 爱看但逻辑上投机取巧的步骤。

路线三:budget forcing,把「再想想」拧成旋钮

前两条路线都在「采样空间」上做文章,斯坦福的 s1 论文(Muennighoff et al., 2025,arXiv:2501.19393)换了个角度:直接控制思考长度。做法朴素到离谱——当模型想提前结束推理时,把「</think>」替换成「Wait」,强制它继续想下去;反之也可以强制截断。官方摘要给出的关键数字:

  • 基座只是 Qwen2.5-32B-Instruct,用精选的 1000 道题(s1K,按难度、多样性、质量三标准筛选)做监督微调,得到 s1-32B;
  • 在 MATH 与 AIME24 上超过 o1-preview 最多 27%;
  • budget forcing 带来可控外推:AIME24 从 50% 提到 57%,且推理长度是连续可调的旋钮——这是它最重要的学术贡献,「测试时算力第一次有了精确的油门」。

s1 全套(模型、数据、代码)开源在 GitHub simplescaling/s1,「1000 样本 + 32B 基座复刻推理能力」的配方让预算有限的团队第一次摸到了这条路线的入场券。

天坑:overthinking,想得越多不一定越好

测试时扩展的真实曲线不是「越想越准」。2025–2026 年的一批研究(如 2026 年 4 月的《When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling》)系统测量后给出两个结论:边际收益在高预算下大幅递减;超过某个点后,更长推理不仅不涨分,还会把原本对的答案想错——模型在漫长的思考链里自我说服、推翻正确结论,或陷入同一个错误循环里打转。ICLR 博客轨道上甚至有论文标题直接质问 budget forcing:《Wait, Do We Need to Wait?》。

由此出现了逆向思路:自适应预算——按题目难度动态分配思考长度,简单题速通、难题才放开想(如 OpenReview 上的 Adaptive Budget Forcing)。这与推理模型产品侧的「思考预算」设置(低/中/高档)在工业上汇流:算力是要花钱的,路由比无脑拉满重要。

怎么用:一张决策表

手段 成本 适用 不适用
self-consistency N 倍推理成本 有唯一答案、可投票(数学、抽取) 开放生成、成本敏感的在线服务
PRM 引导搜索 N 倍 + 额外模型/标注 可分步验证的领域(数学、代码) 标注贵的开放领域
budget forcing 思考 token 增多 需要「保底想够久」的难题 简单题(纯浪费)、易 overthinking 的任务
自适应预算 需要难度估计 生产环境的推理服务 一次性离线评测

实践口径可以很直白:默认别开长思考,让模型按难度自己选;评测时用 self-consistency 拿最稳的数字;预算敏感的场景盯紧「每提升 1% 准确率花了多少 token」这条汇率。

结语

Test-time scaling 把「模型能力」拆成了「训练出来的潜力」加「推理时愿意花的钱」。s1 证明了潜力可以在 1000 个样本里被激发,overthinking 研究则给这条曲线画上了拐点。2026 年这条轴上的竞争焦点已经从「能不能」转向「会不会省」——谁能用更少的测试时算力拿到同样的准确率,谁就在推理成本上赢一截。

参考资料

← 返回资讯列表

读者留言

COMMENTS 暂无
仅本站原创文章开放留言 · 请勿留下手机号、邮箱等个人信息

还没有留言,来说第一句?