Scaling Laws 时代的默认姿势是「训练时堆算力」:更多参数、更多数据、更多 GPU。2024 年 o1 发布后,业界补上了第二个坐标轴——推理时算力(test-time compute):回答问题时多花时间和 token,同样能换准确率。这条轴正是推理模型(reasoning model)的技术本质。但它不是免费的午餐:算力往上堆,收益曲线有形状,堆过头还会倒扣分。本文梳理三条主要路线与已知边界(相关背景可先读站内的《思维链为什么有效》与《推理模型怎么用》)。
路线一:self-consistency,最朴素的「多想几次」
最直接的测试时扩展是采样多条推理链、投票取多数答案——self-consistency(Wang et al., 2022)。模型对同一道题采样 N 次(比如温度调高跑 20 遍),每条链各自得出一个最终答案,数数最多的当选。它至今仍是各种推理基准的标配评测技巧,原因很简单:实现只需一行循环,收益与采样数大体对数增长。
代价也直接:成本乘以 N,延迟也要等最慢的那条链。工程上的变体是把「全量投票」改成「早停」——已有某答案拿到明显多数就终止剩余采样。
路线二:过程奖励模型(PRM),给推理步骤打分
结果投票只看终点,不看过程。**过程奖励模型(Process Reward Model, PRM)**学的是给推理的每一步打分:OpenAI 的《Let's Verify Step by Step》(Lightman et al., 2023)人工标注了 80 万步级别的过程数据(PRM800K),证明用 PRM 引导「从 N 条候选里挑过程最靠谱的」显著优于只看最终答案的结果奖励模型——尤其在数学这类可分步验证的领域。Math-Shepherd 等后续工作则用自动构造的方式降低了标注成本。
PRM 路线的自然延伸是搜索:把推理当成树,PRM 当启发函数,做束搜索或 MCTS。它带来真正的「算法级」收益,但两个工程难点至今没完全解决:一是标注过程数据贵且难(什么算「好的一步」高度主观);二是 PRM 本身会被「钻空子」——模型学会写出 PRM 爱看但逻辑上投机取巧的步骤。
路线三:budget forcing,把「再想想」拧成旋钮
前两条路线都在「采样空间」上做文章,斯坦福的 s1 论文(Muennighoff et al., 2025,arXiv:2501.19393)换了个角度:直接控制思考长度。做法朴素到离谱——当模型想提前结束推理时,把「</think>」替换成「Wait」,强制它继续想下去;反之也可以强制截断。官方摘要给出的关键数字:
- 基座只是 Qwen2.5-32B-Instruct,用精选的 1000 道题(s1K,按难度、多样性、质量三标准筛选)做监督微调,得到 s1-32B;
- 在 MATH 与 AIME24 上超过 o1-preview 最多 27%;
- budget forcing 带来可控外推:AIME24 从 50% 提到 57%,且推理长度是连续可调的旋钮——这是它最重要的学术贡献,「测试时算力第一次有了精确的油门」。
s1 全套(模型、数据、代码)开源在 GitHub simplescaling/s1,「1000 样本 + 32B 基座复刻推理能力」的配方让预算有限的团队第一次摸到了这条路线的入场券。
天坑:overthinking,想得越多不一定越好
测试时扩展的真实曲线不是「越想越准」。2025–2026 年的一批研究(如 2026 年 4 月的《When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling》)系统测量后给出两个结论:边际收益在高预算下大幅递减;超过某个点后,更长推理不仅不涨分,还会把原本对的答案想错——模型在漫长的思考链里自我说服、推翻正确结论,或陷入同一个错误循环里打转。ICLR 博客轨道上甚至有论文标题直接质问 budget forcing:《Wait, Do We Need to Wait?》。
由此出现了逆向思路:自适应预算——按题目难度动态分配思考长度,简单题速通、难题才放开想(如 OpenReview 上的 Adaptive Budget Forcing)。这与推理模型产品侧的「思考预算」设置(低/中/高档)在工业上汇流:算力是要花钱的,路由比无脑拉满重要。
怎么用:一张决策表
| 手段 | 成本 | 适用 | 不适用 |
|---|---|---|---|
| self-consistency | N 倍推理成本 | 有唯一答案、可投票(数学、抽取) | 开放生成、成本敏感的在线服务 |
| PRM 引导搜索 | N 倍 + 额外模型/标注 | 可分步验证的领域(数学、代码) | 标注贵的开放领域 |
| budget forcing | 思考 token 增多 | 需要「保底想够久」的难题 | 简单题(纯浪费)、易 overthinking 的任务 |
| 自适应预算 | 需要难度估计 | 生产环境的推理服务 | 一次性离线评测 |
实践口径可以很直白:默认别开长思考,让模型按难度自己选;评测时用 self-consistency 拿最稳的数字;预算敏感的场景盯紧「每提升 1% 准确率花了多少 token」这条汇率。
结语
Test-time scaling 把「模型能力」拆成了「训练出来的潜力」加「推理时愿意花的钱」。s1 证明了潜力可以在 1000 个样本里被激发,overthinking 研究则给这条曲线画上了拐点。2026 年这条轴上的竞争焦点已经从「能不能」转向「会不会省」——谁能用更少的测试时算力拿到同样的准确率,谁就在推理成本上赢一截。
参考资料
- s1: Simple test-time scaling — arXiv:2501.19393
- simplescaling/s1 — GitHub(模型、数据、代码)
- Let's Verify Step by Step — arXiv:2305.20050
- Self-Consistency Improves Chain of Thought Reasoning — arXiv:2203.11171
- When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling — arXiv:2604.10739
- Stop Overthinking: A Survey on Efficient Reasoning for LLMs — arXiv:2503.16419
- Math-Shepherd: Verify and Reinforce LLMs Step-by-step — arXiv:2312.08935
读者留言
COMMENTS 暂无还没有留言,来说第一句?