2024 年 9 月 12 日,OpenAI 发布 o1-preview:同样一张美国数学邀请赛(AIME)卷子,GPT-4o 只解出 13% 的题目,这个回答前「先想一会儿」的新模型解出了 83%。它靠的不是更大的参数量,而是一个此前不存在的自由度——测试时算力。两年过去,截至 2026-10-09,「先思考」已经从旗舰特权变成默认配置:DeepSeek V4 的思考模式默认开启,GPT-6 全系带推理档位向约 12 亿周活用户推送。这篇深度解析沿思维链、GRPO、RLVR 与 R1 训练流水线,把推理模型的炼成路径拆开来看,也把「激发还是塑形」「虚假奖励」「熵坍缩」三场还没吵完的架摆上桌面。
一条铺了三年的线:从「提示技巧」到「训练范式」
推理模型不是 2024 年凭空冒出来的,它的每一块砖都提前铺好了。
- 2022 年 1 月,思维链提示:Google 的 Wei 等人发现,在少样本示例里写上推理步骤,就能显著提升大模型做数学题的表现,且模型越大效果越明显。但这只是「提示」——能力本来就在预训练分布里,推理步骤只是把它钓出来,关掉示例就退化。
- 2022 年 3 月,STaR 自举:纯提示不稳定,那就让模型自己生成推理过程,答案对了就把推理过程留下来微调,循环往复。「用模型生成的数据训练模型自己」从这里成型。
- 2023 年 5 月,过程监督:OpenAI 在《Let's Verify Step by Step》里给出关键结论——对每一步推理打分(过程监督),比对最终答案打分(结果监督)更能训出可靠的数学模型。奖励的粒度第一次成了核心问题。
- 2024 年 2 月,GRPO:DeepSeek 发布 DeepSeekMath,顺手提出 Group Relative Policy Optimization——把强化学习的训练成本打下来,让「在数学上大规模跑 RL」从烧钱变成可行。
- 2024 年 9 月,o1:OpenAI 把所有线索拧成产品:用大规模强化学习训练模型生成内部思维链,首次把「测试时算力」变成可以买卖的东西。
- 2024 年 11 月,RLVR 有了名字:AI2 的 Tulu 3 把「用可验证奖励做强化学习」写进完全开放的训练配方,RLVR(Reinforcement Learning with Verifiable Rewards)从此成为标准术语。
- 2025 年 1 月,R1 与 Kimi k1.5:DeepSeek-R1 证明整套方法可以开源复现,Kimi k1.5 则把 RL 定义为「预训练数据墙之外的新扩展轴」。
flowchart LR
A["2022-01 思维链提示"] --> B["2022-03 STaR 自举"]
B --> C["2023-05 过程监督"]
C --> D["2024-02 GRPO 提出"]
D --> E["2024-09 o1 发布"]
E --> F["2024-11 RLVR 定名"]
F --> G["2025-01 R1 开源复现"]
G --> H["2026 推理默认化"]
每一步单独看都是渐进改进,连起来才是一条因果链:思维链证明「会」,STaR 解决「数据从哪来」,过程监督解决「怎么评」,GRPO 解决「练得起」,o1 证明「值多少钱」,R1 证明「抄得走」。后面几节,就沿着这条链把关键环节拆开。
测试时算力:训练完成后剩下的那个自由度
预训练时代的扩展定律只有一个旋钮:参数与数据的规模。2024 年 8 月,卡内基梅隆大学的 Snell 等人在论文里给出另一个旋钮的定量结论:给固定的模型配上最优的测试时算力(更好的搜索、更聪明的采样),效果可以胜过把参数规模放大的贪心解码。同年 9 月,OpenAI 发布 o1 时也宣称,模型准确率与回答前思考所耗算力的对数相关——「想多久」正式成为与「多大」平级的变量。
这里值得停下来想清楚推理 token 的本质:它不是什么新的架构部件,就是普通的输出 token。所谓推理,是把模型内部本就存在的搜索与自我纠错过程,显式地写成一段内部独白,让下一个 token 的生成条件变得更充分。代价同样直白——推理 token 全部按输出计费,并占用输出长度配额。本站此前的《KV Cache 争夺战》讲的是「想」这件事的显存账单,而这里讲的是「想」的账单怎么变成产品定价。
到 2026 年,这个变量已经全面档位化。截至 2026-10-09 各家官方文档的现状:
| 厂商 | 推理控制方式 | 默认行为 |
|---|---|---|
| OpenAI GPT-6 系列 | reasoning effort 五档,low 到 max,Luna 多一档 none |
按档位显式控制 |
| DeepSeek V4 系列 | thinking 开关 | 思考默认开启 |
| Anthropic Claude 4.7+ | budget_tokens 手动预算,或 adaptive 模式加 effort 档位 |
adaptive 由模型自定 |
| 阿里 Qwen3 系列 | thinking 与 non-thinking 混合训练,单模型可切换 | 双模式按需选择 |
有意思的是三个厂商走向了三种产品哲学:OpenAI 把「想多久」交给用户选档,DeepSeek 直接默认全员思考、想省再关,Anthropic 则在 2026 年转向 adaptive thinking——预算该花多少让模型自己判断。同一个技术变量,三种定价与交互的答案。
RLVR:奖励模型下班,判卷器上岗
要理解 RLVR 为什么出现,得先看它替代的东西。RLHF 的奖励来自一个用人类偏好数据训练出来的奖励模型,它带来两个根深蒂固的问题:奖励只是人类偏好的代理,模型会学会讨好打分器而非真正变好——也就是奖励黑客;训练奖励模型本身又贵又慢,打分标准还模糊。本站此前的《奖励黑客》与《一篇读懂 LLM-as-a-Judge》分别从失效机理与评测角度聊过这两件事,这里不再展开。
RLVR 的思路是把奖励模型整个裁掉:奖励不来自另一个神经网络的主观打分,而来自可自动验证的规则判卷——数学题比对 boxed 里的最终答案,代码题跑编译器过测试用例。术语出自 AI2 的 Tulu 3(2024 年 11 月),但把它推到聚光灯下的是 DeepSeek-R1 论文里 R1-Zero 的奖励设计,简单到令人发指:
- 准确性奖励:数学题要求把最终答案放进规定格式,规则直接比对;代码题用编译器对照预定义测试用例判定。
- 格式奖励:只要求模型把推理过程放进
<think>与</think>标签内。
两项等权相加,没有别的。论文明确解释了为什么不用神经奖励模型:大规模强化学习下奖励模型容易被 hack,规则判卷难以伪造。当然,规则判卷只覆盖得了有标准答案的领域——数学、代码、逻辑题。开放域的文风、安全、帮不帮忙没法自动判卷,这正是 R1 完整版后面还要补一阶段偏好 RL 的原因,也是 RLVR 至今的主战场仍集中在推理任务的原因。
| RLHF | RLVR | |
|---|---|---|
| 奖励来源 | 偏好数据训练的奖励模型 | 规则判卷:答案比对、测试用例 |
| 监督信号 | 连续、模糊、可被讨好 | 稀疏、明确、难伪造 |
| 擅长领域 | 文风、安全、开放域偏好 | 数学、代码等可验证任务 |
| 主要风险 | 奖励黑客、偏好失真 | 判卷覆盖不到的能力不涨反跌 |
| 代表工作 | InstructGPT、R1 第四阶段 | Tulu 3、R1-Zero、Kimi k1.5 |
GRPO:把 critic 从 PPO 里拿掉
RLVR 解决「奖励从哪来」,还剩「怎么练得起」。经典 PPO 要同时养四个模型:策略、参考、奖励、价值网络。其中价值网络(critic)最尴尬——它与策略同规模,显存与算力开销巨大;而语言模型的奖励往往只落在最后一个 token 上,逐 token 学一个准确的价值函数本来就难。DeepSeekMath 论文原话:GRPO「抛弃 critic 模型,改从组内得分估计基线,显著降低训练资源」。
GRPO 的做法可以概括为「同题多答、组内排名」:对每个问题,用当前策略采样一组(论文设置 G = 64)回答,判卷打分后做组内归一化——减均值、除标准差——把得到的相对得分直接当作该回答中所有 token 的优势。一组回答互为彼此的基线,critic 就没有存在的必要了。KL 约束也不再折进奖励里,而是直接加进损失函数,用 Schulman 的 k3 无偏估计器(保证非负)计算与参考模型的偏离。
# GRPO 单轮更新示意(省略工程细节)
for q in batch: # 一批问题
outputs = [policy.sample(q) for _ in range(G)] # 同题采 G 个回答,论文 G=64
rewards = [verify(o) for o in outputs] # 规则判卷,无奖励模型
adv = [(r - mean(rewards)) / std(rewards) # 组内归一化即优势
for r in rewards]
loss = -clipped_surrogate(adv) \
+ beta * kl_k3(policy, ref_model) # KL 直接进损失,k3 估计保证非负
optimize(loss)
效果落在数字上:DeepSeekMath 从指令模型出发只加这一个 RL 阶段,GSM8K 从 82.9% 提到 88.2%,MATH 从 46.8% 提到 51.7%。两个月后的 2025 年 3 月,字节 Seed 的 DAPO 又把工程细节摊开:Clip-Higher 放开上界鼓励探索、动态采样过滤全对全错的无效组、token 级损失、超长回答惩罚——用 Qwen2.5-32B 基模型在 AIME 2024 上做到 50 分,训练代码基于 verl 框架全量开源。从 GRPO 到 DAPO 的两个月,是 RL 训练系统从论文技巧变成公开基础设施的两个月。
R1 全流程:纯强化学习能自己长出什么
2025 年 1 月的 DeepSeek-R1 论文做了两个实验,一个惊人,一个更惊人。
惊人的是 R1-Zero:不做任何监督微调,直接在基模型上跑纯 RL,奖励就是上一节的「判卷 + 格式」。训练中出现了两个自发现象。其一,回答长度持续增长——模型自己发现想得越久对得越多,测试时算力这个推理侧的自由度,被训练侧「自发发明」了出来。其二,论文记录了那个著名的时刻:模型在解到一半时写下「Wait, wait. Wait. That's an aha moment I can flag here.」,然后推翻自己重来。作者的原话是:「模型学会了用拟人化的语气重新思考。这对我们来说也是一个 aha moment。」自我反思、中途验证、动态换策略,这些此前要靠提示工程引导的行为,纯 RL 就能长出来。
但 R1-Zero 不可读——中英混杂、格式混乱,没法直接当产品。于是更惊人的是完整版 R1 的克制:没有一步神奇的端到端,全流程是四个朴素阶段的拼接。
flowchart TD
A["阶段一:冷启动<br/>数千条长思维链数据 SFT"] --> B["阶段二:推理强化学习<br/>判卷奖励 + 语言一致性奖励"]
B --> C["阶段三:拒绝采样 + SFT<br/>约 80 万条推理与非推理数据混合"]
C --> D["阶段四:全场景偏好 RL<br/>对齐有用性与无害性"]
冷启动解决可读性,推理 RL 拉能力,第三阶段用拒绝采样把推理能力翻译成约 80 万条干净数据回灌,第四阶段再把对话偏好补齐。最终成绩:AIME 2024 上 79.8% pass@1、MATH-500 上 97.3%、GPQA Diamond 上 71.5%、Codeforces 评分 2029(超过 96.3% 的人类选手)——论文自述与 OpenAI o1-1210 相当,而训练成本与开放程度完全不在一个量级。同篇论文还给出蒸馏路线:把 R1 生成的数据拿去微调 Qwen 与 Llama 底座的小模型,公开发布的 R1-Distill 系列在小尺寸上表现强劲。论文的结论是,对小型模型,直接蒸馏比自己在上面跑 RL 效率高得多——这句话为下一节的争论埋了伏笔。
三场没吵完的架
第一场:RL 是「激发」还是「塑形」? 2025 年 4 月,一篇流传很广的论文给出怀疑视角:把六种主流 RLVR 算法放在同一条件下对比,它们的表现惊人地接近,且都跳不出基模型自身的 pass@k 包络——RL 训练后的模型在大采样次数下并不比基模型会更多的题,只是把「偶尔做对」变成「稳定做对」;真正能引入新推理模式的是蒸馏。反驳立场来自 R1 与 k1.5 一系:RL 的意义在于探索出新轨迹,是预训练数据墙之外的新扩展轴。本文作者的判断是两个结论并不完全矛盾:pass@k 度量的是「会不会」,而 RL 优化的很大程度上是「何时用对」——把分布里已有的能力以更高的概率、更低的方差调用出来,这本身就是价值,但确实不该宣称成「无中生有」。
第二场:奖励是真是假? 2025 年 6 月的《Spurious Rewards》把怀疑推到极致:给 Qwen2.5-Math-7B 完全随机的奖励做 GRPO,MATH-500 居然也涨了 21.4 个百分点,与真奖励的 29.1 相差无几。解读众说纷纭,但一个事实很清楚:RLVR 的增益高度依赖基模型——Qwen 系在预训练里见过海量带推理步骤的数学数据,随机奖励可能只是刺激了既有能力的表达;换基模型增益就大幅缩水。这场争论的实际影响是,各家现在报告 RLVR 收益时必须附上基模型对照,否则数字不可信。
第三场:熵坍缩与想太久。 训练侧,2025 年 5 月的研究确认了实践者的普遍体感:RL 训练早期策略熵急剧下降,探索能力随之萎缩,性能很快饱和——模型过早锁死在自己的舒适区,论文给出的缓解手段是对高熵 token 做裁剪与 KL 控制。推理侧则是镜像问题:对一道简单题烧五万思考 token,用户只为「正确」付账是不够的,还得为「想多久」付账。这正是第二节的档位与 adaptive 模式出现的直接原因——把效率问题产品化。Kimi k1.5 把 RL 称为新的扩展轴时也没回避这一点:轴是新的,账单也是新的。
2026 年的格局:默认化、档位化、自适应化
把时间线拨到现在。截至 2026-10-09,从各家官方渠道能确认的现状是这样一幅图景。
OpenAI 2026 年 10 月上旬向全部用户(含免费层)推送 GPT-6 系列,官方博客以「GPT-6 for everyone」为题,媒体报道其周活跃用户约 12 亿。开发者文档里,GPT-6 Astra 定价输入 $10、输出 $50(每百万 token),GPT-6.1 Sol 为 $2 与 $10,GPT-6 Luna 低至 $0.1 与 $0.5——三个模型共享 1.05M 上下文与同一套推理档位,价差一百倍的只有「多聪明」与「多快」,范式没有差别。
DeepSeek 现役 V4 系列(V4-Pro 与 V4.1-Flash)在官方文档里把 thinking mode 标为默认开启,上下文 1M,最大输出 384K。2024 年用户还在问「要不要打开思考」,2026 年的问题变成「敢不敢关掉思考」。Anthropic 的 Claude 从 4.7 系列起把固定 budget_tokens 的手动模式让位给 adaptive thinking,由模型自己决定想多久、甚至跳过思考。阿里 Qwen3 则从 2025 年起就把 thinking 与 non-thinking 做进同一个模型的混合训练里,一个模型两副面孔。
这幅图景里有三点值得记下。其一,推理已经完成从「产品特性」到「基础设施默认值」的降落,争论的焦点从「能不能想」移到「该想多久」。其二,档位就是钱:同一个推理范式下,effort 档与思考预算本质上是给测试时算力定价——调参的意义从调「性格」(temperature)扩展到调「用心程度」。其三,本文作者判断:下一阶段的竞争不在「想得更久」,而在「想得刚好」——adaptive 思考、长思考到短思考的压缩、多轮与环境交互中的按需思考,都会比单纯拉长思维链更有产出,这也正是 pass@k 之争的结尾处那篇论文指出的方向:让 RL 走出单轮判卷,进入多轮的真实环境。
写在最后
回头看这条五年长的线:思维链证明基模型「会」,STaR 解决示范数据从哪来,过程监督指明奖励的粒度,GRPO 把训练成本打到可承受,RLVR 把奖励的判定权从人手里交还给规则,R1 证明整套东西可以开源复现,2026 年把它变成数十亿人每天默认经过的路径。技术史上少有这样的案例——每一环单看都不惊艳,连起来却完成了一次范式更换。
对开发者的建议只有一条:从今天起,把推理档位当作和温度系数同级的正经超参数来调——它直接影响成本、延迟与正确率的三角。想深入相邻话题,可以读本站的《一篇读懂 RLHF》与《一篇读懂 DPO》(对齐训练的上下文)、《奖励黑客》(奖励信号的失效模式)与《KV Cache 争夺战》(推理成本在显存侧的另一本账)。
参考资料
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning(arXiv 2501.12948,R1-Zero 现象、四阶段流水线与最终成绩的原始出处)
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models(arXiv 2402.03300,GRPO 算法出处)
- Tulu 3: Pushing Frontiers in Open Language Model Post-Training(arXiv 2411.15124,RLVR 术语与开放配方出处)
- Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?(arXiv 2504.13837,「激发还是塑形」之争的怀疑方)
- Spurious Rewards: Rethinking Training Signals in RLVR(arXiv 2506.10947,随机奖励也涨分的反直觉实验)
- The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models(arXiv 2505.22617,熵坍缩机理与缓解)
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale(arXiv 2503.14476,RL 训练系统的工程公开化)
- Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters(arXiv 2408.03314,测试时算力的定量研究)
- Kimi k1.5: Scaling Reinforcement Learning with LLMs(arXiv 2501.12599,RL 作为新扩展轴)
- OpenAI GPT-6 模型文档 与 DeepSeek Models & Pricing(截至 2026-10-09 的推理档位与定价现状)
读者留言
COMMENTS 暂无还没有留言,来说第一句?