2025 年 1 月 20 日,DeepSeek 发布 DeepSeek-R1 与 DeepSeek-R1-Zero 两个模型;两天后(1 月 22 日)论文挂上 arXiv(编号 2501.12948),2025 年 9 月又以《DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning》为题登上 Nature(第 645 卷,633–638 页)。彼时 OpenAI 的 o1 已经展示了「推理时计算」的价值——模型多想一会儿,难题就能多解对几分——但训练方法完全闭源。R1 论文回答的问题因此格外尖锐:推理能力能不能不靠人工标注的推理数据,由强化学习直接从基座里"种"出来?
论文给出两份答案:R1-Zero 证明"能",R1 证明"能做得又好又可读"。本文逐节精读 arXiv 版论文,所有数字均标注论文中的表号与章节;推理时计算的脉络与 o1 的发布解读此前已有专文,这里不再展开,只聚焦论文本身:它怎么训练、报了哪些数字、哪些结论经得起推敲。
R1-Zero:不给 SFT,直接上 RL
R1-Zero 是整个论文最激进的实验:在 DeepSeek-V3-Base 上直接做强化学习,论文原话是"不依赖监督微调(SFT)作为前置步骤"(第 1.1 节)。此前业界的通行做法是先用人工标注的长思维链数据做 SFT"教会模型思考",再谈 RL。R1-Zero 把第一步整个扔掉了。
RL 算法是 GRPO(组相对策略优化),概念上它去掉价值网络(critic),对同一道题采样一组输出,用组内平均分当基线:单条输出的优势 A 等于(该条的奖励 − 组内均值)除以组内标准差。论文第 2.2.1 节只用了这个量级笔墨——毕竟方法本身在 DeepSeekMath 论文里已提出,R1 论文的重点不在算法而在"喂什么奖励"。
奖励只有两条规则(第 2.2.2 节):
- 准确率奖励:数学题按约定格式给出最终答案(论文要求答案放在 boxed 形式里)判对错,代码题用编译器和预置测试用例判分;
- 格式奖励:只检查输出是否把思考过程和答案分别放进 think、answer 两对标签里(模板见论文表 1)。
刻意不用神经奖励模型,理由是奖励破解(reward hacking)风险——可验证领域里规则奖励天然可信,这也是后来"RLVR(可验证奖励强化学习)"这条路线的雏形。
"Aha moment":能力是自己长出来的
R1-Zero 训练过程中最著名的记录有两处(第 2.2 节分析部分)。
第一处是响应长度自发增长。论文图 3 显示,RL 过程中模型在训练集上的平均响应长度持续上升,从数百 token 涨到数千 token——没有任何一项奖励奖励"写长",模型自己学会了用更长的思考换更高的准确率。
第二处是**"aha moment"**。某个中间版本模型在解题途中开始重新审视自己的思路,论文引用了模型的原话:
"Wait, wait. Wait. That's an aha moment I can flag here."
论文的解读是:我们从未显式教模型怎么解题,只是给了对激励,反思(reflection)行为便自发涌现——"这是纯 RL 的力量与美"。类似的还有自我验证与回溯。
成绩单也撑得起这种说法(论文表 2):AIME 2024 上 pass@1 达到 71.0(对照 OpenAI-o1-0912 为 74.4、o1-mini 为 63.6),而 64 采多数投票的 cons@64 达 86.7,反超 o1-0912 的 83.3;MATH-500 上 pass@1 达 95.9,超过 o1-0912 的 94.8。一个没有任何标注推理数据的模型,纯靠规则奖励的 RL 就追到了 o1 门前的台阶上。
但论文同样坦诚地记录了代价:R1-Zero 的输出可读性差、语言混杂——回答常常中英混排、缺乏排版,思考过程不适合直接给人看。这两条问题直接催生了 R1 的完整管线。
R1 的四阶段管线
R1 在 R1-Zero 的基础上加回"少量人工",变成四个阶段,每个阶段解决一个明确的问题。
flowchart LR
A["DeepSeek-V3-Base"] -->|"阶段1 冷启动SFT<br/>数千条长CoT"| B["输出可读<br/>RL起点稳定"]
B -->|"阶段2 推理RL<br/>GRPO+准确率+语言一致性"| C["推理强<br/>但偏理科"]
C -->|"阶段3 拒绝采样+SFT<br/>约60万推理+约20万非推理"| D["文理兼备"]
D -->|"阶段4 全场景RL<br/>规则奖励+人类偏好"| E["DeepSeek-R1"]
E -->|"蒸馏:仅SFT"| F["Distill-Qwen<br/>1.5B/7B/14B/32B"]
E -->|"蒸馏:仅SFT"| G["Distill-Llama<br/>8B/70B"]
阶段 1:冷启动 SFT。 用几千条高质量长思维链微调基座(第 3.1 节),数据来自 few-shot 提示生成、R1-Zero 输出改写与人工后处理。解决两个问题:让早期 RL 阶段更稳定,以及把输出格式统一为"推理过程 + 末尾摘要"的可读样式。
阶段 2:推理 RL。 在冷启动模型上跑 GRPO,奖励仍以准确率为主,另加一条语言一致性奖励(第 3.2 节):按思维链中目标语言单词占比计分,缓解语言混杂。论文注明这条奖励会带来轻微性能损失,是清晰性与分数之间的权衡。
阶段 3:拒绝采样 + SFT。 推理 RL 收敛后,用当时的 checkpoint 采样并只保留答对的样本,得到约 60 万条推理数据;再混入约 20 万条非推理数据(写作、事实问答、自我认知、翻译等,部分复用 DeepSeek-V3 的 SFT 数据),合计约 80 万条,对 DeepSeek-V3-Base 从头微调两个 epoch(第 3.3 节)。判定时用的是 DeepSeek-V3 充当的生成式奖励模型。值得注意的细节是,这一步微调的对象是基座本身,而不是推理 RL 的 checkpoint——先在基座上把两类能力重新融合,再交给阶段 4 统一对齐。
阶段 4:全场景 RL。 最后一轮 RL 对推理数据继续用规则奖励,对通用数据改用人类偏好训练的奖励模型(第 3.4 节):有用性只评判最终摘要,无害性则评判包括思考过程在内的完整输出。
四阶段管线跑完,成绩对齐 o1(论文表 4,均为 pass@1):
| 基准 | DeepSeek-R1 | OpenAI-o1-1217 |
|---|---|---|
| AIME 2024 | 79.8 | 79.2 |
| MATH-500 | 97.3 | 96.4 |
| GPQA Diamond | 71.5 | 75.7 |
| MMLU | 90.8 | 91.8 |
| Codeforces 评分 | 2029(96.3%) | 2061(96.6%) |
| SWE-bench Verified | 49.2 | 48.9 |
数学与代码两项 R1 领先,GPQA Diamond 与 MMLU 略逊,整体与 o1-1217 相当——开源模型第一次在这张表上站到了同一排。顺带说明评测口径:论文统一采用温度 0.6、top-p 0.95、最大生成长度 32768 token 的采样设置;pass@1 指单次采样通过率,cons@64 则是 64 次采样后取多数投票,衡量的是"多试几次能到什么水平"。
蒸馏:小模型要推理,抄近道
论文第 4 节的蒸馏实验常被低估,结论其实比 R1 本身更实用。DeepSeek-R1 生成的 80 万级推理样本被直接用来微调六个开源小模型:Qwen2.5-Math-1.5B、Qwen2.5-Math-7B、Qwen2.5-14B、Qwen2.5-32B、Llama-3.1-8B 与 Llama-3.3-70B-Instruct,且蒸馏模型只做 SFT、不做任何 RL。
蒸馏结果表中的关键数字(pass@1,AIME 2024 / MATH-500):Distill-Qwen-1.5B 为 28.9 / 83.9,Qwen-7B 为 55.5 / 92.8,Qwen-14B 为 69.7 / 93.9,Qwen-32B 为 72.6 / 94.3,Llama-8B 为 50.4 / 89.1,Llama-70B 为 70.0 / 94.5。7B 蒸馏模型的 AIME 成绩超过了此前不少大得多的开源模型;就连能在消费级设备上跑动的 1.5B 模型,MATH-500 也有 83.9 分。两个 Llama 蒸馏模型的成绩还说明,这条路线并不绑定 Qwen 家族。
更有分量的是对照组:论文用 Qwen2.5-32B 基座直接复刻 R1-Zero 式大规模 RL(R1-Zero-Qwen-32B),训练超过 1 万步,结果只追平 QwQ-32B-Preview,全面落后于蒸馏出的 DeepSeek-R1-Distill-Qwen-32B。论文的结论写得很直白:对较小的模型,蒸馏强大模型的输出效果出色,而直接做大规模 RL 需要巨额算力且可能根本达不到蒸馏的性能;要突破当前智能的上限,恐怕仍需更强的基座配合更大规模 RL。
影响、复现与边界
R1 的开源(R1 本体 MIT 许可,蒸馏模型沿用 Qwen 的 Apache 2.0 与 Llama 系列许可)把 RLVR 从论文概念变成人人可跑的工程路线,也直接引爆了推理模型的研究潮。复现方面,截至 2026-10-07:HuggingFace 的 Open-R1 项目按"先复现蒸馏、再复现纯 RL、最后扩规模"的三步计划完成了使命,仓库已声明停止维护;Berkeley 的 TinyZero 用约 30 美元的算力在倒计时任务上让 0.5B–7B 小模型复现出"aha moment",证明涌现现象并不专属于大厂集群。
论文自述的局限(第 5 节)有四条:函数调用、多轮对话、复杂角色扮演与 JSON 输出上不及 DeepSeek-V3;除中英外的语言可能用英文作答;对 prompt 敏感——few-shot 示例一致地降低性能,官方建议 zero-shot;软件工程任务因评测耗时长、RL 效率低,尚未吃到大规模 RL 的红利。
本文作者判断:R1 论文的最大贡献不是表 4 的那些数字,而是 R1-Zero——它把"推理能力可以由纯 RL 涌现"从猜想变成了人人可验证的工程事实,此后所有推理模型的论文都得先跟它对表。
参考资料
- DeepSeek-AI, DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, arXiv 2501.12948(v1 2025-01-22): https://arxiv.org/abs/2501.12948
- Nature 版论文(Nature 645: 633–638, 2025, DOI 10.1038/s41586-025-09422-z): https://www.nature.com/articles/s41586-025-09422-z
- arXiv 全文 HTML 版(本文表格数字逐表核对所据): https://ar5iv.labs.arxiv.org/html/2501.12948
- HuggingFace 模型卡 deepseek-ai/DeepSeek-R1: https://huggingface.co/deepseek-ai/DeepSeek-R1
- HuggingFace Open-R1 开源复现项目: https://github.com/huggingface/open-r1
- TinyZero(Berkeley,低成本复现 R1-Zero 式 aha moment): https://github.com/Forty-nine/TinyZero
读者留言
COMMENTS 暂无还没有留言,来说第一句?