推理模型已经不是新鲜事物,但「什么时候该让模型想一想」仍是一个工程问题。自 2024 年 9 月 o1 确立「先思考再回答」的产品形态(OpenAI《Learning to reason with LLMs》)以来,思考能力已内化到各家旗舰里:截至 2026-10-07,OpenAI 当家的是 GPT-6 系列,Anthropic 是 Claude 4.5/5.x,Google 是 Gemini 2.5/3 系列。共同点是:回答之前先在内部生成思维链,用推理时计算换准确率。但思考不是免费的,本文以三家官方文档为准(检索时点 2026-10-07),整理一份面向使用者的选型与调参指南。
一、什么是推理模型:把「想一想」变成产品参数
普通 chat 模型拿到问题后直接自回归地「说」;推理模型则会先输出一段只有自己看得到的思考 token——推演、回溯、自我检查——然后再给出最终答案。本质是同一句话:多花算力想,答对的概率更高。
落到产品上,「想一想」是可配置的,差异主要在两处。
思考预算的形制不同。 OpenAI 用 reasoning.effort 档位(none/minimal/low/medium/high/xhigh/max,各模型支持的子集不同);Anthropic 早期用显式 budget_tokens(Claude 4.5 及更早),新模型改为自适应思考(thinking: {"type": "adaptive"})加 effort 档位,思考深度由模型按题目难度自定;Google 在 Gemini 2.5 上用 thinkingBudget(token 数),Gemini 3 改为 thinkingLevel(minimal/low/medium/high),默认动态思考,且官方明确 Gemini 3 不能完全关掉思考。
思考过程的可见性不同。 OpenAI 不通过 API 返回原始思考,只提供摘要(summary),但计费按完整思考 token 算;Anthropic 与 Gemini 可以直接返回思考文本,Anthropic 还提供摘要、省略(omitted)等展示模式——官方原话是「省略只降延迟、不降成本」。
二、官方文档都建议用在哪
三家官方文档的场景建议高度收敛,下表按官方原文归纳:
| 场景 | 官方建议 | 依据 |
|---|---|---|
| 数学、证明、硬推理 | 开高档 | Anthropic:思考改善 math、coding、analysis 与长程智能体任务 |
| 编程与复杂调试 | 高档 | OpenAI:high 用于 hard reasoning、complex debugging、deep planning |
| 智能体与长程任务 | 中高档 | 三家一致;OpenAI medium 默认档即含 agentic coding |
| 工具调用、规划、搜索、草拟 | 低档 | OpenAI:low 映射 tool use、planning、drafting、customer support |
| 简单分类、快速检索、语音 | 关闭或最低档 | OpenAI:none 用于 latency-critical 的分类与检索 |
| 高吞吐、简单指令跟随 | 最低档 | Google:low/minimal「Minimizes latency and cost」 |
其中 OpenAI 的档位-场景映射最细,模型选型指引也很直接:大多数推理负载从 gpt-6-astra 起步,对成本与延迟敏感再降级到 GPT-5.6 家族的低延迟型号。值得注意的是它对深思考档的告诫——xhigh/max 只用于深度研究、长程智能体运行、安全与代码审查这类任务,官方原话是「Only use when your evals show a clear benefit」:评测显示明确收益才开。
三、成本账:思考 token 也是输出 token
关键账目三家口径完全一致:思考 token 按输出 token 计费。输出单价通常是输入的数倍,这意味着开思考后,同样的任务总花费与延迟可能翻几倍。
- OpenAI:思考 token「billed as output tokens」,只占上下文、不占可见输出,用量在 usage 的
reasoning_tokens里披露;官方建议起步就为「推理 + 输出」预留至少 25,000 token,否则可能扣了钱却拿到incomplete状态的空回答。模型一次任务生成的思考 token「从几百到几万不等」。 - Anthropic:思考 token「按输出计费,即使思考文本没有返回给你」;手动模式预算最低 1,024 token(更小的值直接被拒),简单任务从最小预算起步、复杂任务建议 16,000 起,超过 32k 建议改走批处理。
- Google:回答的价格等于输出 token 与思考 token 之和;即便
max_output_tokens把请求截断成incomplete,已生成的思考 token 照常计费。
所以决策框架可以收敛成三个问题:
flowchart TD
A[新任务] --> B{答案有硬对错且错误代价高}
B -- 否 --> C[关思考或用最低档]
B -- 是 --> D{默认档评测达标}
D -- 是 --> E[用默认档]
D -- 否 --> F{升档收益经评测验证}
F -- 是 --> G[升高档]
F -- 否 --> H[保持默认 改提示词或改分工]
第一,任务有没有可验证的硬对错,错了代价大不大——数学推导、代码正确性、多步决策有,简单分类与格式转换没有;第二,正确率提升的期望价值,覆盖得住几倍的 token 与延迟吗;第三,高档位的收益在自己的评测里验证过吗。三问都是「是」才值得让模型认真想,这也正是 OpenAI 把最终裁决权交给 evals 的原因。
四、档位怎么调:从低往高,用评测说话
默认档先用起来。 OpenAI 的 gpt-5.5 默认 medium;Gemini 3 动态思考本身就会按难度自适应,Pro 默认 high、Flash 默认 medium。大部分负载根本不需要手动调档。
降本先降档,而不是砍输出上限。 Anthropic 明确建议「思考开启的负载要降成本或延迟,先降 effort」;Google 同样建议降 thinking_level 而不是砍 max_output_tokens——后者会直接把回答本身截断。OpenAI 的 Responses API 写法如下:
{
"model": "gpt-6-astra",
"reasoning": { "effort": "medium", "summary": "auto" },
"max_output_tokens": 32000
}
Anthropic 的自适应模式则是 thinking={"type": "adaptive"} 配 output_config={"effort": "low"},effort 是软引导,max_tokens 才是硬上限。
温度别碰。 开思考后,采样参数的老经验全部失效:OpenAI 推理系模型只接受默认 temperature=1,传其他值直接报 400 错误;Anthropic 开思考时同样「temperature may only be set to 1」。控制输出质量的旋钮是 effort 档位,不是温度。
五、实战模式:让推理模型指挥,小模型干活
推理模型与工具调用的组合,官方给出的分工思路是一致的:推理模型当 orchestrator 做规划与审查,小模型或低档位执行子任务。Anthropic 工程博客《How we built our multi-agent research system》给出的数字是:Opus 4 做主智能体、Sonnet 4 做并行子智能体,在内部研究评测中比单个 Opus 4 基线高出 90.2%。OpenAI 的档位映射表也是同一个思想——编排、工具调用用低档,难题才升档。Anthropic 还支持在工具调用之间穿插思考(interleaved thinking),让模型在每次拿到工具结果后先消化再决定下一步。
普通模型加思维链提示词能替代到什么程度? 思维链提示(Wei et al., 2022)在足够大的模型上对数学与逻辑类任务确实有效,且几乎零成本;Google 的官方迁移建议甚至直接说:从 2.5 时代的手写思维链提示词迁到 Gemini 3,改用 thinking_level: "high" 加简化提示词即可。但公开评测的共识是:强化学习训练出来的长推理,在难基准上明显强于提示词思维链——提示词能帮模型「组织步骤」,帮不了模型「多想几步再回溯」。经验法则:轻量任务先试提示词思维链,上难度后差距拉开,再切推理档位。
六、边界与坑:假推理、不忠实的思维链与过度思考
过度思考(overthinking)。 ICML 2025 论文《Do NOT Think That Much for 2+3=?》记录了长推理模型在 2+3=? 这类问题上生成上千 token 冗余推理路径的现象——思考长度上去了,正确率原地踏步。2026 年的研究《When More Thinking Hurts》进一步发现:高算力预算下边际收益递减,模型有时会在长时间推理后放弃原本正确的答案。「想得多」不等于「想得好」,简单问题上的思考是纯烧钱。
假推理与忠实性。 思维链是模型生成的文本,不是内部计算的直接披露。Anthropic 2025 年的研究《Reasoning models don't always say what they think》测试发现:给模型埋入提示时,模型会利用它,却在思维链里否认——「看起来在思考」未必反映真实的决策依据。把思考文本当调试线索可以,当可解释性证据就要打折扣。
可见性的坑。 OpenAI 返回的思考摘要是模型再创作的文本,计费却按完整思考算;评估模型工作量时,别拿思考长度当指标。
工程细节。 max_tokens/max_output_tokens 把思考 token 计算在内,设太小会拿到 incomplete 还照扣费;Anthropic 侧改动 budget_tokens 会使 prompt cache 前缀失效(预算值被渲染进提示词),选定后保持稳定,思考密集任务建议用 1 小时缓存。
一句话总结:推理模型是「用钱和延迟买正确率」的旋钮——有硬对错、错误代价高的任务大胆开,用评测决定档位;简单、量大、延迟敏感的任务,让模型少想或者别想。
参考资料
- OpenAI — Reasoning models(API 指南)
- Anthropic — Thinking / Extended thinking(Claude 文档)
- Google — Gemini 3 指南(thinking_level)
- OpenAI — Learning to reason with LLMs
- Chen et al. — Do NOT Think That Much for 2+3=?(ICML 2025)
- Anthropic Research — Reasoning models don't always say what they think
- Anthropic Engineering — How we built our multi-agent research system
读者留言
COMMENTS 暂无还没有留言,来说第一句?