
控制 LLM 推理深度:从 DeepSeek-R1 到 GPT-5.6 的多级推理机制详解
看完本文你就能理解现代 LLM 的推理模式是怎么工作的:从 DeepSeek-R1 的 RLVR 训练到 GPT-5.6 的六档推理努力级别,以及 Qwen3、DeepSeek V4、Nemotron 等模型的实现差异
原文来源:Sebastian Raschka, PhD — Controlling Reasoning Effort in LLMs — 2026年7月18日发表于 Ahead of AI 专栏
现在几乎每个主流模型都支持多级推理——你可以告诉模型「稍微想一下」或者「使劲想」。GPT-5.6 甚至有六个推理努力级别,从 Light 到 Ultra。
这些级别是怎么实现的?底层原理是什么?这篇文章帮你理清。
推理模型是什么
先说清楚概念。这里的「推理」不是指模型像人类一样思考,而是指模型在给出最终答案之前,先生成一段中间推理过程——我们称之为「推理痕迹」或 reasoning trace。
左边是普通模型的回答,直接给出答案。右边是推理模型的回答,在 <think> 标签内先生成推理过程,再给出最终答案。
换句话说,推理模型在回答前会「先想一想」,把思考过程写下来再给答案。
—— 广告 ——
训练推理模型:RLVR 方法
当前最主流的推理模型训练方法是 RLVR(Reinforcement Learning with Verifiable Rewards,基于可验证奖励的强化学习)。
DeepSeek-R1 论文让这个方法火起来的。核心思路其实很简单:
- 选一些答案可验证的领域(数学可以用符号计算器检查,代码可以用编译器/单元测试检查)
- 让模型先自由发挥,生成答案
- 答案对了给正奖励,错了给零奖励
- 通过强化学习让模型学会「先想清楚再回答」
有意思的是,模型在训练过程中会自动出现所谓的「Aha 时刻」——它在推理过程中发现自己错了,主动回溯修正。这个过程没有被显式训练,是奖励信号带来的涌现行为。
一个重要的细节:训练时只对最终答案和格式做奖励,中间推理过程本身不参与训练。DeepSeek 试过用中间推理信息做训练,发现没有帮助。
推理缩放:两个维度
改善模型推理性能有两种方式:
训练缩放(Training Scaling):训练一个更大的模型,或者用更多数据和算力训练。比如 GPT-5.6 的 Luna → Terra → Sol,就是不同训练规模的模型。
推理缩放(Inference Scaling):模型不变,但允许它花更多 token 去「思考」。同一个模型,在低努力级别下生成几百个 token 就回答,在高努力级别下可能生成几千个 token。
GPT-5.6 的界面清晰地展示了这两种缩放:左边选 Luna/Terra/Sol 是训练缩放,右边选推理努力级别是推理缩放。
有意思的是这两者的曲线有重叠——一个小模型给足推理时间,有时能达到大模型快速回答的效果。
推理努力级别的实现方式
不同模型厂商的实现方式不同。主要有两条技术路线。
路线一:System Prompt 驱动
最简单的方法。GPT-5.6 和 gpt-oss 的实现:在 system prompt 中插入 Reasoning effort: low/medium/high,模型收到指示后自行调整回答长度和详细程度。
从 gpt-oss 开源模型的代码看,OpenAI 的 chat template 会根据用户选择的努力级别,在 system message 末尾追加对应的指令,然后将整个 prompt 发给同一个模型。
效果上,努力级别直接关联 token 消耗和准确率。低努力 → 短回答 + 低准确率;高努力 → 长回答 + 高准确率。不过在最高级时收益递减——多花 10 倍 token 可能只换来 1% 的准确率提升。
路线二:训练时 Conditioning
Qwen3 的推理开关是通过训练实现的:
- 推理模型训练完成后,增加「Thinking Mode Fusion」阶段
- 用 SFT 让模型同时学会两种模式:
/think: <reasoning>answer和/no_think: answer - 后续的通用 RL 阶段进一步强化
推理时,通过 tokenizer 参数 enable_thinking=True/False 控制。False 时,tokenizer 会自动在 assistant 响应开头填入空 <think></think>,模型就跳过推理直接回答。
DeepSeek V4 的多专家方法
DeepSeek V4 制造了三个推理专家模型:
- Non-think:直接回答,不输出推理痕迹
- Think High:标准推理模式,在
<think>标签内输出推理过程 - Think Max:额外加上特殊系统指令("Reasoning Effort: Absolute maximum with no shortcuts permitted")
三个专家使用不同的上下文窗口和长度惩罚。Think Max 的上下文窗口更大、长度惩罚更小,允许模型持续推理更久。训练完成后,三个专家通过 on-policy distillation 合并到同一个模型权重中。
推理时只要在系统消息中指定努力级别,模型就会使用对应专家学到的行为模式。
Nemotron 3 Ultra 的双层控制
NVIDIA 的方案更精细:训练学到的模式 + 推理时的硬预算。
训练层面:
- Medium-effort 模式通过 SFT 引入(用 GPT-OSS-120B 的 medium-effort 输出作为训练数据)
- RLVR 阶段约 2.5% 的 prompt 使用 medium-effort 设置
推理预算层面:
- 模型推理痕迹长度达到预算上限时,客户端强制关闭
<think>块,让模型直接进入最终回答 - 学到的努力级别决定模型如何使用推理 token,预算约束能持续推理多久
这使得你可以自由组合——regular 模式配宽松预算,或 medium-effort 配紧缩预算,根据成本和精度需求灵活调整。
Inkling 的连续努力值
Thinking Machine Labs 的 Inkling 模型采用连续值(0.2 到 0.99)而不是离散级别。实现上:
- 在系统消息中指定期望的努力级别
- 调整每个生成 token 的成本系数 λ(e)
- 奖励公式大致为:R(e) = R_task - λ(e) × N_tokens
- 低努力 → 高 token 成本系数 → 鼓励短推理
- 高努力 → 低 token 成本系数 → 允许长推理
实际应用指南
训练缩放和推理缩放哪个更划算?取决于场景。
GPT-5.6 的数据显示,模型大小和推理努力这两个维度可以互相替代。Luna(最小)在高努力下可以达到 Terra(中等)在低努力下的表现。这意味着你可以:
- 对延迟敏感的场景:用大模型 + 低努力,快速得出好答案
- 对成本敏感的场景:用小模型 + 中高努力,牺牲一点延迟换取价格优势
- 对精度敏感的场景:用大模型 + 高努力,接受更高的成本和延迟
目前所有主流模型(GPT-5.6、Claude Opus 5、DeepSeek V4、Qwen3、Nemotron 3 Ultra、Inkling)都支持多级推理。选模型时不再只是选「哪个最强」,而是选「在成本、延迟、精度三个维度上哪个方案最适合你的场景」。
© 2026 四月
原文链接:https://www.aprilzz.com/tutorials/llm-reasoning-effort-control
相关文章
2026 年用 AI 编程的正确姿势:来自 Google 资深工程师的实战工作流
Google Chrome 团队资深工程师 Addy Osmani 总结了经过实战检验的 LLM 编程工作流:先写规格再写代码、分小块迭代、充分提供上下文、测试驱动开发
2026 生产级 AI Agent 构建指南:从用例到监控的 8 个步骤
从用例选择到原型再到评估框架,完整的生产级 AI Agent 构建指南——8 个可操作的步骤,带代码示例和真实项目经验
MCP(Model Context Protocol)从入门到实战:构建你的第一个 AI 工具服务器
手把手教你理解 MCP 协议的原理、架构,并用 Python 从零搭建一个支持实时数据查询的 MCP 服务器