教程·阅读约 2 分钟·
控制 LLM 推理深度:从 DeepSeek-R1 到 GPT-5.6 的多级推理机制详解

控制 LLM 推理深度:从 DeepSeek-R1 到 GPT-5.6 的多级推理机制详解

看完本文你就能理解现代 LLM 的推理模式是怎么工作的:从 DeepSeek-R1 的 RLVR 训练到 GPT-5.6 的六档推理努力级别,以及 Qwen3、DeepSeek V4、Nemotron 等模型的实现差异

原文来源:Sebastian Raschka, PhD — Controlling Reasoning Effort in LLMs — 2026年7月18日发表于 Ahead of AI 专栏

现在几乎每个主流模型都支持多级推理——你可以告诉模型「稍微想一下」或者「使劲想」。GPT-5.6 甚至有六个推理努力级别,从 Light 到 Ultra。

这些级别是怎么实现的?底层原理是什么?这篇文章帮你理清。

推理模型是什么

先说清楚概念。这里的「推理」不是指模型像人类一样思考,而是指模型在给出最终答案之前,先生成一段中间推理过程——我们称之为「推理痕迹」或 reasoning trace。

左边是普通模型的回答,直接给出答案。右边是推理模型的回答,在 <think> 标签内先生成推理过程,再给出最终答案。

换句话说,推理模型在回答前会「先想一想」,把思考过程写下来再给答案。

—— 广告 ——

训练推理模型:RLVR 方法

当前最主流的推理模型训练方法是 RLVR(Reinforcement Learning with Verifiable Rewards,基于可验证奖励的强化学习)。

DeepSeek-R1 论文让这个方法火起来的。核心思路其实很简单:

  1. 选一些答案可验证的领域(数学可以用符号计算器检查,代码可以用编译器/单元测试检查)
  2. 让模型先自由发挥,生成答案
  3. 答案对了给正奖励,错了给零奖励
  4. 通过强化学习让模型学会「先想清楚再回答」

有意思的是,模型在训练过程中会自动出现所谓的「Aha 时刻」——它在推理过程中发现自己错了,主动回溯修正。这个过程没有被显式训练,是奖励信号带来的涌现行为。

一个重要的细节:训练时只对最终答案和格式做奖励,中间推理过程本身不参与训练。DeepSeek 试过用中间推理信息做训练,发现没有帮助。

推理缩放:两个维度

改善模型推理性能有两种方式:

训练缩放(Training Scaling):训练一个更大的模型,或者用更多数据和算力训练。比如 GPT-5.6 的 Luna → Terra → Sol,就是不同训练规模的模型。

推理缩放(Inference Scaling):模型不变,但允许它花更多 token 去「思考」。同一个模型,在低努力级别下生成几百个 token 就回答,在高努力级别下可能生成几千个 token。

GPT-5.6 的界面清晰地展示了这两种缩放:左边选 Luna/Terra/Sol 是训练缩放,右边选推理努力级别是推理缩放。

有意思的是这两者的曲线有重叠——一个小模型给足推理时间,有时能达到大模型快速回答的效果。

推理努力级别的实现方式

不同模型厂商的实现方式不同。主要有两条技术路线。

路线一:System Prompt 驱动

最简单的方法。GPT-5.6 和 gpt-oss 的实现:在 system prompt 中插入 Reasoning effort: low/medium/high,模型收到指示后自行调整回答长度和详细程度。

从 gpt-oss 开源模型的代码看,OpenAI 的 chat template 会根据用户选择的努力级别,在 system message 末尾追加对应的指令,然后将整个 prompt 发给同一个模型。

效果上,努力级别直接关联 token 消耗和准确率。低努力 → 短回答 + 低准确率;高努力 → 长回答 + 高准确率。不过在最高级时收益递减——多花 10 倍 token 可能只换来 1% 的准确率提升。

路线二:训练时 Conditioning

Qwen3 的推理开关是通过训练实现的:

  1. 推理模型训练完成后,增加「Thinking Mode Fusion」阶段
  2. 用 SFT 让模型同时学会两种模式:/think: <reasoning>answer/no_think: answer
  3. 后续的通用 RL 阶段进一步强化

推理时,通过 tokenizer 参数 enable_thinking=True/False 控制。False 时,tokenizer 会自动在 assistant 响应开头填入空 <think></think>,模型就跳过推理直接回答。

DeepSeek V4 的多专家方法

DeepSeek V4 制造了三个推理专家模型:

  • Non-think:直接回答,不输出推理痕迹
  • Think High:标准推理模式,在 <think> 标签内输出推理过程
  • Think Max:额外加上特殊系统指令("Reasoning Effort: Absolute maximum with no shortcuts permitted")

三个专家使用不同的上下文窗口和长度惩罚。Think Max 的上下文窗口更大、长度惩罚更小,允许模型持续推理更久。训练完成后,三个专家通过 on-policy distillation 合并到同一个模型权重中。

推理时只要在系统消息中指定努力级别,模型就会使用对应专家学到的行为模式。

Nemotron 3 Ultra 的双层控制

NVIDIA 的方案更精细:训练学到的模式 + 推理时的硬预算

训练层面:

  • Medium-effort 模式通过 SFT 引入(用 GPT-OSS-120B 的 medium-effort 输出作为训练数据)
  • RLVR 阶段约 2.5% 的 prompt 使用 medium-effort 设置

推理预算层面:

  • 模型推理痕迹长度达到预算上限时,客户端强制关闭 <think> 块,让模型直接进入最终回答
  • 学到的努力级别决定模型如何使用推理 token,预算约束能持续推理多久

这使得你可以自由组合——regular 模式配宽松预算,或 medium-effort 配紧缩预算,根据成本和精度需求灵活调整。

Inkling 的连续努力值

Thinking Machine Labs 的 Inkling 模型采用连续值(0.2 到 0.99)而不是离散级别。实现上:

  1. 在系统消息中指定期望的努力级别
  2. 调整每个生成 token 的成本系数 λ(e)
  3. 奖励公式大致为:R(e) = R_task - λ(e) × N_tokens
  4. 低努力 → 高 token 成本系数 → 鼓励短推理
  5. 高努力 → 低 token 成本系数 → 允许长推理

实际应用指南

训练缩放和推理缩放哪个更划算?取决于场景。

GPT-5.6 的数据显示,模型大小和推理努力这两个维度可以互相替代。Luna(最小)在高努力下可以达到 Terra(中等)在低努力下的表现。这意味着你可以:

  • 对延迟敏感的场景:用大模型 + 低努力,快速得出好答案
  • 对成本敏感的场景:用小模型 + 中高努力,牺牲一点延迟换取价格优势
  • 对精度敏感的场景:用大模型 + 高努力,接受更高的成本和延迟

目前所有主流模型(GPT-5.6、Claude Opus 5、DeepSeek V4、Qwen3、Nemotron 3 Ultra、Inkling)都支持多级推理。选模型时不再只是选「哪个最强」,而是选「在成本、延迟、精度三个维度上哪个方案最适合你的场景」。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/tutorials/llm-reasoning-effort-control