大模型推理档位:DeepSeek/Kimi优化与未来趋势

当你在代码助手或是AI聊天工具中选择完模型后,往往会看到一个推理档位的选择器。多数人会凭感觉调整——简单问题调低档,复杂难题拨到高档,但很少有人真正清楚,拨动这个开关的瞬间,大语言模型到底发生了哪些变化。
推理模型并非真的“思考”,只是提前写下解题草稿
很多AI技术名词不能按字面意思理解,所谓的“推理模型”并不像人类一样具备逻辑推理能力,它的核心是在给出最终答案之前,先输出一段完整的中间思考过程,相当于把草稿纸上的解题步骤完整展示出来。普通的大语言模型会直接给出最终结果,而推理模型则会先完成草稿推导,再整理出答案。
用结果奖励训练模型,自主学会推理步骤
DeepSeek-R1提出的RLVR可验证奖励强化学习方法至今仍是行业主流的训练方案。这种方法的逻辑非常直接:对于可以自动验证对错的任务,比如数学题用符号工具验算、代码用编译器或单元测试验证,模型答对就给1分,答错就给0分。
反直觉的是,训练过程中并不会去评判中间草稿写得好不好,只关注最终答案的正确性和格式合规性。DeepSeek团队曾尝试将草稿内容纳入训练信号,但最终发现对效果提升帮助不大,因此移除了这部分训练逻辑。依靠仅基于最终结果的奖励信号,模型会自主学会生成中间步骤、回头检查错误并修正,这个过程被研究者称为“Aha moment”。
<think>标签只是装饰,不影响推理能力
很多人会在模型输出中看到<think></think>这样的标签,误以为这是让模型开始思考的开关,但实际上这只是装饰性的格式标记。
它的唯一作用是标记中间思考过程的起止范围,方便界面将草稿内容折叠隐藏。换成其他任意一对符号也能实现同样的效果,甚至不用这类标签重新训练的模型,在基准测试中的表现也不会有明显差异。这类标签的出现,是因为训练时加入了格式奖励项,鼓励模型将思考过程放在这对标签中,DeepSeek-R1的总奖励由结果准确率奖励和格式合规奖励两部分组成,后者只是简单的规则检查。
从单档到多档:早期推理模型的通病与改进
早期的推理模型属于“专职”模式,比如DeepSeek-R1就是基于独立基座训练的专用推理模型。这类模型的通病是,无论用户提出的问题多么简单,都会长篇大论地输出思考过程,而且没有关闭推理的开关。
直到后来的模型才推出了混合模式,比如Qwen3,同一个模型既可以作为普通的指令助手,也可以按需切换为推理模式。Qwen3通过enable_thinking=True/False参数控制推理开关,当关闭开关时,工具会在回答开头插入一个空的<think></think>标签,让模型直接跳过草稿阶段给出最终答案,这套开关逻辑是在名为Thinking Mode Fusion的训练阶段中学习得到的。
推理档位的本质:通过系统提示词控制推理长度
到了GPT-5、GPT-5.6这类模型版本,推理档位从简单的“开/关”升级为low/medium/high/max多档选择。OpenAI并未公开闭源模型的具体实现细节,但从其开源的gpt-oss项目中可以窥见端倪:推理档位本质上是通过system prompt来控制的,也就是向每个请求前加入一句类似Reasoning effort: low/medium/high的指令。ChatGPT界面上的档位选择器,大概率只是将用户的选择映射为对应的system prompt语句。
让模型听懂档位指令的两种训练方案
并不是所有模型加入这类指令都会生效,训练阶段需要配合特定的设计。主要有两种实现路径:
- 调整RLVR训练的长度惩罚:当指令要求“low”档位时,对生成的token数量施加更重的惩罚,逼迫模型缩短思考过程;当要求“high”档位时,则几乎不施加惩罚,允许模型生成更长的思考内容。
- 补充SFT对齐档位与长度:在RLVR训练完成后,再补充一轮监督微调,向模型输入“该prompt对应对应长度的推理过程”的样本数据,让模型建立起档位标签和目标思考长度之间的对应关系。
这两种路径也可以组合使用,有推测认为gpt-oss和GPT-5.6就是采用了组合方案。
换模型和调档位:两个独立的性能缩放轴
GPT-5.6的界面清晰地将选择模型和调整档位分成了两个独立的区域。左侧选择Luna/Terra/Sol,本质上是切换模型本身,大致对应训练时投入的算力规模;右侧调整推理档位,则不会改变模型本身,只是调整模型在推理时生成的token数量,对应推理阶段投入的计算资源。
有趣的是,这两个维度的效果会出现重叠:一个较小的模型开最高档位,有时能追平一个更大的模型开低档的表现。沿单条曲线调整档位属于推理缩放,跨模型曲线切换则属于训练缩放,两者都能提升模型表现,但同时也会推高使用成本和延迟。用户可以根据需要的精度、成本和延迟,选择使用更大的模型、调高推理档位,或是两者结合使用。
档位并非越高越好,边际效益明显递减
推理档位直接影响模型输出的长度,而输出长度和回答精度呈正相关,这一点在gpt-oss上有清晰的体现。但当档位提升到一定程度后,精度提升会出现边际递减。
比如GPT-5.6 Sol模型的曲线就非常明显:随着推理档位升高,API调用成本和代码编程表现同步提升,但到了最高几个档位后,收益变得非常有限,继续增加推理投入就不再划算了。一句话总结:将档位拨到max并不等于能得到更准确的答案,多数任务中,中间档位才是精度、成本和延迟三者的最佳平衡点。
国产旗舰模型的真实实现方案
闭源模型通常不会公开具体细节,但已经发布技术报告的开源模型,给出了经过验证的可行方案。
比如DeepSeek V4训练了三个“专家”模式:Non-think、Think High、Think Max,每个模式使用不同的上下文窗口和长度惩罚策略,最后将这些模式蒸馏到同一个checkpoint中。Think Max模式对应的system指令“Reasoning Effort: 绝对最大,不允许走捷径”看起来只是简单的prompt技巧,但实际上背后有专门的训练支撑,直接复制这条指令到其他模型上并不会生效。
Kimi K2.5采用的Toggle方法,在训练时交替使用“限预算”和“不限预算”两个RL阶段,可以将生成的token数量减少25%到30%,同时基准测试成绩几乎没有下降。更新的K3版本提供了low/high/max三档,默认使用max档位,但具体的训练细节尚未公开,需要等待官方技术报告发布。
未来趋势:自动选档与手动覆盖结合
GPT-5曾尝试推出Auto模式,试图自动为用户选择合适的推理档位,但最终效果好坏参半,后来从界面中移除了该功能。
可以预见的是,短期内推理档位仍会作为显式输入选项,大多通过system prompt传递给模型。但在Agent应用外层的控制框架或是内部路由逻辑中,会越来越多地根据任务状态、剩余预算自动推断合适的推理档位,同时保留用户手动覆盖的权利。当用户需要压低延迟、节省成本,或是需要榨干模型性能时,手动调整档位就会派上用场。


