推理档位就是一句提示词——但这句提示词背后,是训练管线在替你兜底
Site Owner
发布于 2026-07-23
Sebastian Raschka 7 月 22 日的长文把 Codex/Claude Code 界面里那个推理档位拆了个底朝天——一句话 system prompt 加上训练管线的 RLVR 长度惩罚与 SFT 档位对齐,是这个看似玄学的下拉菜单背后的全部真相。
推理档位就是一句提示词——但这句提示词背后,是训练管线在替你兜底
2026年7月22日,Sebastian Raschka 写了一篇长文,把 Codex、Claude Code、Kimi Code 界面里那个你每天都在拨的推理档位,拆了个底朝天。
结论很反常识:你拨的不是什么复杂开关,就是往 system prompt 里塞了一句话——“Reasoning effort: low / medium / high”。
但这句话能起作用,因为一群人在训练阶段已经替你铺好了整条管线。RLVR 的长度惩罚、SFT 的档位对齐样本、DeepSeek V4 的三个专家——这些东西在你拨动滑块之前就已经就位了。
你以为自己在调引擎,其实你只是踩了一脚油门。齿轮比、悬挂阻尼,工厂里早就设定好了。
推理模型的本质:把草稿写出来
先回到一个更底层的问题——推理模型到底在干什么。
DeepSeek-R1 的训练配方是这个领域最干净的例子。训练时,模型拿到一道数学题,走一遍思考过程,最后给一个答案。评分环节,只给最终答案打 0/1 分——答对 1,答错 0。中间的思考草稿,不看不评不打分。
用 RLVR(Reinforcement Learning with Verifiable Rewards)术语说:reward 信号只锚定在可验证的输出上。数学题用 SymPy 验算对错,代码题跑单元测试,就这么简单粗暴。
诡异的事发生了。
模型自己发展出了“等一下,这里好像不对”的自我纠错行为。DeepSeek 团队管这叫 Aha moment。不是预设的规则,不是 prompt 里教的技巧,纯粹是奖励最终答案带来的副产品。
RLVR 像一个只批改作业不批改草稿的老师——学生为了拿到那个“对”字,自己琢磨出了打草稿、检查、再改这一整套习惯。
这个机制有个前提:领域必须能自动核对对错。数学可以,代码可以,但“这篇文案写得好不好”就不行,因为“好”是模糊的。
档位是一句话,但有两条管线在撑
说回档位。
从 OpenAI 开源的 gpt-oss 代码里能直接看到:档位确实是通过 system prompt 控制的。实际请求前缀会被加上“Reasoning effort: low/medium/high”。
但“一句话就能生效”这件事,是以大价钱换来的。
Sebastian Raschka 的推测是两条路线在背后起作用——注意,Claude 的具体细节没公开,这部分是作者基于 gpt-oss 和 DeepSeek 公开资料的推断。
路线一:RLVR 阶段加长度惩罚
训练时,对 low 档位样本的 token 输出量罚得重——你多写一个字就扣分。对 high 档位几乎不罚——你爱写多少写多少。模型在 reward 的压力下学会了:看到“low”就少写,看到“high”就放开了写。
路线二:RLVR 之后再补一轮 SFT
收集 RLVR 产生的高质量轨迹(long-chain reasoning 和 short-chain 的都有),喂给模型做监督微调。样本里标明了“这道题按 low 思路解”“那一道按 high 思路解”。模型就这样把档位标签和篇幅、深度绑定在一起。
DeepSeek V4 的做法更激进。直接训了三个专家:Non-think、Think High、Think Max。每个专家用不同的上下文窗口、不同的长度惩罚,最后蒸馏进同一个 checkpoint。你切换到 Think Max,system 指令写的是“Reasoning Effort: 绝对最大”,看起来中二,但背后对应的是一个专门训出来的专家权重。
你觉得档位只是个界面 UI,实际上每次拨动都在调用不同的训练成果。
两个旋钮,两条曲线
GPT-5.6 的界面把这件事说得最清楚。
左边选 Luna / Terra / Sol——换模型,改训练算力,权重不一样。
右边调推理档位——不改权重,只改推理算力,同一套参数里压出不同表现。


