思考令牌按输出费率计费——对一个不需要它的任务,自适应 `effort: high` 会让账单变成原来的 3–5×,答案却毫无变化;决策规则是经验的,不是原理的。
到 2026 年,每家主要厂商的推理 API 都提供 effort(Claude)/ thinking_level(Gemini)/ reasoning_effort(OpenAI)旋钮。默认答案是"就用 medium 吧"。这个默认很贵——思考令牌按输出费率计费,而在延迟敏感的路径上,medium 会让延迟预算翻倍,质量却毫无可测提升。本章讲一份经得起真实成本表检验的决策规则:哪些任务类别真的从思考中受益、哪些在思考上烧钱,以及在你为某个设置背书之前如何在你自己的流量上度量差异。读完之后你会拿到一份按任务类别的思考策略,并明白"默认 medium"为什么是最贵的错。
三家的旋钮。
2026 年每一份主流推理 API 都以不同名字暴露同一个抽象旋钮。Claude 叫它 effort,档位是 low、medium、high。Gemini 叫它 thinking_level,同样三档,另加一档 none 用来彻底压掉推理。OpenAI 叫它 reasoning_effort,档位是 minimal、low、medium、high。三家背后的心智模型一致:这是一个提示,运行时据此在给出可见答案之前,分配数量可变的隐式推理令牌。自适应思考与努力度预算深入解析走一遍内部机制;对本章而言你只要知道:这个旋钮是提示、不是合约,模型有权在它不认同你对任务的定框时,花掉比档位建议更多或更少的令牌。
更早的接口——Anthropic 的 budget_tokens——按 2026 年规范已被废弃,因为它逼作者去思考令牌记账,而不是他们真正在乎的结果。档位抽象是更好的形状,但它藏了一个值得点名的运维事实:思考令牌按输出费率计费。在 Claude 上这意味着每个隐式推理令牌与一个可见输出令牌同价,而当一项任务模型在 effort: low 下就干净利落地完成时,effort: high 就是一次让账单里输出令牌那一行直接增到 3–5×、答案质量却毫无变化的操作。这个事实——加上 推理 vs 非推理模型 关于那些令牌实际在做什么的心智模型——就是接下来各节里那份决策规则的全部依据。
从思考中受益的任务类别。
当任务具有一条可核验的中间步骤链,而模型没有它常常会把最后一步做错时,思考就值它的价。推理何时有用深入解析细讲完整分类学;这里给出一份短名单——medium 或更高档能挣回账单钱的类别,各家一致而紧凑。
多步逻辑与形式化推理——证明、SAT 形状的约束题、多跳演绎——是范式案例。草稿空间就是答案。在这些类别上把 effort 关掉,会让准确率明显、可预测地下滑,而多出的延迟买到的是一次真实的质量胜利。带一步以上的数学也归入此处:单步算术不受益,但任何一处中间步骤出错就会传播到最终答案的问题都受益。如果你能给中间步骤打分,而模型在开着 effort 时明显做得更对,就把它留着。
带测试的代码生成是次清晰的胜利。任务是生成一个"其行为被一套可运行测试套件校验"的函数时,medium 或 high 让模型在给出最终稿之前,先在自己对这些测试的心智模型上迭代。在智能体化代码外壳上——工具调用一章覆盖的那种——这经常意味着整条循环里 编辑—运行—修 的往返更少,即便每一步更贵,跨越循环的总体令牌开销反而下降。有一处升级值得盯着:如果你发现模型在只需一次简单 lint 修复就够的步骤上花了 high 档思考,就往下调。
带信用分配的智能体工具循环是第三类。当模型必须在若干工具里挑一个来调、然后在选下一步之前对上一次调用的结果做推理时,思考令牌帮它把这条链维持住。这就是为什么长视野的研究智能体与浏览器智能体(见 r2 生产中的计算机操作)常常带着 effort 上线:与在五跳之后选错工具的代价相比,那点增量成本很小。
在思考上烧钱的任务类别。
更大的面——也就是团队在第一次成本复盘时最容易被打个措手不及的那一大片——是这样一组类别:思考大约帮不上忙,成本却翻了三到五倍。这些是烧钱的默认档,每一个都是"就用 medium"变成"所有档位里最贵那一档"的地方。
抽取式问答是头号大户。当答案就是提示里的一段——"这封邮件里客户的账号是什么"——模型一遍注意力就找到了,任何多出来的思考都花在给一个已经对的第一版答案自我否认上。以抽取为主的生产流量,从 medium 换到 off 通常能把每次调用成本降到 1/3,而在金标集上无可测回归。
按固定结构给结构化输出是第二类。任务是"把这段自由文本转成如下 JSON 形状"时,那份 schema 就是推理,而模型本就把它确定地套用。在这里思考令牌反而可能拖后腿,因为它们偶尔会怂恿模型现场改动 schema。如果你的 JSON 校验器在 medium 下退回响应比在 off 下更多,那多出的推理就没花在你所要求的事情上。
多数分类任务属于同一大家族。情感、意图、类别——但凡标签集小、输入短的都算。2026 年的分类任务努力度曲线数据毫不含糊:对绝大多数生产分类器来说,质量在 medium 以下就已平台化,成本曲线却继续上扬。摘要、短段翻译与简单改写把名单凑齐。这些任务都没有让思考挣钱所依赖的"可核验中间步骤"属性。
如何在你的流量上度量差异。
上面的分类学是一份强先验,但每一份生产流量都有它自己的怪癖,为一个设置背书的正确方式是在你自己的数据上先度量再拨。度量本身是一次小 A/B:把一批采样过的生产输入在两档 effort 下重放一遍,把输出对着一个固定评判器或一份金标集打分,再拿质量差和成本差做比较。
# A/B replay — 500 sampled prompts, one task class at a time config: class=customer-email-classification, n=500 setting A: effort=off -> cost=$0.42 latency_p50=380ms quality=0.94 setting B: effort=medium -> cost=$1.61 latency_p50=920ms quality=0.94 delta: cost x3.8 latency x2.4 quality +0.00 decision: effort=off wins (no quality gain, 3.8x cost, 2.4x latency) config: class=multi-hop-reasoning-audit, n=500 setting A: effort=off -> cost=$0.61 latency_p50=440ms quality=0.71 setting B: effort=medium -> cost=$2.30 latency_p50=1180ms quality=0.89 delta: cost x3.8 latency x2.7 quality +0.18 decision: effort=medium wins (quality gain justifies cost)
两条经验能让读数更快。质量差在 5% 以下、成本差在 2× 以上时,off 默认赢——把 effort 留给差值越过噪声底的类别。质量差在 15% 以上时,几乎肯定 effort 值得,问题就变成 medium 与 high 谁赢——那是同样形状的第二次 A/B。介于两者之间就是一次生意决定:这个类别上一个百分点的质量值多少?对一个欺诈检测分类器来说答案可能是"什么成本都行",对一个批量邮件打标签来说答案是"不多"。把数字推给 s2 成本与延迟里那份成本与延迟预算,由它来定。
一份按任务类别的思考策略。
上面这一轮练习的产出,就是一份策略——在你的代码拨旋钮之前查阅的一张表。把它写明白、跟你的提示词一起做版本、每次厂商放出新的模型档次或你注意到底层流量分布已经漂移时,就回过头重看一次。给一个可运行的例子,写成配置。
# thinking_policy.yaml — per-task-class effort settings
# reviewed monthly; A/B evidence linked in each entry
policies:
- class: customer-email-classification
effort: "off"
evidence: "ab-2026-06-14 (dcost 3.8x, dquality 0.00)"
- class: invoice-json-extraction
effort: "off"
evidence: "ab-2026-06-14 (dcost 4.1x, dquality -0.01)"
- class: contract-clause-classification
effort: "low"
evidence: "ab-2026-06-21 (dcost 1.6x, dquality +0.06)"
- class: coding-agent-step
effort: "medium"
evidence: "ab-2026-06-28 (dcost 3.1x, dquality +0.14)"
- class: multi-hop-reasoning-audit
effort: "medium"
evidence: "ab-2026-06-14 (dcost 3.8x, dquality +0.18)"
- class: fraud-triage
effort: "high"
evidence: "ab-2026-07-05 (dcost 5.2x, dquality +0.22)"
default_effort: "off" # fail closed on cost, not on capability
其中三条性质是承重的。默认是 off,不是 medium——新的任务类别从便宜起步,只有当一次度量为它挣到升级时才升级。evidence 字段是必填——一条不带链回 A/B 的条目就是一次猜,而猜有一种本事,会随着时间陈化为"我们一直是这样做的"。策略是有版本的——新的模型档次上线时,把同样那些 A/B 重放一遍,更新档位。厂商在不同发布之间会更改 effort 到隐式令牌的映射,一份按上季度模型校准的策略,可以在一个月内无声漂进"贵而多余"或"便宜而错"。
你要带走的框架是:effort 是按任务类别的旋钮,不是按应用的默认。2026 年把推理账单管住的团队,不是选对了档次的那批——他们是给每个类别选了不同档次、并能指着一次度量为每次选择背书的那批。其余人在交"默认 medium"税,还称之为经营成本。