价格通缩与每任务成本

9 分钟读完

B14
运维 · 经济性与投资回报

令牌价格在崩塌,你的账单却没有,因为通缩发生在一个你并不购买的单位上。

前沿模型的输入令牌,如今大约只要 2023 年 3 月 GPT-4 价格的六分之一;一个够用的便宜模型更是只要三百分之一——可几乎没人的智能体因此便宜了六倍,因为同样这三年把"每任务令牌数"乘上了一个差不多量级的倍数。你买的是完成的任务,不是令牌,而那个单位几乎没被通缩碰到。把这件事想清楚,决定了哪些成本工程值得做、一份容量承诺究竟是省钱还是下注,以及你的 ROI 模型该把哪个数字当作不确定项。

STEP 1

通缩是真的、幅度很大,而且短期不会停。

先从没有争议的那部分说起。GPT-4 于 2023 年 3 月上线,每百万输入令牌 30 美元、输出 60 美元。到 2026 年 4 月,Gemini 3.1 Flash 的标价是 0.10 与 0.40 美元——输入端相差三百倍,而这个模型在几乎所有真正会被部署的事情上都胜过 2023 年的前沿。跟踪前沿标价的指数把 2026 年 8 月放在 2023 年 3 月水平的八分之一附近。无论你用哪一套序列,这个方向已经在所有厂商身上保持了三年。

值得拿来做计划的预测,比历史要平淡。2021–2025 年那种每年 10 倍的下降,来自一叠一次性的胜利——更好的算子、量化、专家混合路由,以及跑马圈地的价格战——而可信的预测把接下来到 2027 年放在每年 3–5 倍,随后收敛到 1.5–2 倍。就算取悲观那一端,一份固定能力的价格也大约每十八个月腰斩一次。

有两个价格在以两种速度移动,把它们混为一谈是这类分析里最常见的错误。一份固定能力水平的价格跌得很快。当下前沿的价格几乎不动:2026 年 8 月,Claude Opus 5 的标价是每百万令牌 5/25 美元,GPT-5.6 Sol 是 5/30 美元——与 GPT-4 在 2023 年的输入价同一个量级。通缩是你靠往下挪一档去捕获的东西,不是会自己寄到你门口的东西。

STEP 2

发生通缩的那个单位,不是你消耗的那个单位。

你的财务不买令牌。他们买的是被解决的工单、被合并的 PR、被对平的发票。而在令牌与完成的任务之间,横着一个倍数——它增长的速度,大致就是价格下跌的速度。

  • 就同一件名义上的工作而言,智能体式工作流烧掉的令牌是单次对话补全的 5–30 倍,这是 Gartner 2026 年 3 月的估计——循环每一步都在重发整段记录,也就是智能体成本控制推演过的那笔平方级的账。
  • 推理模型又加了第二个倍数。思考令牌按输出计费,而输出正是贵的那一侧。一件 2023 年只要 800 个令牌答案的任务,如今可能要 8,000 个令牌的思考再加一个答案——而且它往往更准:你是在用同一个行项目价格,买一个不同的、更好的产品。
  • 编程智能体是极端情形。一次有代表性的 50 轮会话,建模下来大约是一百万输入令牌对四万输出令牌,输入输出比接近 25:1,输入承担了约 85% 的成本——而同一任务类的运行间方差可达 30 倍。

把两个趋势放进同一句话,结论是:确实在通缩,但不是定价页上那个倍数——便宜 10 倍的令牌乘上胃口大 10 倍的工作流,等于原地踏步。真实部署落在这两极之间,这也是为什么诚实的计划陈述是"我们的每成功任务成本去年下降了 40%",而绝不是"令牌便宜了 90%,所以我们的成本也是"。

STEP 3

成本工程会折旧,可靠性工程不会。

这是那个在运营上真正有用的推论,它会改变你的团队该干什么。任何以令牌计价的优化,都是一份以通缩速率贬值的资产。一个今天省下 30% 开销的提示词压缩项目,省下的是一个两年后只剩三分之一大小的数字的 30%。与此同时,提升成功率的那类工程会保值,因为它动的是"每成功任务成本"的分母,而市场上没有任何东西会侵蚀它。

  • 回本期测试。只有当一项纯令牌优化的回本期明显短于它所作用的那个价格的腰斩周期时才立项——按当前速率,大约是十二到十八个月。一个六周做完、三个月回本的项目没问题。一个耗时两个季度去削上下文的工程计划,通常输给"什么都不做,等着"。
  • 结构性的节省能活下来,增量式的活不下来。提示词缓存、把高频步骤路由到便宜模型,以及干脆不调模型,都是结构性的:它们改变工作负载的形状,并在价格移动之后继续付息。手工把一段提示词抠掉 400 个令牌是增量式的,会过期。
  • 可靠性会与通缩叠加复利。把一类任务的成功率从 70% 提到 85%,每成功任务成本约降 18%,同时削掉人工复核与返工的开销——而那条线完全不通缩,因为它是以工资计价的。

反过来的一面也值得直说:通缩不是可以粗心的理由。一个失控的循环今天该花多少就花多少,而钱包耗尽攻击不会等下一次降价。上限与熔断属于可靠性工作、不是成本工作,它们归在前一类里。

STEP 4

一份期限承诺是一次有方向的下注,你该知道自己押的是哪一边。

预留容量、预置吞吐量和年度消费承诺,做的都是同一件事:把一个浮动价格换成一个固定价格。而在一个浮动价格已经连跌三年的市场里,那是在做空一个趋势——你答应用今天的费率去付明天的用量。

  • 为它们真正交付的东西去买:你能对客户承诺的容量、高负载下的延迟下限,以及数据处理条款。这些都是实实在在的商品,值得付钱。
  • 别把它们当作省钱来买,除非折扣同时越过两道门槛:预置吞吐量与容量承诺算过的那个利用率打平点,以及合约期内的预期降价幅度。两年期打七折,若标价在十八个月内腰斩,就输给什么都不做。
  • 把模型锁定单独计价。长期承诺更大的代价通常不是钱——而是它会在一个每季度都发布明显更好选项的市场里冻住你的模型选择;而你能为账单做的最便宜的事,就是换到一个用更少步数就能收尾的模型。
  • 优先要短期限与重新议价条款。一份挂钩公开标价、带重新定价触发条件的一年期承诺,开口去要几乎不花什么成本,却能去掉大部分下行风险。
STEP 5

把价格路径写下来,因为它现在是一个隐含假设。

大多数智能体的商业论证里都藏着一个从没被说出口的价格假设:单位成本在这个模型的整个生命周期里维持在今天的水平。而这恰恰是我们能有把握说它是错的那一个输入项,并且它通常错在对你有利的方向——这意味着那些因成本被否掉的商业论证,是被一个没人替它辩护过的悲观输入否掉的。

  • 建三条路径,不是一条。持平(不再下降)、中性(固定能力每 18 个月腰斩)、快速(每年腰斩)。如果项目只在快速路径上过线,那它就是一次对市场的下注,应该由某位够级别的人点头来下。
  • 套用路径时把能力水平固定住。通缩说的是你今天用的模型变便宜、或被一个同等质量的更便宜模型取代。它不适用于你"明年要升级到届时最好的那个"的打算——那是另一条大致持平的线。
  • 把令牌增长项显式带上。你自己的历史里就有:按季度测量每成功任务的令牌数。在多数部署里它一直在涨,因为智能体变好之后,步数更多、工具更多、上下文更多。
  • 设一个重估触发条件,而不是一个重估日期。"当主力模型的标价变动超过 30%,或每任务令牌数变动超过 30% 时,我们重做这份模型。"这两个量都能从你已经为成本归因而采集的数据里看出来。

预测的机械部分——任务类组合、p95、为何均值系统性偏低——在预测智能体开销里。这一步只是补上那一页固定住的那一项:价格本身。

STEP 6

一块经得起价格变动的仪表盘。

未来两年最会误导你的指标是"开销",因为它会同时因为四件互不相干的事而移动——用量、任务组合、令牌增长和价格——而一条平坦的开销曲线能把其中任何一项的严重恶化盖住。改盯比值。

  • 按任务类、按月的每成功任务成本。首要数字。"成功"意味着通过了你的评估,而不是返回了一个响应——这正是单位经济学的全部论点。
  • 按任务类的每成功任务令牌数。你能控制的那一项。如果它涨得比价格跌得还快,那就是你的工程输给了你自己的功能迭代速度。
  • 实际付出的混合每百万令牌价。它揭示你捕获了市场通缩的多少。如果标价在跌而它是平的,说明你把所有东西都跑在前沿档上,而这里有一个比任何提示词改动都值钱的路由机会。
  • 把人的那条线单列。复核、上报与返工是以工资计价的,不会通缩;随着令牌变便宜,它会变成账单的大头,并最终成为唯一值得优化的东西。

这个季度只做一件事:把上个月的模型开销除以上个月成功完成的任务数,按任务类分开算,再把这个数字和一年前的同一个数字并排放着。如果它下降的幅度没有至少追上你主力模型标价的跌幅,那道差额就是你的令牌增长——而那是一个你能控制的工作负载,不像价格。然后用三条价格路径重跑一遍商业论证,标出它需要的是哪一条。

延伸阅读:衡量投资回报讲同一个比值的价值侧,小模型与本地模型讲通缩最陡的地方,收缩一次部署讲当一类任务在任何价格路径上都过不了线时该怎么办。