给延迟定价

9 分钟读完

B17
运维 · 经济性与投资回报

给延迟定价。

如果有个人正等着你的智能体,那么 40 秒的 p50 延迟,花掉的是一位时薪 60 美元员工身上约 0.67 美元,而你这次任务的令牌账单大概是四分钱——于是那个慢一倍的「更便宜的模型」根本不是省钱,它是一次披着折扣外衣的十六倍成本上涨。延迟是一条成本线,它该和推理开销摆进同一张表;而一旦它进了那张表,关于选型的那些争论,会朝着所有人默认的反方向落定。麻烦在于这笔成本对秒数并不是线性的,所以你得给分段定价,而不是给平均值定价。

STEP 1

两份账单,其中一份从没人加总过。

每一次智能体任务都会产生一份你读得到的发票——令牌、工具调用、沙箱秒数——以及第二笔真实、可归属、却从未被写下来的成本:某个人花在等它上面的墙钟时间。延迟出现在可靠性仪表盘上,被当作用户体验来讨论,却从不出现在商业论证里。这就是全部的失败所在,因为一笔不在表上的成本,赢不了任何一场对上「在表上的那笔」的争论。

把一次阻塞式任务写出来,这套算术简单得叫人难堪:

wait cost per task
  = wall-clock seconds the human is blocked
  / 3600
  x fully loaded hourly cost of that human

40 s  x  $60/hr  =  $0.67
inference for the same task      ~$0.04
ratio                             16 : 1
  • 用完全负担成本,不是薪资。薪资加上雇主税、福利、设备,以及那个工位的分摊成本。对多数知识岗位而言大约是基本薪资的 1.25–1.4 倍,而用基本薪资会把整个论证说轻。
  • 发现在于那个比值,不在那个数字。任何一个令牌账单不到一美元、响应要好几秒的阻塞式交互智能体,都处在这个区间里;而这个比值随工资而动、不随模型价格而动——这意味着推理每便宜一年,它就更糟一分。
  • 这是单位经济性里缺掉的那一半。通常的模型算的是推理、平台与复核。等待时间是第四条线,而在交互式部署里,它常常比前三条加起来还大。
STEP 2

这笔成本是凸的,所以平均值在撒谎。

如果等待成本对秒数是线性的,你优化均值然后收工就行了。它不是——因为电话另一头那个人在不同时长下做的是性质不同的事,而那几个经典的响应时间阈值——大约十分之一秒、一秒、十秒——既是感知上的阈值,也是成本上的阈值。

  • 约 1 秒以内:近乎免费。人留在这次交互里。你付的只是那几秒本身,而这里几乎没什么可买的。
  • 1 秒到约 10 秒:线性。注意力被占住但不产出。上面那套算术干净地适用于这个区间,而这里的秒数也真的就只是秒数。
  • 超过约 10 秒:一级台阶,不是一段斜坡。人切换到别处去了。你现在付的是等待加上一笔重新进入的成本——把问题重新装回脑子、重读自己问过什么、判断这个答案是否还适用——这笔通常以分钟而不是秒计,而且不会因为等待变短而缩水。跨过那条线,是你的延迟做过的最贵的一件事。
  • 超过几分钟:放弃开始入场。有一部分任务再也不会被捡回来。把整个任务的价值乘以「不再续做」的比例,加进去;在长时间运行的工作上,这一项会压过其他一切——这也正是异步智能体 UX 是一项经济干预、而不是一项化妆品的原因。

凸性正是「该拿 p95 做预算、该无视均值」的原因。p50 六秒、p95 四十秒,比恒定十二秒贵得多,因为上下文切换发生在长尾里——而在一个每天跑一万次的负载上,长尾不是一个舍入误差。把分布带在身上,就像预测智能体开销对成本所做的那样;而分布本身,从度量智能体延迟那里取。

STEP 3

四种情形,而秒数只在其中两种里值钱。

反方向的错误一样昂贵:在一个没人等着的负载上为速度付溢价。花钱之前,先把每个部署归类。

  • 阻塞式交互。一个人闲着等那个答案。照 STEP 1 给秒数定价。这是「更贵、更快的模型几乎总是正确选择」的那个区间,也是它几乎从不被选中的那个区间。
  • 异步与批处理。没人在等;结果落进一个队列、一份报表或一个收件箱。秒数约等于不值钱,正确的优化是吞吐与每令牌成本。在这里买速度是纯粹的浪费——而反方向的那一步,刻意拿延迟去换批处理折扣,是多数团队留在桌上没捡的白送的钱。
  • 实时语音。延迟不只是成本,它还是一个质量输入:超过大约一秒的空气死寂,来电者就会以为线断了。而且电话那一段是按墙钟分钟计费的,所以一个慢轮次要花两份钱。见延迟预算——它用毫秒而不是美元来给这件事定价。
  • 有截止期限。一次必须在营业日之前跑完的夜间对账。延迟的成本一直到截止时刻都是零,过了那一刻则是巨大的。那是一个容量问题,不是一个速度问题——照限流与厂商容量去买并行度与余量,别去为一个更快的模型付钱。

多数组织四种都在跑,却只有一套延迟策略。那是第一件值得修的事,而它除了一次对话之外不花任何东西。

STEP 4

该买什么,按回报排序——并留意「更快的模型」落在哪儿。

一旦秒数有了价格,你就能按「每削掉一秒花多少钱」给各项干预排序。排出来的顺序,不是团队一开始动手的那个。

  • 删步骤。唯一一项同时改善两份账单的干预,也是唯一免费的一项。一个根本不跑的步骤既不占时间也不花令牌。多数智能体循环里至少有一次工具调用,它的结果从来不改变结局——见智能体成本控制。
  • 提示词缓存。同样同时改善两份账单,因为缓存过的前缀不会被重新处理:在一个长而稳定的前缀上,首令牌时间会与价格一起显著下降。这是最高回报、且不需要任何架构改动的那根杠杆。见提示词缓存。
  • 并行。把彼此独立的工具调用一起发出去而不是排队发,把彼此独立的子任务扇出。令牌一样多,墙钟少掉一截。见并行工具调用。
  • 流式输出与进度。这一项很特别,也被严重低估:它根本不降低延迟,它降低的是延迟的成本——办法是把人留在那个尚未发生上下文切换的「十秒以内」区间里。鉴于 STEP 2 里的凸性,它常常是手边能拿到的最大一笔美元收益,而它是一次前端改动。见流式与部分输出与等待与延迟 UX。
  • 一个更快或更大的模型。现在才轮到。它每次调用都要花真金白银,而它之所以是团队最先伸手去够的那一项,是因为它是唯一一个不需要工程投入的。
  • 预留容量与热池。去掉排队与冷启动,带着一条利用率下限;只有当你自己的长尾是被「等容量」而不是被「生成」主导时才值得。见预留吞吐与期限承诺与沙箱池与冷启动。
STEP 5

诚实面对速度的代价,因为其中三个把戏只是把账单挪了个位置。

削延迟不是免费的,而好几种流行做法,是从另一个文件里记着的预算里给自己找的钱。

  • 更小的模型端到端未必更快。它按令牌更快,而且常常要多走几步;一个每步 1.5 秒的二十步任务,只有在你不算那些多出来的失败时,才赢过一个每步 4 秒的八步任务。测到完成任务的时间,永远别测到首次响应的时间。
  • 跳过校验,是从错误账单里买来的秒数。砍掉一个检查步骤是手边最快的延迟收益,而它把钱挪到了出错的代价上——在多数部署里那是更大的一个账户。如果你要做这笔交换,就明明白白地做,并且逐任务类别地做。
  • 调低推理投入,是拿令牌换正确率。思考预算是一根轴上的延迟旋钮兼质量旋钮。把它拧小是正当的;把它说成一次纯粹的延迟优化则不是。
  • 路由到快模型会抬高方差。一个把八成流量送给快模型、其余升级处理的路由器,延迟分布是双峰的;而人真正体验到的 p95,是慢路径再加上那次白费的首次尝试。见模型路由。
  • 预留容量把一笔可变成本变成了固定成本。这是对你的成本结构与盈亏平衡量的一次真实改变——见固定成本与试点税——而不仅仅是一次打折。
STEP 6

仪表盘上的一行,就摆在每成功任务成本旁边。

这件事能改变决策的那个版本,是每个任务类别一个数字,用你手上已有的量算出来,坐在令牌账单旁边——而不是待在一场财务部门没人参加的可靠性评审里。

fully loaded cost per completed task
  = inference + tools + platform          # the invoice
  + (p50 blocked seconds / 3600) x loaded rate
  + P(wait > 10s) x re-entry cost
  + P(never resumed) x value of the task
  • 按任务类别算,绝不混算。同一个智能体,服务一个交互界面和一个夜间批处理,会有两个完全不同的数字;而那个混算出来的数,会给两边都推荐错的模型。
  • 重新进入的成本,就照这里其余东西的办法来取——从十个真实案例里。问五个人:当智能体花掉三十秒时他们会做什么,以及他们要多久才把那件事捡回来。一个下午你就能拿到一个可用的数字,而且它站得住脚——这已经胜过眼下那个隐含的「零」。
  • 把「不再续做率」当作一等公民的计数器来追。按类别统计中途被放弃的会话。它是离散度最大的那一项,也是没人插过桩的那一项。
  • 每次换模型后重新推一遍。一次换模型会同时挪动两栏,而且几乎总是朝相反方向。有这个数字的全部意义,就在于让那笔交换变成算术而不是口味——这与衡量投资回报对周边模型所作的论证是同一个。

这一周做那个两小时的版本。挑出你流量最大的那个交互式任务类别,从你本来就有的追踪里拉出被阻塞秒数的 p50 与 p95,乘以一个你们财务部门认的完全负担时薪,再把结果放进与每成功任务成本同一张表里。在多数交互式部署里,等待那一行会比令牌那一行大出一个数量级;于是两个决定会立刻翻转:那个更快的模型显然值得买,而把输出做成流式,成了板上回报最高的那项工程任务。相关:成本、质量与延迟(那个三角)、度量智能体延迟(分布的来处),以及人工复核的成本(一个人的时薪进入你智能体经济性的另一个入口)。