固定成本与试点税

9 分钟读完

B16
运维 · 经济性与投资回报

固定成本,以及试点为什么看起来贵得离谱。

智能体是被当作纯可变成本卖出去的——每个任务几分钱,随用量线性增长——而这个模型错的方向,恰好会杀死本来不错的试点。一个生产环境里的智能体背着一笔不随流量变动的常备账单:索引、评估套件、追踪留存、复核值班、工程值班。在试点体量下,这一层就是花销的大头;于是"每月 300 个任务"下算出来的"每任务成本",不过是披着可变成本外衣的固定成本读数,而团队会照着它把项目砍掉。先把账单拆开,再去做除法。

STEP 1

按令牌计价的模型是可变成本模型,而在低量时它是较小的那一半。

每一份厂商测算表、每一份内部商业论证,以及关于智能体经济性的多数建议,算的都是同一个量:消耗的令牌乘以单价,或许再加上按席位计的平台费。这个数字是真的,它也确实随用量线性增长——而在试点阶段,它通常只占这套部署实际花销的少数。

原因是结构性的。凡是让一个智能体不只是"能用"而是"可信"的东西,几乎都是一次性配置好、然后不论有没有人用都照付的。你不会因为在做试点就买半套评估集;向量索引不会因为流量清淡而缩水;那位必须随时能处理队列的复核员,在队列是空的时候同样得在岗。

  • 判断一笔支出属于哪一行,只需一个问题:如果这个月流量减半,这笔账单会减半吗?推理花销会。清单上其余几乎没有一项会。
  • 按席位定价是固定成本,不是可变成本,哪怕它是按用户报价的。它随人头按季度变动,而不是随用量变动——这意味着在试点期间,它的行为和一份许可证完全一样。
  • 错的不是乐观,而是归类。团队对令牌单价的判断没有错;他们是把一个同时含有两类成本的总额,除以了一个只对其中一类成立的任务数。它所依附的每任务口径,见单位经济性。
STEP 2

把六条常备成本线点出名字,否则它们都会被算到模型头上。

问题很少出在"这些成本没人知道"。而是它们被记在了别处——记在平台下、数据下、某个人的人头预算下——于是智能体的每任务成本,会依照分摊落在哪一边,看起来要么便宜得不可思议,要么贵得说不清。

  • 检索与记忆基础设施。向量库或检索集群、嵌入流水线,以及两者底下的存储。它是按语料规模和延迟要求来配的,不是按查询量,所以每月 300 个任务和 30,000 个任务花的钱一样多。重新嵌入这类事件也算在这里——见重建索引与嵌入迁移。
  • 评估套件。评估集每跑一次 CI,都是你要付钱、而没有任何客户要求过的推理,其成本由集合大小和跑动频率决定。它怎么失控见评估的成本;在这里要紧的是:它和生产流量完全脱钩。
  • 追踪存储与留存。智能体的追踪很大,而一个由合规而非工程设定的留存期,会把它变成一笔拖着数年尾巴的常备账单。追踪采样与留存是那根杠杆,也是少数几条你真能调的固定成本线之一。
  • 预置或承诺容量。当你为了拿到延迟保证或速率下限而买下吞吐的那一刻,你就是有意把一笔可变成本换成了固定成本。这常常是对的,但它绝不是可变的。见预置吞吐与承诺用量。
  • 复核的最小排班。人工复核通常是按件建模的,但排班不可细分:工作时间内覆盖一条队列,下限就是一个人,而只要量大于零,这个下限就得照付。
  • 工程值班。一个跑在生产里的智能体,需要有人值班、有人处理厂商下线、有人在换模型后重跑评估。这在多数部署里是最大的一条固定成本线,也是商业论证里最常被整条略去的一条。

把这六条给一个典型的首个生产级智能体老实加一遍,固定层在一个任务都还没跑之前,大约落在每月 8,000 到 30,000 美元之间——而且被最后一条主导,因为一名工程师比其余所有加起来还贵。这算不算多,完全取决于量——这恰恰就是重点:它是一个完全说明不了你的智能体效率如何的数字。

STEP 3

每任务成本是一条双曲线,而试点正坐在它糟糕的那一段上。

把它写出来,问题的形状立刻就清楚了:

cost per task = fixed / N + variable per task

N = 300      fixed 15,000 -> 50.00 + 0.40  = 50.40 per task
N = 5,000    fixed 15,000 ->  3.00 + 0.40  =  3.40 per task
N = 50,000   fixed 18,000 ->  0.36 + 0.40  =  0.76 per task
  • 同一套系统、一字未改,每任务成本在这个区间里横跨两个数量级。没换模型,没调提示词,什么都没变得更高效。动的只有 N。
  • 在 N = 300 时,你量的是自己的固定成本。那个 50 美元里 99% 是摊销。拿它去和"人做一次 12 美元"比,比的不是智能体和人;比的是"一笔固定成本除以一个很小的数"和"一份边际工资"。
  • 试点阶段诚实的指标是盈亏平衡量,不是每任务成本。"每月超过 4,100 个任务后,这比现状更便宜"是一句够格拿去做决定的话;"它每任务 50 美元"不是——而后者已经杀死过一些在生产体量下本来能赚钱的部署。
  • 反过来的错误在规模上同样常见。每月跑 20 万个任务的团队,会看到固定成本消失在小数点后第三位,于是不再跟踪它——直到某个季度他们加了第二个地域或一档合规留存,"固定"这一行翻了一倍。
STEP 4

固定层是一段楼梯,不是一条直线。

把固定成本建模成一个平坦的月度数字,比忽略它好,但仍然是错的,因为它是阶梯式跳动的——而每一级台阶的触发因素,都不是流量。

  • 第二个值班人。由覆盖时段的预期触发,不由流量触发。它通常是任何智能体部署会迈出的最大一级台阶,而且它到来的时刻是第一份 SLO 被写下来的时候,不是用量长上去的时候。见 SLO 与错误预算。
  • 一档留存等级。由一次合规评审或一份客户合同触发。把追踪留存从 30 天改成 7 年,存储账单变化的倍数,与你跑了多少任务毫无关系。
  • 第二套环境或第二个地域。由数据驻留要求或预发环境的强制要求触发。它会一次性把固定层的大部分复制一遍——索引、留存、容量下限——却不增加任何你需要的容量。这件事在智能体的预发环境里拍板。
  • 一次模型迁移。由厂商下线触发,按他们的日历走。它的代价是一整轮评估重跑、提示词工作和一个重新验证周期,而这些都不会按你那个月恰好跑了多少任务去摊销。模型下线与迁移是一笔扮成事故的周期性固定成本。

按触发条件来预测这些台阶,而不要把它们抹平成一个增长率。一份写着"固定成本每季度增长 4%"的预算,会连着对两个季度,然后在审计落地的那个季度错上 60%。这和预测智能体开支对可变成本长尾所用的,是同一套纪律。

STEP 5

自建还是外购,问的是你想要哪一类成本。

这个拆分,把一个团队通常按功能去争的决定重新框定了。从经济学上说,托管平台是一台把你的固定成本转换成别人的固定成本、再向你收一份毛利的机器。这笔交易划算还是不划算,完全取决于你坐在曲线的哪一段。

  • 在盈亏平衡点以下,买几乎总是对的——不是因为平台更好,而是因为你在租一层你填不满的固定成本。在一笔不大的可变账单上付 3 倍溢价,好过为一层你只用得上 4% 的固定成本付 100%。
  • 越过那个点,算术就反转了,而溢价现在是加在一个很大的数字上。这才是自建 vs 外购的实质内容,而交叉点可以从这两条线算出来,不必靠偏好去争。
  • 当心平台吸收不了的那些固定成本。买一个运行时,买不来评估套件、复核排班,也买不来那位对这东西负责的工程师。厂商是对着可变成本那一行报价的,因为那是他们替你顶掉的那一行;最大的那笔固定成本,无论如何都还在你这儿。
  • 缩减规模不会让你沿原路退回来。流量减半只会让可变的那一半减半,别的都不动,于是每任务成本上升。收窄智能体范围的团队常常震惊地发现它的单位成本反而变贵了——这正是缩减智能体部署里几个陷阱背后的机制。
STEP 6

用两个数字加一个阈值来汇报。

汇报方式的改动很小,而它正是让决定得出正确结论的东西。一行变成三行。

  • 每月固定、每任务可变,以及盈亏平衡量。每一套智能体部署都该带着这三个数字,而评审应该先问第三个再问第二个。阈值才是回答"这东西该不该存在"的那个数,另外两个都不是。
  • 报每任务成本时把摊销拆出来。"每任务 3.40 美元:其中 3.00 为摊销固定成本,0.40 为边际成本"能整类地避开本页讲的这种错,代价只是多一列。
  • 显式跟踪固定层的利用率。用每月任务数对比"你现有固定层本可以服务的量"。跑在一份预置承诺的 6% 上是一个发现,而它在任何每任务指标里都看不见。
  • 每次出现台阶式变化之后重算这个拆分,而不是按周期重算。新增一个地域、改一次留存、加一名复核员——每一件都会移动盈亏平衡量,而一个自试点以来没人重算过的阈值,比没有阈值更糟。
  • 别让固定成本藏进"平台"里。一个笼统的科目,正是评估套件、索引和值班从此彻底无人管理的方式。哪怕金额还小也要拆出来;会跳台阶的正是它们。

下次试点评审之前,挑一套部署做这件事:把六条常备成本线各自列出一个月度数字,旁边放上每任务可变成本,然后解出"总额优于现状"所需的量。然后拿盈亏平衡量去汇报,别再拿每任务成本。多数试点里这两个数字讲的是相反的故事,而一直被拿去汇报的那个,恰恰撑不起一个决定。延伸阅读:度量 ROI 看这个阈值往下接到哪里,经济性失败模式看商业论证还会怎么出错,智能体成本控制看在固定那一半诚实之后如何压缩可变的那一半。