人工复核的成本:模型变好,也不会让它变小。
在多数已上线的智能体上,复核者的开销是 token 的十到五十倍,而这是成本模型里唯一一条不会随智能体变好而缩小的开销——因为复核者连那些正确的输出也得读一遍。准确率买到的是更小的返工账单,不是更小的检查账单。唯一能真正消掉复核成本的杠杆,是拿测得出来的证据决定:哪些输出根本没有人去看。
把复核者放进单位成本,并按你真正付出的工资计价。
智能体的成本模型都是由盯着 token 计费表的人写的,所以里面只有 token 账单,写到那儿就停了。然后有人问:为什么部门预算里从来没出现过这笔节省?答案就坐在一条谁也没算过成本的复核队列里。
把它写下来,算术一点也不微妙。假设一项任务智能体花 0.40 美元的 token 完成,由一位综合成本 75 美元/小时的专家复核:
- 六分钟复核就是 7.50 美元。模型占这项任务交付成本的 5%,人占 95%。把 token 单价砍半,单位成本变动 2.5%;把复核时间砍半,变动 47%。
- 复核者的级别通常高于执行者。智能体往往替掉的是初级的生产环节,留下的是高级的检查环节,所以哪怕人头减少了,一项任务上挂的平均工资也可能反而上升。原本一位 45 美元/小时的分析师从头做到尾,现在换成一位 110 美元/小时的经理来复核智能体的版本,你等于把工作挪给了更贵的人。
- 复核在每一份输出上都要付,无论成败。错误答案的返工成本按错误率支付;检查成本则在 100% 的输出上支付。仅这一条区别,就决定了质量提升时这两笔成本的走势完全不同。
- 排队时间也是成本,哪怕没人在干活。一份等了九小时才轮到复核的输出,周期时间就是九小时;在任何结果要接上下游期限的工作流里,客户体验到的正是这段延迟。而按 异步智能体体验所讲,这也正是"复核所需的上下文"衰减掉的地方。
衡量智能体投资回报把留在循环里的人当作一个要扣除的项。本页要做的是把这一项好好定价,因为在多数落地里它并不是对模型的一点修正——它就是那个模型,而 token 那一行才是舍入误差。
为什么换个更好的模型,并不会削减你的复核账单。
这是反直觉的那部分,也是决定一个智能体项目能不能回本的那部分。团队做规划时默认:准确率从 85% 爬到 95%,人力成本就会跟着错误率一起下降。它不会——因为复核者没法在不读的情况下分辨哪些属于那 95%。
- 检查成本是输出体量与可验证性的函数,不是正确性的函数。一段 40 行的补丁,无论对错,读起来花的时间差不多。错误率决定的是你要额外支付修复成本的频率;它决定不了那次阅读。
- 准确率更高,反而可能让单件复核更慢。错误一旦稀少,也就更出乎意料,而一个连着看了二十份好输出的复核者,是比看了五份坏输出的复核者更差的探测器。你失去了那条廉价启发式——明显的垃圾——只剩下昂贵的那条:真去验证。
- 剩下的错误只会更难,不会更容易。强模型留下的失败,是那些看着合理、格式良好、内部自洽的失败。它们每一件都更吃复核者的分钟数,也更可能活着穿过复核——这正是经济性在何处崩溃里"无声失败税"背后的机制。
- 于是节省曲线变平的位置,恰好是营销曲线变陡的位置。从 70% 正确做到 85%,价值极大,因为它消掉了返工。从 92% 做到 96%,省下一点点返工、以及零检查——而检查才是贵的那一半。
它落地的形式是:把每完成一项任务所耗的复核分钟数当作一等运营指标来跟踪,摆在智能体单位经济学里的"每个成功任务成本"旁边。如果它跨越两次模型升级都纹丝不动,你学到的是:你的复核流程对质量不敏感——这是关于流程的信息,不是关于模型的。
让输出变得便宜可查——这是你能掌控的那根杠杆。
在试图消掉复核之前,先让它变快。同一份工作换两种呈现方式,复核时间可以差出五倍,而差别全在于:智能体替复核者把多少验证工作先做掉了。
- 交差异,不要交文档。检查"改了什么"的人,读的东西只是检查"整件产物对不对"的人的一小部分。如果任务确实要产出一份全新的产物,就按模板产出,让新增的段落在视觉上一眼可辨。
- 把证据就近贴在论断旁边。一句带引用的话几秒就能核;同一句话把参考文献堆在文末,就要几分钟。接地不只是一项准确性技术,它是你手上最大的一根复核时间杠杆——见幻觉与接地。
- 把工作的颗粒度切小。复核时间随输出体量的增长快于线性,因为把一大件产物端在工作记忆里才是贵的那部分。总量相同的情况下,四件小的也胜过一件大的。
- 能结构化的就结构化。机器能校验的字段,永远不该送到人面前。schema 合法、算术能对上、链接解析得开、日期落在范围内——把这些全部在前置检查里烧掉,好让复核者把注意力花在判断而不是校对上。见结构化输出。
- 让智能体具体说出它对什么没把握。"我没能把第二个数字与原始来源核对上"能把复核者的目光引到该去的地方,价值高过一个全局置信度分数。它还能失败得安全:标错了,复核者读得更多而不是更少。
- 用可逆性把复核买回来。一个点一下就能撤销的动作,可以事后按例外抽查,而不必事前全量复核。这是世上最便宜的复核成本削减手段,而且它是一项工程决策而非模型决策——机制在撤销与可逆性。
只有选择性复核才真的把成本拿掉。
STEP 3 里的一切让复核者更快。只有一件事能让复核者从一部分流量里彻底消失,而它不是准确率——它是一条站得住脚的规则,规定哪些输出不经人看就发出去。
- 你需要一个路由信号,而且它必须经过校准。模型自报的置信度不是——让模型变得可亲的那步对齐,同时也让它过度自信。跨多次采样的一致性、检索支撑度检查、校验器结果,才是真能区分开的信号——见不确定性与校准。
- 阈值从覆盖率-风险曲线上读出来,不要靠感觉拍。在一份带标签的样本上打分、按信号排序,然后读出在选定错误率下你能自动放行多大比例。"我们自动放行前 60%,该切片实测错误率 0.8%"是一个运营决策。"模型现在看起来不错了"不是。
- 对自动放行的那部分永久保留随机抽审。抽几个百分点照样人工看。这一步把你的阈值从一次性研究变成一个活的控制,也是你能在客户之前发现该切片已经漂移的唯一途径。给它列预算——量很小,而且不是可选项。
- 按后果分级,而不是只按置信度。不可逆的、对外可见的、受监管的动作,无论置信多高都留在全量复核里。节省来自那一大块高频、可逆的中间地带,而它通常就是绝大部分流量。放置规则见人在回路。
- 预期第一版阈值会偏保守,并计划把它往外推。自动放行 30% 的流量,就等于砍掉系统里最大那条成本线的 30%。这比桌面上任何一次模型改动都更划算,而且每次抽审为你赢得一次放宽,它都会复利。
注意这重构了什么。"智能体够不够好到可以把人拿掉?"这个问题没有答案,因为它是对整个总体提出的。可回答的问题是:"在哪个可度量的切片上它已经够好了,而今天那个切片有多宽?"——而这个问题带着一个财务部门会认账的数字。
复核掩盖掉的成本,和它自己制造的成本。
复核环节不是一张免费的安全网。它有自己的失效模式,其中两种会让经济性变糟,却不出现在任何一本账上。
- 橡皮图章是默认的稳态。一个大批量批准"基本正确"的复核者,会收敛到默认批准,此时你付着全额复核成本,买到的检测约等于零。直接量它:拒绝率与单件复核耗时同时下行,就是它的特征签名,而这恰是批准与确认体验要抵抗的那种失效。
- 复核者是一道硬性的扩容天花板。智能体吞吐是弹性的,复核者吞吐不是。一个产出速度超过检查速度的系统会转化成一条队列,而队列把吞吐上的胜利变成延迟上的损失,成本模型却毫无变化。如果你没法线性地招到复核产能,那么自主度的上限由人员编制而非能力决定。
- 复核质量是负载的函数。一小时里的第十次复核不等于第一次。任何把复核者分钟数当作可互换资源的成本模型,都会高估你在高负载下买到的检测量。
- 注意力有你早就在付的机会成本。那位在复核智能体输出的资深同事,本来在做别的事。按工资给他计价是低估——真实数字是这次复核挤掉了什么,而那通常是团队里价值最高的工作。
- 复核记录本身也是一份责任。批准会挂在具名的人身上并被留存。这正是问责所需要的,同时它也是一份可被调证的记录——值得刻意决定,而不是由可观测性的默认值替你决定,见留存与法务保全。
先把它测出来,再给这个决策定价。
没有度量,上面这些都没法执行,而复核时间恰恰是几乎没人记录的那个输入。三个数字能让整个模型活起来。
- 每完成一项任务的复核分钟数。给条目进入复核和被处理完各打一个时间戳,再扣掉空闲。粗略可以,缺失不行。这是上面一切的分子。
- 复核比——复核分钟数除以这项任务无辅助时本来要花的分钟数。低于约 0.3,智能体明显在赢。0.5 上下,你买到的是速度与一致性,而不是成本。高于约 0.7,再算上协同开销与排队延迟,你其实在跑一套更贵、还多出若干失效模式的流程;诚实的做法是收窄范围直到这个比值降下来,而不是继续调提示词。
- 自动放行占比,旁边挂着抽审出的错误率。一个数字是节省,另一个是你继续拥有它的许可证。两个一起报,否则第一个会一路往上飘,直到出事。
然后像对待任何一笔开销一样做归因。复核分钟数属于成本归因与预算里那份按任务的成本视图,按工作流打标签,好让某个团队提出新的智能体入口时,它要消耗的复核产能是提案的一部分,而不是丢给另一个团队编制的意外。
这周就把复核分钟数记录下来,哪怕很粗糙,并把它放进你的每任务成本数字里。然后别再指望用准确率把自己买出困局:挑一条流量最大、动作可逆的工作流,做一个经过校准的路由信号,把最安全的那个切片自动放行,背后永久挂一条随机抽审。抽审给出许可,就把切片放宽。模型质量决定你要为多少返工付钱;只有选择性复核决定你要为多少检查付钱——而检查才是更大的那个数。
相关:智能体单位经济学提供本页所嵌入的分母,衡量智能体投资回报给出反事实基准,不确定性与校准提供路由信号,为信任而设计讲的是让一次复核值回那些分钟的界面。