锯齿状前沿

A33
概念 · 智能体 AI 详解

锯齿状前沿。

一个能起草出像样法律摘要的模型,可能数不清它自己刚写下的那份清单里有几项;而从外面看,这两件事一样简单。这就是锯齿状前沿:能力不是一个水位,而是一条带着无数港湾的海岸线,一项任务上的表现,对紧挨着它的那项任务毫无预测力。实际后果很硬:基准分数、演示、厂商说辞,全都是关于别处的证据——唯一能迁移到你那项任务上的测量,是在你那项任务上做的测量。

STEP 1

这个词从哪来,以及让它站住脚的那个数字。

这个说法出自一项与 758 名波士顿咨询公司(BCG)顾问一起做的预注册田野实验,论文题为 Navigating the Jagged Technological Frontier。在 18 项被选在模型能力之内的真实咨询任务上,使用 AI 的顾问多完成了 12.2% 的任务,快了 25.1%,质量高出 40% 以上。而在一项被刻意构造成恰好落在能力之外的任务上,使用 AI 的顾问给出正确答案的可能性,比完全不用 AI 的顾问低了 19 个百分点。

有两点让这一对结果值得随身带着,而不是归档到「AI 有局限」那一栏里。

  • 「界内」那一侧的效应很大。这不是一个边际工具。凡是前沿把你的任务包进去的地方,效应量大到组织会围着它重构。
  • 「界外」那一侧是负的,而不只是「没帮上忙」。辅助不是没起作用,而是让人比单干更差,因为一个流畅的错误答案比没有答案更有说服力。落在前沿之外的代价,由那个相信了输出的人来付。

而这些任务事先无法用任何寻常意义上的「难度」区分开。这恰恰是关键:那条边界并不沿着人会去画的等高线走。

STEP 2

边缘之所以看不见,是因为失败保持着成功的形状。

人的能力是可读地衰退的。一个人干到自己能力之外,会变慢、会打埋伏、会提问,或者交出明显毛糙的东西——而那份吃力本身,就是给旁观者的信号。模型没有这种破绽。在前沿之外一点点的地方,它产出的东西流畅度相同、结构相同、语气同样笃定,跟它在界内深处时一模一样,因为流畅与正确是由过程中不同的部分产出的。这跟幻觉与校准从内部描述的是同一种不对称;锯齿状前沿则是它从外部、在任务选择这个层面上的样子。

所以危险区并不在前沿之外的深处——那里模型会拒答,或者输出明显不对。危险区是紧贴边缘的那一条窄带:答案形式工整、看着合理、但就是错的;而恰恰在那里,复核者的注意力最低,因为前面九个输出都没问题。

这就是为什么「这个模型擅长 X」是一句几乎没有可操作内容的话。该问的是:擅长 X 的哪些具体实例、用什么方式核验的、失败的时候长什么样?一句不附带失败描述的能力主张,无论出自谁之口,都是营销话术。

STEP 3

究竟是什么把一项任务推到界外,以及智能体为何让情况更糟。

前沿不是按难度画出来的。把一项任务推到界外的那些性质,大多是结构性的:

  • 答案取决于上下文里没有的东西——一件发生在知识截止之后的事实、一份私有文档、某个系统此刻的状态。模型会从自己的分布里补上缺失的那块,而不是停下来。
  • 正确的输出是一次拒答或一句「不确定」。「凭这些数据得不出答案」是一种模型被训练得很弱、又被压力强烈反对的输出形状。
  • 这项任务是常见零件的罕见组合。每一味配料都眼熟,这个具体的组合却不眼熟,于是模型朝那个眼熟的版本插值,而不是朝你要的那个。
  • 成功要求在整份输出上守住一个约束——一个字数上限、一套 schema,或者一条不变量:第九段必须为真,因为第二段那样说了。

接着,智能体把这种逐步的锯齿,跑上四十遍。循环不会把毛刺磨平,它把毛刺复利,因为每一步的输出都成了下一步的输入,而第六步那一次越界,会被无声地洗成第七到第四十步的前提。任务视野量的是这件事崩掉之前能走多远,而轨迹是你查出「是哪一步」的地方。

STEP 4

画出你自己的海岸线,并在每次模型变更后重画。

正因为前沿是锯齿状的,有用的证据单位既小又具体。由此有三个习惯。

  • 按任务试点,而不是按模型试点。「我们该不该在这件事上用 AI」这个问题,对你团队做的十一件事各有各的答案,而这些答案并不按「那些事感觉有多难」排序。取某一项任务的二十个真实实例,跑一遍,然后照「究竟怎样才算对」去评分。这就是最不光鲜、也最能定调的评测。
  • 优先选那些你能核验答案的任务。如果核验比生成便宜得多,一项刚好落在界外的任务只让你多试一次;如果核验和生成一样贵,它让你付出一个错误决定。这个不对称就是生成器—验证器差距,也是「一次部署能否在与现实接触后存活」最好的单一预测指标。
  • 把你的地图当成会过期的东西。每一次模型发布都会重画这条海岸线——多数时候是往外扩,但并不均匀,而且你所依赖的行为可能朝两个方向变化。一张照着去年的模型画好、从此再没重跑过的地图,正是有些团队至今仍在躲开那些早已变简单的任务、又仍在信任那些悄悄变糟的任务的原因。评测集维护是让这张地图一直活着的办法。

挑出你团队最有把握的那项任务,和最怀疑的那项任务,这周就各拿二十个真实案例测一遍。做好在其中一项上判断错误的准备——把这件事亲历一次,对一个组织判断力的提升,胜过读再多关于「能力」的文章,因为它把一个关于「这个模型」的信念,换成了一个关于某项任务的数字。相关:批判地阅读基准讲为什么那些公开分数从来就不是关于你的,何时该用智能体是更前面的那个问题,智能体评测讲当规模超过二十个案例时怎么做。