任务时长视野

A20
概念 · 智能体 AI 详解

任务时长视野。

任务时长视野把智能体的能力换算成一个你能拿来做计划的单位:以人类工时衡量、它能在指定成功率下独立完成的任务长度。人人引用的是 50% 视野,而你真正要拿来部署的是 80% 视野,后者大约只有前者的五分之一。引错了那一个,你就会拿一个稳定只能干一小时的模型,去许诺一整天的无人值守工作。

STEP 1

一项以分钟而非百分比计量的能力。

大多数基准回答的是"这些题目里模型做对了多少比例?"视野回答的是另一个问题:"在散架之前,它能做完多长的一件活儿?"你取一组任务,记下一位胜任的人各需多久,跑一遍智能体,找出它的成功率跨过某个阈值时对应的时长。那个时长就是该阈值下的视野。

这个度量出自 METR 对长时软件任务的研究,它之所以流行开来,是因为它说出了百分比说不出的东西。基准上 71% 这个分数,完全不能告诉你能不能把智能体丢下不管一个下午。视野能,而且用的就是你做计划时本来在用的单位。它也是把从业者反复重新发现的那件事说清楚的最干净方式:智能体不是败在难的步骤上,而是败在的步骤链上——每步的误差会复利,而且没人在旁边看着。

那个头条结论是一条趋势线。在大约六年里,前沿模型 50% 成功率下的视野大致每七个月翻一番——从 GPT-2 的区区数秒,到 Claude 3.7 Sonnet 一代的数十分钟,再到以小时计。较新的重新估计把 2023 年之后的翻倍周期压到接近四个月。把确切斜率当作有争议的,把方向当作没有争议的。

STEP 2

50% 视野是一次抛硬币,而它就是上标题的那个。

下面这段在转述中总被丢掉。50% 视野意味着智能体能完成那个长度里的一半任务。一半。没人会按抛硬币去部署任何东西,所以真正的作业数字,是在你真肯接受的可靠度下的视野——而 METR 自己的报告把 80% 视野放在 50% 那个数字的大约五分之一

拿具体例子过一遍。一个 50% 下视野为 50 分钟的模型,到 80% 时大约只剩十分钟。一个宣称五小时的模型,若你需要五次里成四次,那它是一个一小时的模型。这个落差不是四舍五入的误差,那是另一件产品。

可靠度崩得比长度涨得快,因为长任务是一条链:十五步、每步 98%,整体是 74%;每步 95%,整体是 46%。这与智能体基准上的 pass^k 打分背后是同一套算术——成功一次是能力主张,连续成功 k 次是部署主张,而只有后者能预测一个普通的星期二。

所以当厂商、论文或同事引用一个视野时,第一个要问的是它在哪个阈值上。如果没人说,就当它是 50%,除以五,再照那个去做计划。

STEP 3

那条趋势线量的是一个多半不属于你的任务分布。

视野是在软件工程与研究类任务的题库上估出来的:干净的起始状态、机器可核验的终点、没有第二方。这是刻意的方法学取舍——你没法给一件"完成与否见仁见智"的任务计时——而这也正是这个数字迁移得很差的原因。

  • 你的任务可能比题库更脏。需求含糊、环境陈旧、某个工具上周被改了名。METR 自己就发过一份说明这套度量局限的笔记,诚实的读法是:视野描述的是在良定义工作上的表现。
  • 也可能更干净。一条狭窄、重复、全程有仪表的流水线,可以跑得远超公开视野,因为题库采样的那些失败模式,正是你已经用工程手段消掉的。
  • 人类耗时是难度的代理量,不是难度本身。一件"四小时都在敲键盘"的四小时任务,与一件"四小时都在做判断"的四小时任务不是一回事,而模型在前者上强得多。
  • 第二方一出现,计时重新开始。任何有人在对话里的场景——审批、澄清、有人在争取例外——都是另一种状态,时长数字带不过去。

有用的做法不是不信这个数字,而是给它定位:公开视野告诉你这一档模型在良定义工作上能撑多久,你自己的测量告诉你这个模型在你的活儿上能撑多久。

STEP 4

量出你自己的那个,并把它花在自主性决策上。

自己量视野比听上去便宜,也不需要一套评测框架。取三十件你已经有追踪记录的真实任务。给每件标上人类要花多少分钟——估到最近的半小时就行,精度不是重点。每件任务跑五遍智能体,记下它完全成功的次数。把成功率对时长画出来,读出它跨过 80% 的位置。那个交点就是你的数字,而且它会比你希望的小。

然后让它去定政策,而不是躺在一页幻灯片上:

  • 把无人值守的工作单元切到视野以下。如果你的视野是四十分钟,一件两小时的活儿就该被切成若干不到四十分钟的检查点,每段各有自己的成功判定——这正是目标、规划与终止里主张分解的理由。
  • 按任务长度的档位来设自主性等级视野以下,跑完汇报。接近视野,跑完必须复核。视野以上,没有人类负责人就别启动。
  • 把它当作发布指标来追踪。换过模型或改过提示词之后位移了的视野,是你能写进发布说明里信息量最大的一个数字,而且比一个聚合分数更可操作。
  • 环境变了就重新量,而不只是模型变了才量。视野是这一对的属性,一次工具改名就能把它缩短,而别的什么都没动——见第三方工具漂移

拿这个想法做三件事。你在任何地方读到一个视野,先找出它的阈值再去引用;如果是 50%,就假定可部署的数字只有它的五分之一。在三十件真实任务上量出你自己的 80% 视野——半天的活儿,而它会成为你团队关于自家智能体最有用的一个数字。然后把它当作无人值守工作的长度上限,让智能体永远不会被交办一件长过"它能稳定做完"的活儿。

相关:智能体评测看视野如何与你其余的度量拼在一起,读懂基准练"一个数字究竟量的是什么"这项通用功夫,评测方差与统计功效看一个视野估计要跑多少遍才算数,以及持久状态与可恢复性看那些无论如何都超出视野的任务该怎么活下来。