标注运营

11 分钟读完

E11
运维 · 评估与可观测性

标注运营:裁判的准确率,不可能高过你的标签。

每支团队都在调裁判提示词,却几乎没有人去度量那些用来校准它的人——所以当你自己的两位专家在轨迹上只有 72% 的一致率时,一个对着其中一人打到 72% 的裁判早已触到天花板,而此后每一周的提示词工程都是在拟合噪声。先量一致率,再量别的。你拿回来的那个数字并不是关于标注员的事实,它是一份关于评分标准的缺陷报告——而修好评分标准,是唯一能把下游一切的天花板抬起来的动作。

STEP 1

没人算过的那个天花板。

LLM 裁判是一个拟合到人工标签上的分类器。它汇报的准确率就是与这些标签的一致率,所以标签定义了可达上限——而如果标签之间彼此不一致,这个上限就远低于 100%,且不去度量你根本看不见它在哪。

  • 把这道算术做一遍,路线图就会改。如果两位合格标注员在 75% 的条目上一致,那么在剩下四分之一分歧的条目上,任何裁判面对"碰巧被记录下来的那一个标签"都只是在掷硬币。一个 78% 的裁判和一个 85% 的裁判并不是有意义地不同的分类器;它们是同一条噪声带上的两次采样,而下个月这个差距不会复现。
  • 单标注员的标签集把这一切完全藏了起来。一个人标完全部,产出的是一套自洽得完美、却与任何其他人的判断关系未知的集合,而一个被训练去匹配它的裁判,会把这个人的个人癖好继承为地面真值。这种失败是静默的,几个月后才以"评测说我们进步了,用户说没有"的形式浮出水面。
  • 把一致率当作与裁判准确率并列的头条数字来汇报。"裁判与人一致 84%;人与人彼此一致 88%"是一对诚实且当场可执行的数字。只报第一个数字,就是在邀请一个季度的无效调优。
  • 在类别倾斜的任务上,多花一步算"排除偶然"的一致率是值得的。当 90% 的轨迹都是正常的,两位都说"正常"的标注员几乎必然拿到 90% 的原始一致率,却不携带任何信号。Cohen's kappa 或 Krippendorff's alpha 会把这个基线除掉;在智能体评估典型的那种严重不平衡的通过/失败数据上,原始数字是主动误导人的。

值得随身带走的重构:你度量的不是模型,而是一件度量仪器,而一件误差未经量化的仪器什么也认证不了。这与评测方差是同一套纪律,只是往上挪了一层——方差在打分者身上,而不在运行身上。

STEP 2

一致率低是评分标准的缺陷,不是人的缺陷。

看到 68% 的一致率,本能反应是把标注员训得更狠,或者换更好的人。这几乎总是错误的诊断。当问题本身没说清楚时,有能力的人就是会给出不同答案——而那个问题是你的产物。

  • 大多数分歧可以追溯到四种含混之一。没有定义的严重性边界("引用错了但无害,算不算失败?");把两个判断捆进一个标签的复合标准;没有说明的受众("对谁而言正确?");以及部分成功时缺失的裁决规则。每一种都能用一句话修好,而在有人写下那句话之前,每一种都会在成百上千条目上重复出现。
  • 把评分标准写成判定程序,而不是写成描述。"给有用性打 1–5 分"会永远制造分歧。"如果回答断言了检索到的文档中不存在的事实,即使该事实为真,也判 FAIL"会制造一致,因为它给出的是判定动作而不是感受。每一条标准都应该能靠"指着轨迹里的某样东西"来回答。
  • 每个档位都用一个真实的、来自你自己流量的标注样例来锚定。每档两三个样例,各配一句论证。标注员照着样例做校准,远比照着形容词可靠,而这些样例还能兼作你构建裁判时的 few-shot 集。
  • 给"判断不了"一个一等公民的按钮。逼人对一个含混条目下判断,是凭空制造标签、污染整个集合。弃权是数据:一条弃权率 15% 的标准就是一条需要重写的标准——而只有允许弃权,你才学得到这件事。
  • 评分标准要有版本,标签要打上版本戳。评分标准会变——那正说明流程在起作用——而 v3 下收集的标签,未经确认改动是否实质,就不能和 v5 的合并。没有版本的标签集会在两个季度内悄悄变得无法解读。
STEP 3

分歧才是最有价值的产出,所以要把它路由出去,而不是平均掉。

标准流水线取三份标签、做多数投票。作为"生产一份训练集"的手段这说得过去,作为流程却很浪费,因为它扔掉了那个告诉你"你的判定标准实际在哪"的信号。

  • 产生分歧的条目就是决策边界。所有人都判通过的条目没有信息量;所有人都判失败的也没有;有争议的那些恰恰坐在你的策略尚未定义的位置上。它们同时是最好的裁决队列、最好的裁判 few-shot 样例,以及最好的回归集。
  • 做裁决,并把理由写下来。由一位资深评审解决分歧,而且关键在于用一行字记录推理。这些行就是下一版评分标准的原材料。一次只产出标签、不产出理由的裁决,修好了一个条目,剩下四百个同类条目原封不动。
  • 按标准逐条追踪分歧率,而不只看总体。总体会把那条造成全部损害的标准藏起来。通常是单独一条标准贡献了大部分分歧,而把它重写一遍,一个下午就能让整个数字移动。
  • 把有争议的那批条目作为一项显式测试喂给裁判。一个在简单条目上得分高、在争议条目上得分低的裁判,比它的头条准确率所暗示的更差——因为在你真正在意的那部分流量里,争议条目的占比高得多。按"人类一致程度"对裁判评估做分层,见裁判校准与元评估
  • 绝不要让裁判自己的输出去播种那些将用来给它打分的标签。预填一个标签让人去"确认"能提高吞吐,也毁掉独立性:确认偏误会让一致率上升而准确率不变,而你从此失去了发现裁判系统性错误的能力——并且是永久失去,因为标签里现在含着这些错误。
STEP 4

谁来标注,以及那把外包不出去的椅子。

智能体轨迹不是情感分析数据。单个条目可能是一段带工具调用、检索文档和部分正确结果的二十步轨迹,而判断它需要知道这个产品本该做什么。

  • 领域专家定标准,外包人力做规模。专家定义评分标准、标注校准集、裁决分歧。规模化标注员随后在这套标准覆盖的条目上照着它干活。把这个关系倒过来——让外包人力去定义一个临床或法律智能体的"质量"——产出的标签会内部自洽而对外错误。
  • 产品和工程都必须定期亲自标注,量不大。每人每月两小时。不是为了吞吐,而是为了那件仪表盘给不了你的东西:系统实际失败时的质地。停止读轨迹的团队,会开始优化一些已经漂离产品的指标。
  • 给标注员的上下文,要与裁判将拿到的一致,不多也不少。如果裁判只会看到最终回答,那么一个拿着完整轨迹做标注的人产出的标签,裁判在结构上就复现不了,而你会把这个差距错误地归因到模型头上。要刻意对齐观察窗口。
  • 为上手期留预算,并预期会有一段校准期。新标注员最初几百条标签与标准的一致率,可度量地低于他后来的。第一天就让他标一份共享校准集、和他一起复盘,并把他早期的产出挡在黄金集之外——而不是在下游才发现漂移。
  • 留意疲劳效应与位置效应。长时段作业中一致率会明显下滑,而同一条目排在批次后面时的评分,与排在前面时不同。打乱顺序、限制单次时长,并持续掺入少量已知答案的条目作为在线质检。
STEP 5

预算的胜负在采样上决定。

专家标注通常是评估项目里最大的一笔开销,而默认策略——随机抽样标注——把其中大部分花在了结果从来就没有悬念的条目上。标注预算买到的东西,是决策边界处的分辨率。

  • 先分层,再采样。按任务类型、按租户、按轨迹长度、按是否触发了降级。对生产流量做随机抽样,会被容易的多数类主导,而对那个制造投诉的细分群体什么也说不出来。
  • 把钱不成比例地花在裁判不确定的地方。挑出裁判置信度低、或两种裁判配置意见相左的条目去标注。这是可选策略里"每块钱信息量"最高的一种,通常只用随机抽样所需条目的一小部分就能达到可用的校准。
  • 无论如何都要保留一片真正随机的切片。不确定性采样在构造上就是有偏的,估不出比率。留一个小的随机层,专门用来回答"生产中究竟有多大比例在失败",并且永远不要把两个集合混进同一个数字里。
  • 先把免费的标签挖出来。编辑、重试、升级、撤销,以及"智能体产出的东西"与"用户最终交付的东西"之间的差异,都是你已经拥有、并且没在为之付费的标签——这正是生产反馈信号的全部论点。人工标注应该花在那些信号说不出来的东西上,也就是"为什么会失败"。
  • 给黄金集设上限并做精选,而不是无限扩张。几百条精挑细选、经过裁决、带版本的条目,胜过一万条廉价标注的;而且当评分标准变更时,前者重标得起——而重标恰恰是把大集合杀死的那个操作。成本模型见评估的成本
STEP 6

标签是有日期的,以及用来运营这个项目的那几个数字。

一个标签,是在某个特定时刻、依据某一版评分标准、对某一个特定输出所做的判断——而这三样都在动。要把黄金集当作一件有主人的、需要维护的资产,否则它会衰变成一堆没人辩护得了的断言。

  • 每个标签都存来源信息。标注员、评分标准版本、时间戳、观察窗口、是否经过裁决。没有来源信息,你回答不了"是质量变了还是我们的标准变了",而这个问题偏偏会在你最需要它的那次事故中到来——见检测质量回归
  • 按周期重标一片切片。每季度盲标黄金集的 5%,度量它与已存标签的一致率。相对于自己过去判断的漂移是正常的,也值得知道;在发布评审会上才发现它则不然。
  • 逐条标准的标注员间一致率。评分标准的健康指标。每次修订之后它都应该上升;如果没有,那这次修订并没有击中真正的含混之处。
  • 裁判与人的一致率,并对照人类天花板汇报。永远成对给出。天花板 85% 时裁判打到 82%,是完成品;天花板 97% 时同样的 82%,是一个坏掉的裁判。
  • 每条已裁决标签的成本,以及"每一次落地的评测变更"消耗了多少标签。项目的效率。如果第二个数字很大,那你是在为"感觉周全"而标注,而不是为"决定某件事"而标注。
  • 弃权率。评分标准已经不再覆盖当前流量的早期预警——通常也是"产品变了而评测没变"最先冒出来的可见征兆。

下一轮调裁判之前,先做这件事:让两个人各自独立标注同样的 100 条轨迹,算出原始一致率与排除偶然的一致率,然后两人一起花一小时把每一处分歧读完。这一小时结束时,你会得到一份重写过的评分标准、一个对你今后要汇报的每个裁判数字都成立的现实天花板,以及一份"本来就根本判定不了"的标准清单。它的代价是一个下午,而它是智能体评估项目里杠杆率最高的一小时。

相关:面向智能体的 LLM 裁判看这些标签在校准什么,为什么评估智能体这么难看底下那个地面真值问题,结果评估 vs 轨迹评估看标注员到底在看什么,以及不确定性与校准看采样策略所倚仗的那些置信度数字。