人在回路

A14
概念 · 智能体 AI 详解

人在回路。

真正危险的问题从来不是"智能体是否聪明到能独自行动",而是"它出错的那一次会发生什么,以及在酿成损害之前有没有人能拦下"。本条目把人在回路定义为一个关于把人的检查点放在哪里的工程抉择,讲清哪些动作该配一个检查点,并点出这个检查点是如何悄悄失效的。

STEP 1

它是谱系,而非开关。

"人在回路"(human-in-the-loop,HITL)常被说得像是自动化的反义词。它不是。它是一个关于"人在哪些时刻、以多大程度参与"的设计决策,落在一条谱系上:

  • 人在回路(human-in-the-loop)。智能体暂停,等待人在动作执行之前批准(或修改、或拒绝)它提议的动作。人处在关键路径上。
  • 人在回路之上(human-on-the-loop)。智能体默认自行行动,但有人监视,可以介入、暂停或推翻。人是监督者,而非闸门。
  • 人在回路之外(human-out-of-the-loop)。完全自主——智能体行动时没有逐动作的人为参与,监督(如果有)发生在事后。

误区是把它当成对整个智能体的一个全局开关。设计良好的智能体,会在同一次运行里,对少数可能造成真实伤害的动作处于回路之中,而对大量无害的动作处于回路之外。这正是为何 HITL 本质上是关于单个动作的问题,并与自主性等级阶梯紧密相关:合适的档位是逐动作而非逐智能体选定的。

STEP 2

按后果设闸,而非对每一步都设闸。

最有用的一条启发式:把检查点放在动作高影响或难以撤销之处,其余一概不放。两个属性决定它——最坏情况有多糟,以及你能否撤销。

  • 要求批准那些有后果、不可逆的写动作:发送消息或邮件、付款、删除数据、部署代码、合并变更、公开发帖,凡是触及金钱、外部方或生产环境的动作。
  • 放它自行运行那些廉价、可逆的动作:读取、搜索、摘要、起草一份人反正会看到的提案。给这些设闸只会增加摩擦,几乎买不到安全。

对任何会写向外部世界的动作,一个干净的默认是提议,而非执行:智能体产出它想采取的确切动作——起草好的邮件、diff、那笔交易——由人把它变成真实的效果。这一条边界,就把一个自主的行动者变成了一个快速的助手,其错误止步于草稿。先决定这个任务是否需要智能体;再决定它的哪些动作需要人。

STEP 3

实现它的那些模式。

少数几种具体形态,几乎覆盖所有情形:

  • 批准闸。智能体暂停,连同上下文与理由一并呈上它提议的动作,然后等待。人批准、修改或拒绝,循环随后恢复。闸的质量,就是它所呈现内容的质量。
  • 确认 UX。让决策既知情又迅速:明确展示将要发生什么(具体的 diff、收件人、金额),而不是含糊的"智能体想继续"。看不到后果的人,无法有意义地批准它。
  • 升级 / 交接。智能体察觉自己力有不逮——低置信、超出策略的请求、反复失败——便把控制权交给人,而不是硬推下去。懂得何时止步是一种能力,而非失败。
  • 用可逆性替代批准。当你能让一个动作廉价可撤(软删除、暂存步骤、"撤销"窗口)时,有时可以让智能体径直行动、完全省掉闸门——人在事后拦截问题,且不付逐动作的成本。

批准与撤销是限定影响范围的两种办法;自动化护栏是第三种。最强的设计会把它们分层——廉价的自动检查处理显而易见的情形,好让稀缺的人力注意只花在真正需要判断的抉择上。

STEP 4

检查点是如何悄悄失效的。

人在回路并非天然就是安全——它是一种会腐坏的机制,而且腐坏得很有规律:

  • 橡皮图章 / 批准疲劳。让人批准太多低风险动作,他们就会停止阅读、条件反射地点"是"。此时检查点已成表演:它增加延迟、制造安全的错觉,却什么也没拦住。
  • 自动化偏见。人会过度信任一个看上去自信的提案,尤其来自一个通常正确的系统。那罕见的一个错误恰恰因为前一百个都没问题而畅通无阻。
  • 吞吐。关键路径上的人限定了智能体能做多快、做多少。这一成本,对有后果的动作值得付、对琐碎的动作则是浪费——这正是"少设闸"的全部论据。

一个你总是点"是"的批准,比没有批准更糟:它耗费时间、制造信心,却不增加任何监督。如果一道闸从未被真正行使——从没有人拒绝过——那是一个信号,该移除它、或让它更罕见、更高信号,而不是去表扬这个智能体。

结论与智能体设计的其余部分如出一辙:把人的参与程度匹配到每个动作的利害,让你保留的少数闸门都配得上一个人的全部注意,并把监督当成你要去工程的东西——心里装着那些故障模式——而非想当然。本站的批准与确认 UX渐进式自主实战手册,把这些模式带入生产级细节;而决策回执与审计深入解析,则讲如何在事后证明"批准了什么、为什么批准"。