A19
概念 · 智能体 AI 详解
智能体的交互设计:为「复核」而设计。
一个五分钟干完一小时活儿的智能体,如果检查它要花五十分钟,那它一文不值。复核成本与自己动手成本之比,才是你的界面真正在优化的那个数字,而多数智能体界面都在悄悄让它变差:读者需要的是 diff,你给的是散文;需要的是计划,你给的是既成事实;需要知道哪些部分是猜的,你给的是一段自信的摘要。
STEP 1
复核成本才是那个指标。
自动化划算的前提是:省下的工作多于新造出来的工作。而智能体是会造出工作的——总得有人判断该不该采纳它的输出。如果这个判断和自己干一样久,你做出来的就只是个演示。
- 决定难易的不是长度,而是可读性。一份四百行、格式熟悉的 diff,复核起来比三段描述改动的文字更快。散文逼着读者去重建那个改动;而产物本身就是那个改动。
- 可逆性决定该看多深。一键可撤销的动作扫一眼就够;给客户发邮件的动作要逐字读。把复核预算花在能买到东西的地方——这与人在回路是同一个分配决策,只是换到了界面这一侧来看。
- 批量能省事,直到它开始遮蔽问题。一次复核二十处小改动,单处成本更低——但这条曲线的尽头,是复核者不再阅读、只是往下滚。
一个智能体界面设计糟糕,最清楚的症状是:用户读完摘要,无法据此判断这活儿干得对不对,然后照样点了同意。这不是用户不上心。这是界面把「核实」做得比「信任」更贵,于是如愿换来了信任。
STEP 2
事前给计划,事后给产物。
纠正一个智能体最便宜的时刻,是在任何工具被调用之前。改一份计划的代价是一句话;改一次已完成的运行,代价是回滚,外加所有已经泼出去的水。
- 给一份可编辑的计划,而不是一个确认弹窗。「我要做 X——继续吗?」收上来的是一次点击。一份用户能改的计划收上来的是一次纠正,而且它让误解在还不要钱的时候就浮出水面。
- 运行之后,展示产物本身。那份 diff、那些变动的行、那封即将发出的邮件原文。渲染出来的输出永远胜过被描述的输出。
- 按后果分组,而不是按时间顺序。四十次工具调用的时间线是一份日志,不是一个复核界面。按爆炸半径排序:写了什么、删了什么、什么离开了系统,最后才是那些只读的操作。
- 渐进式披露。默认给摘要,完整轨迹永远只隔一次点击,随时可看但从不强制。参见渐进式披露。
STEP 3
逐条校准信任,而不是整体校准。
目标既不是一个信任智能体的用户,也不是一个不信任它的用户,而是一个信心恰好与智能体在这一份具体输出上的真实可靠度相匹配的用户。这要求界面把「它确实知道的」和「它推断出来的」分开呈现。
- 把证据挂在论断上,而不是挂在整段回复上。底部的参考文献列表是装饰;落在它所支撑的那句话上的链接,两秒钟就能核实。
- 区分「读到的」与「推断的」。「发票上写着 4,200 美元」和「这张发票看起来是三月那个项目的」是两种不同的认知行为,而错误就住在第二种里。
- 别显示置信度百分比。模型并不擅长用语言表达自身的不确定性,而一个数字会被读成模型并不具备的精确度。展示证据、让读者自己判断——这才是你真能挣到的校准。
- 让失败大声一点。智能体能呈现的最糟状态是无声的部分成功:十条记录更新了八条,汇报成「已完成」。部分完成必须看起来就和完成不一样,而不只是在某处被提了一句。
STEP 4
设计等待,也设计退出。
智能体的运行以分钟计而非毫秒计,这打破了你手上每一个 UI 模式所依赖的「请求—响应」假设。
- 叙述当前步骤,而不是转个圈。「正在检索发票归档」告诉用户智能体有没有理解任务——这是发现它走岔路的最早时机。流式输出让等待变得可读,但并不会让它变短。
- 可中断胜过快。一个显眼的停止按钮既是交互可供性,也是安全控制,而且它会改变用户愿意容忍多少自主性。它底下坐着的是运维版本的同一件事:急停开关。
- 撤销胜过确认。这是最值得内化的一处反转:可靠而廉价的撤销让你有底气删掉确认弹窗,而幸存下来的那几个弹窗因为稀少,才真的会被人读。你在高频路径上每加一个对话框,都是在训练用户随手关掉下一个。
- 长任务需要交接,而不是扣人质。让用户离开,完成时通知他。一个要求页面常开的智能体,已经把自己的有用程度封顶在一杯咖啡的时长上了。
这周只改一件事的话:把「智能体将要做 X——好吗?」的弹窗换成一份用户可编辑的计划,并给每一次写操作配上真正能用的撤销。确认弹窗训练人们点「是」;可编辑的计划与可用的撤销,则是在不削减自主性的前提下把复核成本压下来的两个界面。用真实任务上的「批准所需时长」来衡量结果——如果它没在下降,那么无论模型那边发生了什么,你的界面都没有变好。