首次运行与用户引导

11 分钟读完

H11
实战手册 · 智能体体验与人机交互

首次运行:这一次会话立下的先验,你的产品要花半年去跟它争辩。

用户与智能体的第一次会话,会生成一个关于"它能干什么"的持久估计,而之后的每一次交互都是在这个估计的滤镜下被解读,而不是取代它——所以一次展示天花板的首次运行,是在为第二个任务预制一场失望;而一次在首轮就失手的首次运行,代价高于一个月后的十次失手。真正管用的引导展示的是边界而不是能力:让用户看见智能体会拒绝什么、看见它在任务中途被纠偏,并且宁可挑一件你能打包票的首个任务,也不要挑一件能唬住人的。

STEP 1

第一次会话立下一个先验,而先验的更新既缓慢又不对称。

人不会每次使用都重新建构一个关于智能体能力的模型。他们很早就用极少的证据形成一个,然后在很长一段时间里用它来解读新证据。这是普通的人类行为,但对智能体格外要命——因为被估计的那个东西("我能把什么交给它?")是不可见的、没有天然边界的,而它又是决定这个产品到底会不会被用起来的唯一那个判断。

  • 早期失败之所以昂贵,是因为没有战绩可以吸收它。第二十次会话里的错误,落在十九次成功之上,会被读作例外。第一次会话里的错误就是全部数据集。在首轮见到一个自信的错误答案的用户,往往会得出"这东西会瞎编"的结论并且再不修正,哪怕背后的模型一直在变好。
  • 早期的超常发挥同样昂贵,只是方向相反。一个 demo 级别的首个任务,教会用户一条过宽的边界。他们的第二个请求恰好落在界外、失败了,于是他们一次学到了两件事:这个智能体不可靠,以及他们事先分不清自己站在线的哪一侧。杀死使用量的是后一条。
  • 人们形成的估计是关于边界的,不是关于平均值的。没有人因为一个工具的平均质量而采用它;他们是在能够预测"哪些任务可以放心交出去"之后才采用的。在这个阶段,可预测性胜过能力,一个更窄但清晰可读的智能体,会比一个更宽却读不懂的智能体更快被采纳——这与为信任而设计关于校准的论证是同一个。
  • 就算挽回成功,挽回本身也不是免费的。把一个在第一周就给你判了死刑的用户请回来,通常需要一个重新尝试的新理由——同事的推荐、一次显眼的发布——而这种机会你没有几次。

由此得出的设计结论让人不舒服,但很清爽:首次运行不是一块营销阵地。它的一切都该为"所生成的心智模型的准确度"做优化,而不是为"生成过程中产品看起来有多厉害"做优化。这两个目标相冲突的时候,比它们一致的时候多。

STEP 2

能力巡礼教的是天花板。改成教边界。

默认的引导——一串展示智能体能耐的轮播图,或者一组精挑细选、保证成功的建议提示——是为"传达能力范围"而优化的。它传达得非常准确,而问题正在这里:范围是分布的上沿,而用户会照着上沿去校准。

  • 刻意地、尽早地展示一次拒绝。一个明确拒绝越界请求、并用一句话说明原因的智能体,教给用户的边界信息比五次成功还多。它也是你手上最便宜的可信度信号——一个会说不的工具,它的"是"才有分量。
  • 不只展示自信的回答,也展示不确定的回答。如果智能体在证据稀薄时会打折扣,用户就学到"打折扣本身携带信息",进而更信任那些自信的回答。如果所有回答都以同一个音量抵达,他们什么都学不到,只能默认全部去核验——而那正是智能体制造工作量的失败模式。
  • 用一句话、以智能体自己的口吻,在最上方说明边界。"我能读你的文档、起草回复;我不能发送任何东西,也碰不了账单。"具体、可核对,比一整页功能列表都值钱。关于这些内容有多少该放进界面而不是文档,参见透明性与可解释性
  • 别让建议提示变成精彩集锦。如果起步提示集是按"够不够惊艳"挑的,那它就是一句转化率很高的谎言。挑最可靠且最常见的三个任务;如果这两张清单不重合,那是你的路线图在说话。
  • 绝不承诺你还没打开的自主度。描述"智能体将来会做什么"的引导文案,在初次使用者眼里读起来就是"它现在会做什么"。那道落差就是第一次失望的来源,而渐进自主正是随时间诚实地拓宽边界的机制。
STEP 3

挑一件你能打包票的首个任务,并且让它是用户的真实工作。

首次运行的任务是整个引导里杠杆最大的产品决策,而它通常是由"写空状态文案的那个人"顺手定的。有两个属性要紧,而且它们之间的取舍没有你想象中那么尖锐。

  • 可靠性第一,可靠到你敢拿这个客户去赌。无论首个任务是什么,它都该是你手上实测成功率最高的那条路径——不是最新的功能,也不是 demo 用的那个。如果你的评测说不清那条路径是哪一条,你就还没到能设计首次运行的时候。
  • 必须是他们的真实工作,不是沙盒。用假数据做的教程任务只教机制,完全不说明适用性,而用户几乎会把玩具输入上的成功全额折价。在他们自己的材料上拿到一个真实、小巧、可核验的结果,才是这件事的全部。
  • 小而可核验,胜过大而惊艳。用户必须能在一分钟内检查完输出。一个他们无法核验的结果不会创造信任——它创造的是一项复核义务,那感觉像工作,读起来像风险。
  • 把"到达"与"首个结果"之间的配置步骤压到接近于零。首个输出之前的每一个连接器、每一项权限、每一步配置,都是一个离开的出口,而为它们买单的是一个还没看见任何东西跑通的用户。只索取首个任务所必需的最小集合,其余的推迟到 STEP 4。
  • 如果智能体会慢,就说清楚它在干什么。一次静默九十秒的首次运行,被解读为"坏了"的次数远多于被解读为"很认真"。流式的中间步骤在这里比在产品的任何其他地方都值钱,因为用户此时还没有任何耐心的依据——参见流式与部分输出
STEP 4

首次运行时授出的权限不是知情同意,而把它们打包会在无意中构成一种暗黑模式。

标准流程会在智能体还什么都没做之前,就把它可能需要的全部权限一次要齐。这对工程很方便,作为"同意"却站不住脚:用户被要求授权一些他们还无从估计后果的能力,时点恰好是他们此生信息量最少的那一刻,而且他们此刻的动机是尽快越过这一屏。

  • 在使用发生的那一刻要权限,并绑定到需要它的那个任务上。"为了起草这封回复,我需要读取这个会话线程"是一个用户能够评估的请求。第二屏上一张九项权限的清单不是,而它换来的批准在出事时一文不值。
  • 永远把读与写分开,并从只读开始。对多数智能体而言,最有价值的首次运行配置是一个什么都改不了的配置。它一次性消除了整类首轮灾难,而代价只是一项用户此刻本来也不会用的能力。
  • 展示后果,而不是权限名。"可以用你的身份发邮件",才是那串读起来人畜无害的权限字符串的诚实译法。这与审批与确认体验是同一套纪律,只是被用在了"还没有任何历史可供推理"的时刻。
  • 让第一次授权在视觉上就是可撤回的,并且把撤回入口放在他们所在的位置。知道自己收得回来,才使得给出去这件事变得合理。一个藏在三层菜单之后的权限页面,无法给一个才用了四分钟产品的人提供这份保障。
  • 把首次运行的授权单独记为一类并复盘它。如果大多数用户在五秒之内就批准了最大权限范围,那你的流程不是在取得同意,而是在收割点击——这是一项治理发现,不是一次转化胜利。
STEP 5

教会修复,因为用户的第一次纠正,就是他们判定"这是不是协作"的那一刻。

每个智能体都会跑偏。跑偏是否致命,几乎完全取决于用户知不知道该怎么办——而首次运行是你唯一能拿到他们全部注意力去演示这件事的时候。

  • 至少演示一次任务中途的纠偏。让用户打断、补一条约束,然后看着智能体把它吸收进去而不是从头再来。做过一次这件事的用户,与只看着它一路跑完的用户,与工具的关系是根本不同的。
  • 在需要撤销之前,先让撤销可见。一个可用的撤销的存在,会改变人们愿意让智能体去尝试什么,也就是说它抬高了首次会话的价值,而不只是为它上了保险——这正是撤销与可逆性铺开的论证。
  • 无论之后展不展示,都要为首个结果展示轨迹。读了什么、调了什么、决定了什么。用户正在建构一个"这东西怎么运转"的模型,而这是唯一能支撑它的物证。几次会话之后大多数人就不看了,这没问题——它已经完成了使命。
  • 把第一次失败当作一条设计好的路径,而不是一个错误态。如果首个任务失败了,就说清楚失败在哪、它没有碰过什么,并给出那个能跑通的更窄版本。一次优雅失败并成功恢复的首轮会话,可能比一次悄无声息的成功带来更好的校准。为失败而设计在这里杠杆最大。
  • 让纠正成本低廉,并且显然是被欢迎的。用户第一次编辑输出时,他们既在教你,也在测试这个产品想不想被教。如果那次编辑消失进一个没有任何回应的文本框,他们就得到答案了。
STEP 6

把首次会话单独度量,因为你的汇总指标天生就在掩盖它。

混合后的质量指标由你的深度用户主导,而他们早已学会了边界、形成了绕行方案,也不再去问那些会失败的问题。你最需要看见的那群人——处在头十分钟里的人——在仪表盘上的每一个数字里都只是舍入误差。

  • 把首轮会话成功率作为独立指标上报,定义为"在真实数据上拿到一个经核验的有用结果"。不是"完成了引导",也不是"发出了一条消息"。如果你定义不出那个结果,你就还没定义出首次运行的任务。
  • 盯"到首个有用结果的时间",看尾部。p90 是最可能流失的那批用户的真实体验,而中位数把它遮得严严实实。
  • 按"首轮发生了什么"切分队列,追踪次日与七日回访率。"首个任务成功"与"首个任务失败"两个队列之间的差距,就是一次糟糕首次运行的诚实标价,而且它用的是你的管理层本来就在读的那种货币。
  • 每周手工读头十份文字记录。不抽样、不做摘要。新用户的措辞与智能体真实能力之间错开的那个具体位置,读三十秒就能看见,在任何汇总指标里都看不见——而这是整栋楼里最便宜的用户研究。
  • 每次能力变更之后,都以新用户身份重跑一遍引导。你在屏幕上描述的那条边界会悄悄过期,而最不可能察觉的人就是把它建起来的那个人。把它写进发布检查清单,紧挨着灰度发布与版本化

本周只做一件事的话:以新用户身份打开你的引导流程,写下一个通情达理的人会从中推断出的那条边界,然后拿它和你在同一批任务上的评测结果比一比。这两条线之间的距离,就是你正在刻意交付的那份失望;而把它收窄通常意味着撤掉一句承诺,而不是加一个功能。把用户引导到智能体的边界,而不是它的天花板。

相关:为信任而设计是校准论证的完整版,渐进披露讲展示多少、何时展示,智能体交互模式提供词汇表。