引用与来源归属的交互设计

11 分钟读完

H14
实战手册 · 智能体体验与人机交互

引用是一种便于核验的可供性,不是一枚信任徽章。

没人点开的引用不会让答案更正确,只会让读者更自信——而这恰恰与你想要的相反。斯坦福对四款生成式搜索引擎的审计发现:只有 51.5% 的生成句子被其引用完全支撑,也只有 74.5% 的引用真正支撑了它所挂靠的那句话——也就是说,在几款融资充裕的产品里,四分之一的脚注是装饰品。设计的活儿不是把来源展示出来,而是把"核验某一条具体主张"的代价压到大约三秒,然后去测量究竟有没有人真的去核。

STEP 1

先定下引用是干什么用的,因为两种用途需要两种界面。

智能体产品里的每一条引用,服务的都是下面两件事之一;没把它们分开的团队,会做出一个两头都不称职的界面。

  • 核验。读者想验一条自己马上要依赖的主张。他需要快速抵达确切的支撑文本、看到上下文,然后回来。这趟往返的速度就是产品的全部。
  • 归属与审计。之后的某个人——审阅者、监管方,或那个署名在输出上的人——需要还原某句话的来处。他需要的是稳定、耐久的标识符,以及一份熬得过会话生命周期的记录;那是与聊天气泡里一个链接完全不同的产物。

把两者混为一谈的失败形态,正是人人都在发的那个设计:段落末尾一个上标数字,链到某个域名的首页。它对核验来说太粗——读者得自己在页面里找那条主张,而这正是他想省掉的活儿;对审计来说又太易逝——页面会改,链接会烂。它唯一成功做到的,是发出"是有来源的"这个信号,而当底下的支撑其实很弱时,这恰恰是那件真正造成伤害的事。

本页余下内容都由这个不太舒服的判断推动:一条无法核验的引用,比没有引用更糟。没有来源时,读者会对一段流畅的答案施加正常的怀疑。有来源却核不动时,这份怀疑被压了下去,而证据并没有被补上——这是一次背后什么都没有的信任转移,也正是为信任而设计里编目过的那种过度信任失效。

STEP 2

引用要在生成过程中挂上,而不是事后补。

把引用弄到答案上有两条路,它们在界面里长得一模一样,而只有一条可能是忠实的。

  • 事后归属先写答案,再去为每一句检索一个匹配的来源。检索的目标是模型已经写死的主张,于是搜索会找到最接近的现成文本并挂上去。当那条主张是错的、或是综合出来的,最近邻依然会被返回——这正是"主题上相关、却支撑不了这句话"的引用是怎么来的。74.5% 这个数字背后就是这个机制。
  • 接地生成先把检索到的段落放进上下文,并要求模型边写边为每条主张吐出一个片段标识符。这样引用就成了"模型当时在看什么"的记录,而不是事后拼出来的辩护。

选第二条路,工程后果很具体,而且落在检索层而不是前端。

  • 切片需要稳定、可寻址、且熬得过重建索引的 ID,因为一条指向"昨晚刚重建的那个索引里第 4117 号切片"的引用,现在指着的是别的东西。要把文档 ID、版本和字符偏移都带上——你能不能做到,取决于面向 RAG 的文档解析里那些解析决策。
  • 按片段引用,不要按文档引用。"这条主张来自那页的这两句话"几秒钟就能核;"这个答案用了那个页面"根本核不了。
  • 留下检索到的文本,而不只是 URL。模型真正读到的那段摘录才是证据。线上页面是另一个对象,可能早就变了;对审计轨迹而言,这个区别比看上去重要得多。
  • 多跳答案需要按跳记录来源。一个搜了四次再跨源综合的智能检索循环,没法诚实地给结论挂上一条引用。要么把每一个支撑步骤都引出来,要么把结论标成推断——见再下一步。
STEP 3

照着"核一条要多久"来设计,并把这个数字往零压。

决定你的引用界面成不成立的指标,是读者确认一条他存疑的主张要花多长时间。每一个设计选择要么压低这个数字,要么抬高它。多数产品在抬高而不自知,因为他们优化的是答案的观感,而不是怀疑时的人机工学。

  • 就地展示支撑原文。悬停、点按或行内展开,露出真正的那几句话——不是标题、不是域名、不是来源摘要。这一项改动,比这份清单上其余所有加起来还管用,因为它把上下文切换整个去掉了。
  • 当读者确实要离开时,深链到确切位置:文本片段、页码与段落锚点、媒体中的时间戳。把读者丢在一份 90 页 PDF 的第一页,是一次伪装成引用的拒绝帮忙。
  • 锚定到主张,而不是段落。四句话末尾的一个标记只告诉读者"这里面有东西是有来源的",剩下的靠猜。按主张打标记视觉上更吵,但读者省的力气多得多。
  • 别把核验做成一种模式。如果查来源意味着离开对话、打开一个面板、丢掉滚动位置,那核验就在与"继续往下读"竞争——而后者每一次都赢。
  • 让引用熬过复制粘贴。智能体的输出多数会立刻离开产品,被粘进文档、工单或邮件。如果来源信息熬不过这次转移,那条主张到了下游就被剥光了一切可核验的东西,而下一位读者甚至不知道它出自模型。

不妨在某一处刻意抬高这个代价:当答案即将被据以行动、而不只是被阅读时。一个破坏性或不可逆的步骤,值得让人先打开来源、确认按钮才生效——这与审批与确认界面里安放摩擦力的推理是同一套。处处让核验变便宜;只在出错代价高的地方强制核验。

STEP 4

让没有支撑的句子看起来就不一样。

每句都加脚注的设计,和一个脚注都不加的设计,传递的信息量一样多——都是零。信号在反差里,而多数产品把均匀的引用密度当成质量目标,恰恰毁掉了这份反差。

  • 区分三类句子。直接引用或有直接支撑的;跨来源综合出来的;以及背后没有任何检索、纯出自模型自身知识的。三类都正当,而把它们在视觉上合成一类,正是让一条无来源的推断继承周围有来源句子的可信度的原因。
  • 诚实地渲染第三类。模型从自身权重里产出的句子不该带一个引用形状的标记,而且应当能被明显地与带标记的句子区分开——知识截止也正是在这里咬人,因为无来源的主张恰恰是可能已经陈旧数年的那些。
  • 让智能体能说"这些来源支撑不了"。"检索到的文档没有覆盖这一点"是一个正确的输出;如果你的界面没有地方渲染它,模型就会改为给出一个自信的答案。弃答得先在界面里有个容身处,才谈得上把它训出来。
  • 把冲突摆出来,而不是悄悄消解掉。两个来源打架时,挑一个并引用它的答案,比同时呈现两者要不诚实——而分歧本身往往是最有价值的输出,对研究智能体那类模式尤其如此。
  • 抵抗密度军备竞赛。引用数量是那种"给'天是蓝的'也挂个来源就会上涨"的指标,而每一个装饰性脚注都让真正承重的那些更难被找到。这是个渐进式披露问题:把一位怀疑的读者真正会质疑的那些引用浮出来。
STEP 5

来源不止是那个链接,而那个链接本身就是攻击面。

一条引用断言的是"这条主张来自某处"。它没有断言的两件事——那个某处是否可信、以及它现在是否还说着同样的话——恰恰是用户会自行脑补进去的。

  • 显示检索时间与来源日期。一条引到"八个月前抓取的页面"或"写于 2019 年的文章"的引用,与今早刚抓的那条,干的活儿完全不同,而界面通常两者都藏了起来。陈旧在链接里不可见,在答案里却是决定性的。
  • 别用统一的样式给权威性洗白。监管机构的 PDF、厂商的营销页和论坛里的一条留言,渲染出来是一模一样的上标。如果你的语料混着不同层级,层级就该出现在引用里,否则你等于在告诉读者:所有证据一样重。
  • 把"引用了攻击者可控的内容"当成实时风险。智能体抓到的任何网页都可能藏着冲模型去的指令,而引用界面是这个问题的后半截:渲染抓来的标题、链接或远程图片,等于给被检索内容开了一条通往你界面的通道。渲染前要做净化,并且带着"引用渲染器"而不只是"模型"的视角去读提示注入
  • 区分"智能体读过它"和"智能体推荐它"。一个被检索到、内容却与答案相反的来源,仍然是一个来源;而用户往往把任何列出来的链接理解成背书。
  • 把"这是机器写的"这条披露与主张绑在一起。来源的溯源和输出本身的溯源是两项不同的义务,而后者正越来越成为法律义务——见披露与内容溯源
STEP 6

在流水线里量忠实度,在用户身上量识别率。

引用质量是少数几个有干净的自动化检查方法的体验属性之一,而几乎没人在跑它。有两项测量,回答的是不同的问题。

  • 离线的引用忠实度。对每一个主张-片段对:该片段是否真的支撑了该主张?这是一个自然语言推理问题,裁判模型做得不错,附带LLM 裁判里那些关于校准裁判的常规注意事项。会掉出两个数字,而你两个都需要:有支撑的主张占比,以及支撑住了自己主张的引用占比。斯坦福那次审计分开报这两个数是有原因的——它们各自独立地失效,取平均会盖住究竟坏的是哪一个。
  • 引用覆盖率。承重的主张里,有多大比例带着任何支撑?一份十五条断言只引了三条的页面,忠实度分数再高也不是好结果。
  • 用户侧的识别率。唯一能告诉你这项可供性是否奏效的测量:埋一条"其引用并不支撑它"的主张,看有多少读者能抓出来。引用点击率是个自我安慰的代理指标——一次落在首页上的点击,什么都没教给读者。
  • 也盯住虚假自信这个方向。让读者在看到来源前后各报一次自己的信心。如果信心涨得比准确率还多,说明你的引用界面在制造过度信任,而解法是降低核验代价,不是加更多脚注。
  • 把它设成闸门。评估 RAG 的做法,引用忠实度应当和答案质量待在同一套回归测试里。检索器、切片器或提示词一改,它就会悄悄退化,而界面上不会有任何地方看起来不一样。

先把"悬停显示原文"发出去,别的都往后排。把每一条"点开会跳转页面"的引用换成"就地露出支撑句子"的引用,并埋点统计读者展开的频率。这一项改动就把信任徽章变成了可供核验的东西,而且通常一周之内就会曝出一件不太愉快的事实:你的引用里有相当一部分并不包含那条主张,而没人发现,因为根本没人点开过它们。用"实际发生的核验次数"来衡量引用,永远不要用"展示了多少条引用"——并且把任何读者三秒内核不动的脚注,当成过度信任的制造机而不是一项功能。

相关:透明度与可解释性看为什么推理轨迹不像来源那样算证据,幻觉与接地看这一切在约束的是什么失效,研究智能体看在哪个领域一条捏造的引用会让整份交付物作废,以及评估 RAG 看是什么样的测试台在让这些数字保持诚实。