幻觉与接地

F9
概念 · AI 基础

幻觉与接地。

一个编出貌似合理答案的模型,听上去和一个真知道答案的模型一模一样——这正是问题的全部所在,而在提示词里写多少遍"要准确"都无济于事。本条目讲清为何编造是这类系统生成文本方式的结构性属性,而非等待打补丁的 bug,以及"接地"(grounding)究竟能买到什么。

STEP 1

流畅与真实是两条互不相干的轴。

大语言模型被训练去产出最可能的下一个令牌,而不是最可能为真的下一个令牌。这个目标里没有任何东西能把一条正确的引文和一条编得很像的假引文区分开——两者都是流畅的序列,而流畅正是模型所优化的东西。

由此有两个推论,它们解释了人们感到意外的大部分现象:

  • 没有内建的"我不知道"。被问到知识范围之外的问题时,模型并不会撞上一条缺失的记录然后返回空值——它会继续,因为继续就是它的全部工作。输出是最貌似合理的续写,而对一个读过百万份正确答案之形态的系统来说,"貌似合理"是个极低的门槛。
  • 自信是一种文体,而非一个信号。编造答案那种笃定的语气,是从训练数据里正确答案的笃定语气借来的。你无法从文字中读出可靠性,所以"它听上去很自信"作为证据一文不值。

"幻觉"是这一现象的通用叫法。这个名字略有误导——它暗示某种故障,可产生错误答案的机制,与产生正确答案的机制是同一个。

STEP 2

你真正会遇到的三种。

把它们混为一谈,会掩盖一个事实:它们的解法并不相同。

  • 凭记忆编造。模型用训练中吸收的东西作答,然后答错了——一个杜撰的统计数字、一个不存在的库函数、一篇作者真实而标题虚构的论文。最常出现在具体细节上:数字、人名、日期、版本号、URL。
  • 不忠于所给上下文。你递给模型一份文档,它总结出了文档里没说的东西——混入先验知识、过度概括,或用杜撰来消解歧义。这一种最要紧,因为它正是 RAG 的故障模式:检索成功了,生成照样撒谎。
  • 虚构的结构。模型产出一个形状规整、内容却是虚构的对象——一次 API 调用,参数看着像模像样,真实 API 却根本不接受;一条 JSON 记录,带着一个杜撰的 ID。schema 约束输出保证的是形状,从不保证内容;校验通过并不能告诉你其中的值是否真实存在。

发生率会随三件事可预期地上升:离训练分布越远、问得越具体、答案越长。长答案是复合的赌注:每多一条断言,就多一次出错的机会。

STEP 3

接地:让答案依赖于你能掌控的东西。

接地就是把证据摆到模型面前,并要求答案出自证据而非出自权重的做法。它是杠杆率最高的单项干预,且由三部分组成——而人们往往只做了其中一部分:

  • 提供来源。检索相关文档、调用工具、查询数据库——把真实依据放进上下文窗口,而不是指望它恰好在权重里。这正是 RAG 与工具调用存在的目的
  • 把答案约束到来源上。明确指示:只依据所提供的材料作答;如果答案不在其中,就说出来。给模型一个被许可的退路——一句明确的"来源中未找到"——很关键,因为一个没有合法失败方式的模型,会发明一种成功的方式。
  • 要求出处。要求每条断言都引用它所出自的段落。引文不是装饰:它把一段无从核验的文字,变成一组人或脚本可以抽查的断言,而且这项要求本身就能可测量地压低编造率。

接地能大幅减少编造;它不能消除编造。模型仍可能误读某个段落、把两处来源揉在一起,或为文档并未支持的断言引用一份真实文档。把接地后的答案当作可核验的,而非已核验的——它的价值在于核验变便宜了,而不是核验变得不必要了。

STEP 4

如何发现,以及为何智能体让赌注更大。

既然无法彻底杜绝,就为"抓住它"留出预算:

  • 对着来源核验,而不是对着模型的自信核验。凡是机器可查的断言——必须出现在文档中的某个数字、必须存在于库中的某个函数、必须能解析的某个 ID——就用代码去查。一次廉价的确定性检查,胜过一次昂贵的概率性检查。
  • 用多次采样交叉验证。把同一个问题问上几遍;在多次采样间发生变化的断言,正是模型最没把握的那些。这招之所以能抓住编造,恰恰因为杜撰是不稳定的,而回忆出的事实不是。
  • 把"忠实度"单独打分。评测集里,"这是否被检索到的上下文支持"和"这是否是正确答案"是两个不同的问题,一个系统完全可能通过其一而败于其二。两者都要测。

在智能体里,幻觉不是一句错话——它是一个错误的动作。一条杜撰的文件路径被写入;一个编造的记录 ID 被更新;一个记错的参数被对着线上系统执行。更糟的是,这个编造出的结果会作为看似真实的观察重新进入上下文,循环便在其上继续构建。这正是"执行前先对着真实环境校验工具参数"的论据所在——而不是想当然地认为一次符合 schema 的调用就是一次有意义的调用。

务实的立场是:假定任何答案里都有一部分是编的,能接地的全部接地,其余的都做到便于核验,并把人的注意力留给那些"错了确实要付代价"的断言。评估 RAG 深入解析把忠实度与接地度指标带入生产级细节,以 LLM 为评判运营章节则讲如何把这些检查规模化地自动跑起来。