环境式临床病历智能体

8 分钟读完

Y35
实战手册 · 领域实战手册

环境式临床病历智能体。

把环境式 AI 病历助手卖出去的每一个数字,量的都是医生,不是病历——那个被反复引用的 JAMA Network Open 结果把职业倦怠从 51.9% 降到 38.8%,而它压根没有测量病历质量。这道缺口就是整个设计难题:签署耗时与病历保真度朝相反方向拉扯,其中只有一个被埋了点;而签署是一次著作权转移,它让一个人在法律上为模型写下的文字负责。要建的是复核那一步,不是草稿。

STEP 1

先定 KPI,再选厂商,因为那个显而易见的 KPI 是与你对抗的。

病历负担是真实的,环境式采集也确实在缓解它;医生报告每天拿回三十分钟到两个多小时,而如今大约三分之一的医疗机构能用上这一类产品。这些都不存在争议。有争议的是:部署之后,你究竟该优化什么。

「每次就诊省下的分钟数」和「签署耗时」是每块看板自带的指标,而把它们最大化的办法,是让医生不读就签。同一批证据在更长的时间尺度上本就含糊——匹兹堡大学的一项随访发现,倦怠在后续各时间点上又回升了——如果说头一个月的收益有一部分来自「少读」,而后来的代价来自在下游改病历,那这正是你该预期到的形状。

  • 把「省下的时间」当作约束(「不得增加病历耗时」),永远不要当作目标。目标会被钻空子,约束只会被满足。
  • 把目标设成一个只有你自己建才会存在的保真度指标:已签署病历中含有临床上实质性错误或遗漏的比例,抽样并经裁定。没有任何产品默认交付这个。
  • 预期这两者会互相交换。一个在同一个季度里把两者都改善了的项目,通常是在量签署延迟,然后把它叫作质量。
STEP 2

从签署这一刻倒着设计,因为它是一次著作权转移。

签下这份病历的医生,在此后所有要紧的场合都是它的作者——临床交接、费用依据、医疗纠纷取证、执业资格。模型在上述任何一个房间里都没有出庭资格。这不是治理层面的一条脚注,它直接决定了界面怎么做。

  • 让复核一份病历,比写一份更快。这才是真正的产品需求,而它是一个 UI 需求,不是模型需求。用 diff 式呈现、把每一句论断链回到就诊中产生它的那个时刻、把缺乏支撑的行在视觉上单独隔开——见智能体产出的复核队列。
  • 永远不要给签署通路预填。把一天的就诊一键全签,会把复核这一步变成走过场;而它恰恰是呼声最高的功能。拒掉它,或者只对改动量低于某个阈值的病历限量开放。
  • 让草稿可归因。记录里应当带上是哪个模型版本、哪条提示词产出了草稿,以及医生在签署前改了什么——这就是寻常的审计轨迹那套论证,只不过被审计的那份产物,是一份关于某个人的法律文件。

给任何一个待定功能一个好用的检验:如果它在一次庭外取证中被如实描述,你还坦然吗?「系统标出了三处它无法支撑的陈述,医生逐条复核」过得去。「系统生成了一份完整病历,医生四秒后签署」过不去。

STEP 3

你造出了第二份记录,而没人决定它的去向。

环境式采集意味着这次就诊的录音如今存在了。不论病历最终变成什么样,音频和转写稿都是各自独立的产物,各自带着自己的同意、留存与取证后果——而团队常常在这三件事都没有结论的情况下就上线了。

  • 同意是按法域、按就诊来处理的,不是按部署。要求全体在场方同意的州会改变话术,房间里多一位第三方也会。把同意采集嵌进就诊开始的流程,记录当时念的是哪个版本的告知,并确保拒绝之后还有一条可用的退路——说「不」的患者不能变成等着的患者。这套机制与录音同意与脱敏相同。
  • 音频留存窗口要在上线前定,不是在收到第一张传票之后。无限期保留原始音频,给你的是一个调试语料库,给对方律师的是一份「房间里说过的一切」的录音,包括没写进病历的那部分。多数项目应当在签署时删除音频,转写稿只保留到 STEP 6 的质量抽样所需的时长为止。
  • Trace 就是 PHI。提示词、转写稿与模型输出统统含有受保护健康信息,这直接排除了默认的可观测性姿势——见 智能体 trace 中的 PII 脱敏与留存与诉讼保全。
STEP 4

危险的那类错是遗漏,不是编造。

凭空编出的句子是人人都会预料到的失效,也是最好抓的:医生读自己的病历,会注意到一个患者从未报告过的症状。真正能从复核里活下来的错误安静得多。医疗信息学研究者给其中最典型的那种起了名字——简化型幻觉:摘要把一句带保留的、有条件的、或是否定的陈述,压平成一句干净的陈述句,而干净的那版读起来像一份更好的病历。

  • 给每一句论断强制一个来源层级。第一层:就诊中说过的,带时间戳。第二层:从结构化 EHR 字段取来的,写明是哪个字段。第三层:推断出来的——而病历里根本不许出现这一层。这里的全部工作就是接地;见幻觉与接地。
  • 禁止写下从未说出口的阴性发现。在没有任何查体被口述的情况下写出「双肺听诊清音」,是那个经典的危险输出,因为它既说得通,又能计费。体格检查所见,只有被说出口才允许出现。
  • 逐字保留保留语与否定。「否认胸痛」与「未报告胸痛」是关于「谁说了什么」的两种不同主张。凡是模型想抹平的地方,它应当去引述。
  • 把遗漏显式地摆出来。病历末尾应当列出模型听见了但没有安放的内容——顺口提到的一次过敏、患者说自己已经停掉的一种药。被摆到复核者眼前的遗漏是一次被抓住的错误;否则,遗漏在结构上就是看不见的。
STEP 5

别让写病历的那个东西,同时决定这份病历值多少钱。

病历是费用依据。更丰满的病历能支撑更高的评估与管理(E/M)等级,于是任何一个被「每次就诊收入」奖励的系统——哪怕只是隐含地,哪怕只是被厂商的 ROI 看板奖励——都存在一个单向的、多写一点的激励。放任不管,优化器会找到那个方向,结果是一份逐句看都站得住、整体看却站不住的病历。

  • 把角色切开。病历助手产出临床叙述。编码归属是下游的一步,有它自己的控制与它自己的双边成绩单,见医疗编码与理赔申报智能体——编码偏低永远不会被拒付,所以单边目标存在一个退化解。
  • 盯分布,不是盯单份病历。稽核风险浮现出来的样子,是上线之后你的 E/M 等级构成按医生、按科室发生了漂移。一份一份查病历找不到它;拿每月分布去比对上线前的基线就能找到。
  • 拒绝模板膨胀。一个总是输出十项系统回顾的按医生风格模板,就是换了个名字的「照抄前次」,而且它在结构上就废掉了 STEP 4 里的来源层级。
STEP 6

去量那些熬过签署的东西,并且留一部分就诊不上这套系统。

四个数字加一份排除清单,足以把这件事负责任地跑起来。

  • 按医生统计的签署前修改率。不是拿它当质量分——拿它当注意力探测器。一个修改率在第三周掉到接近零的医生,已经不读了;而那是一次关于培训的干预,不是关于模型的。
  • 抽样并经裁定的实质性错误率。每周抽取已签署病历,由第二位医生对着转写稿逐份比对并分类:编造、遗漏、扭曲。这是整个项目里唯一一个量病历本身的数字。
  • 下游更正率。签署之后提交的补记与修订——签得太快的代价,正是在几周后从这里重新冒出来的。
  • 患者可见的结果。病历是要向患者开放的;针对病历内容的投诉是一个免费、有偏、但非常快的信号。
  • 一份明确的排除清单。默认不开启环境式采集的就诊类型——行为与精神健康、涉及疑似受虐的就诊,以及任何「录音这件事本身就会改变患者会说什么」的场合。这份清单是一个临床决定,做一次、落成文字,并且由代码而不是由制度来执行。

把它当成一个起草工具来上线:不留情面地展示不确定性、不提供批量签署;先在一个科室跑一个季度;并且从第一天起就给每周那次经裁定的抽样拨预算——它是唯一能告诉你这个项目是否奏效的仪器,也是每份商业论证里第一个被砍掉的行。如果在草稿之外你只能建一样东西,就建那份遗漏清单:它把复核抓不住的那种失效,变成了复核抓得住的那种。

延伸阅读:医疗健康智能体讲更宽的临床面,人在回路讲关卡该设在哪,把实战手册适配到你的领域讲如何推导下一个垂直领域。