医疗编码与理赔申报智能体。
给编码智能体设定的那个显而易见的目标——把账单收回来、把拒付率压下去——存在一个不费力的作弊解,而一个无人看管的优化器一定会找到它:把所有东西都往低了编。拒付下降,收入悄悄流失,而没有任何一家付款方会来抱怨,因为你向他们少要了本该属于你的钱。这正是这个领域的特别之处。你在每一笔理赔上都能免费拿回一个带对抗性的真值标签——这在智能体部署里几乎绝无仅有——而这个标签在一个方向上存在系统性偏差。从第一天起就把目标做成双边的,否则你交付的将是一份非常听话的收入损失。
标签会自己送上门,而它并不是你想要的那个标签。
理赔生命周期免费给了你一个监督信号。一份 837 发出去,一份 999 在语法层面确认了这次交换,一份 277CA 在理赔层面给出受理或退回,最终一份 835 付款说明带着钱回来;凡是被扣下的钱,都会附上一个理赔调整原因码(CARC),通常还有一个付款说明备注码(RARC)。HIPAA 至今仍然规定这些交易使用 005010 版本,所以这套格式已经稳定了十几年,解析早就是个已解决的问题。
你绝不能做的,是把这个信号误当成「正确性」。835 告诉你的是某家付款方按其自身裁定规则决定支付多少。它不告诉你病历文档支持的是什么。两者在两个方向上都会背离:
- 被支付的理赔也可能是错的。付款方并不会在裁定环节逐行稽核;编码偏高的账单常常先付后追,追回时还带着利息和罚金。
- 被拒付的理赔也可能是对的。按 Premier 的数据,医疗机构提起申诉的拒付中约有 70% 被推翻并获得支付——这是对付款方第一次答复的多数否决。
- 而编码偏低对它完全不可见。这套标准里没有任何一种交易会说「你本来可以多收一点」。恰恰在你的优化器会漂移的那个方向上,信号是沉默的。
延迟本身的机理——标签在决策数周之后才落地,而且只对你放行的动作落地——与欺诈与争议处理里是同一个陷阱,纪律也相同:留住队列、在成熟的理赔上做评估,绝不看本周的看板。这里特有的是偏差的方向,那正是下一步的主题。
把目标做成双边的,否则智能体会一路往低了编,编出一张干净的成绩单。
单边目标——最小化拒付、最大化一次通过率——是退化的。最安全的编码永远是最不具体的那个、级别最低的那个评估与管理码、不带任何修饰符的那个。它会被支付,永远不会被申诉,并且在每一次就诊上都让机构永久性地少收钱。反馈回路里没有任何东西会把它暴露出来。
解法是一张带两个对立项的成绩单,两项都在同一批成熟队列上测量:
- 拒付率与返工率——由付款方监督的那一边。要跟机构自身的历史基线比,而不是跟行业数字比;不同专科之间的分母差异太大,跨机构比较没有意义。
- 编码级别分布对照经稽核的基线——没人监督的那一边。随机抽取智能体处理过的一批就诊,让持证编码师盲编,再比较两份分布。向低特异性编码的漂移正是这一项要抓的失败,而且它是唯一能抓到的东西。
分布漂移也是监管从另一个方向找上你的路径。CMS 会对高级别编码的离群者做标记,而一个向上漂移的智能体会把你送到 UCHealth 待过的位置——见第 4 步。盯住分布而不只是均值,并对两个方向上的移动都设告警。
抽样盲编是整份手册里性价比最高的一件仪器,而它建起来很无聊:一个队列、一份随机样本、两名持证编码师、一列分歧记录。请把它当作一项长期运营成本来预算,而不是上线前的一次性验证。没有它,你那两个目标项里有一项是没被测量的,于是智能体只会去优化另一项。
CO-16 是一个指针,不是一个原因——你的拒付分类法成败全在这里。
在大多数账目里,最大的拒付桶是 CARC 16:「理赔/服务缺少裁定所需的信息,或存在提交/计费错误。」照字面读,它几乎没有信息量。这是有意为之——X12 要求它必须至少伴随一个 RARC,而真正的诊断细节由 RARC 承载。一个只按 CARC 分流的智能体,会把自己最大、最可处理的那个桶压成一个不加区分的类别,并且从中什么也学不到。
请以 CARC/RARC 组合来建分类法,并把那些本质不同的问题分开:
- CARC 16 + RARC——数据或文档缺陷。可分流,通常智能体自己就能修,而 RARC 会告诉你怎么修。
- CARC 197——「缺少预授权/授权/告知/预处理。」这压根不是编码失败,而是编码上游的流程失败;把它回灌进编码模型,等于在拿别人的错误做训练。
- CARC 50——付款方认定不具备医疗必要性的服务。这是文档与临床支持问题,可申诉,也是最值得交给人的一类。
- CARC 97——已被打包进另一项已裁定服务。这是一个真正的编码逻辑信号,也是应当抵达模型的那一个。
- 组码同样要紧。CO 是由医疗机构核销的合同义务,PR 是患者责任。合同性核销不是缺陷,绝不应进入智能体的误差信号。
这一块接下来只会变好,不会变坏。HHS 于 2026 年 3 月定稿了首批 HIPAA 理赔附件标准,采纳 X12N 275 与 277 交易,合规期限大约在两年后——这会把「把文档发过去」从传真变成一次结构化、可被机器处理的交换。请现在就把文档路径当成一种交易来设计,因为它正在变成交易。
责任是按笔计、且会相乘的,这把通常的风险模型整个倒了过来。
大多数智能体部署担心的是偶发的一个坏输出。这里的形状是反过来的:一个系统性的编码错误会被复制到每一次匹配到它的就诊上,而《虚假申报法》(FCA)的责任是按笔理赔核定的——三倍损害赔偿,外加目前每笔 14,308 至 28,618 美元的民事罚款;2026 年这一区间未变,因为通胀调整所需的数据无法计算出来。一条在常见就诊类型上出错的规则,代价不是一笔理赔的金额。它会相乘。
值得一读的先例是 UCHealth:司法部于 2024 年介入,该案以 2,300 万美元和解,起因是一套偏离相关编码标准的自动编码规则,抬高了急诊评估与管理的级别。其中没有模型参与,也没有指控主观故意——是确定性的自动化被一致地施加,从而产生了责任敞口。FCA 的主观要件涵盖「罔顾后果的漠视」,而一条未经稽核的自主流水线正好落在那里。
由此得出三条设计后果,没有一条是改模型:
- 给逻辑打版本并冻结。你必须能在几个月之后说出某一笔理赔是由哪一套规则、哪一个模型版本生成的。这让审计轨迹成为硬性要求,而不是加分项。
- 把「已复核/未复核」做成一条被存下来的事实。不要靠时间戳去推断。你会被问到的问题是:在这一笔理赔上,实际发生过什么复核。
- 对群体层面的偏移告警,而不是对单笔分数。危害是一条分布在移动。单笔置信度看不出它;第 2 步里的分布比较能看出来。
你能不能自主运行,现在是一个路由问题,不是架构问题。
目前看来,没有任何联邦规则要求在提交前必须由人复核 AI 生成的编码——但每一笔理赔所附的认证声明,都让提交方对它负责,无论它是由什么生成的,所以「是厂商的模型干的」不构成抗辩。州法正在填补这个空白,而且填得并不均匀,这才是运营上要紧的部分。
印第安纳州的 HB 1271 于 2026 年 7 月 1 日生效,据我们所知是美国第一部直接限制医疗机构侧自动化的法律:它禁止医疗机构在没有经由该机构或另一位参与该理赔编制的人员复核的情况下,使用 AI 提交医疗福利理赔。它面向付款方的另一半,则禁止保险机构在没有人先行查阅病历的情况下,把 AI 作为以医疗必要性为由下调编码的唯一依据。其他州的动作——加州 SB 1120、马里兰、犹他等——大多规制的是付款方一侧,但方向是一致的;而 OIG 2026 年 2 月的医疗保险优势计划合规指引,已明确把「用于添加风险调整诊断的 AI 生成 EMR 提示」点名为一项合规风险。
所以自主与否这个决定属于路由表,键就用你手上已有的事实:
- 提供服务的医疗机构所在司法辖区——因为在印第安纳州提交的理赔带着一项复核义务,而在别处提交的没有。
- 付款方与业务条线——医疗保险优势计划的风险调整如今背着被点名的监管关注,而商业按项目付费没有。
- 编码族——评估与管理级别、以及风险调整诊断,是错误既呈系统性又会被追责的两个族。即便法律没有强制,也把它们路由到人工复核。
请把这一块做成带生效日期的配置,而不是代码里的条件判断。规则跟着立法日程变,你每年都要改上好几次。
去检索编码,别去回忆它——并且每年十月重新验证一遍。
让模型从权重里吐出一个编码,是那个行不通的架构,而且有一份干净的测量:2024 年发表在 NEJM AI 上的基准测试,用数万个真实的 ICD-10-CM 与手术操作编码考了当时的前沿模型,最佳者的完全匹配率为 33.9%,所有模型都不足 50%。此后模型变强了;结构性问题没有变。编码集庞大、分层、按固定日历更新,且充满了仅靠侧别或就诊类型区分的近乎相同的兄弟项——这是一个披着生成外衣的检索与校验问题。
- 把每一个编码都接地到当前编码集这份数据上。先检索候选,再让模型对照病历文档为其选择给出理由,最后在编码进入理赔之前,校验它确实存在于生效编码集中且可计费。这是把接地用在一个封闭词表上;一个在校验环节被拦下的废止编码,就是一次你根本没发生过的拒付。
- 把年度更新当成有排期的模型漂移。ICD-10-CM 每年 10 月 1 日换版——FY2027 带来 190 个新码与 30 个删除;CPT 每年 1 月 1 日换版,2026 版共有 418 项编辑变更;HCPCS 则按季度变动。无论你重不重跑,你的评估集都会在这些日期上过期。
- 每次换版后重建基线。一份在更新前编好的留出集,测的是旧词表。请重新切一份,并预期受影响的编码族在一个周期内会出现真实的准确率下滑。
- 对厂商的准确率宣称打折。已公开的自主编码数字——95% 以上的准确率、很高的直接出账比例——都是厂商自报的,而据我们所能查到的,没有一项经过独立稽核。关于你自己那份就诊构成,唯一的数字来自你自己的盲编样本。
请按这个顺序上线:先把编码建议呈给人类编码师,由其接受或修改,持续测量数月,并以按编码族的修改率作为你的自主化地图。然后只在修改率接近零的那些族里放开自主提交,只在允许的司法辖区里放开,且在没有复核的情况下绝不放开评估与管理级别与风险调整诊断。经济账支持这份耐心——申诉一笔拒付的成本在每笔数十美元量级,而医疗机构每年要花掉数十亿美元去争这些钱;所以这里的回报来自那些压根没被拒付的理赔,而那是一件比「自动化率」这个头条数字慢得多、也安全得多的优化对象。
延伸:医疗健康智能体讲临床安全框架,保险理赔智能体从付款方一侧看同一个问题,模型风险管理讲这里需要的那套验证机制,人在环讲怎样把复核这一步设计成一道真正的控制而不是橡皮图章。