实战手册 / 领域实战手册

领域实战手册

按领域的实战手册——客服、研究、销售、数据分析、DevOps——该建什么,可以省什么。

  1. 客户支持智能体
    在自信错答率近乎为零的约束下优化分流:接地答案自主、交易设关、语气进评估、干净交接胜过自信猜测。
  2. 数据与分析智能体
    失败模式是自信的错误数字:schema/语义层接地、只读执行、核验作为独立阶段、弃答得分高于自信错答。
  3. DevOps 与 SRE 智能体
    只读优先,因为爆炸半径是生产:先诊断后修复、运维手册即经测试的工具、限制在工具签名里、变更管控不因操作者是模型而改变。
  4. 研究与综合智能体
    一个捏造来源即令整份交付物作废:检索-写作-核验、引用忠实度作为硬约束、保留分歧而非平均、深度与广度作为有界预算。
  5. 销售与 GTM 智能体
    失败模式是规模化的自动垃圾邮件:价值在调研/个性化而非量、同意作为上游 fail-closed 关卡、人工签核随触达面伸缩、评估中垃圾邮件风险赋重权。
  6. 金融场景智能体
    智能体在金融场景真正能创造价值的地方——对账、研报合成、KYC 审核——以及它们必须背着的硬性约束(审计、确定性、可供监管审阅的轨迹)。
  7. 医疗场景智能体
    病历记录、事前授权、分诊接待——这些是医疗中智能体真正节省人力的少数任务,以及离开它们就不能上线的隐私与临床安全护栏。
  8. 法律场景智能体
    电子取证、合同审阅、引文核查——法律智能体已经能跑的地方、它们会幻觉的地方,以及不同法域下需要的人工监督。
  9. 把实战手册适配到你的领域
    每份实战手册背后的元方法:按顺序回答五个问题来推导新垂直领域——任务、按可逆性的自主、作为接地与限制的工具、镜像代价不对称的评估、结构性护栏。
  10. 招聘智能体
    监管者先一步指定了架构的唯一领域:纽约市第 144 号地方法与欧盟《AI 法案》附件三都要求一个可数、可归因的按候选人决策——这正是自由文本式"匹配度强,8/10"设计过不了审计的原因,也是模型该待在漏斗拓宽一侧的原因。
  11. 邮件与日历智能体
    唯一一类未经认证的陌生人也能写入的记录系统:能熬过一次转发的来源分级、以强类型接口切开的读取者/执行者结构使邮件内容永远够不到发送通路、作为无人加固的零点击载体的日历,以及只在异常时才发问的确认设计。
  12. 辅导与学习智能体
    唯一一个把活儿干好就等于失败的领域:测无辅助后测而不是会话满意度、用代码而不是提示词执行提示阶梯、诊断错误概念而不是讲解知识点,并承认任何做得了作业的智能体都已经让作业作为考核失效了。
  13. 安全运营智能体
    唯一一类输入由"知道有模型在读"的对手亲手撰写的智能体:确定性富化、把裁决权挡在模型之外、按可逆性分配自主并给遏制动作设关,以及用那些"没人告诉过你判错了"的结案来搭黄金集。
  14. 翻译与本地化智能体
    流畅度不再预示忠实度,于是只读译文什么都抓不到:审校 diff 中的原文-译文对、用机器可校验的不变量设关卡(占位符对等、术语库、结构),并把术语当作检索问题而不是塞进提示词的一张术语表。
  15. 购物与结账智能体
    Instant Checkout 在上线商家不足十五家时被收回,因为难的是商品数据而不是支付——所以要把商品接地、在下单那一刻重新核验,并把唯一那个不可逆的步骤挡在模型之外的关卡后。
  16. 内容审核智能体
    公开准则只是十年间未成文判例的一份摘要,所以要把审核建成在已决案例上的检索——并让基础发生率而不是准确率分数来告诉你还需要多少审核员。
  17. 保险理赔智能体
    周期时间花在等一份缺失材料上,而不是花在裁定上——所以去建完备性引擎、在责任认定处停下,并刻意拒绝欺诈评分:它是这个领域里风险调整后回报最差的用例。
  18. IT 服务台智能体
    真正吃掉产能的工单最后都落在某个身份系统的变更上,所以产品其实是那层授权:用带外的持有型因子核验身份、从权限而非请求推导动作集合,并把密码与 MFA 恢复放到最后再上——或者干脆不上。
  19. KYC 与反洗钱开户智能体
    筛查告警里 90–95% 是误报,瓶颈从来不是发现,而是那堆没人能写出站得住脚论证的告警积压——所以让智能体去汇集证据、起草理由,由一个具名的人作处置,而制裁匹配器保持确定性并带版本。
  20. 采购与寻源智能体
    落标方有权拿到中标理由,所以唯一不该自动化的恰恰是那个分数:把带页级定位的需求覆盖矩阵建出来、让每份标书各自一个索引,并把排名留给一个能为之辩护的具名的人。
  21. 公共福利经办智能体
    MiDAS 在无人复核下自动裁定了三万四千人的欺诈,错误率约 93%,而荷兰补贴丑闻拖垮了一届内阁——所以智能体只组装卷宗、由具名的人做出裁定,检索要钉死在申领日期当时生效的规则上,而你必须去测的那类错误,是那些没人申诉的拒绝。
  22. 旅行与预订智能体
    搜索免费且可重复;下单则是一笔支付、一份合同,外加一个别人再也拿不到的座位——所以把它们做成两套系统,并让提交通道接受报价 ID 而不是参数、在提交时重新计价、带幂等键,并用对账代替重试。
  23. 供应链与物流智能体
    失效模式不是幻觉,而是自信地依据一个四小时前才为真的事实动手——所以给每个工具响应加上必填的 as_of 与由代码强制的最大年龄,把路径规划留给求解器、把智能体收敛到一份封闭的异常分类法,并且去测它从未报出的那个异常,而不是已报异常的精确率。
  24. 现场服务与派工智能体
    排程恰恰是早已被解决的那部分——派工上约束求解器胜过模型,所以智能体属于它读不懂的那两个边缘:决定哪些零件上车的受理,以及一天崩掉时的改约电话。每一次写入看板都是一句承诺,所以要先预留再确认、要假定人类派工员也在写入,并且衡量一次修复率而不是自动化率。
  25. 应付账款与发票智能体
    同业最佳的无接触率在 49% 上下徘徊多年,而失手的那一半并不是失手在读单据上——它失手是因为没有采购订单、没有收货记录,或者压根没人订过;所以要为例外队列而建,不是为干净通道。按"能不能撤回"而不是按金额设闸门:银行账号变更才是那笔你永远要不回来的损失。
  26. 催收与账款催缴智能体
    联邦 Regulation F 允许每笔债务每七天拨打七通电话;纽约市的 SHIELD 规则则规定每个账户七天内任何形式的联系只许三次——所以真正的产品是那个联系配额管理器,而不是模型,任何渠道在动笔之前都得先去扣同一个权威计数器。先确认对方身份,再谈内容;披露话术、金额与让步阶梯属于代码,不属于生成。
  27. 营销与广告运营智能体
    智能体拿到一根实时的花钱杠杆,和一个在它想动手的时间尺度上纯属噪声的反馈数字,而广告平台早已在同一个账户上跑着自己的优化器——所以这是一个控制器设计问题:最小变更间隔、以转化数而非小时数计的观察窗口、取自你自己数仓而不是取自收你钱那一方的目标函数,以及一个只读的对账智能体——它从坏掉的埋点里追回的钱,比任何出价调整都多。
  28. 欺诈与争议处理智能体
    误拒给行业造成的损失,约为它拦下的欺诈的 13 倍;而你拒掉的交易根本不会产生任何标签——所以唯一诚实的测量是一个有预算的「照放不误」留出组,看板必须在 120 天的争议窗口面前只报告老到足以为真的队列,而智能体该待在案件卷宗里,不是待在一条百毫秒级的授权路径上。
  29. 医疗编码与理赔申报智能体
    835 付款说明在每一笔理赔上都免费给你一个带对抗性的标签,而它恰好在一个方向上有偏——编码偏低永远不会被拒付,于是单边目标存在一个优化器一定会找到的退化解;请以盲编基线为参照把成绩单做成双边的,按 CARC/RARC 组合而不是单看 CARC 来分流(因为 CO-16 是指针而非原因),并且在印第安纳州已要求提交前须经人工复核之后,把「自主与否」当成一个按司法辖区取值的路由决策。
  30. RFP 与安全问卷智能体
    每个答案都是一项合同性陈述,所以一条过期的主张是不实陈述而非幻觉:一座每条主张都带负责人与 valid_until 的答案库、给「差异」而不只给「相似度」打分的匹配,以及三个档位加一道禁绝将来时承诺的硬闸。
  31. 差旅与费用稽核智能体
    能追回的钱是未抵扣的增值税、重复单据与被计入成本的政策渗漏——不是舞弊——所以把确定性检查扩到 100%、把需要判断的那部分继续抽审,把政策放进一个模型永不读取的带生效日期规则引擎,并用每晚免费送达的卡账清算真值,去给模型唯一负责的那件事(票据、卡账流水与申报的三方对账)打分。
  32. 临床试验匹配智能体
    代价最高的那种错是看不见的——一位符合条件却从未被推出来的患者——所以要按召回率来建,而不是按你看得见的筛选失败率:把自由文本标准拆成各自带时间窗的原子谓词,输出一张带证据片段与显式"未知"状态的逐条标准表而非一个结论,并把联系患者这一步交给一个具名的人把关。
  33. 药物警戒与不良事件智能体
    把智能体对准一条通道,是一次法律行为,不是一次监控决定:上报时钟自任何代表公司行事的人首次知悉起算,所以书面的通道范围要排在模型之前。围着让个例成立的那四个要素来建,输出"缺哪个要素、该追问什么"而不是"可上报:是/否",把编码约束在当前生效的词典版本内,并让智能体只能上报、只有具资质的人才能驳回。
  34. 点餐车道与餐厅点单智能体
    纯语音 AI 把大约 83% 的点餐车道订单点对,普通车道为 87%,而店员介入时约为 95%——而他们大约每五单介入一次——所以产品是那次交接,不是识别器。去盯自助完成率、介入成本、点单时长与放弃排队量,而不是准确率;把每个商品接地到当前生效的菜单版本并穿过 POS 写入;并记住难的是配料语法与车道上的音频,不是转写。
  35. 环境式临床病历智能体
    那个被反复引用的结果把倦怠从 51.9% 降到 38.8%,而它压根没测量病历质量——于是每块看板自带的「签署耗时」,其最大化解法是让医生不读就签。从「签署是一次著作权转移」倒着设计,强制来源层级、让体格检查所见只有被说出口才允许出现,把遗漏显式摆出来(因为复核抓不住它),把编码归属挡在病历助手之外,并给每周那次经裁定的抽样拨预算——它是唯一一个量病历本身的数字。
  36. 事前授权智能体
    法律已经把这条工作流劈开了:两个会期十一个州规定 AI 不得作为医疗必要性拒付的唯一依据,而同样这些法律又明确准许把 AI 用于行政性工作与整理临床信息——所以要建一个能批准、能上报、却无法拒付的智能体,让拒付那条分支压根不存在,而不是被开关关掉。自 2026 年 1 月起,付款方欠你的是加急 72 小时、常规 7 日,并须附具体理由;所以该冲着理由码与「一次过完整率」做工程,而不是冲着一个批准概率模型——再把 WISeR 读作一堂关于目标函数而非技术的课:在得克萨斯,机器的初次批准率为 62%,人工复核后为 84%。
  37. 保险核保智能体
    成交率几秒钟就到,赔付经验要等发展尾部走完才到,所以任何照着快信号闭环的循环都是一台逆向选择机器——而受监管的那件东西,是决定价格的、可枚举的因子,LLM 的判断永远当不了它。产出带来源片段与显式「未知」的申报变量,让费率引擎保持确定性,赶在检查官之前在自己的业务上跑 BIFSG 式的结果检验,并把拒保那条路做成一次转人工,而不是一条分支。
  38. 智能家居与 IoT 智能体
    每一场演示都在开灯,而每一起事故都会是关于智能体读到的什么:设备事件历史是一份关于全家的在场日志,在设备名这一层可由攻击者写入,而一旦进了上下文窗口就再也读不回去。按可撤销性而非品类给设备分类,把策略写在运行时发现的 trait 上并对未知默认拒绝,把命令表达成由观测来核验的绝对目标,在服务端给历史窗口设上限,并为那些从没看见过同意屏的同住人做设计。
  39. 消费信贷智能体
    团队们绷紧神经准备应对可解释性难题,却栽在那段对话上:在 Regulation B 之下,智能体能问什么是受限的,它对一位犹豫的申请人说的话可能构成违法劝退,而它停止收集材料的那一刻就启动了一个没人接上计时器的三十天通知时钟。请把受理环节建成一份封闭的问题登记表加一条写成代码的完整性规则,把评分留在智能体够不着的、经申报的模型里,并专门在拒贷样本上测量文档抽取准确率——正是那条长尾产出了写错的主要理由。
  40. 薪资与雇佣税智能体
    薪资里本来就已经有一个确定性权威,所以一个智能体只要产出一个「要进申报」的数字,就往一个「整套罚则结构都假定其为确定」的流程里插进了一个概率性步骤。请把它留在引擎的输入一侧与阅读一侧;并请注意首要控制是一个计时器而不是一条置信度阈值:美国缴存罚款仅按迟到时长就走 2/5/10/15% 的阶梯,所以一个提个问题然后等着的智能体已经造出了一次合规失败。请把能力花在通知分拣、方差与对账上,并且绝不要让模型去推断七千四百多个地方辖区中的某一个。
  41. 科学发现智能体
    2026 年 10 月初发布到 arXiv 的两个基准把设计问题定了下来:在 EurekaBench 上,智能体的预测准确率 47.4% 对人类科学家的 48.8%,而在该任务真正围绕的洞见上是 29.4% 对 69.7%——所以照着它本来就能赢的指标去造,你交付的会是没人能发表的专家级准确率相关性。请把执行、分析与提出机制拆成独立的智能体,把昂贵的模拟预先跑好并用固定规则而非评判模型评分,把指引申报成一个记录在案的 L0–L3 参数,并以「每位专家复核工时换来几条被接受的洞见」来汇报。