实战手册 / 领域实战手册

领域实战手册

按领域的实战手册——客服、研究、销售、数据分析、DevOps——该建什么,可以省什么。

  1. 客户支持智能体
    在自信错答率近乎为零的约束下优化分流:接地答案自主、交易设关、语气进评估、干净交接胜过自信猜测。
  2. 数据与分析智能体
    失败模式是自信的错误数字:schema/语义层接地、只读执行、核验作为独立阶段、弃答得分高于自信错答。
  3. DevOps 与 SRE 智能体
    只读优先,因为爆炸半径是生产:先诊断后修复、运维手册即经测试的工具、限制在工具签名里、变更管控不因操作者是模型而改变。
  4. 研究与综合智能体
    一个捏造来源即令整份交付物作废:检索-写作-核验、引用忠实度作为硬约束、保留分歧而非平均、深度与广度作为有界预算。
  5. 销售与 GTM 智能体
    失败模式是规模化的自动垃圾邮件:价值在调研/个性化而非量、同意作为上游 fail-closed 关卡、人工签核随触达面伸缩、评估中垃圾邮件风险赋重权。
  6. 金融场景智能体
    智能体在金融场景真正能创造价值的地方——对账、研报合成、KYC 审核——以及它们必须背着的硬性约束(审计、确定性、可供监管审阅的轨迹)。
  7. 医疗场景智能体
    病历记录、事前授权、分诊接待——这些是医疗中智能体真正节省人力的少数任务,以及离开它们就不能上线的隐私与临床安全护栏。
  8. 法律场景智能体
    电子取证、合同审阅、引文核查——法律智能体已经能跑的地方、它们会幻觉的地方,以及不同法域下需要的人工监督。
  9. 把实战手册适配到你的领域
    每份实战手册背后的元方法:按顺序回答五个问题来推导新垂直领域——任务、按可逆性的自主、作为接地与限制的工具、镜像代价不对称的评估、结构性护栏。
  10. 招聘智能体
    监管者先一步指定了架构的唯一领域:纽约市第 144 号地方法与欧盟《AI 法案》附件三都要求一个可数、可归因的按候选人决策——这正是自由文本式"匹配度强,8/10"设计过不了审计的原因,也是模型该待在漏斗拓宽一侧的原因。
  11. 邮件与日历智能体
    唯一一类未经认证的陌生人也能写入的记录系统:能熬过一次转发的来源分级、以强类型接口切开的读取者/执行者结构使邮件内容永远够不到发送通路、作为无人加固的零点击载体的日历,以及只在异常时才发问的确认设计。
  12. 辅导与学习智能体
    唯一一个把活儿干好就等于失败的领域:测无辅助后测而不是会话满意度、用代码而不是提示词执行提示阶梯、诊断错误概念而不是讲解知识点,并承认任何做得了作业的智能体都已经让作业作为考核失效了。
  13. 安全运营智能体
    唯一一类输入由"知道有模型在读"的对手亲手撰写的智能体:确定性富化、把裁决权挡在模型之外、按可逆性分配自主并给遏制动作设关,以及用那些"没人告诉过你判错了"的结案来搭黄金集。
  14. 翻译与本地化智能体
    流畅度不再预示忠实度,于是只读译文什么都抓不到:审校 diff 中的原文-译文对、用机器可校验的不变量设关卡(占位符对等、术语库、结构),并把术语当作检索问题而不是塞进提示词的一张术语表。
  15. 购物与结账智能体
    Instant Checkout 在上线商家不足十五家时被收回,因为难的是商品数据而不是支付——所以要把商品接地、在下单那一刻重新核验,并把唯一那个不可逆的步骤挡在模型之外的关卡后。
  16. 内容审核智能体
    公开准则只是十年间未成文判例的一份摘要,所以要把审核建成在已决案例上的检索——并让基础发生率而不是准确率分数来告诉你还需要多少审核员。
  17. 保险理赔智能体
    周期时间花在等一份缺失材料上,而不是花在裁定上——所以去建完备性引擎、在责任认定处停下,并刻意拒绝欺诈评分:它是这个领域里风险调整后回报最差的用例。
  18. IT 服务台智能体
    真正吃掉产能的工单最后都落在某个身份系统的变更上,所以产品其实是那层授权:用带外的持有型因子核验身份、从权限而非请求推导动作集合,并把密码与 MFA 恢复放到最后再上——或者干脆不上。
  19. KYC 与反洗钱开户智能体
    筛查告警里 90–95% 是误报,瓶颈从来不是发现,而是那堆没人能写出站得住脚论证的告警积压——所以让智能体去汇集证据、起草理由,由一个具名的人作处置,而制裁匹配器保持确定性并带版本。
  20. 采购与寻源智能体
    落标方有权拿到中标理由,所以唯一不该自动化的恰恰是那个分数:把带页级定位的需求覆盖矩阵建出来、让每份标书各自一个索引,并把排名留给一个能为之辩护的具名的人。
  21. 公共福利经办智能体
    MiDAS 在无人复核下自动裁定了三万四千人的欺诈,错误率约 93%,而荷兰补贴丑闻拖垮了一届内阁——所以智能体只组装卷宗、由具名的人做出裁定,检索要钉死在申领日期当时生效的规则上,而你必须去测的那类错误,是那些没人申诉的拒绝。
  22. 旅行与预订智能体
    搜索免费且可重复;下单则是一笔支付、一份合同,外加一个别人再也拿不到的座位——所以把它们做成两套系统,并让提交通道接受报价 ID 而不是参数、在提交时重新计价、带幂等键,并用对账代替重试。
  23. 供应链与物流智能体
    失效模式不是幻觉,而是自信地依据一个四小时前才为真的事实动手——所以给每个工具响应加上必填的 as_of 与由代码强制的最大年龄,把路径规划留给求解器、把智能体收敛到一份封闭的异常分类法,并且去测它从未报出的那个异常,而不是已报异常的精确率。
  24. 现场服务与派工智能体
    排程恰恰是早已被解决的那部分——派工上约束求解器胜过模型,所以智能体属于它读不懂的那两个边缘:决定哪些零件上车的受理,以及一天崩掉时的改约电话。每一次写入看板都是一句承诺,所以要先预留再确认、要假定人类派工员也在写入,并且衡量一次修复率而不是自动化率。
  25. 应付账款与发票智能体
    同业最佳的无接触率在 49% 上下徘徊多年,而失手的那一半并不是失手在读单据上——它失手是因为没有采购订单、没有收货记录,或者压根没人订过;所以要为例外队列而建,不是为干净通道。按"能不能撤回"而不是按金额设闸门:银行账号变更才是那笔你永远要不回来的损失。
  26. 催收与账款催缴智能体
    联邦 Regulation F 允许每笔债务每七天拨打七通电话;纽约市的 SHIELD 规则则规定每个账户七天内任何形式的联系只许三次——所以真正的产品是那个联系配额管理器,而不是模型,任何渠道在动笔之前都得先去扣同一个权威计数器。先确认对方身份,再谈内容;披露话术、金额与让步阶梯属于代码,不属于生成。