采购与寻源智能体

11 分钟读完

Y20
实战手册 · 领域实战手册

采购与寻源智能体。

最显而易见的那个做法——让智能体读完标书、给供应商排名——恰恰是采购唯一买不起的东西,因为落标方有权拿到中标理由,而"模型给你打了 6.8 分"不是一个经得起质疑的理由。真正吃掉几周时间的活儿要枯燥得多,也完全可以自动化:对四百条需求逐条定位,九家供应商各自在哪里答了、有没有答。把覆盖矩阵建出来,拒绝去建那个分数,其余的设计就都跟着出来了。

STEP 1

先看时间花在哪儿,而它不在写文档上。

寻源之所以感觉像是个文档生成问题,是因为文档是它看得见的产出。但拿工时说话就是另一回事:照模板起草一份 RFP 是一天,评审收回来的应答是一个月。

  • 需求覆盖矩阵才是成本中心。四百条编号需求乘以九份应答就是 3600 次查找,每一次都是一个人翻两百页 PDF,去判断 4.7.2 这条究竟是答了、答了一半、被绕开了,还是被悄悄跳过了。这是检索与抽取,是机械劳动,也是价值所在。
  • "未实质应答"是最要紧却最晚被发现的结论。没有回答某条强制性需求的供应商可能可以被判为不合格,而这个判定会改变入围名单。第四周才发现而不是第一周,是整个流程里最贵的一种寻常失败。
  • 可比性在评审开始之前就被毁掉了。九家供应商用九种格式、九套词汇、九种详略程度回答同一个问题。把它们归一到同一个框架里——同样的单位、同样的术语、同样的粒度——才是让人类比较得以进行的那一步,而这恰恰是语言模型的强项。
  • 商务条款藏在散文里。价格很少只是一个数字。阶梯、起订量、上浮条款、出流量费、续约递增和真实用量结算,散落在一份主协议和三个附件里,而总拥有成本模型是靠人从中一点点拼出来的——与金融场景智能体是同一套抽取纪律。

在定任何范围之前,先跑一遍把实战手册适配到你的领域里的那个诊断:问品类经理上周二干了什么。答案几乎从来不是"写了一份文档",而是"翻了两份应答的安全附录,看他们支不支持 SCIM"——那是一个穿着采购外衣的检索问题。

STEP 2

智能体负责抽取与比对,不负责打分。

这是整份手册里承重的那一句,而且它是一条设计约束,不是一句告诫。在判断介入的那个点上把流水线切开。

  • 归智能体的:为每条需求定位应答、引出原文、标注页与段、把覆盖情况分类为"已答/部分/未涉及"、标出应答正文与其附件之间的自相矛盾、归一单位与术语,并把总拥有成本模型搭起来,且每一个输入项都能追溯到某个条款。
  • 归人的:"部分"能不能接受、这条需求相对于其他需求值多少分、以及哪一家中标。这些是采购方必须自己拥有、并且要能为之辩护的行为。
  • 结构化输出是让这条边界真实存在的东西。智能体的交付物是"每条需求每家供应商一行"——原文、位置、覆盖类别、置信度——而不是一段评价。散文式的小结会把你刚刚排除掉的判断重新引进来,因为"A 家在这一点上的回答更强"就是一个用文字写的分数。用结构化输出把形状定死。
  • 弃答胜过猜,而且这里的差距比几乎任何地方都大。"我在这份应答里找不到 4.7.2 的答案"是一个有价值、可行动的输出。而一个编造的定位比没用还糟:它把评审员送到一页并不包含该主张的纸上;一旦它活到了中标记录里,就成了一份可能被诉的决定里的事实错误。

总会有人反驳:"模型可以打分,人再复核一下就是了。"问题就在这个锚定效应上。拿到排好序名单的复核者,检查的是那个排序;拿到覆盖矩阵的复核者,评审的是那些标书。你以什么顺序把工作呈上去,决定了这两件事里究竟发生哪一件——而只有其中一件才是这份工作本身。

STEP 3

从"被质疑"倒推来设计,而不是从工作流顺推。

采购是少数几个"对手有权拿到你的推理过程"的业务流程之一。依欧盟公共采购指令,采购人必须告知落标方落标理由,随后还要等过一个静默期——电子通知情形下至少 10 个日历日——在此期间不满的投标人可以要求答疑、并在合同签署前提起质疑。私营部门的寻源没有静默期,但有会把事捅到你高管那里的供应商;在受监管行业,还有一个会问同样问题的内审。

  • 中标决定必须可归属到具名的人,并对照公布过的标准。标准与权重事先固定、且不应在过程中变动;一份追溯到模型、或没有任何个人愿意署名的评审理由,正是要在设计上排除掉的失效形态。
  • 评审中的每一条事实主张都必须带定位。"B 家不提供区域数据驻留"必须指向支撑它的那句话。这一点弄错不是质量问题,而是质疑的实体内容——也正因如此,抽取层需要来源归属交互设计里那套引用纪律:按主张给片段,而不是给文档级引用。
  • 在记录里让机器的贡献可分离。中标卷宗应当一眼看得出哪些结论是抽取来的、哪些由谁核验过、哪些是判断出来的。把它们糅在一起,就会得到一份日后没人说得清"人究竟决定了什么"的记录——而责任与角色存在的意义就是保住这个区分。
  • 不只留输出,也要留输入。提交的文档、抽取结果、产出它们的提示词与模型版本,以及复核者的修正,全都属于这份卷宗,其保留期要长过质疑的时效期限——见审计轨迹
  • 如果被问到会不自在,那就该主动披露用了什么工具。一些公共机构现在已经要求披露,而判断标准很简单:如果"得知有智能体预处理过应答"会改变投标人接受结果的意愿,那你本就该事先说明。
STEP 4

标书隔离是架构要求,不是一条政策。

你收到的每一份应答,对其发出方都是保密的;而对你的智能体最有用的信息——报价、架构、具名分包商、路线图承诺——恰恰是泄露给竞争对手时最具杀伤力的信息。于是采购成了一个多租户问题,而这些租户彼此之间是敌对的,边界的责任在买方。

  • 一份标书一个索引,而不是一次招标一个索引。一个覆盖所有应答的共享向量库,迟早会在回答关于 B 家的问题时检索出 A 家的报价,而这次泄露是看不见的,因为那个答案读起来毫无破绽。在存储层做切分,别指望一个你可能忘记加的元数据过滤条件。隔离的几种形态在面向智能体的多租户里。
  • 比对发生在抽取出的事实之上,而不是在原始上下文之上。在互相隔离的运行里逐家建好矩阵,然后去比那些行。永远不要把两家供应商的文档放进同一个上下文窗口——这一项改动就消掉了绝大部分交叉污染风险。
  • 出方向也要盯着。一个正在起草发给 B 家澄清问题的智能体,历史里带着某位投标人的机密材料。按数据外泄风险里的推理,把外发草稿当成一个需要人工放行的外泄面。
  • 核一下你的保密协议究竟允许什么。很多供应商 NDA 把披露范围限制在具名评审人,而对"交给第三方模型 API 处理"只字未提。这是招标开始之前要问法务的问题,不是等某家供应商问起之后——它和保留期的答案一起,属于你的数据治理政策。
  • 把提交上来的文档当作不可信输入。一个有动机进入短名单的供应商,正在提交一份会被模型读到的文档。在 PDF 里嵌入冲评审智能体去的指令,是一种低成本高回报的攻击;而应答文件是少数几个"攻击者是已知的、有动机的商业对手"的通道之一。
STEP 5

截止时间是硬实时约束,而且它对两边都成立。

多数智能体领域的延迟要求是软的。采购却有一个不会挪动的提交时钟,而在公共招标中,逾期提交通常直接不予受理,没有酌情空间。这改变了这个循环被允许有的行为方式。

  • 每次运行都用挂钟时间设界,而不是用步数。一个在截止日下午为一次不稳定的解析重试了两小时的智能体,造成的是一次任何准确率指标都显示不出来的商业损失。时间预算属于任务定义的一部分,兜底是一份降级但完整的输出。
  • 提交不可逆,必须挡在一道明确的人工关卡之后。上传到招标平台、在标书上签字、在供应商协议上点接受,都是单向门——人在回路这个模式管的是这个动作本身,而不是它之前那份计划。
  • 澄清窗口比截止日更早关闭。向采购方提问的机会通常提前数天就到期,所以一个在最后一个上午才抛出歧义的智能体,抛得太晚了。把"歧义检测"这一遍前置——在卖方侧,它是价值最高的早期产出。
  • 隔离恰恰是在截止压力下被打破的。提交前一晚,正是有人把三家供应商的报价粘进同一条提示词里"就是想快点比一下"的时刻。要让安全的路同时是最快的路,否则上一步那条约束撑不过一个周四晚上。
STEP 6

卖方侧是同一台机器掉了个头——而这本身是个问题。

镜像的那个做法,是一个从历史应答库里作答 RFP 与安全问卷的标书智能体。它有效,确实省下真金白银的几周,而两边加在一起,正在悄悄摧毁这套流程本该承载的信号。

  • 答问卷是一个检索问题,外加一个维护问题。答案库——SIG、CAIQ 以及各家定制的变体——的质量上限就是它的新鲜度,而一条被自信地检索出来、讲的却是你去年已经下线的某项控制的答案,是一份写给客户的书面失实陈述。给每一条存档答案配一个负责人和一个复审日期,否则这个库就成了一件带搜索索引的负债。
  • 永远不要让智能体提交一条未经复核的、关于你自家控制的事实主张。这不是质量闸门,它与一份合规声明属于同一类陈述。复核是按条进行的,由一个"在取证问询中说错了要担责"的人来做。
  • 散文式问卷已经不再具有区分力。当两边都自动化之后,一个写得好的答案不再能说明底下那项控制的任何事。买方侧的反制是去要模型生成不出来的凭证——真正的审计报告、一张配置截图、一份写着人名的架构图、一通推荐人电话——并把这些的权重压过叙述本身。要预期重要的品类都会朝这个方向走,正如同样的压力在KYC 开户里所推动的那样。
  • 两边都要量对东西。买方侧的指标是需求定位准确率——对一组答案已知的抽样需求,智能体有没有找到正确的段落,以及有没有正确识别出那些根本没有答案的条目?"未实质应答"的召回率才是要紧的那个数,因为漏掉的缺口正是会一路走到中标决定的那种失败。卖方侧的指标是每条答案相对当下现实的事实准确率,而不是与上一次提交的相似度。在放量之前,把这两项都做进评估测试台里。

为一次真实招标只发覆盖矩阵这一件东西:每条需求、每家供应商、带页码定位的引文,以及"已答/部分/未涉及"的覆盖类别。不要分数,不要推荐,不要小结。它是一周的工作量,抹掉的是评审员当下花在查找上的那一个月,而且它安全地失败——因为一个错误的定位,人一点开就抓到了。智能体的活儿是让标书里的每一条主张都可被找到;它一开始给供应商排名,你就把唯一那个必须属于具名的人、并且要能对落标方讲得清楚的决定给自动化掉了。

相关:法律场景智能体看同一条流水线上合同审阅的那一半,第三方与供应商风险看那些问卷本该确立的是什么,面向 RAG 的文档解析看怎么从两百页 PDF 里拿到页级准确的定位,以及把实战手册适配到你的领域看这一份是用什么方法推导出来的。