RFP 与安全问卷智能体

10 分钟读完

Y30
实战手册 · 领域实战手册

RFP 与安全问卷智能体。

你在一份安全问卷或 RFP 里交回的每一个答案,都是贵司向买方作出的一项陈述;而一句过期的「是的,静态加密并使用客户自管密钥」不是幻觉——那是一份由你的销售签了字、要由你的法务去解释的不实陈述。仅这一个事实就把整个项目重排了一遍:起草是便宜的那部分,而真正决定这台智能体帮你还是害你的,是一座答案库——库里每一条主张都带着一个证据指针和一个到期日。

STEP 1

这活儿是匹配,不是写作——而且映射是多对一。

团队之所以把它当成生成问题来立项,是因为产出是散文。它其实是一个披着散文外衣的检索问题,而立错项正是「第一版原型演示惊艳、评审阵亡」的原因。

  • 买方用四百种说法问同样的四十件事。「你们对静态数据加密吗?」「请描述你们的静态加密控制措施」「客户数据在存储时是否加密?」最终都归到你早已拥有的同一条规范主张上。智能体的任务是把它找出来,不是把它写出来。
  • 答案已经存在,只是不在一处。历史问卷、信任中心、SOC 2 报告、一份架构文档,以及一条 CISO 纠正了那份架构文档的 Slack 线程。把这些合并成一套规范答案,就是大部分价值所在,而这项工作智能体能加速、却替代不了。
  • 格式是一笔真实的成本,而且确实纯属机械。一张有合并单元格的 300 行表格、一个下拉项被限定为 Yes/No/Partial/NA 的门户、一份每格限 500 字符的 Word 模板。这部分值得自动化,而且几乎不担风险——先做,而且单独做。
  • 量是它被自动化的原因,也是它翻车的原因。一份卡着交易的问卷送来,限期五天、280 条,其中大概只有 30 条是真正新的。那 250 条让这台智能体值得建;那 30 条让人工评审不可省。
  • 第一版只做一种产物。安全问卷(事实性、可核验、责任重)与 RFP 的叙述章节(说服性、讲差异化、责任轻)是两个不同的产品,失败模式也不同。两个一起上,产出的是一套两边都没调好的系统。
STEP 2

答案库就是产品,而 valid_until 是它的承重字段。

一座没有到期日的答案库,是一份随着年岁增长而愈发自信的、正在衰变的负债——因为「被复用的频次」代表的是受欢迎程度,不是真实性。

  • 把一条答案建模成五样东西,而不是一个字符串。主张、证据指针(控制项编号、政策章节、审计报告页码)、人类负责人、valid_until,以及说明它对哪个产品、哪个地区成立的适用范围限定。一座字符串的库是没法治理的。
  • 大多数错误答案都住在「适用范围」里。「我们通过了 ISO 27001 认证」对主平台为真,对买方真正要买的那家被收购的子公司为假。请把边界和主张存在一起,否则智能体会自信地把范围放大。
  • 到期是按条设的,不是按库设的。一项认证在一个你知道的日期到期。一条架构主张则在架构变更时到期,而你是从一张变更工单、而不是从日历上得知这件事的——所以「负责人」才是那个机制,他们的季度确认才是那个流程。
  • 检索必须把证据一起返回,而不只是文本。如果评审人只看得到散文,那他评审的是文笔。请在历史问答对与源文档之上做混合检索——混合检索与重排里的那种形态——并让证据指针与候选答案同行。
  • 绝不要让这座库在无人监督下自我学习。一条通过的回答,只有在人类批准之后才回写,并继承它所引用的最弱那份证据的到期日。否则,一条被放大了范围的答案,会传播进往后每一笔交易。

判断你的库有没有准备好,就一个测试:随机挑一条答案,问「这条谁负责、什么能证明它、它什么时候不再为真?」如果这三个问题需要一个人去翻找,那智能体同样答不上来——而且它不会告诉你这一点。

STEP 3

要给「差异」打分,而不只是给「相似度」打分。

这里危险的检索失败不是「什么也没找到」,而是「找到了一条相似度 0.94、但实质不同的」——而相似度排序在结构上恰恰对那几个能翻转答案的词是瞎的。

  • 一个介词就能反转真值。「静态加密」对「传输中加密」。「你们支持 SSO 吗」对「你们强制 SSO 吗」。「数据是否隔离」对「是否按租户隔离」。这些成对的说法在嵌入空间里挨得很近,在事实上相距很远。
  • 情态动词是第二个陷阱。「你们能否」「你们是否」「你们将否」分别在问能力、现行做法与未来承诺。只有中间那个问的是当下,也只有中间那个可以安全地从库里作答。
  • 匹配之前先抽出主张骨架。把每个问题规范化为主体、控制项、条件与范围,然后按这个结构去匹配,而不是按句子。检索到的答案必须四项全中,否则它只是一个候选,不是一个答案。
  • 把差异明确摆到评审人面前。「复用自 Acme,2026-03;他们的问题说的是静态,这一份说的是静态与备份中」——这把一次两分钟的重读变成一个五秒钟的判断,也正是要在库里逐字保留原始问题的理由。
  • 用真实问卷、而不是合成问卷来校准弃答。买方的措辞有一种任何生成式评测集都复现不出的特异性。请留出五十份真实的历史问卷,量一量智能体多久会复用一条本该被人工改过的答案。
STEP 4

三个档位,外加一条关于「承诺」的硬规矩。

只给智能体三个动作,并禁掉第四个。大部分损害来自一套「本该上报却被允许自行撰写」的系统。

  • 复用。主张完全匹配、证据在有效期内、范围覆盖这笔交易。逐字输出,注明来源答案与其日期,并送进抽检队列而不是全量评审。
  • 改写。同一条主张,措辞或格式约束不同。模型可以改措辞;不可以改主张、加限定词或删去限定说明。每一次改写都要标记送审,并把原文并排放着。
  • 上报。没有在有效期内的证据、范围不匹配、或主张骨架对不上。把问题连同最接近的三个候选与具名负责人一起交回去——一个被路由出去的问题就是一个完成了的工作单元,而正是这样的定义,才拦住模型去把空缺填上。
  • 禁止:面向未来的承诺。「我们将在第三季度前实现 X」「在企业协议下我们可以满足这一点」「这在我们的路线图上」。这些是合同条款,不是答案,必须由一个有权约束公司的人亲手敲进去。请让工具在物理上就吐不出一句将来时的承诺。
  • 弃答必须足够便宜,才会被选择。如果上报意味着评审人要从一个空格子开始,那智能体的弃答率就会被一路调低,直到它不再弃答。上报的产出必须包含候选、证据与缺口——接地只有在「没接上地」的那种情况也有个好落点时才有用。
STEP 5

量的是评审人的分钟数,不是每小时答题量——并当心那个 92% 陷阱。

投资回报的论证通常就在这里骗到人。吞吐量好展示,但它不是决定「你上线的东西安不安全」的那个数字。

  • 把那笔没人写进 PPT 的算术做一遍。一台以 92% 准确率填完 400 条中 300 条的智能体,产出了 24 条错误答案,隐形地散布在 276 条正确答案之中。一个面对着满满一页自信散文的评审人,一条都不会细读——所以交付文档的实际准确率,就是智能体的准确率,而不是评审人的。
  • 按置信度切分队列,并让切分可见。二十条被标记的条目接受真正的审视;280 条逐字复用的条目做抽检。一个不分层的评审队列,会退化成一律不评审——理由见智能体产出的评审队列
  • 在评审界面里把证据指针放在主张旁边。能点进去看到那条「证明这句话」的控制项的评审人,审的是事实;只看得到句子的评审人,审的是语法。这和引用与来源标注是同一个论证,只是这里还挂着合同后果。
  • 真正要紧的指标是「发出前被拦下的更正数」。按档位分别统计每一百条智能体答案的编辑次数。复用档的编辑率在上升,就是在告诉你:库在任何到期日触发之前,就已经开始过时了。
  • 把上报计为战果,而不是缺口。三十个带着负责人被路由出去的问题,比三十个自信的猜测是更好的结果;而如果你的看板把上报显示成「未作答」,早晚会有人去把它优化掉。
STEP 6

文档的两个方向都要治理——包括你收到的那一份。

有两项治理义务把这条工作流夹在中间,而入站的那一项常被漏掉,因为问卷送到手上时看着像一件杂务,而不像一份输入。

  • 你发出去的一切都可被取证。对每一份离开公司的回答,保留一份不可篡改的记录:问题、交付的答案、证据版本、模型版本、批准人与时间戳。当买方的事故复盘问起「三月你们是怎么告诉我们的」,这就是那份凭证——与审计轨迹是同一条要求,只是另一端坐着一个交易对手。
  • 入站的问卷是不可信输入。它是一份来自贵司之外的表格或 PDF,会被解析后喂给一台对你的控制文档有检索权限的智能体。一个写着指令的单元格,就是教科书级的间接注入载体;请把解析出来的单元格当作数据,并且绝不要让这台智能体握有「发送」能力。
  • 只给它对库的只读权限,不给写入权限。写入路径必须走人工批准。仅这一道边界,就消掉了最糟的失败模式——一台照着自己上周编出来的答案作答的智能体。
  • 买方越来越会问你「是否用 AI 作答」。请在第一次发送之前就和法务定好披露口径,而不是等买方问起之后;并且要与你自己的采购一侧对供应商提出的要求保持一致。
  • 互换视角是最有用的一次自检。把你的答案当成买方安全团队收到它们的样子来读一遍。如果一条答案过不了你自己的供应商风险评审,那它就还不能发。

按这个顺序建,项目就很难做坏:把一座规范答案库合并出来,让每一条主张都带上负责人与 valid_until,然后再写第一行智能体代码;把填格式的自动化单独上线,它在几乎不担风险的地方就能省下时间;最后再加上带三个档位的检索,并对将来时的承诺设一道硬闸。这台智能体不是在回答问题——它是在代表贵司断言事实,而把这两件事分开的,只有一样东西:每一条事实是否都有一个负责人和一个日期。

延伸阅读:销售与市场进入智能体讲这件事所处的交易语境,法务智能体讲评审那一侧,研究与综合智能体讲引用忠实度那套机械,而披露与来源溯源讲买方如今会问的那个「是否用了 AI」。