E22
概念 · AI 模型与工具生态
系统卡:这份文件究竟为什么背书。
系统卡是一份关于某一个检查点的安全测试记录,由最输不起这份记录的那一方撰写——而你带着来的那个问题「这个模型能不能干我的活」,恰恰是它永远不会回答的。请读它的能力激发方法与拒答边界,因为只有这两样能迁移;至于每一个能力数字,都当成一句关于某个构建版本的主张来看待——而你被服务到的,未必就是那个版本。
STEP 1
模型卡、系统卡、监管技术文档——三份不同的文件。
这几个词被混着用,是因为这些产物相隔十年才陆续出现;而搞清楚手里拿的是哪一份,就知道它有权略去什么。
- 模型卡是 2019 年的研究界惯例:预期用途、训练数据来源、按人群拆分的评测结果、已知局限。它描述的是权重。多数开放权重的发布至今仍是这个形态;对于你自己托管的模型来说,它几乎就是全部故事。
- 系统卡描述的是被部署的那套系统:模型,加上包在外面的安全分类器,加上使用政策,加上拒答训练,再加上前向传播前后服务栈所做的一切。它之所以存在,是因为前沿实验室交付的是一件产品而不是一个检查点,而安全属性大多并不在权重里。
- 监管技术文档又是另一回事。欧盟《AI 法案》第 53 条要求通用模型提供者维护技术文档,并向下游提供者提供足以理解其能力与局限的信息;自 2026 年 8 月 2 日起,AI 办公室已对通用模型拥有正式执法权。那份卷宗是写给一个有传唤权的监管者看的。系统卡是它的公开子集,两者不是同一份文件。
实务后果是:系统卡的安全主张,是关于某个配置的主张。把同一份权重放到你自己的推理服务商那里跑、不带厂商的那些分类器,你就留下了能力数字、丢掉了这张卡真正在描述的那些缓解措施。这么做是正当的——见开源与闭源模型——但那一半原本才是卡的主题,现在归你自己了。
STEP 2
它在结构上无法回答的三个问题。
这些不是「卡写得更好就能补上」的疏漏,而是由这份文件的性质推出来的。
- 这个模型在你的任务上好不好。它跑的是公开基准,选型时还要兼顾与上一版可比,而公开基准恰恰是最容易被污染的那一类。一张报出漂亮的智能体编码分数的卡,告诉你的是某个分布上的事;你的分布不在里面。这与批判地阅读基准是同一个论证,只是多了一重加重情节——作者同时也是卖方。
- 你被服务到的到底是什么。卡在发布那天被冻结,端点却没有。别名会指向新的快照,安全分类器在持续更新,量化版本与投机解码变体会为了容量被推上线,而在负载之下一个路由器可能把你的请求交给另一档。这些都不会产生一张新的系统卡,也没有一样会显示在你的响应里。
- 他们究竟有多用力。每一个危险能力数字都是能力激发投入的函数——脚手架、工具权限、采样次数、拒答如何计分。用一个裸聊天界面、试一次得出的「模型无法完成该任务」,和用一套智能体骨架、试一百次得出的同一结论,是两句不同的话。脱离方法的数字无法解读,所以真正值得读的是方法。
STEP 3
该读的其实是这四样。
一张好卡里确有真信号,只是大多不在表格里。
- 能力激发的描述。他们给模型工具了吗?给脚手架了吗?试了几次,报的是 best-of-n 还是 pass@1?这告诉你公开数字与一个铁了心的用户所能拿到的结果之间还有多少余量,也是这份文件里最接近「能力预测」的东西。它同时告诉你这条安全结论该有多当真——因为一次弱激发白送你一个让人安心的数字。
- 拒答与准入的边界。哪些类别被直接拒答,哪些被挡在企业协议或已验证账户之后,哪些相对上一版收紧了。这是会弄坏你产品的那一部分,而且它变动的频率高于能力本身。见拒答与能力准入。
- 保障措施清单。分类器、监控、针对特定能力的限流、账户层面的处置。每一项都是厂商代你运行、且可以不经通知就改动的控制;而你按哪种方式接入模型,决定了你继承还是失去它们。
- 能力阈值的声明。前沿实验室如今都会公布分级框架,承诺模型跨过某个界定的能力档位时启用相应缓解。当一张卡说某模型是按比前代更高的档位部署的,那就是一句前瞻性陈述——关于这一族模型即将到来的访问控制、延迟与审计义务,而且往往是迁移已排上你日程的最早一个公开信号。
把同一家实验室前后两张卡当成 diff 来读,而不是当成两份独立文件。有意思的内容是「什么动了」:某项评测被悄悄退役、某个阈值被重新表述、新增了一个拒答类别、上一张卡里描述过的某项缓解在这一张里不见了。一张卡告诉你厂商想说什么;两张卡告诉你什么变了。
STEP 4
读完之后拿它做什么。
这张卡是两个流程的输入,而这两个流程它都替代不了。
- 自己留一套验收评测,并且按快照逐版跑。从真实流量里取二十到一百个用例,按你真正在意的方式打分,钉死在一个显式的模型版本上而不是别名上。这是唯一能测到卡测不到的那件事的仪器,也是唯一能抓住一次悄无声息的服务端变更的仪器。这里的完整答案就是评测;卡只是告诉你该往哪儿瞄。
- 先钉版本,再在每次发布时 diff 那张卡。别名很方便,而它正是让一个你从未评测过的模型进入生产的那条通道。钉住版本、有意识地升级,并把「读卡的 diff」做成升级流程里的一步。
- 把它归档进供应商风险卷宗,并指定负责人。作为部署者你本来就要产出一份尽调记录,这张卡是其中的证据——见第三方模型与供应商风险。存 PDF,不要只存链接:卡是会被原地修订的。
- 不要拿它当作你自己系统的安全论证。厂商测的是一个模型面对泛化滥用时的表现。而你把这个模型连同你的工具、你的数据、你的用户的权限一起发了出去,这些都不在他们的范围里。你的威胁模型是你自己的。
如果只读一节,就读能力激发方法,而且在读结果表之前读。下游的一切——还剩多少能力余量、那条安全结论有没有意义、与上一代的比较是不是同口径——都由评测是怎么跑的决定;而这恰恰是所有发布日摘要都不会引用的那一部分。
相关:如何选模型——这张卡最终喂进去的那个决策;智能体骨架——为何能力激发投入主导了公开分数;以及知识截止——另一个发布日给出、却老得很快的数字。