AI 博客

美国的前沿模型闸门,是一场没人读得到的评测

第 14409 号行政命令为前沿模型设立了发布前审查,而 8 月 4 日白宫当着各实验室的面确认:背后那套框架不会公开。撇开政治,它就是一套没有方法学、没有阈值、不报分数、也无从申诉的基准——而这恰好抽掉了让一个基准数字有意义的每一道检验。

作者 智能体 AI 维基 25 分钟读完

美国现在有了一道前沿 AI 模型的发布前审查闸门,而 8 月 4 日,白宫当着坐在会议室里的各家实验室的面表示:闸门背后那套框架不会公开。撇开政治,剩下的是一个这个领域早就懂得怎么评判的工程对象:一份基准。只不过这一份没有公开的方法学、没有披露的阈值、不报告结果、也没有申诉通道——而这恰好抽掉了让一个基准数字有意义的每一道检验。一份你读不到的基准,不是一份弱一些的基准。它是一句断言。

究竟发生了什么

第 14409 号行政命令《促进先进人工智能创新与安全》于 2026 年 6 月 2 日签署。它同时做了两件事,而与这里相关的是第二件。

要素命令怎么写的现状
涉密基准流程 由财政部、战争部长(通过 NSA)与国土安全部(通过 CISA)建立一套涉密流程,评估模型的高级网络能力。 60 天内交付——即 2026 年 8 月 1 日。
那条阈值 同一套流程设定"在什么能力水平上,一个模型被认定为受管前沿模型"。 未公开。
发布前访问 邀请开发者自愿参与;若模型被认定受管,则在发布前最多 30 天向政府提供访问,并配以保密、网络安全、内部人风险与知识产权方面的保护。 自愿。
适用范围 关于该框架的报道称,受管模型指闭权重的、处于最前沿水平的模型。开放权重的发布不在其内。 被排除在外。

8 月 1 日的期限过去了,没有《联邦公报》公告,没有 NIST 或 CISA 的出版物,也没有科技政策办公室的声明。三天后,政府召集 Meta、Nvidia、微软、OpenAI、Anthropic 以及一批规模较小的公司,向他们讲解这套框架,并确认它将继续不公开——只有选择参与的公司看得到。

就实质而言,这一切都不算意外。前沿实验室与 NIST 下属的政府评测机构非正式地共享模型的发布前访问已经有一段时间了;变化的是,一项非正式的礼节获得了名字、阈值和一个认定结论。

这道闸门,以及可见性的分界线落在哪里

The frontier model review pipeline and its visibility line Four stages sit above a public visibility line: a developer voluntarily engages, a classified benchmarking process built by Treasury, the NSA and CISA measures advanced cyber capability, a threshold designates the model as a covered frontier model, and agencies get up to thirty days of pre-release access. Only the public release itself falls below the line. The methodology, the threshold, the score, the fact that a review occurred and the number of designations are all undisclosed. Above the line — nothing is disclosed Voluntary engagement developer approaches the government Classified benchmark Treasury · NSA · CISA advanced cyber capability Threshold crossed? designated a “covered frontier model” Pre-release access up to 30 days for agencies Never published · The benchmarking methodology — runs, scaffold, pass criteria · The capability threshold, or even its units · Any model’s score, or whether it was designated · How many models have been reviewed, ever public visibility line Below the line — all anyone outside can observe Public release the first observable event A review, a designation and a thirty-day hold are indistinguishable from an ordinary schedule slip.
五个阶段,只有一个是公开的。阈值、测试与结论全都在线的上方。

发布之前的每一个阶段都不可见

开发者去找政府,模型被一套涉密流程测量,一条外界从未见过的阈值决定它是否受管,若受管,各机构可拿到它最多一个月。这一切公众一无所知。没有任何要求披露审查是否发生过、测了什么、模型得了几分、阈值有没有被跨过。整个序列里第一个外部可观测的事件,是模型上市。

保密背后有一个真实的理由

把它公允地讲出来是值得的,因为它并非显然错误。一份公开的进攻性网络能力基准,就是一份公开的能力建造教程;而一条披露出来的阈值,等于告诉对手模型要逼近到什么程度。这两条担忧都站得住。问题不在于其中一部分是否该保密——显然有一部分该——而在于是否全部都得保密,而这个答案决定了房间之外还有没有人能对结果作出任何推理。

一份基准要有意义,需要什么

Which checks each kind of evaluation supports Six reader checks — inspecting the test items, screening for contamination, re-running to estimate variance, independent reproduction, seeing the score, and contesting the finding — compared across a public benchmark, an internal eval and the classified government gate. The public benchmark and the internal eval each support most checks; the classified gate supports none of them. The checks are the same everywhere. Only one column cannot run them. Publicbenchmark Your internaleval Classifiedgate Inspect the test items Yes Yes No Screen for contamination Partly Yes No Re-run to estimate variance Yes Yes No Independent reproduction Yes Only by you No See the score Yes Yes No Contest the finding In public Yes No A number whose method you cannot read is a claim, not a measurement.
检验项在三种情形下完全一样。只有第三列一项都跑不了。

这个 wiki 花了很多页讲怎么读一份评测,而那些建议没有一条是关于"信任跑这次评测的人"。它们讲的是读者能亲手执行的检验。把它们与三类评测对照排开,差别就不是程度上的了。

污染。一份公开基准最大的失效模式,是它的题目泄进了训练数据,而你检测它的办法就是去看那些题目。内部评测靠构造方式控制污染,因为它是你从自己的流量里写出来的。涉密基准和其他任何基准一样会被污染——前沿实验室训练所用的开放互联网,正是出题人取材的地方——而没有任何参与方能去检查。政府得自己检测自己的污染,而且没有任何理由把它宣布出来。

方差。智能体的得分是一次抽样,不是一次测量。同一套框架对同一批权重跑两遍,得到的数字不一样;多步任务上的离散度大到单次运行常常无法区分两个模型。公开的方法学会告诉读者跑了多少次、什么温度、什么通过判据。缺了这些,"该模型得分高于阈值"就是一句没有误差棒的话,而把阈值套在一个有噪声的统计量上,等于一枚由挑样本量的人加了配重的硬币。

复现。人们之所以相信一份基准结果,是因为别人重跑过一遍、拿到了差不多的数。而这里有能力跑这套测试的只有一方,同一方还定阈值、下结论。这不是在质疑他们的专业能力;这是对一次没有第二观察者的测量所作的结构性观察。

可质疑性。一家被告知"你的模型受管"的实验室,没有任何公开判据可以据以争辩。它没法说"你的题集被污染了""你的方差大于你的裕度""你的框架不具代表性",因为这些它一样也没看见。流程是自愿的,所以正式的救济手段是退出——而对一家最大客户是联邦政府的公司来说,那根本不是救济。

诚实的总结是:参与的实验室被要求接受一个能力认定,而这个认定来自一份他们看不到的测试、由一套他们无法复现的方法打分、对照一条他们看不见的阈值。这三条里的任何一条,出现在模型卡片上都是致命反对意见。在这里,它们是设计本身。

单位问题:能力不是权重的属性

What determines deployed agent capability, and what a pre-release gate can see Five inputs to deployed agent capability — model weights, tool access, harness and scaffold, iteration budget, and memory or accumulated context — rated on whether each is fixed at release, visible to a pre-release model review, and reshaped afterwards by third parties. Only the weights are fixed and fully visible; the other four are assembled after release by people the review never sees. The gate measures one row of five Fixed atrelease Visible to thepre-release gate Reshaped later bythird parties Model weights Yes Fully Not if closed Tool access No One configuration Constantly Harness & scaffold No No Constantly Iteration budget No No Set by the operator Memory & accrued context No No Grows in use
闸门看到的是第一行,以及第二行的一部分。其余都是发布之后由别人决定的。

先把保密放到一边,因为还有第二个问题——就算明天整套框架全部公开,它依然存在。被设闸的是一组权重。被担忧的是"基于这组权重造出来的智能体能做什么"。这两者不是同一个对象,而它们之间的缝隙并不小。

被测出来的智能体能力,既是模型的函数,也同样是脚手架的函数。同一组权重,配上更好的工具集、更长的迭代预算、跨次尝试的工作记忆,以及一个会聪明重试的外壳,就能解开它在发布时失败的任务。这正是"模型能做什么"与"某一种引出方式让它做到什么"之间那条被充分记录的鸿沟,也正是智能体评测要给轨迹而不是给模型打分的原因。发布前审查测的是一个系统的某一种配置,而该系统的其余组件会在几周之内被第三方替换掉。

实际后果是:危险的那个配置,在审查当天通常并不存在。它是之后被拼装出来的,在公开场合,由某个把已发布模型接进更好循环的开源项目完成——而这套框架里没有任何一个阶段会观察到这次拼装。给权重设闸,就像给发动机做认证却从不看整车。

这不是在论证审查毫无价值。有些能力确实潜藏在权重里,而发布前看一眼是它们扩散之前唯一的机会。这是在论证:对于一种智能体层面的风险,模型层面的闸门是一件很钝的工具;而这套框架自身的逻辑——测网络能力、认定、审查——悄悄假定了一种稳定性,而这个领域大约在 2024 年就不再拥有它了。

开放权重在线之外,而这正是承重的那处排除

关于该框架的报道一致把受管模型描述为闭权重。如果这一点成立,那么这道闸门约束的是一条分发渠道而不是一种能力,随之而来三件事。

能力相当,待遇不同。一个测得能力与受管模型相当的开放权重发布,可以完全不经审查就放出去。如果这次审查值得做,那这是它上面的一个洞。如果这次审查不值得做,那它就是对一部分公司征的一笔税。两种解读都不好受,而框架必须选一个。

一项结构性的时间优势。选择参与的闭源实验室,接受的是最多三十天、无法压缩的发布前延迟。开放权重的竞争者不接受。在一个按月发布的市场里,三十天是有意义的领先,而它落到了那个选择退出监督的一方手里——这是一种很奇怪的、被刻意造出来的激励。

而且阈值在下游本来也执行不了。权重一旦公开就可以被微调,而安全后训练是整个技术栈里最便宜、最容易被剥掉的一层。任何定义在已发布开放权重模型上的能力阈值,都是关于那个检查点的陈述,而不是关于两周后有人会跑什么的陈述。把开放权重排除在外,与其说是一项政策选择,不如说是一次承认:这件工具在那边不起作用。

注意这对"自愿"这个词做了什么。一套框架在"没有法律强制参与"的意义上是自愿的。但对一家最大客户是联邦政府、而竞争对手就坐在同一个房间里的公司来说,它在真正要紧的那个意义上并不自愿。保密的判据,加上采购杠杆,再加上没有申诉——这是一套监管体制,只是没有这个词通常所包含的任何一项程序保障。

如果你在造智能体,什么变了

今天在你的 API 边界上什么都没变。但有三项二阶效应值得纳入规划。

发布时间多了一条你看不见的尾巴。你在等的某个模型可能正处在一个三十天的窗口里,而没人会告诉你。如果你的路线图依赖厂商公布的上线日期,就多留余量——并且让你的迁移路径保持热的,因为面对不可预测的发布节奏,缓解办法就是不把身家押在单一厂商的日历上。

你自己的评测,如今是关于一个模型的唯一公开证据。如果能力评估搬到了保密边界之后,那么外部可验证的数字就只剩你和其他从业者产出的那些。这大幅抬高了一份小而诚实、贴合任务的评测集的价值,而这周正是重读批判地阅读智能体基准、并真的把你自己那份发出来的好时候。

开放权重那一侧,正是未经审查的能力堆积的地方。如果你自托管,你跑的是没有任何闸门审视过的模型,这是一个"控制要自己握在手里"的理由——沙箱、出站策略、划定范围的凭据——而不是从厂商的安全层里继承过来。这在任何情况下都是好做法;只是现在,它同时站在了那道审查不在的位置上。

三项不花什么成本的披露

政府立场最强的版本是:测试内容必须保密。完全接受这一点。下面每一项都在这个约束之下依然成立,而且每一项都恢复了当前设计所抽掉的一道检验。

公开方法学,不公开题目。每题跑多少次、什么脚手架、什么通过判据、方差怎么处理、污染怎么筛。这就是一张模型卡片会披露的东西,而且不泄露任何能力。它的缺席,就是"一次测量"与"一句主张"之间的差别。

公开阈值的单位,以及一个汇总计数。不是那个数字——而是那个数字的形态,以及某段时期内审查了多少个模型、认定了多少个。每季度一个整数就能告诉公众这道闸门到底会不会关上,而告诉对手的信息基本为零。

给被认定的开发者一份书面依据和一条质疑通道。哪怕是一份在密级下交付的依据,也比现在有的多。一个带商业后果、却无从申诉的能力认定,是一处程序缺口,不是一项安全要求。

不舒服的地方在于:这三件事,正是这个领域对每一家公布基准结果的实验室所要求的。我们拿来衡量厂商的标准是方法学、误差棒与可复现性。在唯一一个其结论能扣住一次发布的评测方那里,接受更低的标准,是个奇怪的时刻。

常见问题

前沿模型审查是强制的吗?

不是。第 14409 号行政命令建立的是一套自愿框架——邀请开发者接洽,并提供最多 30 天的发布前访问。没有法律上的强制。但在实践中,参与与否受制于两个事实:政府是重要客户,而最大的几家实验室当时都在会议室里。

什么是"受管前沿模型"?

指其高级网络能力超过某条阈值的模型,而这条阈值由财政部、NSA 与 CISA 建立的一套涉密基准流程设定。阈值本身未公开。关于该框架的报道称受管模型为闭权重且处于最前沿水平,这就把开放权重的发布排除在外了。

这套框架公开过吗?

没有。行政命令那份 60 天交付物在 2026 年 8 月 1 日到期,没有《联邦公报》公告,也没有任何机构出版物;8 月 4 日政府向 AI 公司讲解了这套框架,同时确认它不会对外发布。

这会推迟模型发布吗?

对一家参与、且模型被认定为受管的开发者而言,可能推迟最多三十天。没有任何规定要求把这次推迟或它的存在公布出来,所以从外面看,一个审查窗口和一次普通的排期滑坡毫无区别。

为什么一份未公开的基准,比一次未公开的审计更要紧?

因为基准产出的是一个用来扣动决策的数字,而一个数字的含义完全来自它的方法学。污染、运行次数、方差与通过判据不是分数的脚注——它们才是让这个分数能与任何东西比较的东西。没有它们,输出就只是一个认定,而一个认定的可信度上限,就是你对认定者的信任。

这会取代欧盟《人工智能法案》吗?

不会。两者是各自独立的制度,触发条件不同、义务也不同,一个模型可以同时受两者约束。《人工智能法案》的通用与高风险义务,落在文档、透明度与日志上,而不是落在一条涉密的能力阈值上。

延伸阅读

本站相关:

来源: