AI 博客

同样的权重,不同的拒答:Argon 把护栏做成了一项授权

谷歌把 Gemini 4 Argon 交给 Fairwind 项目中通过审核的防御方,并关掉了网络安全护栏;约束靠的是组织资质核验、抗钓鱼多因素认证、按团队限定的访问范围,以及按员工留存的使用记录。这是能力门控第一次做成了可能真正守得住的样子——而它同时意味着:一个模型标识符不再指称一种行为。

作者 智能体 AI 维基 27 分钟读完

现在,两家机构可以调用同一个谷歌模型、对同一个问题拿到实质不同的答案,而 API 里没有任何东西能告诉它们各自手上拿的是哪个版本。2026 年 9 月 30 日,Gemini 4 Argon 交付给了谷歌 Fairwind 项目中通过审核的成员,并关掉了网络安全护栏——不是靠提示词放宽,而是作为授权本身的一项性质被关掉;这份授权要等谷歌核验完组织资质才给,而且只换取这些条件:抗钓鱼的多因素认证、访问权仅限安全、事件响应或渗透测试岗的员工,以及一份「谁用过」的按员工记录。这是这条轴上第一次做出可能真正守得住的能力门控,因为一份授权没法像一次拒答那样被话术绕过去。它同时也悄悄送走了一个每套智能体技术栈都赖以成立的假设:模型字符串能指认行为。

速览

这次发布在三个彼此独立的方面都不寻常,而其中只有一个方面与模型本身有关。

维度谷歌交付了什么为何不寻常
谁拿得到Fairwind 审核通过的防御方,以及谷歌自家安全团队前沿发布由组织资质审核把关,而不是按档位或花费
他们拿到什么同一个模型,网络安全护栏关闭被分阶段放出的那件东西是策略,不是权重
条件组织核验、抗钓鱼 MFA、按团队限定访问、使用记录在模型之外执行,也就无法被话术绕开
其他所有人「在进一步测试之后」更广铺开,无日期一个没人买得到的旗舰,照样对外宣布了
上限200 万令牌上下文,最多 100 万输出令牌输出上限从约 6.4 万跃升——15 倍的变化
价格入门价每百万输入 2 美元 / 输出 10 美元已宣布入门期结束后调至 4 美元 / 20 美元

Fairwind 本身于 2026 年 9 月 2 日启动,当时有 650 多家伙伴——各国政府与国家网络安全主管部门、关键基础设施运营者、技术平台与安全厂商——起初配的是 Gemini 3.8 Flash Cyber 以及谷歌的漏洞发现与打补丁系统 CodeMender。Argon 是这条通道的升级,谷歌称它在真实软件工程、法律与金融这类企业知识工作、以及网络防御上都达到了前沿水准。

门控从「拒答」挪到了「授权」

One set of weights served through two policy paths The weights are the same on both paths. The gate is outside the model. ONE CHECKPOINT gemini-4-argon weights PATH A — ANY PAYING CALLER + cyber refusal layer rephrasable, version-drifting, unauditable from outside PATH B — FAIRWIND ONLY no cyber refusal layer same weights, different served policy FOUR GATES, NONE OF THEM PROMPTABLE 1 — verified organisation, security and ethics record checked 2 — phishing-resistant MFA on every account that touches it 3 — access limited to security, IR or pen-test employees 4 — per-employee record of who used it, retained WHAT AN ATTACKER CAN REACH a brilliant jailbreak gets you Path A, degraded it does not get you a Fairwind grant An entitlement cannot be talked around. That is the whole improvement — and the reason the model string stops naming a behaviour.
两条路径上的权重完全相同。不同的是被选中的那套策略,而那份授权没人能靠提示词挤进来。

对安全拒答的标准批评是:它是整个技术栈里最弱的一道控制。拒答是在生成时、覆在一项依然存在的能力之上施加的策略,所以它会在换个说法之下退化、会在版本号没变的情况下漂移,而且无法审计。凡是试过用它守住一条真边界的人,都已经学会要把控制放在模型无法与之争辩的地方。

Fairwind 就是把这条建议在分发层上认真执行了一遍。谷歌附加的那四项条件——一家资质经核验、安全与合规经营记录被查验过的组织;在每个接触该模型的账号上启用抗钓鱼 MFA;访问权仅限直接从事安全、事件响应或渗透测试工作的员工;以及按员工追踪使用情况——全都能在不需要模型配合的前提下执行。一个写出了绝妙越狱提示的攻击者,并不会因此获得一份 Fairwind 授权。这道控制是一个访问控制问题,而那是一个已被解决的门类;它不是一个模型行为问题,而那个还没有。

这也不是孤例。一个月前,OpenAI 从另一个方向抵达了同样的结构:在 9 月 1 日把新模型判定为达到「关键级」网络安全门槛之后,它把首批访问权走的是 Daybreak——一个申请制的网络安全项目——而不是常规档位。两家实验室各自独立地得出了同一个答案:门控一项两用能力,正确的位置是调用者的人群,而不是采样循环。

请把这件事读成一次真实的改进,因为它确实是。多年来,关于模型两用能力的公开辩论一直像是在争「模型把『不』说得多硬」这一个旋钮,而这个旋钮的天花板是已知的。把决定挪到一个经过审核的人群身上,配上合约条件与审计义务,是其他每一个两用行业早就在做的事,也是这件事第一次做成了安全工程师能够推敲的样子。

模型字符串不再指称一种行为

What a model identifier used to pin down, and what it pins down now Three columns. Before entitlement-gated policy tiers, a model identifier was treated as pinning the weights, the refusal policy and therefore the behaviour, so eval results, questionnaire answers and incident reports could all be keyed to it. Now it pins the weights only: two callers passing the same string can be served different refusal policies. The third column gives the replacement key — model identifier plus policy tier plus system prompt version plus tool list — which is the smallest set that a result can honestly be filed under. The behavioural primary key just lost a column WHAT WE ASSUMED The ID pinned behaviour weights: yes refusal policy: yes so: two callers, same string, same answers evals, questionnaires and incidents all keyed to it WHAT IS TRUE NOW The ID pins the weights weights: yes refusal policy: no entitlement selects the served policy an unreproducible eval now looks like harness drift THE REPLACEMENT KEY Four fields, not one model identifier policy tier system prompt version tool list anything you cannot rebuild from these was never pinned One extra column, written once, converts a class of mysterious results into explicable ones.
标识符仍然钉住权重。它不再钉住策略,而用户体验到的正是策略。

代价在这里,而且是所有人一起付,包括那些对网络安全能力毫无兴趣的机构。每一套智能体技术栈都把模型标识符当作行为上的主键。你的评测结果归档在它名下。你的供应商安全问卷用它作答。你的事件复盘点它的名字。你的可复现性主张依赖它。而这一切都默默假定了:两个传入同一字符串的调用者会拿到同一套策略——而对这个模型、这次发布来说,他们明摆着拿不到。

实际会出的问题都很平淡、也很具体。一支拿到 Fairwind 授权的安全团队跑出来的那些对拒答敏感的数字,另一支没有这份授权的兄弟团队复现不出来,而这道偏差看起来会像是外壳漂移。一句「我们用的是 Gemini 4 Argon」的问卷答复,已经不再传达这个模型会拒绝什么——而那原本是问这道题的唯一理由。一份建立在公开基准分数上的供应商对比,比的是一个它买不到的授权档位——榜单上的数字总是从某处来的,而那个「某处」现在是一个参数。

如果你在真正需要之前就动手,修起来很便宜:在你记录模型标识符的每一处,都在旁边记下策略档位。把它当作「一个结果所依的配置」的一部分,就像你已经在对待系统提示词版本和工具清单那样——至于这把钥匙为何必须包含所有会动的东西,见可复现性与确定性。多写一列、只写一次,就能把一整类不可复现的结果从「神秘」变成「可解释」。

谷歌没发布的东西,比它赢下的那个基准更要紧

关于 Argon 的报道都围着分数转。第三方指数把它放在通用能力榜单的首位或接近首位,并有报道称它在一个漏洞修复基准上并列第一。把这些全放到一边,因为那份公告里在运营上真正重要的一句话,是没有出现的那一句。

谷歌没有说对 Fairwind 成员解除了哪些限制,也没有说护栏开着的时候到底挡住了模型做什么。《前沿安全框架》把网络安全列为四个风险域之一,并描述了意图——拒绝有害的网络与 CBRN 请求,同时保住正当的两用研究——但两套被提供的策略之间那道差额,在任何客户能读到的地方都没有被刻画。

这个缺席有一个可测量的后果。没有一份公开的差异说明,谷歌之外没人分得清某次失败是能力上限还是策略上限。而这两者的解法正好相反:能力上限意味着换模型或换支架,策略上限意味着换请求、换授权或换供应商。分不清这两者的团队,会花上几周时间对着一次拒答做提示词工程——这是这类工作里最常见的那种浪费,也正是为什么枚举化的拒绝原因是一项产品功能,而不是一点体面。

诚实的反驳是:公开那道差额,等于公开一张「无护栏档位解锁了什么」的地图,而这与一则能力广告近得让人不安。这是一个真实的张力,而且没有干净的解法。但有一条没人走过的中间路线——对两个档位,在一套固定的公开探针集上公布类别及其拒答率,而不公布哪些提示能过。客户得到一个可测量的差额;攻击者得到一张直方图。

那两个会改你外壳、而不是改你榜单的数字

Output token cap and the cost of one cap-filling response A horizontal bar chart on a logarithmic footing comparing output ceilings. Earlier Gemini models capped output at roughly 64,000 tokens, so one cap-filling response cost about 64 cents at ten dollars per million output tokens. Gemini 4 Argon raises the ceiling to one million tokens, so one cap-filling response costs about ten dollars at the introductory rate and about twenty dollars at the announced post-introductory rate of twenty dollars per million. The worst single call in a system therefore moves by roughly fifteen times, in a dimension most per-task budgets do not measure. One response that fills the cap OUTPUT CEILING COST OF ONE FULL RESPONSE Earlier Gemini 64K cap, $10/M out 64,000 $0.64 Argon, introductory 1M cap, $10/M out 1,000,000 $10.00 Argon, post-introductory 1M cap, $20/M out 1,000,000 $20.00 The ceiling was doing unacknowledged work: it was the thing that terminated a runaway generation. A 15× cap turns a truncation error into an open-ended run, and most per-task budgets count calls or input tokens — neither of which changed. Bars are not to scale against each other beyond the 64K-versus-1M contrast; the cost figures are the point.
现在,单独一次回复可能比一千次普通回复更贵。这个上限是一项预算决定,不是一项长度决定。

已公布的数字里有两个会对智能体技术栈干真活。第一个是输出上限:最多 100 万输出令牌,而早先的 Gemini 模型约为 6.4 万。这不是便利性问题。你外壳里每一个超时、重试策略、流式缓冲、成本护栏和按任务预算,都是对着一个低三个数量级的输出天花板校准的;而过去把一次失控生成兜住的东西,正是这个上限本身。把上限抬上去,一次干净的截断错误就变成了一次无界的运行——失败模式从「JSON 不合法」变成「任务还在跑,账单还开着」。

这道算术值得算一次。按入门价每百万输出令牌 10 美元,一次把上限填满的回复要 10 美元。按已宣布的入门期后价位 20 美元,要 20 美元。同样价位下,一次 6.4 万令牌的回复是 0.64 美元与 1.28 美元。所以这个新天花板把你系统里最糟的那一次单独调用抬高了约十五倍,而且抬在一个你的按任务上限很可能压根没测量的维度上——多数上限数的是调用次数或输入令牌,而这两样都没变。如果你只从这篇文章里取一个动作,就取这个:在外壳里强制一条按任务的输出令牌预算,做法见循环内的成本管控。

第二个数字是价格路径。入门价每百万输入 2 美元、输出 10 美元,并已宣布在入门期结束时翻倍到 4 美元与 20 美元,缓存输入另有大幅折扣。一个带到期日的价格是一项条款,不是一个费率;而建立在它之上的单位经济模型,带着一个没人写下来的 2 倍阶跃。这与把价格路径写下来是同一套纪律:把费率、报价日期、以及它改变的日期,都记进模型本身。

该怎么办——审核线的两边各一套

建议要分开讲,因为这两类人群没有任何共同点。

  • 如果你已有、或想要一份 Fairwind 授权:真正的工作量在条件上,不在申请上。按团队限定的访问与按员工的使用记录,意味着你需要一份具名人群、一套你能作证的认证姿态,以及一份经得起审计的留存日志——请把它们当作它们本来就是的「要求」来读,并与智能体凭据的访问复核一起看。并且假定这份授权正是依这些条件可被撤销的。
  • 如果你永远不会有一份:你的暴露面是它的镜像。你的拒答画像同样可以在版本号没变的情况下改变,方向是更严,而几乎没人去测它。智能体循环里的一次拒答不是一句看得见的「不行」——它是一次没有发生的工具调用,和一个悄悄消失的计划步骤。按生产环境中的拒答监控里的做法,开始测它。
  • 所有人:把策略档位加进那把钥匙。模型 ID、策略档位、系统提示词版本、工具清单。凡是你无法从这四样里重建出来的东西,本来就从未被钉住过。
  • 所有人:在外壳里按任务限制输出令牌,而不是靠祈祷。供应商的那个天花板不再是一张安全网了。
  • 所有人:别再把一个公开的基准分数当成某个名字的属性。要问是哪个档位跑出来的,以及你买不买得到那个档位。第二个问题的答案越来越常是「不」——而这正是 2026 年读基准的真实内容。

还有一个值得松松地拿着的预测:如果按授权分档的策略真的成立——如果 Fairwind 与 Daybreak 产出了防御价值而没有明显的滥用——那它就会成为每一项两用前沿能力的默认形态,而那差不多就是所有有意思的能力。在那样的世界里,「你用的是哪个模型」这个问题将永久地不够用,而所有还只问这一句的供应商问卷、评测外壳与事件模板,都得加上第二个字段。

常见问题

我公司能拿到 Gemini 4 Argon 吗?

今天只能通过 Fairwind,而且得是政府或国家网络安全主管部门、关键基础设施运营者、核心技术平台,或是通过谷歌审核的安全服务商。谷歌称更广的铺开会在进一步测试之后、由付费 API 客户与最高档订阅者先行,但没有给出日期。

「关掉护栏」等于一个无审查模型吗?

不等于。谷歌描述被解除的,是针对经审核的防御性工作的那一层网络安全专项拒答。《前沿安全框架》覆盖四个风险域,而公告里没有任何地方暗示另外三个受到影响。谷歌没有公布确切的差额,而那正是本文谈的那个缺口。

授权这套模式真能挡住滥用吗?

它把攻击从一个提示词问题变成了一个冒用或内部人问题,而后者严格更难;并且与越狱不同,它会留下一条带名字的审计链路。它挡不住一个被攻陷的 Fairwind 伙伴,这也正是为什么 MFA 与使用记录这两项条件才是承重的部分。

为什么输出上限比上下文窗口更要紧?

因为上下文窗口约束的是你发出去的东西,而你的代码本来就在测它;输出上限约束的是模型生成出来的东西,而多数外壳一直靠供应商那个低天花板来终止失控生成。上限涨 15 倍,等于拿掉了一个一直在默默干活的限流器。

这周该改的那一件事是什么?

在每一处记录模型标识符的地方旁边加一个策略档位字段——评测元数据、链路属性、问卷答复都算。它只花一个下午,而且是这里其他每一个结论的前提。

延伸阅读

本站相关:

信息来源: