AI 博客

Gemini 3.7 Flash 没有降价——它给价格加了一个日期

标准价是每百万 token 1.50/7.50 美元,与 3.6 Flash 早已挂出的价格分毫不差。8 月 13 日发布的,是同一挂牌价下的一个更好的模型,外加一份 12 月 31 日到期的折扣——一次日期已知的单位成本翻倍,而它会落在你趁便宜时调出来的那些轨迹上。

作者 智能体 AI 维基 22 分钟读完

Google 为 Gemini 3.7 Flash 给出的标准价,是每百万输入/输出 token 1.50 与 7.50 美元——而这恰恰就是 Gemini 3.6 Flash 早已挂出的价格。那个"五折"的标题是一份 2026 年 12 月 31 日到期的折扣,所以摆在你面前的其实是:上一代价位上的一个更好的模型,外加一次日期已知的单位成本翻倍,而它会落在你趁 token 便宜时调出来的那些轨迹上。

实际发布了什么

2026 年 8 月 13 日发布,距 3.6 Flash 约三周,定位明确指向编码与智能体工作流,而不是聊天。

属性Gemini 3.7 Flash
输入价,至 2026 年 12 月 31 日每百万 token 0.75 美元
输出价,至 2026 年 12 月 31 日每百万 token 3.75 美元
标准价,自 2027 年 1 月 1 日起输入 1.50 / 输出 7.50 美元
上下文与输出上限100 万 token 上下文,最多 64K 输出 token
模态与可控项文本、图像、音频、视频;思考预算可配置
Gemini 3.7 Flash introductory and standard token prices against 3.6 Flash Horizontal bar chart of price per million tokens. For input, Gemini 3.6 Flash lists at one dollar fifty, Gemini 3.7 Flash is seventy-five cents through the end of 2026, and returns to one dollar fifty from January 2027. For output, 3.6 Flash lists at seven dollars fifty, 3.7 Flash is three dollars seventy-five through the end of 2026, and returns to seven dollars fifty. The standard rates are identical to the previous generation; only the introductory window is new. USD per million tokens — the list price never moved INPUT 3.6 Flash, list $1.50 3.7 Flash, to 31 Dec 2026 $0.75 3.7 Flash, from 1 Jan 2027 $1.50 OUTPUT 3.6 Flash, list $7.50 3.7 Flash, to 31 Dec 2026 $3.75 3.7 Flash, from 1 Jan 2027 $7.50 $0 $2 $4 $6 $8 PUBLISHED RATES AS OF 17 AUGUST 2026. THE FILLED BARS ARE THE PRICE YOU SHOULD BE BUDGETING AGAINST
人人引用的是促销那几根条。该拿来做预算的,是填实的那几根。

把这张图当作一项产品决策而不是一次降价来读,Google 做了什么就清楚了:它让挂牌价跨代持平、把改进以能力的形式传导下去,然后挂上一份四个半月的促销,在切换成本最低的窗口期里拉动采用。这是一步再寻常不过的商业操作。它同时也是一步与"智能体负载如何累积成本"相处得很糟的操作。

为什么智能体负载对这件事的感受与聊天机器人不同

对一个回答一次性问题的助手来说,1 月 1 日的翻倍只是电子表格里一处让人不快的数字。而智能体负载的两项性质,会把同一个事件变成你现在就得筹划的事。

智能体的花费,在折扣所鼓励的那个变量上是超线性的

模型是无状态的,所以循环的每一步都要把此前的整段对话记录重发一遍。每步的输入 token 随步数增长,也就意味着整个任务的输入总量大约随步数的平方增长——算术在智能体成本控制里。折扣并不改变这条曲线,它只是暂时把你往下挪了一段。要紧的是折扣期间你最终停在曲线的哪个位置,因为那正是将被重新计价的那套配置。

配置的黏性,远高于价格的黏性

思考预算、步数上限、重试次数、要带多少上下文、简单步骤要不要路由到别处——这些一旦调定,就会被编进提示与评估里,然后被人捍卫。价格靠一纸公告就变;外壳配置得靠一个项目才变。而四个半月,足够让一套"便宜窗口期配置"变成你的质量数字所默认的那个东西。

The discount window and what teams do inside it Timeline diagram. A discount window runs from the 13 August 2026 launch of Gemini 3.7 Flash to 31 December 2026, after which the price doubles to the standard rate on 1 January 2027. Below the timeline, two lanes show the trap: during the cheap window teams raise thinking budgets and accept longer trajectories, and those same tuned-up trajectories are what gets repriced at twice the rate on the step date. A price with a date on it, and the habit it encourages Introductory rate — $0.75 / $3.75 13 Aug 2026 through 31 Dec 2026 Standard — $1.50 / $7.50 unchanged from 3.6 Flash 13 AUG 2026 31 DEC 2026 1 JAN 2027 — 2× WHAT THE CHEAP WINDOW ENCOURAGES Raise the thinking budget quality is up and the bill still looks fine Accept longer trajectories more steps, more retries, bigger transcripts This becomes the baseline prompts, evals and budgets all calibrated to it On 1 January, the trajectories you tuned during the discount are the ones that reprice — at twice the rate, on more tokens The step is known in advance. Almost nothing else about it is under your control. PRICES AS PUBLISHED ON 17 AUGUST 2026. INTRODUCTORY WINDOWS CAN BE EXTENDED — PLAN AS IF THIS ONE IS NOT
翻倍是合同上的、带日期的。它所乘上的那个东西,是你从现在到那时之间做出的一个决定。

把两者合在一起,失效模式就具体而不含糊了。某个团队 9 月采用 3.7 Flash,发现调高思考预算能补上他们最难那批任务上剩余的质量差距,于是照此上线,并把省下的钱记在促销价上。到了 1 月,费率翻倍,而 token 用量也涨了——因为思考 token 是按输出计费的,落在两个价位里更高的那一个上。账单涨的不是 2 倍。

Relative cost of the same agent workload across the repricing date Horizontal bar chart of relative cost per completed task, indexed to today. The same workload at the introductory rate is one times. On 1 January 2027 at the standard rate with unchanged effort it is two times. If output tokens per task grew forty-five percent during the discount window because the thinking budget was raised, the same workload lands near two point nine times. The doubling is contractual; the extra is self-inflicted. Cost per completed task, indexed to what you pay today Today introductory rate, current effort 1.0× 1 Jan 2027 standard rate, effort unchanged 2.0× 1 Jan 2027 standard rate, after tuning up in the window ~2.9× THE 2.0× IS ARITHMETIC FROM THE PUBLISHED RATES. THE THIRD BAR IS ILLUSTRATIVE AND ASSUMES OUTPUT TOKENS PER TASK GREW 45% DURING THE DISCOUNT — SUBSTITUTE YOUR OWN NUMBER, WHICH YOU CAN MEASURE THE DOUBLING IS CONTRACTUAL AND DATED. EVERYTHING ABOVE IT IS A CHOICE YOU MADE WHILE IT WAS CHEAP
那 2 倍是算术。它之上的那段差距是你选的,也是唯一你现在还能动手处理的部分。

那些基准数字随身带着一层外壳

公布出来的成绩,值得用与价格同等的怀疑去看。Google 自己的评测材料记录:编码结果是用一套 mini SWE-agent 外壳、在高思考档下自行计算的——也就是说,脚手架与努力度设置是这次测量的一部分。这对智能体评测而言既正常也无可避免,但它有一个直接的成本后果:产出那个标题数字的配置,正是昂贵的那套配置,因为高思考意味着更多输出 token,而输出今天按 3.75 美元计费、1 月起按 7.50 美元计费。

不同套件之间的落差,从另一个方向说明了同一件事。这次发布报出 Terminal-Bench 2.1 上约 85.8%,而 Terminal-Bench 3.0 上约 14.9%——同样的权重、同一周,套件版本不同。两个数字都不算错;它们是对不同问题的回答,而引用其中任何一个却不带上版本与脚手架,几乎等于什么都没说。截至撰稿时,尚无面向竞品的独立 SWE-bench Verified 对比,所以诚实的表述是:在 Google 选择公布的那些维度上这个模型看起来很强,而外界还没有人确认过这个排序。这个问题的一般形式是智能体外壳;我们曾就另一家厂商给出过同样的论点,见 DeepSeek 的外壳分数把脚手架算了进去

1 月之前实际该做什么

从第一天起就按标准价做预算

把每一次选型与单位经济测算都按 1.50 / 7.50 美元来跑,并把折扣当成利润空间而不是可支配余量。这在电子表格里只是一行,却能把整个失效模式移除掉。如果这份负载只有在促销价下才算得过账,那你找到的不是一个便宜模型——你找到的是一个截止日期。

测每完成任务的成本,而不是每 token 的成本

token 单价对"活儿有没有干完"一无所知,而一个八步收工而不是二十五步收工的模型,即便挂牌价更高,往往反而更便宜。盯住"花费除以通过评估的任务数",并观察 p95 与 p99 那些贵出百倍的运行;到了 1 月你就能用一个数字、而不是一场争论,来回答那个问题——这还是不是对的模型。

把思考预算做成一个显式的、可被评审的设置

如果努力度可配置,那它就是一个会在没人看着时悄悄挪动的成本旋钮。逐次运行记录它,画出每任务输出 token 随时间的曲线,并设一个触发评审的阈值。1 月受伤的团队,多半是那些说不清自己 9 月的努力度设成了多少的团队。

常备一个已通过资格认证的备选模型

不是因为你预期要换,而是因为一次带日期的成本翻倍,恰恰是那种让"换不换"值得认真核算的事件;而一次从未演练过的迁移,会吃掉你并没有的一个季度。让一个备选按固定节奏对着你的评估集跑起来——模型退役与迁移里那套常热候选的纪律,原封不动地适用于一次重新计价。

有一条一般性原则会比这个具体模型活得更久:促销价是一份条款清单,不是一个价格。当一家厂商公布带结束日期的折扣时,该进你规划的是那个日期之后的数字;而有意思的问题不是从现在到那时你能省多少——而是到那时,你已经建出了什么假定着那个便宜数字的东西。

常见问题

Google 会不会干脆把促销价延长?

有可能,而且促销窗口被延长的频率高到足以让人抱此期望。但它不是一个计划。延长是由一个你无法左右其激励的人做出的决定,按一个你并不知道的时间表宣布;而把它错误地当作前提,代价是一份你已经押上去的负载被翻倍计费。

和替代方案比,Gemini 3.7 Flash 真的便宜吗?

在促销价下,它的定价远低于前沿档;即便按标准价,它也坐在主力档而非高端档。真正要紧的问题不是每 token 的横向比较,而是在你的负载上每完成任务的成本,而这取决于每个模型需要多少步、以及多久要重试一次。那个排序是可测的,而且经常并不是价目表所暗示的样子。

100 万 token 的上下文会改变成本图景吗?

只有在你真去用它的时候才会,而用它通常是那个昂贵的错误、而不是那项功能。一个很大的上下文上限,是"可以多带一些"的许可,而你带着的每一样东西,此后每一步都会被重发、被重新计费。把这个窗口当作一条你要离得远远的上限,而不是一份用来花掉的预算。

该不该等独立基准出来再采用?

等第三方数字是合理的,但更有用的动作,是别再把任何人的基准当作决定性依据,而是拿你自己的评估集在你自己的外壳上跑一遍。那要花的是几天而不是几个月,回答的是你真正持有的那个问题,而且它给你的那条基线,反正 1 月你也用得上。

今天该写下的那一个数字是什么?

在你当前的努力度设置下,按 1.50 / 7.50 美元算出的每完成任务成本。如果这个数字可以接受,1 月那一步就什么都不是。如果不可以,你还有四个月来修它——这比那些只盯着账单的团队所拥有的时间,多得多。

延伸阅读

本站相关:

来源: