Google 为 Gemini 3.7 Flash 给出的标准价,是每百万输入/输出 token 1.50 与 7.50 美元——而这恰恰就是 Gemini 3.6 Flash 早已挂出的价格。那个"五折"的标题是一份 2026 年 12 月 31 日到期的折扣,所以摆在你面前的其实是:上一代价位上的一个更好的模型,外加一次日期已知的单位成本翻倍,而它会落在你趁 token 便宜时调出来的那些轨迹上。
实际发布了什么
2026 年 8 月 13 日发布,距 3.6 Flash 约三周,定位明确指向编码与智能体工作流,而不是聊天。
| 属性 | Gemini 3.7 Flash |
|---|---|
| 输入价,至 2026 年 12 月 31 日 | 每百万 token 0.75 美元 |
| 输出价,至 2026 年 12 月 31 日 | 每百万 token 3.75 美元 |
| 标准价,自 2027 年 1 月 1 日起 | 输入 1.50 / 输出 7.50 美元 |
| 上下文与输出上限 | 100 万 token 上下文,最多 64K 输出 token |
| 模态与可控项 | 文本、图像、音频、视频;思考预算可配置 |
把这张图当作一项产品决策而不是一次降价来读,Google 做了什么就清楚了:它让挂牌价跨代持平、把改进以能力的形式传导下去,然后挂上一份四个半月的促销,在切换成本最低的窗口期里拉动采用。这是一步再寻常不过的商业操作。它同时也是一步与"智能体负载如何累积成本"相处得很糟的操作。
为什么智能体负载对这件事的感受与聊天机器人不同
对一个回答一次性问题的助手来说,1 月 1 日的翻倍只是电子表格里一处让人不快的数字。而智能体负载的两项性质,会把同一个事件变成你现在就得筹划的事。
智能体的花费,在折扣所鼓励的那个变量上是超线性的
模型是无状态的,所以循环的每一步都要把此前的整段对话记录重发一遍。每步的输入 token 随步数增长,也就意味着整个任务的输入总量大约随步数的平方增长——算术在智能体成本控制里。折扣并不改变这条曲线,它只是暂时把你往下挪了一段。要紧的是折扣期间你最终停在曲线的哪个位置,因为那正是将被重新计价的那套配置。
配置的黏性,远高于价格的黏性
思考预算、步数上限、重试次数、要带多少上下文、简单步骤要不要路由到别处——这些一旦调定,就会被编进提示与评估里,然后被人捍卫。价格靠一纸公告就变;外壳配置得靠一个项目才变。而四个半月,足够让一套"便宜窗口期配置"变成你的质量数字所默认的那个东西。
把两者合在一起,失效模式就具体而不含糊了。某个团队 9 月采用 3.7 Flash,发现调高思考预算能补上他们最难那批任务上剩余的质量差距,于是照此上线,并把省下的钱记在促销价上。到了 1 月,费率翻倍,而 token 用量也涨了——因为思考 token 是按输出计费的,落在两个价位里更高的那一个上。账单涨的不是 2 倍。
那些基准数字随身带着一层外壳
公布出来的成绩,值得用与价格同等的怀疑去看。Google 自己的评测材料记录:编码结果是用一套 mini SWE-agent 外壳、在高思考档下自行计算的——也就是说,脚手架与努力度设置是这次测量的一部分。这对智能体评测而言既正常也无可避免,但它有一个直接的成本后果:产出那个标题数字的配置,正是昂贵的那套配置,因为高思考意味着更多输出 token,而输出今天按 3.75 美元计费、1 月起按 7.50 美元计费。
不同套件之间的落差,从另一个方向说明了同一件事。这次发布报出 Terminal-Bench 2.1 上约 85.8%,而 Terminal-Bench 3.0 上约 14.9%——同样的权重、同一周,套件版本不同。两个数字都不算错;它们是对不同问题的回答,而引用其中任何一个却不带上版本与脚手架,几乎等于什么都没说。截至撰稿时,尚无面向竞品的独立 SWE-bench Verified 对比,所以诚实的表述是:在 Google 选择公布的那些维度上这个模型看起来很强,而外界还没有人确认过这个排序。这个问题的一般形式是智能体外壳;我们曾就另一家厂商给出过同样的论点,见 DeepSeek 的外壳分数把脚手架算了进去。
1 月之前实际该做什么
从第一天起就按标准价做预算
把每一次选型与单位经济测算都按 1.50 / 7.50 美元来跑,并把折扣当成利润空间而不是可支配余量。这在电子表格里只是一行,却能把整个失效模式移除掉。如果这份负载只有在促销价下才算得过账,那你找到的不是一个便宜模型——你找到的是一个截止日期。
测每完成任务的成本,而不是每 token 的成本
token 单价对"活儿有没有干完"一无所知,而一个八步收工而不是二十五步收工的模型,即便挂牌价更高,往往反而更便宜。盯住"花费除以通过评估的任务数",并观察 p95 与 p99 那些贵出百倍的运行;到了 1 月你就能用一个数字、而不是一场争论,来回答那个问题——这还是不是对的模型。
把思考预算做成一个显式的、可被评审的设置
如果努力度可配置,那它就是一个会在没人看着时悄悄挪动的成本旋钮。逐次运行记录它,画出每任务输出 token 随时间的曲线,并设一个触发评审的阈值。1 月受伤的团队,多半是那些说不清自己 9 月的努力度设成了多少的团队。
常备一个已通过资格认证的备选模型
不是因为你预期要换,而是因为一次带日期的成本翻倍,恰恰是那种让"换不换"值得认真核算的事件;而一次从未演练过的迁移,会吃掉你并没有的一个季度。让一个备选按固定节奏对着你的评估集跑起来——模型退役与迁移里那套常热候选的纪律,原封不动地适用于一次重新计价。
有一条一般性原则会比这个具体模型活得更久:促销价是一份条款清单,不是一个价格。当一家厂商公布带结束日期的折扣时,该进你规划的是那个日期之后的数字;而有意思的问题不是从现在到那时你能省多少——而是到那时,你已经建出了什么假定着那个便宜数字的东西。
常见问题
Google 会不会干脆把促销价延长?
有可能,而且促销窗口被延长的频率高到足以让人抱此期望。但它不是一个计划。延长是由一个你无法左右其激励的人做出的决定,按一个你并不知道的时间表宣布;而把它错误地当作前提,代价是一份你已经押上去的负载被翻倍计费。
和替代方案比,Gemini 3.7 Flash 真的便宜吗?
在促销价下,它的定价远低于前沿档;即便按标准价,它也坐在主力档而非高端档。真正要紧的问题不是每 token 的横向比较,而是在你的负载上每完成任务的成本,而这取决于每个模型需要多少步、以及多久要重试一次。那个排序是可测的,而且经常并不是价目表所暗示的样子。
100 万 token 的上下文会改变成本图景吗?
只有在你真去用它的时候才会,而用它通常是那个昂贵的错误、而不是那项功能。一个很大的上下文上限,是"可以多带一些"的许可,而你带着的每一样东西,此后每一步都会被重发、被重新计费。把这个窗口当作一条你要离得远远的上限,而不是一份用来花掉的预算。
该不该等独立基准出来再采用?
等第三方数字是合理的,但更有用的动作,是别再把任何人的基准当作决定性依据,而是拿你自己的评估集在你自己的外壳上跑一遍。那要花的是几天而不是几个月,回答的是你真正持有的那个问题,而且它给你的那条基线,反正 1 月你也用得上。
今天该写下的那一个数字是什么?
在你当前的努力度设置下,按 1.50 / 7.50 美元算出的每完成任务成本。如果这个数字可以接受,1 月那一步就什么都不是。如果不可以,你还有四个月来修它——这比那些只盯着账单的团队所拥有的时间,多得多。
延伸阅读
本站相关:
- 智能体成本控制——为什么智能体花费大约随步数的平方增长。
- 智能体外壳——为什么一个公布出来的智能体分数是"模型加脚手架"的测量。
- 自适应思考与努力度预算——本文让你盯着的那个旋钮该怎么设。
- 单位经济——为一份负载而不是一个 token 定价的模型。
- 模型退役与迁移——如何常备一个备选。