五款前沿模型,两周窗口——而 MMLU 排行榜已不再是值得盯的那条轴。截至 2026 年 6 月下旬,每家实验室都押在了不同的一条轴上,所以采购侧真正要问的不是哪一款最好,而是先选轴,再选模型。Anthropic 把 Claude Mythos 5 推到 GA(同时 Fable 5 进入 preview),OpenAI 放出 GPT-5.6,Google 推出 Gemini 3.2,中国阵营则以 Qwen 3.7 与 DeepSeek V4.1 回敬——这一切都挤在同一个两周窗口里发生。
速览
五款旗舰,五条不同的进攻轴。下表先列基本信息;其下的条形图与特性矩阵会呈现各自真正最用力的方向。
| 模型 | 发布时间 | 定价(美元 / 百万输出 token) | 头条强项 |
|---|---|---|---|
| Claude Mythos 5(GA) | 2026 年 6 月中旬 | 约 $15 | 编码与智能体式推理 |
| GPT-5.6 | 2026 年 6 月中旬 | 约 $10 | 自主电脑使用 |
| Gemini 3.2 | 2026 年 6 月中旬 | 约 $6 | 多模态延迟与性价比 |
| Qwen 3.7 | 2026 年 6 月中旬 | 约 $2 | 开源权重、多语种 |
| DeepSeek V4.1 | 2026 年 6 月中旬 | 约 $1.40 | 价格地板与推理经济性 |
快照:2026 年 6 月下旬。各家定价档每周都在动;上下文长度从 200K(Claude、GPT)到 1M(Gemini),Qwen 原生 256K、DeepSeek 128K——这些数字在 API 档位与权重发布之间还会变,承诺之前请对照当前的 model card 核实。
发布时间线
这次收敛不是巧合。Anthropic 与 OpenAI 大致按季度节奏走,两家都在 2026 年第二季度留了各自旗舰更新的档期;Google 的 Gemini 周期早在 I/O 上就已经放过风声。把中国阵营拽进同一个窗口的是DeepSeek V4 在 2026 年 4 月那次定价,它把推理工作负载的每 token 经济性压到了别的中国实验室无法忽视的水平。紧随其后的 Qwen 3.7 与 V4.1 刷新,与西方旗舰同处一个两周窗口——这是一次刻意的回应,不是档期意外。
有意思的结构性事实是:五款模型里,没有任何两款在同一条轴上较劲。Anthropic 与 OpenAI 争的是智能体王座(一个走编码,一个走自主电脑使用);Google 在多模态的性价比上较量;中国阵营赌的是每 token 成本与权重可得性。这两周窗口,就是这五种押注同时变得清晰可读的那一刻。
Claude Mythos 5 GA(+ Fable 5 preview)
Mythos 5 于 2026 年 6 月中旬走到 GA,是一条"两线策略"中的生产线——Mythos 走生产,Fable 走研究 preview。这种分法在设计上就是采购友好的:Mythos 带着企业买方期待的安全评估文档(漏洞感知推理评测、model card 披露、那套 SOC 形态的尽调),并与它取代的 Claude 4 家族共享同一套稳定的 API 表面。Fable 5 与之同发,基于同一套模型架构,但带研究级的后训练扩展(更长的思考轨迹、实验性的工具模式、更锋利的探索性推理)。名字本身就是信号:谁也不用再问某个模型是不是"采购可用",看后缀就够了。
就当前可见的快照看,Mythos 5 在 Anthropic 整年一直在赢的两条轴上领先——编码与智能体式推理。在 SWE-bench Verified 上它位居这五款的榜首;在长程编码任务上,领先幅度比基准差距所暗示的要更宽。电脑使用那一段是从上一篇关于电脑使用产品形态里讲过的 Vercept 集成延续下来的,意味着 Mythos 5 直接继承了 OSWorld 的领先,而不必再重新打一遍。
Mythos 5 不领先的地方是价格。每百万输出 token 约 $15,它在这五款里以相当舒适的差距坐稳"最贵"位置,与中国阵营的差距是一整个数量级。它的卖点和 Claude 4 时代没变:如果你的单位经济模型扛得住这份每 token 成本,质量与采购故事在整组里是最干净的;扛不住,你接着往下读。对那些主要把 Anthropic 当作"调用其他组件的编排器"用的团队,可以参考智能体框架,看看哪些集成形态能让成本账算得过来。
GPT-5.6
GPT-5.6 是 OpenAI 的"按节奏出货"。它不是一次断点式跃迁——而是把 GPT-5 到现在之间所有出货合并到一个稳定表面上的"按节奏点版本"。推理质量小幅上提;工具使用轨迹更紧凑;model card 上列着数学、代码、长上下文召回那些常见的渐进式胜利。头条故事不在评测数字。它在与 OpenAI 智能体栈的集成深度。
具体讲,GPT-5.6 是首款把 Codex Background CU 与 Operator 作为一等目标(而非旁系产品)出货的 OpenAI 旗舰。同一个模型,驱动 Operator 里那台云端 Chromium,驱动 Codex Background CU 里那些长跑的开发任务,驱动 ChatGPT 对话内的"Agent"表面——而不必为不同表面分别微调出彼此漂移的小模型。这种统一,本身就是自主性优势:当智能体必须在一次任务里从一个工具跨到另一个工具时,底下的模型不会跟着换。这些表面的架构形态以及与其他电脑使用押注的对比,见 Post 1:Claude Computer Use vs Codex CU vs Operator vs Gemini。
每百万输出 token 约 $10,GPT-5.6 定价低于 Mythos 5,但仍明显高于 Gemini 和中国阵营。这个位置是自洽的:如果你买的是"集成式自主"那个故事,你就接受这个价格;如果你买的是一个从自家编排器里调用的模型,你比的就是那一行每 token 成本。在可见基准上,头条编码分数比 Mythos 5 落后几分——小到一两个版本之后就可能再翻一次,也小到自主性那一截差距比百分点更值得在意。
Gemini 3.2
Gemini 3.2 是 Google 3.x 线里的周期中点更新——不是代际变化,而是把 Google 有结构性优势那几块磨得更锋利的一次刷新。多模态延迟是头条:视频理解、图像推理、屏幕截图定位,相对 3.1 都有可测量的提升;1M token 上下文窗口的往返时间,是所有支持该长度的模型里最低的。对那些"智能体得看一帧、决策、出手,而用户都还没察觉到停顿"的产品,Gemini 3.2 是架构上就为它而塑形的那一款。
Workspace 集成是这次押注的第二片拼图。Gmail、日历、Docs、Sheets、Drive 全都拿到了第一方的 Gemini 表面,3.2 这次更新把那些流——摘要、回邮草稿、表格公式合成——拧得更紧,而不改模型 API。同一个模型驱动消费级 Gemini app、Workspace 表面与企业级 Vertex AI 档位;代价是最深的集成,只有在用户本就在 Google 生态里时才回得本。
每百万输出 token 约 $6,Gemini 3.2 落在五款的中段——比西方两巨头便宜,比中国阵营贵——而它的性价比位置,是 Google 一直在稳步打磨的那条线。在通用推理上,以当前快照看,它落后于 Mythos 5 与 GPT-5.6;在多模态以及它瞄准的那类工作负载的"每质量单位价格"上,它领先。1M token 上下文已经宽到长文档 RAG 看起来更像"塞进窗口里就行",而不再是检索问题——好用,但要带上"长上下文召回退化得比头条数字更快"这条常规注脚。
中国阵营
中国阵营里居前的两位是 Qwen 3.7 与 DeepSeek V4.1,正是它俩让 6 月下旬这扇窗里同时出现五款旗舰、而不是三款。Qwen 3.7 在 Qwen3 家族那条"语言覆盖加混合推理"的赌注上,叠加了更锋利的智能体工具使用后训练、更广的多模态覆盖,以及家族延续下来的 Apache-2.0 许可证。DeepSeek V4.1 在 V4 那次 4 月定价齐射之后接上一次质量小幅提升——延续 V3 一脉的 MLA + 稀疏注意力架构、精炼过的后训练、以及 V4 线被压进市场的同一套每 token 经济性。
它们身后的阵营覆盖很广。智谱的 GLM-6 出货一款带混合推理的开源权重 MoE,在多语种轴上与 Qwen 一较高下;腾讯的 Hunyuan Large 3 拿下"闭源中文旗舰"的位置,带强势的中文域后训练;百度的 ERNIE 5.1 落在 ERNIE 5 一脉里,延续 ERNIE 多年来面向"中文企业"的同一种话术;字节的 Doubao Pro 守住消费级规模的价格地板,为字节产品矩阵里的部署上下文优化。这四款没有哪一款在前沿基准上领先,但合在一起,这个阵营在价格上大到无法忽视、在权重可得性上深到无法忽视。
定价压力才是故事。DeepSeek V4 在 2026 年 4 月那次发布,把输出 token 价格压到了别的中国阵营成员不在数周内回应就跟不上的水平——他们都回应了。Qwen 3.7 的托管 DashScope 档约在每百万输出 token $2;DeepSeek V4.1 自家 API 底价约 $1.40;阵营其余成员都落在这个区间里。对比西方三家的 $6、$10、$15,这个阵营在它瞄准的高吞吐推理工作负载上便宜了整整一个数量级。这种压缩不是一次临时促销——这是阵营承诺要守住的价格地板。
权重可得性是这个阵营拉开领先的第二条轴。Qwen 3.7 以 Apache 2.0 发布,权重上 Hugging Face 与 ModelScope;DeepSeek V4.1 以 MIT 发布,同样的渠道;GLM-6 从智谱的 GitHub 开放权重。对那些需要自托管的团队——出于数据边界、离线部署,或托管 API 在规模上做不平的单位经济模型——中国阵营是这五家实验室里唯一肯把"前沿档 checkpoint"放出来下载的那一家。西方三家是清一色"闭源 API only"。
横向对比
推理
就可见的推理快照看——SWE-bench Verified、GPQA、长程智能体轨迹——Mythos 5 微弱领先,GPT-5.6 以小幅差距尾随,Gemini 3.2 在纯推理上比西方两家低一档,但在"多模态绑定的推理"任务上领先。Qwen 3.7 与 DeepSeek V4.1 落在下一档,其中 Qwen 在多语种推理上拉前,DeepSeek 在"成本调整后的推理"(同样的答案,花费只占一小部分)上拉前。相邻档位之间的差距已经小到一两个发布之后排名就可能再翻一次;最强两位与最弱两位之间的差距更宽,但每季度都在收窄。把这些当快照读,不要当作耐用的排序——见读懂基准里讲的"把排行榜次序当稳定信号"的那个陷阱。
电脑使用
在 API 层面,GPT-5.6 是自主电脑使用的领跑者——Codex Background CU 与 Operator 都把它作为一等目标出货,而"同一份 checkpoint 跨 OpenAI 三块智能体表面"那个统一模型故事,本身就是另外四家不再做一次单独微调就赶不上的自主性差距。Mythos 5 继承了 Vercept 之后的 Claude Computer Use 架构,在原始 OSWorld 分数上领先——意思是"自己搭 harness 时,它在每任务成功率上赢";但你直接买现成集成式智能体产品时,它落后。Gemini 3.2 占住"Workspace 里的浏览器标签"那一道,在它瞄准的场景里是三家中最快的。Qwen 3.7 与 DeepSeek V4.1 没有第一方电脑使用产品;开源权重的电脑使用栈(browser-use、UI-TARS、CogAgent)可以跑在它们之上,但与闭源领跑者之间的差距是真的存在的,集成负担落在你这一边。
多模态
Gemini 3.2 在多模态上全面领跑——视频、图像、音频、屏幕截图——加上 1M token 上下文宽到视频推理看起来更像"一段超长 prompt"。Mythos 5 与 GPT-5.6 都出货了强势的"视觉输入"能力(图像推理、为各自电脑使用栈的屏幕截图定位),但没想着去追 Gemini 在视频上的深度。Qwen 3.7 同期出货 Qwen3-VL 兄弟,带可观的图像推理,且仍在同一套 Apache 2.0 之下——这让它成为这组里唯一一款具备认真"视觉输入"能力的开源权重旗舰。DeepSeek V4.1 在旗舰档保持纯文本;DeepSeek-VL 一脉是另立的兄弟线,原始视觉基准上落后于其他几家。如果你的产品是"多模态优先"的,次序是 Gemini → Qwen-VL → Mythos/GPT → DeepSeek。
性价比
价格这张图是所有对比里最干净的一张,因为单位是客观的,而跨度有一个数量级。Mythos 5 的 $15 与 GPT-5.6 的 $10 是高端档,买的是质量与集成;Gemini 3.2 的 $6 是中间档,买的是多模态与 Workspace 契合;Qwen 3.7 的 $2 与 DeepSeek V4.1 的 $1.40 是成本地板,买的是纯粹的 token 经济性。决定你能负担哪一档的临界点要看工作负载——背后的取舍框架见成本、质量与延迟——但对那种每次工具调用都重放长前缀的高吞吐智能体循环,与中国阵营之间的数量级差距会以"质量差距移不动"的方式撬动单位经济模型。价格是快照,档位是快照;真正耐用的是相对次序,不是具体数字。
权重可得性
西方三家是清一色"闭源 API only"——Mythos 5、GPT-5.6、Gemini 3.2 都不出权重,也没有公开的开源路线图。中国阵营恰好相反:Qwen 3.7 以 Apache 2.0 出货,DeepSeek V4.1 以 MIT 出货,GLM-6 以及阵营其余在宽松或近宽松许可证下开权重(一份 14B 的 Qwen 3.7 稠密兄弟跑在单卡 H100 上;一份 4-bit 量化的 DeepSeek V4.1 能放进一台 8×H200 节点)。对那些必须要权重的采购场景——气隙部署、不能走厂商 API 的数据边界制度、有硬性离线要求的受监管行业——选择是结构性的:阵营是唯一的选项。代价是地缘政治与审计开销:在西方企业里跑一份中国实验室的 checkpoint;这个权衡的框架见开源与闭源模型。
该选哪一个
| 使用场景 | 西方最佳选项 | 中国阵营最佳选项 | 理由 |
|---|---|---|---|
| 企业采购 | Mythos 5(Fable 5 作为研究 preview 兄弟) | 经 DashScope 或区域合作方托管的 Qwen 3.7 | Mythos 的安全文档加上"兄弟线分发"那一招,把采购清得干干净净;Qwen 的 Apache 2.0 在买方需要权重时,是宽松许可的兜底。 |
| 智能体式终端工作 | 经 Codex Background CU 调用的 GPT-5.6 | Qwen 3.7 + 开源智能体循环(Qwen-Agent SDK) | GPT-5.6 的统一模型自主性,是开箱即用的赢面;Qwen-Agent 在"工作必须留在你自己基础设施上"时,出货第一方的工具模式。 |
| 多模态产品 | Gemini 3.2——在视频、音频与 1M token 上下文上领跑 | Qwen 3.7(配 Qwen-VL 兄弟做视觉输入) | Gemini 占住多模态延迟与 Workspace 集成;Qwen-VL 是这组里唯一的 Apache-2.0 视觉—语言旗舰。 |
| 自托管 / 必须有权重 | 没有——西方三家清一色闭源 API only。 | Qwen 3.7(Apache 2.0)或 DeepSeek V4.1(MIT) | 选择是结构性的:只有中国阵营出货前沿权重。Qwen 取最干净的许可,DeepSeek 取最便宜的推理经济。 |
| 价格优化的批量推理 | 若产品形态本就贴 Workspace,选 Gemini 3.2;否则跨到阵营那边。 | DeepSeek V4.1——这组里的价格地板。 | 对那种每 token 成本压过质量差距的批处理工作负载,DeepSeek 的 $1.40 档是西方三家给不出的单位经济答案。 |
常见问题
Mythos 5 是不是就是 Opus 改了个名?
不是。Mythos 5 是一条新的"两线命名策略"的生产线,接替 Claude 4 家族——Mythos 走 GA,Fable 走研究 preview——它带着新一轮训练与后训练出货,不是一次重新贴标。名字本身就是采购信号:看到 "Mythos" 你就可以按常规尽调放到生产;看到 "Fable" 它就是研究级、变动更频繁。API 表面与 Claude 4 端点兼容,迁移是机械动作,但端点后面的模型是新的。
高吞吐推理里,哪一款最便宜?
DeepSeek V4.1——相对西方三家便宜大约一个数量级。截至 2026 年 6 月下旬,它的托管 API 底价约为每百万输出 token $1.40,对比 Gemini 的 $6、GPT-5.6 的 $10、Mythos 5 的 $15。Qwen 3.7 的 $2 紧随其后,而且这两款中国阵营模型你都可以自托管,把成本再压下去。常见的注脚一并要带:价格每周都在动,各家档位会变,西方三家的预留容量合约可以为承诺型买方收窄差距。
单卡 H100 能跑得动 Qwen 3.7 吗?
旗舰那款 MoE checkpoint 跑不动,但稠密兄弟可以。Qwen 3.7 家族同时出货从几个 B 一直到约 32B 的稠密模型与 MoE 旗舰,全在同一套 Apache 2.0 之下;一份 14B 或 32B 的稠密 Qwen 3.7,在单卡 H100 上跑得很从容,配上 Qwen-Agent SDK 的工具使用行为也很强。旗舰 MoE 想要一个多卡节点。"开源权重前沿"里这条稠密阶梯,正是只看头条数字会被遮住的部分。
GPT-5.6 在编码上把 Claude 拉下马了吗?
从可见快照看,还没有。Mythos 5 在 SWE-bench Verified 上仍以几个百分点领先,在"智能体得跨多个回合管理状态"的长程编码任务上,领先幅度更宽。GPT-5.6 的编码分相对 GPT-5 有提升,与 Mythos 5 的差距也小到下一个版本就可能翻转——但截至 2026 年 6 月下旬,在草稿期可见的基准上,Mythos 5 仍戴着编码王冠。有意思的问题不是"谁在 bench 上领先",而是"谁在你真正跑的那个循环里领先"。
中国阵营的权重是不是真的宽松许可?
对,两位领跑者都是。Qwen 3.7 以 Apache 2.0 出货,DeepSeek V4.1 以 MIT 出货——两者都是无限制商业使用的许可,无 MAU 上限,也无"派生模型命名"那种限制。许可证文本就是它写的那个意思。对西方买方,真正的实际问题不在许可证本身;而在于把一份中国实验室的 checkpoint 放进受监管企业的采购开销——供应链溯源、model card 审计、与安全团队的地缘政治对话。许可证是宽松的;部署对话是更长的。
Mythos 和 Fable 到底有什么区别?
Mythos 是生产线:GA 稳定、做过安全评估,带着可以签进采购文档的同一份 API 合同。Fable 是研究 preview 线:同一套模型架构与家族,但带实验性的后训练扩展——更长的思考轨迹、更锋利的探索性推理、原型工具模式——加上一个不那么采购友好的更快变更节奏。这种分法是刻意的:没人再用问"这份 checkpoint 是不是企业可用",看线名就知道。生产用 Mythos,探索用 Fable。
延伸阅读
本站相关内容:
- Llama 4 vs DeepSeek V3 vs Qwen3 vs Mistral Large 3——上一篇聚焦开源权重旗舰的前沿对比;本文则在中国阵营扩张到 2026 年年中之后,把"开源 + 闭源"一并刷新一遍。
- Claude Computer Use vs Codex CU vs Operator vs Gemini——GPT-5.6 自主性领先与 Mythos 5 OSWorld 继承所基于的那些电脑使用表面的架构形态。
- 选模型——把"最好的模型"变成"在这条约束下最好的模型"的约束优先指南,正是"先选轴,再选模型"那个框架在实操层面的落地。
- 读懂基准——读 MMLU / GPQA / SWE-bench 数字时,怎样不被那种每发一次版本就翻一次的排行榜次序牵着走。
- 开源与闭源模型——西方三家与中国阵营之间那道结构性分割的取舍框架。
- 成本、质量与延迟——决定哪一档的每 token 经济性对你工作负载真正重要的那个三角。
项目来源:
- Anthropic — News(Claude Mythos 5 GA + Fable 5 preview 发布)
- OpenAI — Blog(GPT-5.6 发布说明与 Codex/Operator 集成更新)
- Google DeepMind — Blog(Gemini 3.2 发布博文与 Workspace 集成说明)
- Qwen — Homepage(Qwen 3.7 发布、模型家族、Apache 2.0 许可)
- Qwen on GitHub(Qwen-Agent SDK、model card、部署指南)
- DeepSeek — Homepage(DeepSeek V4.1 发布与 API 价格)
- DeepSeek on GitHub(V4 一脉技术报告与推理 recipe)
- llm-stats.com——本文快照数字的第三方排行榜交叉核对。