AI 博客

Claude Mythos 5、GPT-5.6、Gemini 3.2、Qwen 3.7 与 DeepSeek V4.1:2026 年 6 月的前沿模型大刷新

2026 年 6 月,五款前沿级模型在两周窗口内集中发布。差距早已不是谁登顶 MMLU——每家实验室如今押注的是不同的轴:智能体计算机操作、推理成本、多模态延迟,或纯粹的价格底线。先选好轴,再选模型。

作者 智能体 AI 维基 36 分钟读完

五款前沿模型,两周窗口——而 MMLU 排行榜已不再是值得盯的那条轴。截至 2026 年 6 月下旬,每家实验室都押在了不同的一条轴上,所以采购侧真正要问的不是哪一款最好,而是先选轴,再选模型。Anthropic 把 Claude Mythos 5 推到 GA(同时 Fable 5 进入 preview),OpenAI 放出 GPT-5.6,Google 推出 Gemini 3.2,中国阵营则以 Qwen 3.7 与 DeepSeek V4.1 回敬——这一切都挤在同一个两周窗口里发生。

速览

五款旗舰,五条不同的进攻轴。下表先列基本信息;其下的条形图与特性矩阵会呈现各自真正最用力的方向。

模型 发布时间 定价(美元 / 百万输出 token) 头条强项
Claude Mythos 5(GA) 2026 年 6 月中旬 约 $15 编码与智能体式推理
GPT-5.6 2026 年 6 月中旬 约 $10 自主电脑使用
Gemini 3.2 2026 年 6 月中旬 约 $6 多模态延迟与性价比
Qwen 3.7 2026 年 6 月中旬 约 $2 开源权重、多语种
DeepSeek V4.1 2026 年 6 月中旬 约 $1.40 价格地板与推理经济性

快照:2026 年 6 月下旬。各家定价档每周都在动;上下文长度从 200K(Claude、GPT)到 1M(Gemini),Qwen 原生 256K、DeepSeek 128K——这些数字在 API 档位与权重发布之间还会变,承诺之前请对照当前的 model card 核实。

SWE-bench Verified (% success, snapshot) — frontier model comparison Horizontal bar chart: Claude Mythos 5 leads at 72%, GPT-5.6 at 68%, Gemini 3.2 at 61%, Qwen 3.7 at 58%, DeepSeek V4.1 at 55%. All scores are illustrative late-June 2026 snapshots. SWE-bench Verified (% success, snapshot) 0 25 50 75 100 Claude Mythos 5 72% GPT-5.6 68% Gemini 3.2 61% Qwen 3.7 58% DeepSeek V4.1 55%
SWE-bench Verified 快照,2026 年 6 月下旬。条形之间已经够紧——下一季度排名还会再翻一次,读它们的次序,别读差值。
Frontier model capability matrix — June 2026 Heatmap comparing five frontier models across five capability axes. Claude Mythos 5: strong reasoning, strong computer use, medium multimodal, medium price/perf, weak open-weights. GPT-5.6: strong across reasoning, computer use, multimodal; medium price/perf; weak open-weights. Gemini 3.2: strong reasoning and multimodal; medium computer use; strong price/perf; weak open-weights. Qwen 3.7: strong reasoning; medium computer use and multimodal; strong price/perf and open-weights. DeepSeek V4.1: strong reasoning; weak computer use; medium multimodal; strong price/perf and open-weights. Frontier model capability matrix Reasoning Computer use Multimodal Price / perf Open- weights Claude Mythos 5 Strong Strong Medium Medium Weak GPT-5.6 Strong Strong Strong Medium Weak Gemini 3.2 Strong Medium Strong Strong Weak Qwen 3.7 Strong Medium Medium Strong Strong DeepSeek V4.1 Strong Weak Medium Strong Strong Weak Medium Strong
每款模型最用力的方向。这张矩阵故意做得参差不齐——没人哪一项都强,而且各家强项几乎从不重叠。

发布时间线

Five frontier models in one fortnight (June 2026) Horizontal date axis from June 3 to June 21 2026, with a shaded convergence window covering roughly 14 days. Five lab release events are marked: Claude Mythos 5 on June 9, GPT-5.6 on June 11, Gemini 3.2 on June 13, Qwen 3.7 and DeepSeek V4.1 on June 17, and a Chinese price-pressure cluster on June 20. Five frontier models in one fortnight (June 2026) ~14-day convergence window Jun 3 Jun 6 Jun 9 Jun 12 Jun 15 Jun 18 Jun 21 Claude Mythos 5 GA + Fable 5 preview GPT-5.6 OpenAI reasoning refresh Gemini 3.2 Google multimodal upgrade Qwen 3.7 + DeepSeek V4.1 Chinese frontier cluster GLM-6 / Hunyuan / ERNIE Price-pressure response
五款前沿模型挤在 14 天的窗口里发布。本文的论点就在这里:这次收敛本身才是故事。

这次收敛不是巧合。Anthropic 与 OpenAI 大致按季度节奏走,两家都在 2026 年第二季度留了各自旗舰更新的档期;Google 的 Gemini 周期早在 I/O 上就已经放过风声。把中国阵营拽进同一个窗口的是DeepSeek V4 在 2026 年 4 月那次定价,它把推理工作负载的每 token 经济性压到了别的中国实验室无法忽视的水平。紧随其后的 Qwen 3.7 与 V4.1 刷新,与西方旗舰同处一个两周窗口——这是一次刻意的回应,不是档期意外。

有意思的结构性事实是:五款模型里,没有任何两款在同一条轴上较劲。Anthropic 与 OpenAI 争的是智能体王座(一个走编码,一个走自主电脑使用);Google 在多模态的性价比上较量;中国阵营赌的是每 token 成本与权重可得性。这两周窗口,就是这五种押注同时变得清晰可读的那一刻。

Claude Mythos 5 GA(+ Fable 5 preview)

Mythos 5 于 2026 年 6 月中旬走到 GA,是一条"两线策略"中的生产线——Mythos 走生产,Fable 走研究 preview。这种分法在设计上就是采购友好的:Mythos 带着企业买方期待的安全评估文档(漏洞感知推理评测、model card 披露、那套 SOC 形态的尽调),并与它取代的 Claude 4 家族共享同一套稳定的 API 表面。Fable 5 与之同发,基于同一套模型架构,但带研究级的后训练扩展(更长的思考轨迹、实验性的工具模式、更锋利的探索性推理)。名字本身就是信号:谁也不用再问某个模型是不是"采购可用",看后缀就够了。

就当前可见的快照看,Mythos 5 在 Anthropic 整年一直在赢的两条轴上领先——编码与智能体式推理。在 SWE-bench Verified 上它位居这五款的榜首;在长程编码任务上,领先幅度比基准差距所暗示的要更宽。电脑使用那一段是从上一篇关于电脑使用产品形态里讲过的 Vercept 集成延续下来的,意味着 Mythos 5 直接继承了 OSWorld 的领先,而不必再重新打一遍。

Mythos 5 不领先的地方是价格。每百万输出 token 约 $15,它在这五款里以相当舒适的差距坐稳"最贵"位置,与中国阵营的差距是一整个数量级。它的卖点和 Claude 4 时代没变:如果你的单位经济模型扛得住这份每 token 成本,质量与采购故事在整组里是最干净的;扛不住,你接着往下读。对那些主要把 Anthropic 当作"调用其他组件的编排器"用的团队,可以参考智能体框架,看看哪些集成形态能让成本账算得过来。

GPT-5.6

GPT-5.6 是 OpenAI 的"按节奏出货"。它不是一次断点式跃迁——而是把 GPT-5 到现在之间所有出货合并到一个稳定表面上的"按节奏点版本"。推理质量小幅上提;工具使用轨迹更紧凑;model card 上列着数学、代码、长上下文召回那些常见的渐进式胜利。头条故事不在评测数字。它在与 OpenAI 智能体栈的集成深度。

具体讲,GPT-5.6 是首款把 Codex Background CU 与 Operator 作为一等目标(而非旁系产品)出货的 OpenAI 旗舰。同一个模型,驱动 Operator 里那台云端 Chromium,驱动 Codex Background CU 里那些长跑的开发任务,驱动 ChatGPT 对话内的"Agent"表面——而不必为不同表面分别微调出彼此漂移的小模型。这种统一,本身就是自主性优势:当智能体必须在一次任务里从一个工具跨到另一个工具时,底下的模型不会跟着换。这些表面的架构形态以及与其他电脑使用押注的对比,见 Post 1:Claude Computer Use vs Codex CU vs Operator vs Gemini

每百万输出 token 约 $10,GPT-5.6 定价低于 Mythos 5,但仍明显高于 Gemini 和中国阵营。这个位置是自洽的:如果你买的是"集成式自主"那个故事,你就接受这个价格;如果你买的是一个从自家编排器里调用的模型,你比的就是那一行每 token 成本。在可见基准上,头条编码分数比 Mythos 5 落后几分——小到一两个版本之后就可能再翻一次,也小到自主性那一截差距比百分点更值得在意。

Gemini 3.2

Gemini 3.2 是 Google 3.x 线里的周期中点更新——不是代际变化,而是把 Google 有结构性优势那几块磨得更锋利的一次刷新。多模态延迟是头条:视频理解、图像推理、屏幕截图定位,相对 3.1 都有可测量的提升;1M token 上下文窗口的往返时间,是所有支持该长度的模型里最低的。对那些"智能体得看一帧、决策、出手,而用户都还没察觉到停顿"的产品,Gemini 3.2 是架构上就为它而塑形的那一款。

Workspace 集成是这次押注的第二片拼图。Gmail、日历、Docs、Sheets、Drive 全都拿到了第一方的 Gemini 表面,3.2 这次更新把那些流——摘要、回邮草稿、表格公式合成——拧得更紧,而不改模型 API。同一个模型驱动消费级 Gemini app、Workspace 表面与企业级 Vertex AI 档位;代价是最深的集成,只有在用户本就在 Google 生态里时才回得本。

每百万输出 token 约 $6,Gemini 3.2 落在五款的中段——比西方两巨头便宜,比中国阵营贵——而它的性价比位置,是 Google 一直在稳步打磨的那条线。在通用推理上,以当前快照看,它落后于 Mythos 5 与 GPT-5.6;在多模态以及它瞄准的那类工作负载的"每质量单位价格"上,它领先。1M token 上下文已经宽到长文档 RAG 看起来更像"塞进窗口里就行",而不再是检索问题——好用,但要带上"长上下文召回退化得比头条数字更快"这条常规注脚。

中国阵营

中国阵营里居前的两位是 Qwen 3.7 与 DeepSeek V4.1,正是它俩让 6 月下旬这扇窗里同时出现五款旗舰、而不是三款。Qwen 3.7 在 Qwen3 家族那条"语言覆盖加混合推理"的赌注上,叠加了更锋利的智能体工具使用后训练、更广的多模态覆盖,以及家族延续下来的 Apache-2.0 许可证。DeepSeek V4.1 在 V4 那次 4 月定价齐射之后接上一次质量小幅提升——延续 V3 一脉的 MLA + 稀疏注意力架构、精炼过的后训练、以及 V4 线被压进市场的同一套每 token 经济性。

它们身后的阵营覆盖很广。智谱的 GLM-6 出货一款带混合推理的开源权重 MoE,在多语种轴上与 Qwen 一较高下;腾讯的 Hunyuan Large 3 拿下"闭源中文旗舰"的位置,带强势的中文域后训练;百度的 ERNIE 5.1 落在 ERNIE 5 一脉里,延续 ERNIE 多年来面向"中文企业"的同一种话术;字节的 Doubao Pro 守住消费级规模的价格地板,为字节产品矩阵里的部署上下文优化。这四款没有哪一款在前沿基准上领先,但合在一起,这个阵营在价格上大到无法忽视、在权重可得性上深到无法忽视。

定价压力才是故事。DeepSeek V4 在 2026 年 4 月那次发布,把输出 token 价格压到了别的中国阵营成员不在数周内回应就跟不上的水平——他们都回应了。Qwen 3.7 的托管 DashScope 档约在每百万输出 token $2;DeepSeek V4.1 自家 API 底价约 $1.40;阵营其余成员都落在这个区间里。对比西方三家的 $6、$10、$15,这个阵营在它瞄准的高吞吐推理工作负载上便宜了整整一个数量级。这种压缩不是一次临时促销——这是阵营承诺要守住的价格地板。

权重可得性是这个阵营拉开领先的第二条轴。Qwen 3.7 以 Apache 2.0 发布,权重上 Hugging Face 与 ModelScope;DeepSeek V4.1 以 MIT 发布,同样的渠道;GLM-6 从智谱的 GitHub 开放权重。对那些需要自托管的团队——出于数据边界、离线部署,或托管 API 在规模上做不平的单位经济模型——中国阵营是这五家实验室里唯一肯把"前沿档 checkpoint"放出来下载的那一家。西方三家是清一色"闭源 API only"。

横向对比

推理

就可见的推理快照看——SWE-bench Verified、GPQA、长程智能体轨迹——Mythos 5 微弱领先,GPT-5.6 以小幅差距尾随,Gemini 3.2 在纯推理上比西方两家低一档,但在"多模态绑定的推理"任务上领先。Qwen 3.7 与 DeepSeek V4.1 落在下一档,其中 Qwen 在多语种推理上拉前,DeepSeek 在"成本调整后的推理"(同样的答案,花费只占一小部分)上拉前。相邻档位之间的差距已经小到一两个发布之后排名就可能再翻一次;最强两位与最弱两位之间的差距更宽,但每季度都在收窄。把这些当快照读,不要当作耐用的排序——见读懂基准里讲的"把排行榜次序当稳定信号"的那个陷阱。

电脑使用

在 API 层面,GPT-5.6 是自主电脑使用的领跑者——Codex Background CU 与 Operator 都把它作为一等目标出货,而"同一份 checkpoint 跨 OpenAI 三块智能体表面"那个统一模型故事,本身就是另外四家不再做一次单独微调就赶不上的自主性差距。Mythos 5 继承了 Vercept 之后的 Claude Computer Use 架构,在原始 OSWorld 分数上领先——意思是"自己搭 harness 时,它在每任务成功率上赢";但你直接买现成集成式智能体产品时,它落后。Gemini 3.2 占住"Workspace 里的浏览器标签"那一道,在它瞄准的场景里是三家中最快的。Qwen 3.7 与 DeepSeek V4.1 没有第一方电脑使用产品;开源权重的电脑使用栈(browser-use、UI-TARS、CogAgent)可以跑在它们之上,但与闭源领跑者之间的差距是真的存在的,集成负担落在你这一边。

多模态

Gemini 3.2 在多模态上全面领跑——视频、图像、音频、屏幕截图——加上 1M token 上下文宽到视频推理看起来更像"一段超长 prompt"。Mythos 5 与 GPT-5.6 都出货了强势的"视觉输入"能力(图像推理、为各自电脑使用栈的屏幕截图定位),但没想着去追 Gemini 在视频上的深度。Qwen 3.7 同期出货 Qwen3-VL 兄弟,带可观的图像推理,且仍在同一套 Apache 2.0 之下——这让它成为这组里唯一一款具备认真"视觉输入"能力的开源权重旗舰。DeepSeek V4.1 在旗舰档保持纯文本;DeepSeek-VL 一脉是另立的兄弟线,原始视觉基准上落后于其他几家。如果你的产品是"多模态优先"的,次序是 Gemini → Qwen-VL → Mythos/GPT → DeepSeek。

性价比

Price per 1M output tokens (USD, snapshot) Horizontal bar chart showing output token pricing. Claude Mythos 5 is most expensive at $15.00 per million tokens, followed by GPT-5.6 at $10.00, Gemini 3.2 at $6.00. The Chinese cluster leads on price: Qwen 3.7 at $2.00 and DeepSeek V4.1 at $1.40 — both shown in accent fill to mark the price-floor thesis. All figures are illustrative June 2026 snapshots. Price per 1M output tokens (USD, snapshot) $0 $4 $8 $12 $15 Claude Mythos 5 $15.00 GPT-5.6 $10.00 Gemini 3.2 $6.00 Qwen 3.7 $2.00 DeepSeek V4.1 $1.40
2026 年 6 月下旬托管 API 输出 token 价格的快照。整张图跨了整整一个数量级——西方两巨头在顶,中国阵营贴地板。

价格这张图是所有对比里最干净的一张,因为单位是客观的,而跨度有一个数量级。Mythos 5 的 $15 与 GPT-5.6 的 $10 是高端档,买的是质量与集成;Gemini 3.2 的 $6 是中间档,买的是多模态与 Workspace 契合;Qwen 3.7 的 $2 与 DeepSeek V4.1 的 $1.40 是成本地板,买的是纯粹的 token 经济性。决定你能负担哪一档的临界点要看工作负载——背后的取舍框架见成本、质量与延迟——但对那种每次工具调用都重放长前缀的高吞吐智能体循环,与中国阵营之间的数量级差距会以"质量差距移不动"的方式撬动单位经济模型。价格是快照,档位是快照;真正耐用的是相对次序,不是具体数字。

权重可得性

西方三家是清一色"闭源 API only"——Mythos 5、GPT-5.6、Gemini 3.2 都不出权重,也没有公开的开源路线图。中国阵营恰好相反:Qwen 3.7 以 Apache 2.0 出货,DeepSeek V4.1 以 MIT 出货,GLM-6 以及阵营其余在宽松或近宽松许可证下开权重(一份 14B 的 Qwen 3.7 稠密兄弟跑在单卡 H100 上;一份 4-bit 量化的 DeepSeek V4.1 能放进一台 8×H200 节点)。对那些必须要权重的采购场景——气隙部署、不能走厂商 API 的数据边界制度、有硬性离线要求的受监管行业——选择是结构性的:阵营是唯一的选项。代价是地缘政治与审计开销:在西方企业里跑一份中国实验室的 checkpoint;这个权衡的框架见开源与闭源模型

该选哪一个

使用场景 西方最佳选项 中国阵营最佳选项 理由
企业采购 Mythos 5(Fable 5 作为研究 preview 兄弟) 经 DashScope 或区域合作方托管的 Qwen 3.7 Mythos 的安全文档加上"兄弟线分发"那一招,把采购清得干干净净;Qwen 的 Apache 2.0 在买方需要权重时,是宽松许可的兜底。
智能体式终端工作 经 Codex Background CU 调用的 GPT-5.6 Qwen 3.7 + 开源智能体循环(Qwen-Agent SDK) GPT-5.6 的统一模型自主性,是开箱即用的赢面;Qwen-Agent 在"工作必须留在你自己基础设施上"时,出货第一方的工具模式。
多模态产品 Gemini 3.2——在视频、音频与 1M token 上下文上领跑 Qwen 3.7(配 Qwen-VL 兄弟做视觉输入) Gemini 占住多模态延迟与 Workspace 集成;Qwen-VL 是这组里唯一的 Apache-2.0 视觉—语言旗舰。
自托管 / 必须有权重 没有——西方三家清一色闭源 API only。 Qwen 3.7(Apache 2.0)或 DeepSeek V4.1(MIT) 选择是结构性的:只有中国阵营出货前沿权重。Qwen 取最干净的许可,DeepSeek 取最便宜的推理经济。
价格优化的批量推理 若产品形态本就贴 Workspace,选 Gemini 3.2;否则跨到阵营那边。 DeepSeek V4.1——这组里的价格地板。 对那种每 token 成本压过质量差距的批处理工作负载,DeepSeek 的 $1.40 档是西方三家给不出的单位经济答案。

常见问题

Mythos 5 是不是就是 Opus 改了个名?

不是。Mythos 5 是一条新的"两线命名策略"的生产线,接替 Claude 4 家族——Mythos 走 GA,Fable 走研究 preview——它带着新一轮训练与后训练出货,不是一次重新贴标。名字本身就是采购信号:看到 "Mythos" 你就可以按常规尽调放到生产;看到 "Fable" 它就是研究级、变动更频繁。API 表面与 Claude 4 端点兼容,迁移是机械动作,但端点后面的模型是新的。

高吞吐推理里,哪一款最便宜?

DeepSeek V4.1——相对西方三家便宜大约一个数量级。截至 2026 年 6 月下旬,它的托管 API 底价约为每百万输出 token $1.40,对比 Gemini 的 $6、GPT-5.6 的 $10、Mythos 5 的 $15。Qwen 3.7 的 $2 紧随其后,而且这两款中国阵营模型你都可以自托管,把成本再压下去。常见的注脚一并要带:价格每周都在动,各家档位会变,西方三家的预留容量合约可以为承诺型买方收窄差距。

单卡 H100 能跑得动 Qwen 3.7 吗?

旗舰那款 MoE checkpoint 跑不动,但稠密兄弟可以。Qwen 3.7 家族同时出货从几个 B 一直到约 32B 的稠密模型与 MoE 旗舰,全在同一套 Apache 2.0 之下;一份 14B 或 32B 的稠密 Qwen 3.7,在单卡 H100 上跑得很从容,配上 Qwen-Agent SDK 的工具使用行为也很强。旗舰 MoE 想要一个多卡节点。"开源权重前沿"里这条稠密阶梯,正是只看头条数字会被遮住的部分。

GPT-5.6 在编码上把 Claude 拉下马了吗?

从可见快照看,还没有。Mythos 5 在 SWE-bench Verified 上仍以几个百分点领先,在"智能体得跨多个回合管理状态"的长程编码任务上,领先幅度更宽。GPT-5.6 的编码分相对 GPT-5 有提升,与 Mythos 5 的差距也小到下一个版本就可能翻转——但截至 2026 年 6 月下旬,在草稿期可见的基准上,Mythos 5 仍戴着编码王冠。有意思的问题不是"谁在 bench 上领先",而是"谁在你真正跑的那个循环里领先"。

中国阵营的权重是不是真的宽松许可?

对,两位领跑者都是。Qwen 3.7 以 Apache 2.0 出货,DeepSeek V4.1 以 MIT 出货——两者都是无限制商业使用的许可,无 MAU 上限,也无"派生模型命名"那种限制。许可证文本就是它写的那个意思。对西方买方,真正的实际问题不在许可证本身;而在于把一份中国实验室的 checkpoint 放进受监管企业的采购开销——供应链溯源、model card 审计、与安全团队的地缘政治对话。许可证是宽松的;部署对话是更长的。

Mythos 和 Fable 到底有什么区别?

Mythos 是生产线:GA 稳定、做过安全评估,带着可以签进采购文档的同一份 API 合同。Fable 是研究 preview 线:同一套模型架构与家族,但带实验性的后训练扩展——更长的思考轨迹、更锋利的探索性推理、原型工具模式——加上一个不那么采购友好的更快变更节奏。这种分法是刻意的:没人再用问"这份 checkpoint 是不是企业可用",看线名就知道。生产用 Mythos,探索用 Fable。

延伸阅读

本站相关内容:

  • Llama 4 vs DeepSeek V3 vs Qwen3 vs Mistral Large 3——上一篇聚焦开源权重旗舰的前沿对比;本文则在中国阵营扩张到 2026 年年中之后,把"开源 + 闭源"一并刷新一遍。
  • Claude Computer Use vs Codex CU vs Operator vs Gemini——GPT-5.6 自主性领先与 Mythos 5 OSWorld 继承所基于的那些电脑使用表面的架构形态。
  • 选模型——把"最好的模型"变成"在这条约束下最好的模型"的约束优先指南,正是"先选轴,再选模型"那个框架在实操层面的落地。
  • 读懂基准——读 MMLU / GPQA / SWE-bench 数字时,怎样不被那种每发一次版本就翻一次的排行榜次序牵着走。
  • 开源与闭源模型——西方三家与中国阵营之间那道结构性分割的取舍框架。
  • 成本、质量与延迟——决定哪一档的每 token 经济性对你工作负载真正重要的那个三角。

项目来源: