Moonshot 把 2.8 万亿参数作为免费下载放上了互联网,又在同一个半月里,把自家托管 API 的价格定到了上一代大约三倍。两件事都是真的,其间并无矛盾;而把它们一起拿在手里,是判断开放权重前沿模型是否该进入你的智能体技术栈的唯一办法。
一览
Kimi K3 于 2026 年 7 月 16 日上线 API,权重则在 7 月 27 日 UTC 零点放出。它的规格在若干方面很不寻常,而这些方面对智能体的意义远大于对聊天的意义。
| 属性 | Kimi K3 | 对智能体意味着什么 |
|---|---|---|
| 参数量 | 2.8T 总量,稀疏 MoE | 迄今最大的开放权重发布。而这些参数必须全部驻留在显存里。 |
| 路由 | 每 token 从 896 个 expert 中激活 16 个 | 每 token 触发的不到 2%,因此单 token 计算量保持温和——但请回看上一行的内存问题。 |
| 上下文 | 1,000,000 tokens | 长的智能体轨迹不再需要激进截断。取而代之的是 KV cache 的账单。 |
| 注意力 | Kimi Delta Attention,混合线性 | Moonshot 声称在百万 token 上下文下解码提速约 6.3 倍——那正是通常拖垮长程循环的瓶颈。 |
| 权重 | MXFP4,约 1.4 TB 下载量 | 从微调阶段起就是量化感知训练,所以这是设定的精度,而非事后的有损压缩。 |
| 托管价格 | 每百万 tokens $3 / $0.30 / $15 | 依次为 cache miss 输入、cache hit 输入、输出。智能体的账单由输出主导。 |
在能力上,各家独立评测给出的画面相当一致。Artificial Analysis 在其 Intelligence Index v4.1 中把 K3 列为 189 个模型中的第 4 名,得分 57,而 K2.6 为 44。Arena 在开发者盲测中把它的前端代码能力排到第 1,得分 1,679。Vals Index 给出第 2 名,74.70%。在私有的长程智能体基准 AA-Briefcase 上它得到 1,527——领先 GPT-5.6 Sol Max 的 1,495,落后 Fable 5 Max 的 1,587。Moonshot 自己的表述罕见地坦白:K3 总体上仍逊于 Claude Fable 5 与 GPT-5.6 Sol,但胜过该公司拿来对比的其他一切。
这就是头条,而且确实是头一遭——接近前沿的智能体性能,可以下载。本文余下的部分要谈的是人们从「开放权重」这个词里听到的三件不同的事,而 K3 真正兑现的只有其中一件。
实际交付的是什么
架构上的赌注,是把稀疏性推到了此前任何公开发布都未曾到达的程度。896 个 expert 的池子里每 token 只激活 16 个,意味着模型在任一时刻都只用一小部分参数进行推理——这正是一个 2.8 万亿参数的系统还能被经济地服务起来的原因。各家报道对「有效激活参数量」的数字并不一致;路由比例才是被一贯披露的那个数,也是下文论证真正用得上的那个。
Kimi Delta Attention 是智能体开发者最该仔细看的部分。在选定的层里用混合线性形式替换二次注意力,针对的恰恰是让长程智能体变昂贵的那种失效:智能体每一步都要重发整段轨迹,所以第 400 步的解码成本和第 4 步完全不是一回事。百万 token 上下文下 6.3 倍解码提速是厂商数字,也该当作厂商数字来对待,但它瞄准的瓶颈是对的——参见智能体成本控制,了解为什么通常是那条曲线、而不是单 token 价格,决定了一个智能体的开销。
Moonshot 还附带了一个名为 Agent Swarm 的编排层,声称可协调多达 300 个子智能体、单任务超过 4,000 次工具调用,吞吐约为顺序执行的 4.5 倍。倍数当营销看,形态当信息看:这个模型是为多智能体工作训练和封装的,而不是一个外挂了智能体模式的聊天模型。
「开放权重」是三个主张,只有一个成立
当一个前沿模型以开放权重发布时,人们会同时听到三个不同的承诺,而它们一经检视就立刻分道扬镳。
它不意味着便宜
最清楚的证据就是 Moonshot 自己的定价。K3 标价每百万 cache-miss 输入 token 3 美元、每百万输出 token 15 美元;K2.6 则在 0.95 美元与 4 美元附近。这个开放权重模型比它所继承的那个相对封闭的前代贵了约三到四倍。前沿能力的服务成本就是那么多,公开权重并不改变服务它们的算术。唯一真实的折扣是结构性的而非竞争性的:cache hit 输入 0.30 美元,降幅九成;对一个反复重发大体稳定轨迹的智能体来说,那才是值得围绕它做工程的那一行开销。在这里,为你的账单出力更多的是提示缓存,而不是许可证。
它不意味着本地
在 MXFP4 下权重约为 1.4 TB——相对 FP16 的约 5.6 TB,说明量化确实在起真实作用;而且由于它从微调阶段起就是量化感知的,这是设定的精度,而不是对某个「更真实」模型的有损压缩。但它仍然是 1.4 TB。没有任何单块 H100、H200 或 B200 装得下。分布式推理在这里不是一项优化,而是唯一的模式。Moonshot 把生产用户引向 64 块及以上加速器的超节点配置;社区自托管指南给出的下限大致是 8 块 H100,若要以全速运行并用满上下文窗口,则是跨两个 NVLink 互联节点的 16 块。
「可以免费下载」和「能跑在你的硬件上」是两句不同的话。如果你想要的是一个跑在自己机器上的模型,答案依然是小型与本地模型,而 K3 不属于那一类——它是一个权重恰好公开的数据中心模型。
它确实意味着没有别人的政策管得着你
这是唯一存活下来的主张,而它的价值超出字面。把 K3 跑在你自己的集群上,就不存在外部施加的速率限制、不存在在你的生产流量之下把模型下线的弃用通知、没有提示词离开你的边界,也没有你未曾选择的拒答行为。对受监管的部署而言,那是可行架构与不可行架构之间的分界——参见数据驻留与主权。
政策独立性的论据刚刚变得具体
直到不久前,对受监管行业之外的团队来说,自托管一个前沿开放权重模型的论据大体还是假想的。这个月提供了一个具体且承重的例子。
当 Hugging Face 重建我们所记述的 ExploitGym 事件中那次入侵时,响应人员想把语言模型指向一万七千多条被记录下来的攻击者动作。商用前沿模型拒绝了:在安全分类器看来,对攻击手法的细致分析与生产攻击手法非常相像。取证最终在一个自托管的开放权重模型上完成,把通常需要数天的工作变成了数小时。
把它推广到安全之外。任何贴着拒答边界的工作负载——滥用调查、内容审核政策工作、医疗或法律文书起草、对自家智能体的对抗性红队演练——都是一个厂商对你请求的判断可能在某个周二让你的生产系统停摆的场景,没有 bug 可修,也没有申诉渠道。那种风险不会出现在基准或价格对比里。它只出现一次,在最糟糕的时刻。自托管的前沿模型是针对它的保险,而在这次发布之前,这种能力级别的保险是买不到的。
有一点值得直说:让不受限的自托管模型对防守方有用的那个性质,同样让它对攻击方有用,这种对称是真实存在的。它构成的论据是「要清楚你哪些工作负载真的需要它」,而不是「这个取舍不用付代价」。
何时选哪一种
| 场景 | 租用托管 K3 | 自托管 K3 | 留在闭源 API |
|---|---|---|---|
| 评估它到底合不合适 | 是——永远从这里开始 | 否 | 留作待超越的基线 |
| 流量突发或量小 | 是 | 否——闲置的加速器会主导成本 | 没问题 |
| 持续的高流量 | 与摊薄后的集群成本对比 | 开始回本的地方 | 比总额,不比单 token |
| 数据不能离开你的边界 | 否 | 是——这正是理由 | 否 |
| 工作负载贴着拒答边界 | 否 | 是 | 否 |
| 前沿推理能力是决定因素 | 接近前沿,但非最强 | 接近前沿,但非最强 | 按 Moonshot 自己的对比仍然领先 |
对多数团队来说,实际的形态不是二选一而是分工。租用 K3 去弄清它在智能体上的强项能否在你的真实流量上成立;把闭源前沿模型留给最难的推理步骤;让某个小型本地模型承担那些能力并非瓶颈的高频窄任务。这就是模型路由,而开放权重的前沿模型让它成为一个更有意思的问题,而不是一个已解决的问题。
动手之前还有两件事要确认。其一是许可证:发布前的报道并未把确切条款说定,因此请读模型卡,而不要假定「开放权重」就是你上一次看到的那个发布里的含义。其二是跑你自己的评测。本文里的每一个数字都是别人的基准,而把基准读明白,大体上就是记住:排行榜上的名次,是关于排行榜的证据。
常见问题
我能在自己的机器上跑 Kimi K3 吗?
不能,至少不是通常意义上的能。MXFP4 权重约 1.4 TB,没有任何单块 H100、H200 或 B200 装得下。社区指南把实际下限放在 8 块 H100 级别 GPU 附近,而 Moonshot 把生产部署引向 64 块及以上加速器。它是一个权重公开的数据中心模型。
Kimi K3 比闭源前沿模型便宜吗?
并非自动如此,它甚至不比自己的前代便宜——K3 每百万输入与输出 token 标价 3 美元与 15 美元,而 K2.6 约为 0.95 美元与 4 美元。它是否胜过某个特定闭源模型,取决于那个模型的定价,以及各自完成你的任务分别要花多少 token,那是一次按工作负载的实测,而不是一次查表。
那开放权重到底给我买来了什么?
从另一家公司的运营决策中独立出来:没有外部速率限制、不会在你的流量之下弃用模型、数据不离开你的边界、也没有你未曾选择的拒答政策。如果这些今天都不构成你的约束,诚实的答案是:托管访问一个闭源模型更简单,而且大概率更好。
它好到可以替换我现在的智能体模型了吗?
在智能体基准上它接近榜首,并且在至少一个长程套件上领先 GPT-5.6 Sol Max,而 Moonshot 自己说 K3 总体上仍逊于 Claude Fable 5 与 GPT-5.6 Sol。准确的概括是「接近前沿,且可下载」。接近是否够用,是一个关于你任务错误容忍度的问题,而回答它的唯一办法是跑你自己的评测。
百万 token 上下文是否意味着我可以不用再管理上下文了?
不。更大的窗口改变的是你能做什么,而不是你该做什么——注意力质量在超长上下文上会退化,而你保留的每一个 token 都会在后续每一步被重发并再次付费。窗口是天花板,不是策略。
延伸阅读
本站相关:
- 开源与闭源模型——这次发布挪动了这个取舍空间,但没有终结它。
- 小型与本地模型——「能跑在我的硬件上」实际长什么样。
- 模型路由——如何同时用上其中不止一个。
- 智能体成本控制——为什么决定账单的是轨迹增长而非标价。
- 蒸馏与量化——MXFP4 对那 2.8 万亿参数做了什么。
- 数据驻留与主权——让某些团队非自托管不可的那个约束。
- ExploitGym 事件——政策独立性的论据从这里开始不再假想。