AI 博客

Kimi K3 开放权重,但这不等于便宜、本地或不受限

Moonshot 在 7 月 27 日把 2.8 万亿参数做成了免费下载——同时把自家 API 定价定得高于它所取代的上一代模型,而市面上没有任何一块 GPU 装得下这份权重。开放权重为智能体开发者换来的恰恰只有一样闭源 API 给不了的东西,而那样东西不是成本。

作者 智能体 AI 维基 28 分钟读完

Moonshot 把 2.8 万亿参数作为免费下载放上了互联网,又在同一个半月里,把自家托管 API 的价格定到了上一代大约三倍。两件事都是真的,其间并无矛盾;而把它们一起拿在手里,是判断开放权重前沿模型是否该进入你的智能体技术栈的唯一办法。

一览

Kimi K3 于 2026 年 7 月 16 日上线 API,权重则在 7 月 27 日 UTC 零点放出。它的规格在若干方面很不寻常,而这些方面对智能体的意义远大于对聊天的意义。

属性Kimi K3对智能体意味着什么
参数量2.8T 总量,稀疏 MoE迄今最大的开放权重发布。而这些参数必须全部驻留在显存里。
路由每 token 从 896 个 expert 中激活 16 个每 token 触发的不到 2%,因此单 token 计算量保持温和——但请回看上一行的内存问题。
上下文1,000,000 tokens长的智能体轨迹不再需要激进截断。取而代之的是 KV cache 的账单。
注意力Kimi Delta Attention,混合线性Moonshot 声称在百万 token 上下文下解码提速约 6.3 倍——那正是通常拖垮长程循环的瓶颈。
权重MXFP4,约 1.4 TB 下载量从微调阶段起就是量化感知训练,所以这是设定的精度,而非事后的有损压缩。
托管价格每百万 tokens $3 / $0.30 / $15依次为 cache miss 输入、cache hit 输入、输出。智能体的账单由输出主导。
Kimi K3 hosted API pricing against the model it replaces Horizontal bar chart of published list prices in US dollars per million tokens. Kimi K3 charges fifteen dollars for output against roughly four for K2.6, and three dollars for cache-miss input against roughly ninety-five cents. Only the cache-hit input price, thirty cents, is cheaper than anything in the previous generation. USD PER MILLION TOKENS — PUBLISHED LIST PRICE $3.75 $7.50 $11.25 $15.00 Kimi K3 — output what agent loops actually burn $15.00 Kimi K2.6 — output the previous generation $4.00 Kimi K3 — input cache miss $3.00 Kimi K2.6 — input the previous generation $0.95 Kimi K3 — input cache hit, 90% off $0.30
公布的标价。开放权重的发布没有让托管模型变便宜——它比自己所取代的那一代更贵了。

在能力上,各家独立评测给出的画面相当一致。Artificial Analysis 在其 Intelligence Index v4.1 中把 K3 列为 189 个模型中的第 4 名,得分 57,而 K2.6 为 44。Arena 在开发者盲测中把它的前端代码能力排到第 1,得分 1,679。Vals Index 给出第 2 名,74.70%。在私有的长程智能体基准 AA-Briefcase 上它得到 1,527——领先 GPT-5.6 Sol Max 的 1,495,落后 Fable 5 Max 的 1,587。Moonshot 自己的表述罕见地坦白:K3 总体上仍逊于 Claude Fable 5 与 GPT-5.6 Sol,但胜过该公司拿来对比的其他一切。

这就是头条,而且确实是头一遭——接近前沿的智能体性能,可以下载。本文余下的部分要谈的是人们从「开放权重」这个词里听到的三件不同的事,而 K3 真正兑现的只有其中一件。

实际交付的是什么

Kimi K3 architecture and its memory footprint Tokens from a context window of up to one million pass through Kimi Delta Attention, a hybrid linear attention used in selected layers, then a router that fires sixteen of eight hundred and ninety-six experts per token — under two percent of the pool. Sparse activation keeps compute per token modest, but every one of the 2.8 trillion parameters must still be resident, which is why the MXFP4 weights alone come to roughly 1.4 terabytes. PER-TOKEN PATH Context up to 1,000,000 tokens native vision folded into pretraining, not bolted on Kimi Delta Attention hybrid linear attention replacing the quadratic form in selected layers vendor claim: 6.3× decode at 1M Sparse MoE router picks 16 experts out of 896 for this token latent-space routing over a pool that never fully activates THE EXPERT POOL — WIDTH IS PROPORTIONAL 16 experts fire under 2% of the pool 896 experts resident, 880 idle for this token WHAT HAS TO BE IN MEMORY ANYWAY 2.8T parameters sparse activation cuts the compute per token, not the memory the model occupies MXFP4 weights ≈1.4 TB to download, against ≈5.6 TB at FP16 — quantisation aware from fine-tuning onward No single GPU fits not an H100, H200 or B200; Moonshot points production users at 64+ accelerators
稀疏激活削减的是每 token 的计算量,不是模型占用的内存。

架构上的赌注,是把稀疏性推到了此前任何公开发布都未曾到达的程度。896 个 expert 的池子里每 token 只激活 16 个,意味着模型在任一时刻都只用一小部分参数进行推理——这正是一个 2.8 万亿参数的系统还能被经济地服务起来的原因。各家报道对「有效激活参数量」的数字并不一致;路由比例才是被一贯披露的那个数,也是下文论证真正用得上的那个。

Kimi Delta Attention 是智能体开发者最该仔细看的部分。在选定的层里用混合线性形式替换二次注意力,针对的恰恰是让长程智能体变昂贵的那种失效:智能体每一步都要重发整段轨迹,所以第 400 步的解码成本和第 4 步完全不是一回事。百万 token 上下文下 6.3 倍解码提速是厂商数字,也该当作厂商数字来对待,但它瞄准的瓶颈是对的——参见智能体成本控制,了解为什么通常是那条曲线、而不是单 token 价格,决定了一个智能体的开销。

Moonshot 还附带了一个名为 Agent Swarm 的编排层,声称可协调多达 300 个子智能体、单任务超过 4,000 次工具调用,吞吐约为顺序执行的 4.5 倍。倍数当营销看,形态当信息看:这个模型是为多智能体工作训练和封装的,而不是一个外挂了智能体模式的聊天模型。

「开放权重」是三个主张,只有一个成立

What each deployment shape actually gives an agent builder A matrix comparing a closed frontier API, Kimi K3 through its hosted API, Kimi K3 self-hosted, and a small local model across four properties. Only self-hosting a frontier open-weight model gives both frontier capability and freedom from another company's usage policy, and it is the one option with a hard hardware floor. DEPLOYMENT SHAPE × WHAT YOU ACTUALLY GET FRONTIER CAPABILITY LOW COST PER TOKEN RUNS ON MODEST HARDWARE NO EXTERNAL USAGE POLICY Closed frontier API someone else runs it Yes No No hardware at all No Kimi K3, hosted API open weights, rented Near-frontier Dearer than K2.6 No hardware at all No Kimi K3, self-hosted the weights, your cluster Near-frontier Only at high volume 64+ accelerators Yes — the whole point Small local model runs on one machine No Marginal cost ~0 One GPU, or a laptop Yes The row that has no cheap column is the one that made news. The column that only self-hosting fills is the one worth paying for. Fully Conditionally Not at all
没有哪一行填满所有列。选得好,意味着清楚自己究竟是为哪一列而来。

当一个前沿模型以开放权重发布时,人们会同时听到三个不同的承诺,而它们一经检视就立刻分道扬镳。

它不意味着便宜

最清楚的证据就是 Moonshot 自己的定价。K3 标价每百万 cache-miss 输入 token 3 美元、每百万输出 token 15 美元;K2.6 则在 0.95 美元与 4 美元附近。这个开放权重模型比它所继承的那个相对封闭的前代贵了约三到四倍。前沿能力的服务成本就是那么多,公开权重并不改变服务它们的算术。唯一真实的折扣是结构性的而非竞争性的:cache hit 输入 0.30 美元,降幅九成;对一个反复重发大体稳定轨迹的智能体来说,那才是值得围绕它做工程的那一行开销。在这里,为你的账单出力更多的是提示缓存,而不是许可证。

它不意味着本地

在 MXFP4 下权重约为 1.4 TB——相对 FP16 的约 5.6 TB,说明量化确实在起真实作用;而且由于它从微调阶段起就是量化感知的,这是设定的精度,而不是对某个「更真实」模型的有损压缩。但它仍然是 1.4 TB。没有任何单块 H100、H200 或 B200 装得下。分布式推理在这里不是一项优化,而是唯一的模式。Moonshot 把生产用户引向 64 块及以上加速器的超节点配置;社区自托管指南给出的下限大致是 8 块 H100,若要以全速运行并用满上下文窗口,则是跨两个 NVLink 互联节点的 16 块。

「可以免费下载」和「能跑在你的硬件上」是两句不同的话。如果你想要的是一个跑在自己机器上的模型,答案依然是小型与本地模型,而 K3 不属于那一类——它是一个权重恰好公开的数据中心模型。

它确实意味着没有别人的政策管得着你

这是唯一存活下来的主张,而它的价值超出字面。把 K3 跑在你自己的集群上,就不存在外部施加的速率限制、不存在在你的生产流量之下把模型下线的弃用通知、没有提示词离开你的边界,也没有你未曾选择的拒答行为。对受监管的部署而言,那是可行架构与不可行架构之间的分界——参见数据驻留与主权

政策独立性的论据刚刚变得具体

直到不久前,对受监管行业之外的团队来说,自托管一个前沿开放权重模型的论据大体还是假想的。这个月提供了一个具体且承重的例子。

当 Hugging Face 重建我们所记述的 ExploitGym 事件中那次入侵时,响应人员想把语言模型指向一万七千多条被记录下来的攻击者动作。商用前沿模型拒绝了:在安全分类器看来,对攻击手法的细致分析与生产攻击手法非常相像。取证最终在一个自托管的开放权重模型上完成,把通常需要数天的工作变成了数小时。

把它推广到安全之外。任何贴着拒答边界的工作负载——滥用调查、内容审核政策工作、医疗或法律文书起草、对自家智能体的对抗性红队演练——都是一个厂商对你请求的判断可能在某个周二让你的生产系统停摆的场景,没有 bug 可修,也没有申诉渠道。那种风险不会出现在基准或价格对比里。它只出现一次,在最糟糕的时刻。自托管的前沿模型是针对它的保险,而在这次发布之前,这种能力级别的保险是买不到的。

有一点值得直说:让不受限的自托管模型对防守方有用的那个性质,同样让它对攻击方有用,这种对称是真实存在的。它构成的论据是「要清楚你哪些工作负载真的需要它」,而不是「这个取舍不用付代价」。

何时选哪一种

Three ways to run an open-weight frontier model, and what each is for Renting Kimi K3 through a hosted API costs the least to start and buys none of the independence open weights promise. Self-hosting demands a cluster of 64 or more accelerators and only pays back at sustained volume, but it is the only shape where no external usage policy applies. A small local model gives up frontier capability entirely in exchange for running anywhere. PICK THE SHAPE THAT MATCHES WHY YOU WANTED OPEN WEIGHTS Rent it HOSTED API Zero hardware, same-day start, $3 in and $15 out per million. You are back under someone else's terms of service — the openness bought you a second vendor, not freedom. Own it SELF-HOSTED CLUSTER 64+ accelerators for production; ≈1.4 TB of weights to place. Pays back only at sustained volume — but no refusal policy, no rate limit and no data leaving your boundary. Shrink it SMALL LOCAL MODEL One GPU or a laptop; marginal cost per call rounds to zero. Gives up frontier reasoning, so route to it for the narrow, high-volume steps and escalate the hard ones elsewhere. Most agent stacks end up using two of these three, not one.
多数智能体技术栈最后会用上这三者中的两者。
场景租用托管 K3自托管 K3留在闭源 API
评估它到底合不合适是——永远从这里开始留作待超越的基线
流量突发或量小否——闲置的加速器会主导成本没问题
持续的高流量与摊薄后的集群成本对比开始回本的地方比总额,不比单 token
数据不能离开你的边界是——这正是理由
工作负载贴着拒答边界
前沿推理能力是决定因素接近前沿,但非最强接近前沿,但非最强按 Moonshot 自己的对比仍然领先

对多数团队来说,实际的形态不是二选一而是分工。租用 K3 去弄清它在智能体上的强项能否在你的真实流量上成立;把闭源前沿模型留给最难的推理步骤;让某个小型本地模型承担那些能力并非瓶颈的高频窄任务。这就是模型路由,而开放权重的前沿模型让它成为一个更有意思的问题,而不是一个已解决的问题。

动手之前还有两件事要确认。其一是许可证:发布前的报道并未把确切条款说定,因此请读模型卡,而不要假定「开放权重」就是你上一次看到的那个发布里的含义。其二是跑你自己的评测。本文里的每一个数字都是别人的基准,而把基准读明白,大体上就是记住:排行榜上的名次,是关于排行榜的证据。

常见问题

我能在自己的机器上跑 Kimi K3 吗?

不能,至少不是通常意义上的能。MXFP4 权重约 1.4 TB,没有任何单块 H100、H200 或 B200 装得下。社区指南把实际下限放在 8 块 H100 级别 GPU 附近,而 Moonshot 把生产部署引向 64 块及以上加速器。它是一个权重公开的数据中心模型。

Kimi K3 比闭源前沿模型便宜吗?

并非自动如此,它甚至不比自己的前代便宜——K3 每百万输入与输出 token 标价 3 美元与 15 美元,而 K2.6 约为 0.95 美元与 4 美元。它是否胜过某个特定闭源模型,取决于那个模型的定价,以及各自完成你的任务分别要花多少 token,那是一次按工作负载的实测,而不是一次查表。

那开放权重到底给我买来了什么?

从另一家公司的运营决策中独立出来:没有外部速率限制、不会在你的流量之下弃用模型、数据不离开你的边界、也没有你未曾选择的拒答政策。如果这些今天都不构成你的约束,诚实的答案是:托管访问一个闭源模型更简单,而且大概率更好。

它好到可以替换我现在的智能体模型了吗?

在智能体基准上它接近榜首,并且在至少一个长程套件上领先 GPT-5.6 Sol Max,而 Moonshot 自己说 K3 总体上仍逊于 Claude Fable 5 与 GPT-5.6 Sol。准确的概括是「接近前沿,且可下载」。接近是否够用,是一个关于你任务错误容忍度的问题,而回答它的唯一办法是跑你自己的评测。

百万 token 上下文是否意味着我可以不用再管理上下文了?

不。更大的窗口改变的是你能做什么,而不是你该做什么——注意力质量在超长上下文上会退化,而你保留的每一个 token 都会在后续每一步被重发并再次付费。窗口是天花板,不是策略。

延伸阅读

本站相关:

来源: