在 Terminal-Bench 2.1 上,两个领先的终端编码智能体只差 0.4 个百分点——89.5% 对 89.1%——这个差距落在测量它们的那套外壳自身的噪声带以内。所有人还在争的那条轴已经合拢了;而真正决定"换一家要付多少钱"的那条轴,6 月 18 日在公开场合被演示了一遍:Google 关停了一个 10.5 万星的开源 CLI,换上一个闭源 Go 二进制,顺手把免费额度从每天约一千次请求砍到约二十次,并在路上弄坏了一批 CI 流水线。挑终端智能体,要挑它的契约,不是挑它的分数。
一览
四件都住在终端里、都读一份项目说明文件、都会说 MCP 的工具;而对"厂商改主意时我的这套配置会怎样"这个问题,它们给出四个不同的答案。
| 工具 | 源码与许可 | 模型 | 分发形态 |
|---|---|---|---|
| Claude Code | 专有,适用 Anthropic 商业条款 | 仅 Anthropic;2026 年 7 月 24 日起默认 Opus 5 | npm 上的 @anthropic-ai/claude-code |
| Codex CLI | Apache-2.0,Rust 编写 | 仅 OpenAI;自 2026 年 7 月 9 日 GPT-5.6 正式发布起为默认 | npm 上的 @openai/codex |
| Antigravity CLI | 闭源,Go 编写 | 仅 Google | agy 二进制 |
| opencode | MIT,TypeScript 编写 | 厂商无关——Anthropic、OpenAI、Google,或本地模型 | npm 上的 opencode-ai |
模型这条轴合拢了,而几乎没人更新自己的对比结论
Terminal-Bench 2.1 在真实 shell 里跑 89 个任务。在 Terminus 2 外壳上,GPT-5.6 Sol 以超高推理力度完成其中 89.5%;Claude Opus 5 以最高力度完成 89.1%。它们分别是 Codex CLI 与 Claude Code 的默认模型。
89 个任务上的 0.4 个百分点,还不到半个任务。它小于同一套外壳对同一份权重重跑一遍所产生的波动,而智能体基准的噪声有一种记录在案的特定形态:一个抖动的容器、一次被重试的网络调用、一处 fixture 里的非确定性排序,排名就翻转了。把这个差距当作"全团队标准化到某一家"的理由,是在把一次掷硬币读成信号——算术见评测方差与统计功效。
这种收敛不是某一个基准的偶然。两个默认模型都是前沿模型,发布时间相隔不到两周,训练目标相近,而评测它们的那套外壳是两家厂商都在针对性优化的。有意思的推论在于它对决策做了什么:如果这些模型在你的工作负载上可以互换——而这件事你应该在你自己的任务上验证,而不是在谁的排行榜上——那么这个选择里剩下的一切,就都是外壳、人机工程与条款。
基准分数是这个决策里被引用得最多、也最不耐久的输入。它每六周就变一次。许可证不会。
Google 在 6 月做的事,是今年最有用的一个数据点
2026 年 5 月 19 日的 I/O 上,Google 宣布把开发者工具统一到 Antigravity 品牌之下。6 月 18 日,Gemini CLI 停止为免费、Pro 与 Ultra 用户服务。持有 Gemini Code Assist 许可的组织获得豁免,可以继续用旧版 CLI;其余所有人迁往 Antigravity CLI——一个以 agy 调用的闭源 Go 二进制,附带一个把旧扩展转成插件、并把 settings.json 重写成新 schema 的迁移工具。
就功能而言,多数说法认为替代品是更好的工具:更快、以异步为先,并且把技能、hooks 与子智能体机制都带了过来。这不是重点。重点是它对下游所有人所呈现出的那个形状:
- 一个 10.5 万星的开源仓库不再是那件产物。fork 它、固定版本、审计它,这些选项都不复存在,因为你现在运行的是一个二进制。
- 免费额度从每天约一千次请求跌到约二十次。任何经济性建立在旧数字上的工作流——CI 检查、批量分诊、一切无人值守运行的东西——都不是"降级",而是"停摆"。
- 一次配置 schema 变更静默地弄坏了流水线。不是能力回归,也不是模型变更:是你的自动化所读取的那个文件被重写了。
- 三十天通知期。够一位开发者迁移完。不够让一家大型工程组织把一个智能体重新做资格认证——那是一次重新评测,不是一次包升级。
这些没有一条出现在基准上,而每一条都能从许可证里预见到。这就是本文的论点被压缩进的那个事件。
四个层,以及你实际在挑的是哪一层
一个终端编码智能体是四层叠起来的,而它们的更换成本天差地别。
模型层关注度最高、黏性最低。在允许换的那两件工具里换它只是一行配置,在另外两件里则不可能——但截至今夏,它也是各家选项最接近的那一层。
外壳循环层——智能体如何规划、如何分派工具、窗口满了如何压缩上下文、何时决定停下——才是真正的能力差异如今所在之处,而它从外部极难评估。一个基准分数是对"模型 + 外壳"的联合测量却只报一个数字,这恰恰解释了为什么两家厂商可以靠调脚手架而不是调权重来互换领先位置。
配置面层才是要你付钱的那一层。项目说明、权限 allow/deny 规则、MCP 服务定义、hooks、子智能体、技能、斜杠命令:全都是你写的,schema 由厂商定义,而没有一项能迁移。一个用了半年 Claude Code 的团队,会有每个包一份的 CLAUDE.md、一套照着真实事故调出来的权限策略、十来个接好的 MCP 服务,以及若干强制统一代码风格的 hooks。搬走这些不是一次安装,而是一次重写,还得由最不想干这活的人来干。
你的仓库与 CI 层是那个比你装过的每一个智能体都活得久的层,也是最值得优先投资的一层。一个签进仓库的环境脚本、一套跑得快的测试、一道评审闸门,能让每一个智能体都变好,而且无论现在流行哪家厂商,它们都属于你——这与后台编码智能体从另一个方向得出的结论是同一个。
四件工具,在那些经得起时间的轴上
源码,以及继续运行它的权利
Codex CLI(Apache-2.0)与 opencode(MIT)可以被 fork、固定、审计与打补丁;Claude Code 与 Antigravity CLI 不行。太平时期这只是抽象概念。它在以下这天变得具体:某家厂商下线了你的自动化所依赖的一个 flag、在某个周三改掉一个默认值,或者终止了一个档位。注意 Codex 身上的那份不对称:外壳是开源的,所以你能固定它;但它对话的模型是 OpenAI 的,所以固定住外壳并不等于固定住行为。只有 opencode 让两半都归你——代价是你要自己承担另外三家替你做掉的那部分集成工作。
模型选择,以及它实际值多少
opencode 的设计原则是不被任何模型厂商拥有——Anthropic、OpenAI、Google 或本地模型,按会话选。既然领先模型之间已经只差一个百分点,这份灵活性买到的"能力"比一年前少了,买到的韧性却比一年前多了:一次厂商故障、一次涨价、一次限流下调,都从"迁移"变成"改一行配置"。而那三件单厂商工具都提供更严丝合缝的体验,因为一个只针对单一模型家族调优的外壳,可以做出可移植外壳做不出的假设。
配置可移植性,以及 AGENTS.md 这个例外
Codex CLI 与 opencode 都读 AGENTS.md——这份约定是 OpenAI 贡献给 Linux 基金会旗下 Agentic AI Foundation 的,与 Anthropic 的 MCP、Block 的 goose 同批。它是整个配置面上唯一有真正跨厂商叙事的部分,也是当下最便宜的对冲:把你耐久的项目说明放进一个厂商中立的纯文本文件,只把工具专属的机制留在工具专属的配置里。这条线以下的一切——权限 schema、hook 格式、子智能体定义——在四件工具里都是专有的,这也是为什么诚实的建议是"少写一点",而不是"写得更可移植一点"。
分发稳定性,也就是 6 月真正检验过的那一条
这是四者分化最剧烈、且唯一有证据可依(即过往行为)的一条。Antigravity CLI 带着一份已经演示过的意愿登场:在三十天内退役一个工具、闭源、并砍掉免费层。Claude Code 与 Codex CLI 都发布过破坏性变更,但都没有在用户脚下抽走一条分发渠道。opencode 没有可砍的档位,因为密钥是你自己带的——它的失败模式是维护者的注意力,而不是一个商业决定;对一个有数百名贡献者、星标数超过 15 万的代码库来说,那是另一种风险,而且更小。
把这几条轴放在一起读,排序会随你的时间跨度而反转。在六周的跨度上,那两件闭源工具在开发者每天有感的每一个维度上都领先。在两年的跨度上,历史上真正起过作用的问题只有"我还跑得了它吗"和"条款变了吗"——而在这两个问题上,排序恰好完全相反。
该怎么选
| 情境 | 选 | 理由 | 代价 |
|---|---|---|---|
| 个人开发者、交互式作业、已经在付某家厂商的钱 | Claude Code 或 Codex CLI | 外壳最深、人机工程最好、账单是你本来就在付的那一份 | 一旦要走,配置面得重写一遍 |
| CI 中的无人值守运行 | Codex CLI 或 opencode | 开源意味着版本可固定,且条款变动时有 fork 这条路 | 搭建更麻烦;集成由你自己扛 |
| 受监管、气隙隔离,或受数据驻留约束 | opencode | 可以指向本地或本区域的模型;这里其余三件都做不到 | 默认模型更弱,需要更多组装 |
| 要在一家大型工程组织里做标准化 | 刻意选两件 | 面对三十天通知期,第二套能跑起来的方案是唯一真实的对冲 | 要维护两个配置面 |
| 已经在 Google 技术栈里,且持有 Code Assist 许可 | Antigravity CLI | 集成深度,加上一条在 6 月被明确豁免的企业渠道 | 一个闭源二进制,以及一家已经亮过底牌的厂商 |
无论你选哪一件都该做的事
这个选择的重要性,低于压在它底下的四个决定,而这四个决定都是可移植的。
把耐久的说明写成厂商中立的。架构、约定、构建与测试用什么命令、新贡献者需要知道什么——这些该放进 AGENTS.md 或任何工具都读得懂的等价纯文本文件。工具专属配置应该薄到一个下午就能重写;如果不是,那不是精细化的标志,而是对你退出成本的一次度量。
在 CI 里固定版本,并把智能体升级当作一次变更。被自动化调用的终端智能体,是一个里面装着模型的生产依赖,而浮动版本意味着厂商在某个周二发个版,你的构建行为就变了。固定版本,加上一套升级时重跑的小评测集,与模型退役与迁移是同一套纪律,只是往上挪了一层。
权限边界要自己拿在手里。这四件工具每一件都有 allow/deny 机制,而每一件的表达方式都不同。真正兜得住的控制——沙箱、默认拒绝的出网策略、只能 push 的令牌、禁止自我合并——都住在智能体之外,并且能扛过一次更换。把安全配置在厂商的 schema 里,就是把它配置在唯一无法迁移的那个地方。
每季度在真实项目上跑一次第二件工具。不是选型评比,而是在一个活的仓库上、由一个真会注意到它坏掉的人,维持一套能用的配置。那半天,就是"三十天通知期只是个麻烦"和"三十天通知期等于一个季度的计划外工作"之间的差别;而 6 月已经证明,通知期是一个真实参数,不是一个假设。
常见问题
2026 年哪个终端编码智能体能力最强?
在 Terminal-Bench 2.1 上,排名前二的默认模型只差 0.4 个百分点——GPT-5.6 Sol 超高力度 89.5%,Claude Opus 5 最高力度 89.1%,均在 Terminus 2 外壳上。这个差距落在正常的跑次间波动以内,所以诚实的答案是:Claude Code 与 Codex CLI 在区间顶端上等价,你应该按别的理由来定。
Gemini CLI 发生了什么?
Google 在 2026 年 5 月 19 日的 I/O 上宣布整合,并于 2026 年 6 月 18 日对免费、Pro 与 Ultra 用户停止 Gemini CLI 的服务。持有 Gemini Code Assist 许可的组织获得豁免。替代品是 Antigravity CLI,一个以 agy 调用的闭源 Go 二进制,配有把旧设置文件重写成新 schema 的迁移工具。
opencode 真的能替代厂商 CLI 吗?
能,但有取舍。它是 MIT 许可、厂商无关、并读取 AGENTS.md,因此是四者中唯一"外壳和模型都由你选"的一件。代价是你要承担厂商工具替你做掉的集成工作,开箱体验也没那么打磨。
用开源 CLI 能让我免受模型厂商决策的影响吗?
只能免一部分。Codex CLI 是 Apache-2.0,所以外壳你能固定、能 fork——但它对话的是 OpenAI 的模型,所以定价、可用性与模型退役仍由厂商说了算。要完全独立,需要"开源的外壳"加上"能指向别处的模型",而今天这意味着 opencode。
哪些东西该写进 AGENTS.md 而不是工具专属配置?
凡是一个新来的人类贡献者同样需要知道的:架构说明、约定、构建与测试命令、哪些地方不要碰。工具专属机制——权限 schema、hook 格式、子智能体定义——要尽量写薄,因为那一层在四件工具里都是专有的,而它正是一次迁移真正的成本。
团队应该统一到一个终端智能体上吗?
统一那些耐久的层——说明文件、测试集、权限边界、CI 闸门——并让第二件工具在一个真实仓库上保持可用。6 月已经表明通知期可以只有三十天,那足够迁走一个人,不足够让一家组织重新做完资格认证。
延伸阅读
本站相关:
- 编码智能体架构——这四件工具都在实现的那个循环。
- 后台编码智能体——智能体在 CI 里无人值守运行时会变什么。
- 沙箱与安全执行——那道该放在你所选工具之外的权限边界。
- 模型退役与迁移——三十天通知期真正触发的那次重新资格认证。
- 评测方差与统计功效——为什么 0.4 分的基准差距什么也决定不了。
- 开放权重 vs 闭源模型——同一个许可证问题,往下挪一层。