AI 博客

Cursor Projects、Codex cloud、Claude Code on the web 与 Jules:该买的是那块表

四个在功能表上看似可以互换的云端编码智能体,计费的形状有四种:一个带超额结算的用量池、一份跨你所有使用界面共享的额度、一条与你账户其余用量共用的速率上限,以及按档位给死的任务次数——而每一种形状都会诱发一种具体且可预测的误用。光是 2026 年,Cursor 就改过三次收费方式,所以任何对比里的数字都已经过期;下个季度仍然成立的,只有那块表的形状,和那个沙箱的边界。

作者 智能体 AI 维基 23 分钟读完

按模型质量去挑云端编码智能体,你挑中的恰恰是下个月可以免费换掉的那一样。真正耐久的差别是那块表的形状,和那个沙箱的边界——而每一种表的形状都会诱发一种具体的误用:给死的任务次数让你把一个任务塞得过满,共享的账户额度让你的后台工作饿死你的交互会话,而按时长计费则让跑得最糟的那些运行收你最多的钱。

速览

五个产品,四种表的形状。Devin 放在表里当第五种形状的参照——按自主工作的挂钟时间计费——因为有了它,其余几种才读得懂。

平台活儿跑在哪表的形状它诱发的误用
Cursor Projects 它自己的云端机器,跨月常驻 席位费加一个包含的用量池,超出部分事后结算 没有天花板的扇出,等收到账单才发现
Codex cloud 隔离的云端环境,任务可并行 一份额度,被 web、CLI、IDE 与聊天共用 后台批量把你写代码要用的预算吃掉
Claude Code on the web 仓库的云端克隆,一个任务一个会话 账户级速率上限;VM 不单独收费,也没有单独的预算 同上,而且算力是真免费——所以没有任何信号提示你在做交换
Google Jules 每个任务一台 Google Cloud VM 按档位给死的任务次数,在配额内边际免费 任务被塞得过满,因为小任务也吃掉一整个名额
Devin (参照) 它自己的云端工作区 ACU——每个大致相当于一刻钟的活跃自主工作 你为那些卡住的运行付得最多
What each meter is good and bad at Matrix with five rows — Cursor Projects, Codex cloud, Claude Code on the web, Jules and Devin — against four columns: fan-out is cheap, a stuck run is cheap, the budget is isolated from your other work, and the cap is predictable. Jules is strong on predictable caps and on a stuck run being cheap, but weak on fan-out. Claude Code on the web is strong on a stuck run being cheap and weak on budget isolation. Cursor Projects is weak on cap predictability because overage is billed in arrears. Devin is strong on budget isolation and weak on a stuck run being cheap. Meter shape, scored four ways Fan-out is cheap Stuck run is cheap Budget is isolated Cap is predictable Cursor Projects Weak Medium Medium Weak (arrears) Codex cloud Medium Medium Weak (shared) Medium Claude Code web Medium Strong (no VM fee) Weak (shared) Medium Google Jules Weak (slot each) Strong Strong Strong (hard count) Devin Medium Weak (time) Strong Medium Weak Medium Strong No row wins. Each column is a different thing the meter makes you responsible for.
没有哪一行更好。每一行只是换了一件你得当心的事。

四块表,四种握错的姿势

Cursor Projects——一个会溢出的池子

Cursor 的付费方案把席位价与一笔以美元计的包含模型用量捆在一起,超出部分事后结算;Pro 每月 20 美元含 20 美元用量,Ultra 200 美元含 400 美元。9 月 10 日公测的 Projects 又在这之上放了一个协调者,工作需要多少子智能体,它就派多少。

这个组合没有天然的天花板。一个事后结算的池子不是上限——它是一道带账单的减速带——而协调者存在的全部意义,正是让同时在跑的智能体更多。你需要的那道控制产品并不提供:给每个 Project 的在途派发工作量设一个上限,而那个上限也正是你的评审产能所隐含的上限。把池子当成预算告警,永远别把它当成护栏。

Codex cloud——一份额度,多个使用界面

OpenAI 在 2026 年把 Codex 转成了按积分计费,而额度是共享的:本地消息与云端会话从同一个池子里扣,云端工作通常比等价的本地一轮消耗更多,一个典型任务大致落在个位数到十几二十个积分这个区间。任务可以从 web、GitHub、GitLab、Linear 或 Slack 发起。

陷阱就在「共享」上。周一早上启动六个后台重构,它们吃掉的预算,正是你打算下午用来结对啃那个硬 bug 的预算。界面里没有任何东西告诉你这件事,因为这两个使用界面是当成两个产品呈现的。缓解手段是排期而不是控费:在你不工作的时候发批量任务——那也正是它的延迟对你代价最小的时候。

Claude Code on the web——算力免费,预算共享

Web 会话把仓库克隆进 Anthropic 的云端并在那里运行;同样的东西也能从终端调用,而在 Git Live 模式下,会话会自己推分支并开出 PR。VM 不单独收费——而且文档写得很明确:也没有单独的预算。速率上限与你账户上所有其他 Claude 用量共享,所以并行任务会按比例吃掉更多。

这是四块表里最干净的一块,也是最容易读错的一块。正因为算力是真免费,人的本能就是多开会话;而「你开过头了」的唯一信号,是你的交互式助手开始变慢或者拒绝服务。如果你打算在这里扇出,用一个有自己配额的服务账号去跑,而不是用你本人工作的那个账号——这与任何共享配额下的隔离论证是同一套。

Google Jules——一个硬计数,以及塞满的问题

Jules 自 2025 年起已正式可用,也是这一组里计量方式最传统的一个:从免费到每月约 125 美元的若干档位,单位是任务次数而不是 token。它克隆进一台 Google Cloud VM,写出计划,执行跨文件改动,跑测试,然后开 PR;自 2026 年初起,它在规划时还能读取一小组经过挑选的 MCP 服务端。

硬计数是这里唯一一块给你真正可预测性的表,而它买下这份可预测性的代价是一种具体的扭曲:既然改一行和一次铺开的重构吃掉同一个名额,你就会被推着去打包。而打包恰恰是让无人值守的运行失败的那种行为——更大的任务有更多种出错的方式,还会产出一份没人愿意评审的 diff。如果你用 Jules,纪律是照样把任务切小,并把没用掉的名额当作换一份可评审 diff 所付的成本。

Devin——那块为「困惑」收费的表

Devin 按 ACU 计费,一个 ACU 大致相当于十五分钟的活跃自主工作——VM 时长、推理与带宽揉成一个数字——只在智能体真正在干活时计费,按量付费下每个 ACU 两美元出头。范围小的任务不到一个 ACU;中等规模的功能要几个。

按挂钟时间计量,是对一个云端智能体真实消耗最诚实的映照,而它的激励也最不令人舒服:一次来回打转的运行,比一次成功的运行更贵。那是正确的价格信号,也是个难受的信号;这正是为什么在按时长计费的平台上,起支配作用的那道控制是给每个任务设一个压得很低的挂钟上限,并要求智能体把手上已有的东西交回来。

另一条耐久的轴:沙箱能看见什么

What a cloud coding agent's sandbox can and cannot reach In the centre, a solid accent box is the cloud VM holding a clone of the repository at a chosen commit, a setup script and injected secrets. To its left, four reachable things: the repository tree, the dependency install, the test suite, and outbound network where policy allows. To its right, four unreachable things marked with dashed borders: local uncommitted files, a running dev server, local MCP servers, and anything on a private network. An arrow leaves the VM downward to a pull request. The boundary is the same everywhere Inside the boundary Repo tree at a commit Dependency install Test suite Outbound network, where policy allows Cloud VM Clone of the repository, your setup script, secrets you injected. Unreachable, everywhere Local uncommitted files A running dev server Local MCP servers Your private network A pull request the one integration point they all share Which half of your backlog is repository-shaped decides how useful any of these are — and that fraction is set by the boundary above, not by the model inside it.
这条边界到处都是同一个形状,而它决定了哪些任务根本做不做得成。

这里每个产品都划同一条线,而 OpenAI 把它说得最直白:一个云端任务看得见的,是 Git 托管方那份仓库副本,此外别无他物——没有本地文件、没有正在跑的开发服务器、没有本地 MCP 服务端、没有私有网络。Jules 克隆进 Google 的 VM,Claude Code 克隆进 Anthropic 的,Cursor 则给 Project 配一台自己的机器。措辞不同;可达集合并无不同。

决定任务清单的是这条边界,不是模型。凡是能由一套从公共源安装依赖的测试套件验证的工作,处处都能跑。凡是需要打到内部预发 API、需要对着本地数据库复现、或者需要驱动你机器上开发服务器的工作,处处都跑不成——而且失败得很晚,要等智能体花上几分钟才发现。实际的分野不是「哪个产品更聪明」,而是你待办清单里有多少是仓库形状的;而那个比例,通常远小于演示所暗示的。

各产品真正有差别的地方,是你被允许往边界里放什么:一段启动脚本、一个容器镜像、注入的密钥、一条出站策略。这值得仔细比较,而它与任何其他智能体沙箱面对的是同一批顾虑——另见智能体的出站管控,因为一台装着你仓库、又能不受限地对外联网的云端 VM,无论由谁在跑,都是一条外泄通路。

真正昂贵到日后改不动的是什么

Three meter shapes and the distortion each one creates Three columns. Capped counts, as in Jules: spend is predictable, and the distortion is over-stuffed tasks because a small task costs a whole slot. Shared allowance, as in Codex cloud and Claude Code on the web: no separate compute bill, and the distortion is background work starving the interactive session. Metered work, as in Cursor's usage pool and Devin's ACUs: cost tracks real consumption, and the distortion is that a stuck or fanned-out run costs the most. Three shapes, three distortions Capped counts Jules Spend is predictable; a slot is a slot. Shared allowance Codex cloud · Claude Code web No separate compute bill and no separate budget. Metered work Cursor pool · Devin ACUs Cost tracks what the run actually consumed. The distortion The distortion The distortion You over-stuff tasks, and the diff gets unreviewable. Background batches starve the session you work in. The runs going worst, and the fan-outs, cost the most.
数字每个季度都在动。这三种形状已经稳了两年。

这个品类的对比文章老得特别快,而原因值得说出来:光是 2026 年之内,仅 Cursor 一家就改了三次收费方式,这意味着网上多数方案表描述的是一个已经不存在的产品。任何以「每席位多少钱」为依据做出的决定,保质期大约一个季度。有两样东西不是这样。

第一样是那块表的形状,因为它决定的不是账单上的金额,而是你团队必须维持的那条纪律。给死的计数要求你抵住打包的冲动。共享额度要求你把身份分开。按工作量计量要求你设挂钟上限。这些习惯比任何具体价格都活得久;而一支为自己那块表养错了习惯的团队,每个月都会以同一种方式被吓一跳。

第二样是这些活儿在哪里汇合。五者都开 PR,这意味着你的合并队列、你的 CI、你的评审者,是共用的下游——而那部分你换不掉,因为那是你自己的。一个让 PR 到达速率翻倍的平台选型,其实是一次穿着采购决定外衣的评审流程变更;后台智能体实战手册讲得很直白:复核队列就是吞吐上限,而它并不在乎是哪家厂商在往里灌。

什么时候选哪个

处境选因为
财务要一个不会动的数字 Jules 任务计数是这里唯一一个你不会不小心超掉的上限
你本来就在某一家的方案里,且不想新增任何采购 Codex cloud 或 Claude Code on the web 已含在订阅里——代价是要共享你自己的那份额度
一项长期的、机械的、可由测试验证的改造工程 Cursor Projects 只有它的协调者会跨月做规划并扇出
你希望成本按任务诚实地贴着工作量走 Devin ACU 计的是挂钟时间,而那正是云端智能体真实消耗的东西
这活儿需要你的私有网络或一个正在跑的开发服务器 一个都别选 这类任务在哪家都在沙箱边界之外——留在本地做

如果你是在替一个团队而不是替自己选,那就冲着那块表而不是冲着模型去做试点:给一个小组两周,把开出的 PR 数、合入的 PR 数、花掉的评审人时、以及合入后发现的实质性错误埋上点,然后看上面那四种扭曲里,哪一种出现在了你的数据里。一定会是其中之一。

常见问题

云端编码智能体比同一个模型跑在本地 CLI 里更好吗?

是不同,不是更好。云端那版买到的是并行,以及合上笔记本也不会中断;它交出去的是你的本地文件、你的开发服务器、你的私有网络和你的本地 MCP 服务端。对于仓库形状、可由测试验证的工作,云端在吞吐上取胜;而对任何需要你真实环境的工作,本地 CLI 不是退路,它是唯一的路。

哪块表最便宜?

这个问题撑不过一个真实的月份,因为这些表彼此不可通约——任务次数、积分额度和一刻钟的算力是三种不同的单位。你能比较的是「每一个熬过评审并合入的改动的成本」,而那得你自己去量,并且量完之后候选顺序通常会重排。

共享的账户额度真的要紧吗?

第一个忙碌的下午就会要紧。后台批量与你的交互会话从同一份预算里扣,所以你早上启动的那条队列,可能会拖垮你四点钟正指望着的那个助手。让扇出跑在一个单独的身份下不花钱,而且把这种相互作用完全消掉了。

我能同时用好几个吗?

能,而且团队确实在这么做——汇合点是 PR,而它们每一个都说这门语言。不会跟着翻倍的是评审产能,所以在不增加评审者的前提下加第二个平台,只是把队列挪了个地方;其结果浮现出来的样子,是已合入改动上的实质性错误率在上升,而不是一次看得见的失败。

延伸阅读

本站:

项目来源: