按模型质量去挑云端编码智能体,你挑中的恰恰是下个月可以免费换掉的那一样。真正耐久的差别是那块表的形状,和那个沙箱的边界——而每一种表的形状都会诱发一种具体的误用:给死的任务次数让你把一个任务塞得过满,共享的账户额度让你的后台工作饿死你的交互会话,而按时长计费则让跑得最糟的那些运行收你最多的钱。
速览
五个产品,四种表的形状。Devin 放在表里当第五种形状的参照——按自主工作的挂钟时间计费——因为有了它,其余几种才读得懂。
| 平台 | 活儿跑在哪 | 表的形状 | 它诱发的误用 |
|---|---|---|---|
| Cursor Projects | 它自己的云端机器,跨月常驻 | 席位费加一个包含的用量池,超出部分事后结算 | 没有天花板的扇出,等收到账单才发现 |
| Codex cloud | 隔离的云端环境,任务可并行 | 一份额度,被 web、CLI、IDE 与聊天共用 | 后台批量把你写代码要用的预算吃掉 |
| Claude Code on the web | 仓库的云端克隆,一个任务一个会话 | 账户级速率上限;VM 不单独收费,也没有单独的预算 | 同上,而且算力是真免费——所以没有任何信号提示你在做交换 |
| Google Jules | 每个任务一台 Google Cloud VM | 按档位给死的任务次数,在配额内边际免费 | 任务被塞得过满,因为小任务也吃掉一整个名额 |
| Devin (参照) | 它自己的云端工作区 | ACU——每个大致相当于一刻钟的活跃自主工作 | 你为那些卡住的运行付得最多 |
四块表,四种握错的姿势
Cursor Projects——一个会溢出的池子
Cursor 的付费方案把席位价与一笔以美元计的包含模型用量捆在一起,超出部分事后结算;Pro 每月 20 美元含 20 美元用量,Ultra 200 美元含 400 美元。9 月 10 日公测的 Projects 又在这之上放了一个协调者,工作需要多少子智能体,它就派多少。
这个组合没有天然的天花板。一个事后结算的池子不是上限——它是一道带账单的减速带——而协调者存在的全部意义,正是让同时在跑的智能体更多。你需要的那道控制产品并不提供:给每个 Project 的在途派发工作量设一个上限,而那个上限也正是你的评审产能所隐含的上限。把池子当成预算告警,永远别把它当成护栏。
Codex cloud——一份额度,多个使用界面
OpenAI 在 2026 年把 Codex 转成了按积分计费,而额度是共享的:本地消息与云端会话从同一个池子里扣,云端工作通常比等价的本地一轮消耗更多,一个典型任务大致落在个位数到十几二十个积分这个区间。任务可以从 web、GitHub、GitLab、Linear 或 Slack 发起。
陷阱就在「共享」上。周一早上启动六个后台重构,它们吃掉的预算,正是你打算下午用来结对啃那个硬 bug 的预算。界面里没有任何东西告诉你这件事,因为这两个使用界面是当成两个产品呈现的。缓解手段是排期而不是控费:在你不工作的时候发批量任务——那也正是它的延迟对你代价最小的时候。
Claude Code on the web——算力免费,预算共享
Web 会话把仓库克隆进 Anthropic 的云端并在那里运行;同样的东西也能从终端调用,而在 Git Live 模式下,会话会自己推分支并开出 PR。VM 不单独收费——而且文档写得很明确:也没有单独的预算。速率上限与你账户上所有其他 Claude 用量共享,所以并行任务会按比例吃掉更多。
这是四块表里最干净的一块,也是最容易读错的一块。正因为算力是真免费,人的本能就是多开会话;而「你开过头了」的唯一信号,是你的交互式助手开始变慢或者拒绝服务。如果你打算在这里扇出,用一个有自己配额的服务账号去跑,而不是用你本人工作的那个账号——这与任何共享配额下的隔离论证是同一套。
Google Jules——一个硬计数,以及塞满的问题
Jules 自 2025 年起已正式可用,也是这一组里计量方式最传统的一个:从免费到每月约 125 美元的若干档位,单位是任务次数而不是 token。它克隆进一台 Google Cloud VM,写出计划,执行跨文件改动,跑测试,然后开 PR;自 2026 年初起,它在规划时还能读取一小组经过挑选的 MCP 服务端。
硬计数是这里唯一一块给你真正可预测性的表,而它买下这份可预测性的代价是一种具体的扭曲:既然改一行和一次铺开的重构吃掉同一个名额,你就会被推着去打包。而打包恰恰是让无人值守的运行失败的那种行为——更大的任务有更多种出错的方式,还会产出一份没人愿意评审的 diff。如果你用 Jules,纪律是照样把任务切小,并把没用掉的名额当作换一份可评审 diff 所付的成本。
Devin——那块为「困惑」收费的表
Devin 按 ACU 计费,一个 ACU 大致相当于十五分钟的活跃自主工作——VM 时长、推理与带宽揉成一个数字——只在智能体真正在干活时计费,按量付费下每个 ACU 两美元出头。范围小的任务不到一个 ACU;中等规模的功能要几个。
按挂钟时间计量,是对一个云端智能体真实消耗最诚实的映照,而它的激励也最不令人舒服:一次来回打转的运行,比一次成功的运行更贵。那是正确的价格信号,也是个难受的信号;这正是为什么在按时长计费的平台上,起支配作用的那道控制是给每个任务设一个压得很低的挂钟上限,并要求智能体把手上已有的东西交回来。
另一条耐久的轴:沙箱能看见什么
这里每个产品都划同一条线,而 OpenAI 把它说得最直白:一个云端任务看得见的,是 Git 托管方那份仓库副本,此外别无他物——没有本地文件、没有正在跑的开发服务器、没有本地 MCP 服务端、没有私有网络。Jules 克隆进 Google 的 VM,Claude Code 克隆进 Anthropic 的,Cursor 则给 Project 配一台自己的机器。措辞不同;可达集合并无不同。
决定任务清单的是这条边界,不是模型。凡是能由一套从公共源安装依赖的测试套件验证的工作,处处都能跑。凡是需要打到内部预发 API、需要对着本地数据库复现、或者需要驱动你机器上开发服务器的工作,处处都跑不成——而且失败得很晚,要等智能体花上几分钟才发现。实际的分野不是「哪个产品更聪明」,而是你待办清单里有多少是仓库形状的;而那个比例,通常远小于演示所暗示的。
各产品真正有差别的地方,是你被允许往边界里放什么:一段启动脚本、一个容器镜像、注入的密钥、一条出站策略。这值得仔细比较,而它与任何其他智能体沙箱面对的是同一批顾虑——另见智能体的出站管控,因为一台装着你仓库、又能不受限地对外联网的云端 VM,无论由谁在跑,都是一条外泄通路。
真正昂贵到日后改不动的是什么
这个品类的对比文章老得特别快,而原因值得说出来:光是 2026 年之内,仅 Cursor 一家就改了三次收费方式,这意味着网上多数方案表描述的是一个已经不存在的产品。任何以「每席位多少钱」为依据做出的决定,保质期大约一个季度。有两样东西不是这样。
第一样是那块表的形状,因为它决定的不是账单上的金额,而是你团队必须维持的那条纪律。给死的计数要求你抵住打包的冲动。共享额度要求你把身份分开。按工作量计量要求你设挂钟上限。这些习惯比任何具体价格都活得久;而一支为自己那块表养错了习惯的团队,每个月都会以同一种方式被吓一跳。
第二样是这些活儿在哪里汇合。五者都开 PR,这意味着你的合并队列、你的 CI、你的评审者,是共用的下游——而那部分你换不掉,因为那是你自己的。一个让 PR 到达速率翻倍的平台选型,其实是一次穿着采购决定外衣的评审流程变更;后台智能体实战手册讲得很直白:复核队列就是吞吐上限,而它并不在乎是哪家厂商在往里灌。
什么时候选哪个
| 处境 | 选 | 因为 |
|---|---|---|
| 财务要一个不会动的数字 | Jules | 任务计数是这里唯一一个你不会不小心超掉的上限 |
| 你本来就在某一家的方案里,且不想新增任何采购 | Codex cloud 或 Claude Code on the web | 已含在订阅里——代价是要共享你自己的那份额度 |
| 一项长期的、机械的、可由测试验证的改造工程 | Cursor Projects | 只有它的协调者会跨月做规划并扇出 |
| 你希望成本按任务诚实地贴着工作量走 | Devin | ACU 计的是挂钟时间,而那正是云端智能体真实消耗的东西 |
| 这活儿需要你的私有网络或一个正在跑的开发服务器 | 一个都别选 | 这类任务在哪家都在沙箱边界之外——留在本地做 |
如果你是在替一个团队而不是替自己选,那就冲着那块表而不是冲着模型去做试点:给一个小组两周,把开出的 PR 数、合入的 PR 数、花掉的评审人时、以及合入后发现的实质性错误埋上点,然后看上面那四种扭曲里,哪一种出现在了你的数据里。一定会是其中之一。
常见问题
云端编码智能体比同一个模型跑在本地 CLI 里更好吗?
是不同,不是更好。云端那版买到的是并行,以及合上笔记本也不会中断;它交出去的是你的本地文件、你的开发服务器、你的私有网络和你的本地 MCP 服务端。对于仓库形状、可由测试验证的工作,云端在吞吐上取胜;而对任何需要你真实环境的工作,本地 CLI 不是退路,它是唯一的路。
哪块表最便宜?
这个问题撑不过一个真实的月份,因为这些表彼此不可通约——任务次数、积分额度和一刻钟的算力是三种不同的单位。你能比较的是「每一个熬过评审并合入的改动的成本」,而那得你自己去量,并且量完之后候选顺序通常会重排。
共享的账户额度真的要紧吗?
第一个忙碌的下午就会要紧。后台批量与你的交互会话从同一份预算里扣,所以你早上启动的那条队列,可能会拖垮你四点钟正指望着的那个助手。让扇出跑在一个单独的身份下不花钱,而且把这种相互作用完全消掉了。
我能同时用好几个吗?
能,而且团队确实在这么做——汇合点是 PR,而它们每一个都说这门语言。不会跟着翻倍的是评审产能,所以在不增加评审者的前提下加第二个平台,只是把队列挪了个地方;其结果浮现出来的样子,是已合入改动上的实质性错误率在上升,而不是一次看得见的失败。
延伸阅读
本站:
- 后台编码智能体——如何设计没人盯着的运行。
- 沙箱与执行——什么该放进边界之内。
- 单位经济——每个完成任务的成本,那是唯一可比的数字。
- 如今提出需求的是那个协调者——当发起工作的是触发器而不是人,什么变了。
- 本地 CLI 横评——这个决定的另一半。