同样的权重,不同的拒答:Argon 把护栏做成了一项授权
谷歌把 Gemini 4 Argon 交给 Fairwind 项目中通过审核的防御方,并关掉了网络安全护栏;约束靠的是组织资质核验、抗钓鱼多因素认证、按团队限定的访问范围,以及按员工留存的使用记录。这是能力门控第一次做成了可能真正守得住的样子——而它同时意味着:一个模型标识符不再指称一种行为。
谷歌把 Gemini 4 Argon 交给 Fairwind 项目中通过审核的防御方,并关掉了网络安全护栏;约束靠的是组织资质核验、抗钓鱼多因素认证、按团队限定的访问范围,以及按员工留存的使用记录。这是能力门控第一次做成了可能真正守得住的样子——而它同时意味着:一个模型标识符不再指称一种行为。
Anthropic 在 9 月 22 日交付了 Claude Opus 5.5,并附上一条与自家天花板相抵触的成本曲线:在 FrontierCode 上,默认的 medium 力度拿到 54.6%、每任务约 0.80 美元,而 max 拿到 54.4%、每任务约 6.19 美元;同一个旋钮在 Terminal-Bench 上却值八个点。它也是第一个默认 medium 而非 high 的 Claude 模型,所以替换模型字符串就是一次行为变更。力度是一项按工作负载而定的测量,而「每完成一个任务的成本」是唯一能在它面前活下来的单位。
搜索 API 返回的是文档,把智能体循环留在你的进程里。研究 API 把那个循环拿走了——这就是那笔交换:你不必再为编排付钱,也不再能给它插桩。没人列进表格的那根轴是「引用到底是什么」:这四家里有三家交还的是模型自己攒起来的一份参考文献,而有一家把依据绑到了你自己定义的 schema 里的某个字段上,还附了置信度。按这个挑,别按报告好不好读挑。
GPT-Live-1 于 9 月 10 日进入 API,能一边听一边说。这读起来像一次自然度升级,实则是一次结构变更。「轮次结束」曾是你的语音智能体用来决定何时调工具、何时写日志、何时跑护栏、何时停表的那个事件——而一个全双工模型根本不会发出它。补救之道不是调一个更好的阈值,而是自己把提交点命名出来,并为一块如今按墙上时钟而非按说话计费的表重新算账。
四个在功能表上看似可以互换的云端编码智能体,计费的形状有四种:一个带超额结算的用量池、一份跨你所有使用界面共享的额度、一条与你账户其余用量共用的速率上限,以及按档位给死的任务次数——而每一种形状都会诱发一种具体且可预测的误用。光是 2026 年,Cursor 就改过三次收费方式,所以任何对比里的数字都已经过期;下个季度仍然成立的,只有那块表的形状,和那个沙箱的边界。
OpenRouter 的 Auto Router 底下跑的是 Not Diamond,所以四个产品其实是三个路由决定。对智能体真正要紧的不是"选哪个模型",而是"一条查询值得多少计算"——那正是 vLLM Semantic Router 所分类的东西。而路由器是一个错误无声的分类器:它会带着 200 返回一个有效、只是略差一点的答案,所以除非你留着一份留出集,否则你能看见的只有省下来的钱。在智能体循环内部,逐步路由会与提示词缓存打架,而且通常打输。
麦肯锡 2026 年的调查发现,32% 的组织至少放弃了一次软件采购,因为智能体编码工具可以在内部把它做出来。而这个数字是在最便宜的那个时刻记录下来的——建造成本刚刚坍塌、运行成本还一分未生——就在同一份调查里,AI 对 EBIT 的贡献纹丝未动。
每份推介材料里的冷启动数字——27 毫秒、低于 90 毫秒、约 150 毫秒——描述的都是「一次创建一个沙箱」。而关于「一次创建很多个」,唯一公开过的测量把同一类平台放在了 0.67 秒到 5.06 秒之间;这四家里有两家压根没有公开过突发场景下的数字。与此同时,沙箱一生中的大部分时间是在等模型,而不是在跑代码——所以真正决定你账单的那条轴,是「什么都没执行时计价器在做什么」。请按突发行为与闲置计费来决策;隔离对照表反倒是容易的那部分。
决定这件事的是两个二选一的问题,而不是任何功能清单:网关在不在请求路径上,以及谁持有厂商凭证。网关所做的一切会改变请求的事情——缓存、故障转移、限流、密钥轮换——都需要第一个条件;而你的爆炸半径与账单则全都由第二个条件推导出来。对智能体而言,这两个答案都要乘上步数——这正是为什么一个对聊天应用来说还行的选择,对一个循环来说可能在结构上就是错的。
四个平台都能对你的语音智能体跑上几千通测试电话,而它们主推的那个数字——并发量——恰恰是最不重要的那条轴。真正把它们区分开的,是电话那头的来电者从哪儿来,因为那设定了所有这些评测能告诉你什么的上限。
Agent 365 每用户每月 15 美元,按智能体收费为零——于是你栈里唯一为控制机群规模而生的那一层,也是唯一对机群规模视而不见的那张账单。另有两处对不齐:计费单元假设每个智能体都有一位人类担保人,而清单能看见的机器,远多于"阻止"按钮够得着的。
6 月,Bugbot 取消按席位收费改为按次计费;Greptile 在 50 次评审之后每次加收 1 美元;CodeRabbit 仍在卖带上限的席位;而 Diamond 干脆没有单独定价,因为它随 Graphite 一起来——如今 Graphite 和 Bugbot 都归 Cursor。三种计费形态,却没有一种给真正决定评审机器人生死的东西定价:每条评论所消耗的开发者秒数。
一家支付公司为「负责数 AI 用量」的那一层付出了据报道 70 亿美元,而就在七个月前,它刚买下负责为这些用量开票的那一层。稀缺的从来不是路由能力,而是一份归一化的记录:每一次模型调用花了多少、算在谁头上。如果这份记录住在你的请求路径里,你就要为智能体走的每一步付一笔百分比。
这四家宣称的首字节音频时延在 40 到 200 毫秒之间,而独立测试台量到的云端中位数是 188 到 313 毫秒——但真正毁掉一通电话的是离散度而不是中位数,其中一家的抖动接近另一家的四倍。价格在这片市场里相差约 2.5 倍,而它两个都预测不了。长尾是用部署方式买来的。
这四家把一次搜索定在每千次 1 到 16 美元之间,而这道价差不是毛利——它是各自在检索流水线上读到多深。改用"一整个研究回合"而不是"一次调用"来计价,排序就会翻转:价目表最便宜的那个,跑出来的回合成本是最贵那个的三倍。
标准价是每百万 token 1.50/7.50 美元,与 3.6 Flash 早已挂出的价格分毫不差。8 月 13 日发布的,是同一挂牌价下的一个更好的模型,外加一份 12 月 31 日到期的折扣——一次日期已知的单位成本翻倍,而它会落在你趁便宜时调出来的那些轨迹上。
聊天产品要有好几百个并发用户,专用 GPU 才划得过按 token 计价;智能体只需要十来个工作单元,因为它每一步都要把整个上下文重发一遍。真正该决定你在这四家里选谁的,是这道算术题,而不是每百万 token 的单价。
KPMG 发现 49% 的负责人因成本收缩过智能体部署,而只有 7% 有站得住的 ROI 数字——也就是说,做出削减的组织里有九成没有分母。成本由一个需要向你收钱的厂商来计量;价值在有人把它造出来之前一直是零。事后补不上的那项测量,是智能体进场之前的基线。
四家里有两家按每 vCPU 小时约九分钱计费那个智能体循环,两个价格相差 3.6%;另外两家干脆不为它收钱。它们真正在卖的,是一个存放对话的地方——而 AWS 在 2026 年 7 月 30 日把 Bedrock Agents Classic 对新客户关闭,是迄今最清楚的证据:托管运行时的哪一半你租得起。
重排序模型不碰索引、不持状态,换一个只要一个下午——这终于让"追排行榜"变得理性了,只可惜排行榜量的恰恰是这四家差异最小的那条轴。真正差出一个数量级以上的是计费单位和许可证,而这两样在智能体规模下咬得最狠。
换掉 LLM,改的是一段提示词。换掉嵌入模型,要重嵌整个语料、重建索引,并让你手上所有检索数字全部作废——两个模型产出的向量彼此不可比,因此不存在渐进迁移。这让它成为 RAG 栈里唯一一个在锁定状态下做出的选择,而真正定案的数字是每条向量占多少字节、以及模型的生命周期由谁掌控,不是排行榜名次。
这四者的每一份对比,开头都是固定 batch 下的每秒 token 数——而这恰恰是最难迁移到智能体流量上的那个数字:在那里,同一段提示词会带着几百个新 token 回来二十次。真正把它们区分开的,是 KV 缓存以什么为键、受约束解码在满 batch 下还能不能撑住,以及那道构建步骤要吃掉你一个季度里的多少。
每一份文档解析器对比都以准确率排行榜的形式发布,而准确率恰恰是最难迁移到你自己文档上的那个维度。真正能迁移的有两件事:版面流水线会漏掉一个数字,但结构上编不出一个数字;以及自建与托管两条成本曲线,会在一个你五分钟就能算出来的量级上相交。
每一个 AI 网关主打的都是同一个功能:自动故障转移到第二家厂商。那个功能并不是可用性上的胜利——它是一次只在事故期间才被触发的、未经测试的部署,而且落到一个你的评估从未覆盖过的模型上。真正该拿来做选择的是:谁来运维这一跳,因为那才是你没法便宜地反悔的决定。
面向智能体的搜索 API,标价紧紧挤在每千次查询 5–8 美元这个区间,这让标价成了整场比较里最没意思的那个数字。真正相差一个数量级的,是每条结果往你的上下文里灌多少令牌——而在一个每步都重发全部对话记录的智能体循环里,那才是账单。
Moonshot 在 7 月 27 日把 2.8 万亿参数做成了免费下载——同时把自家 API 定价定得高于它所取代的上一代模型,而市面上没有任何一块 GPU 装得下这份权重。开放权重为智能体开发者换来的恰恰只有一样闭源 API 给不了的东西,而那样东西不是成本。
每个编码 Agent 留下的遥测轨迹都不一样:JSONL 记录、SQLite 数据库,或者只有一份纯文本日志。所以你该装哪款开源跟踪器,取决于你的 Agent 走的是哪条轨迹。四款跟踪器,四条轨迹,外加几个真正能压低账单的开关。