verl、SkyRL、AReaL 与 ROLL 对比
四者都是 Apache-2.0,四者都带 PPO 与 GRPO,所以许可证和算法清单什么都没定下来。真正定下来的是:你的环境在 rollout 里是一个被单独调度的参与者,还是生成器内部的一个回调——因为针对「慢工具」的每一种修法,买到吞吐的方式都是拿陈旧数据去训练。请按「你拿到的是哪一个陈旧度旋钮」来选,而不是按谁的加速比数字最大。
四者都是 Apache-2.0,四者都带 PPO 与 GRPO,所以许可证和算法清单什么都没定下来。真正定下来的是:你的环境在 rollout 里是一个被单独调度的参与者,还是生成器内部的一个回调——因为针对「慢工具」的每一种修法,买到吞吐的方式都是拿陈旧数据去训练。请按「你拿到的是哪一个陈旧度旋钮」来选,而不是按谁的加速比数字最大。
IBM 在 2026 年 10 月 1 日让自托管版 Bob 正式可用,面向本地、私有云、主权云与气隙环境,shell、并行工具调用、技能与模式完整保留。而受支持运行在客户自管基础设施上的模型是 NVIDIA Nemotron 与 Poolside Laguna——不是托管版的 Claude、Gemini 与 GPT 选项。功能清单能移植;行为得重新挣回来,这使得一次主权迁移成了一次披着基础设施外衣的评测迁移。
四者都能接收 OpenTelemetry,所以「支持 OTel」什么都没定下来——真正能让一条轨迹可迁移的那套词汇表,至今整体仍停在 Development 稳定级。请按「谁拥有写入路径与批量读出路径」来选,因为生产轨迹是你唯一无法重新造出来的资产,而许可证徽章跟你能不能把它们取回来是两回事。
GTIG 在 2026 年 9 月 30 日报告说,由 AI 发现的漏洞里恰好 50% 会导致远程代码执行,而其余漏洞只有 26%——但它没有公布样本量,而它的归属方法又挑中了当下那几家把智能体对准内存不安全系统代码的厂商。真正值得据以行动的数字在往下四节:八个月里智能体框架与编排层 782 个 CVE,而前沿模型是 97 个。
OpenAI 在 2026 年 9 月 29 日把插件自动化向全部订阅档位上线,对接的是 MCP Events——一份没有 SEP 编号的草案,住在一个 README 称其内容属探索性质的仓库里。这份草案把 webhook 的加固做对了,却把那两个报告「缺席」的信封做成了可选,于是被撤销的权限、丢掉的缓冲、以及确实清静的上游,抵达你的智能体时都是同一条空流。
NVIDIA 把智能体的强制力拆成了两层:一层是主机 CPU 上的内核沙箱,一层是跑在主机碰不到的 DPU 上的看守。沙箱今天就以 Apache-2.0 摆在 GitHub 上;看守没有发货日期。这道裂缝不是发布事故——「远得足以防篡改」的那一层,同时也远得看不懂智能体当时想干什么。
一个只允许对外发 GET、别的一概不许的沙箱,读起来像一扇只读窗口。一群研究用智能体拿它存下程序、在别人的浏览器里跑起来,再从一张截图里把回复读回去——并在过程中留下了接近一百万条公开 URL。
四个编程智能体都把插件钉在一个 40 字符的 commit SHA 上,却没有一个去核对自己拿到了什么,因为 40 位十六进制串同时也是一个合法的分支名。真正有意思的是分裂的应对:两家厂商补上了那行缺失的比对,两家指向了自己 git 托管方的命名规则——那是一道真实存在、却由别人拥有的防御,在你的清单里看不见,并且在插件第一次被镜像时就消失了。
这四者都能删掉你智能体环境变量里那把长期密钥,而它们之间的取舍归结为:信任锚放在哪儿,以及人与机器是否需要同一个策略平面。它们谁也回答不了 2026 年智能体事故真正在问的那个问题:SVID 证明的是哪个进程在调用,从不证明这一轮在服务哪位用户,也不证明上下文里那条指令是谁写的。先买下这层地板,然后再去买第二样东西。
你的编码智能体把 PR 数量翻了一倍,集成路径成了新的约束——但打包(每家队列产品都在卖的那个功能)会随智能体占比上升而变糟,因为智能体抬高的正是被打包所放大的那个单 PR 失败率。真正改变这笔算术的只有两项能力:对失败的一组做二分定位,以及从一次变更实际触及的东西推导出彼此独立的道。按这两点来筛,其余都是配置。
你从一套托管知识库买到的不是检索质量——你买的是那个把 SharePoint 的权限连同文件一起搬过来的连接器,以及那条按用户强制执行权限的查询路径。Azure 的 Agents SDK 搜索工具至今仍无法转发那个令牌,而权限层面的锁定才是真正拴住你的那一层。
四个本地运行时、同一份权重,进去的是四份不同的提示词,出来的是「工具调用到底解析没解析出来」的四种答案。这些都与吞吐无关,而吞吐是唯一被拿来比较的那根轴。
搜索 API 返回的是文档,把智能体循环留在你的进程里。研究 API 把那个循环拿走了——这就是那笔交换:你不必再为编排付钱,也不再能给它插桩。没人列进表格的那根轴是「引用到底是什么」:这四家里有三家交还的是模型自己攒起来的一份参考文献,而有一家把依据绑到了你自己定义的 schema 里的某个字段上,还附了置信度。按这个挑,别按报告好不好读挑。
GPT-Live-1 于 9 月 10 日进入 API,能一边听一边说。这读起来像一次自然度升级,实则是一次结构变更。「轮次结束」曾是你的语音智能体用来决定何时调工具、何时写日志、何时跑护栏、何时停表的那个事件——而一个全双工模型根本不会发出它。补救之道不是调一个更好的阈值,而是自己把提交点命名出来,并为一块如今按墙上时钟而非按说话计费的表重新算账。
四个在功能表上看似可以互换的云端编码智能体,计费的形状有四种:一个带超额结算的用量池、一份跨你所有使用界面共享的额度、一条与你账户其余用量共用的速率上限,以及按档位给死的任务次数——而每一种形状都会诱发一种具体且可预测的误用。光是 2026 年,Cursor 就改过三次收费方式,所以任何对比里的数字都已经过期;下个季度仍然成立的,只有那块表的形状,和那个沙箱的边界。
OpenAI 在 9 月 10 日开放了 Agents API 公测,把那套托管的 Codex harness——会话、子智能体编排、恢复与上下文压缩——放到了一次 API 调用后面,除 token 与容器外不另收费。值得争论的是压缩这一步:它正是那个会悄悄改写"智能体到底在做什么"的变换,而如今它跑在一个你无法钉住、无法比对、也无法回滚的版本上。你采用它的那一刻,你的评测数字就不再描述一套你能控制的系统。
OpenRouter 的 Auto Router 底下跑的是 Not Diamond,所以四个产品其实是三个路由决定。对智能体真正要紧的不是"选哪个模型",而是"一条查询值得多少计算"——那正是 vLLM Semantic Router 所分类的东西。而路由器是一个错误无声的分类器:它会带着 200 返回一个有效、只是略差一点的答案,所以除非你留着一份留出集,否则你能看见的只有省下来的钱。在智能体循环内部,逐步路由会与提示词缓存打架,而且通常打输。
四个项目都有混合检索、图谱与智能体式检索,所以功能对照表什么也定不了。真正起决定作用的是两件事:这套框架是跑在你自己的进程里,还是作为一套自带数据库、自带用户体系与自带值班表的第二生产系统抵达;以及文档解析的边界落在哪里——因为正是它决定了你那条质量最高的路径是开源的、是按页计费的,还是一份你自己扛的集成工作。选姿态;功能在一年半以前就已经趋同了。
最多星的开源 text-to-SQL 项目如今是只读的——Vanna 在 2026 年 3 月 29 日以 23.8k 星归档了仓库——而 Dataherald 自 2024 年 7 月起没再收过一次提交。仍在每天发版的那两个,恰恰是在问题与 SQL 之间放了一件持久、可评审的产物的那两个。前沿模型吞掉了 SQL 生成;它们吞不掉的,是你那四种「营收」定义里这个问题指的是哪一种——而无论你选哪个项目,那一层都归你自己。
实验室与工厂的互操作已经被标准化过三次——SiLA 2 自 2019 年、OPC UA LADS 自 2024 年 1 月、ROS 2 作为机器人中间件——而仪器出厂时依然配着厂商自家的 SDK,所以「再来第四份规范」显然不是那个答案。Anthropic 的 Model Hardware Standard 真正补上的,是那三份都没试过的一件事:让设备用模型读得懂的语言描述自己的限值,并由驱动来强制执行,不管开车的是哪个模型。有用,但它不是安全功能——这两者必须分开。
这四者之间检索质量的差距,远小于「一次更新要花多少钱」的差距,所以真正的决定是:你的图是一次建成、只做追加,还是被持续改写。而且四者都用字符串匹配去重实体——这正是没有哪份基准抓得住的那个失败。
训练器和 GPU 都可以租,基座模型每个季度换一次,所以一个 RL 项目唯一留得下来的东西是环境——任务分布、工具面,以及给一次运行打分的那个校验器。这四家平台对"那件产物住在哪里、奖励由谁来写"给出了不同答案,而其中那个提出要包下整条流水线的,正在对新用户关门。按环境的可移植性和校验器的归属来选;训练器的对比反倒是容易的那部分。
每份推介材料里的冷启动数字——27 毫秒、低于 90 毫秒、约 150 毫秒——描述的都是「一次创建一个沙箱」。而关于「一次创建很多个」,唯一公开过的测量把同一类平台放在了 0.67 秒到 5.06 秒之间;这四家里有两家压根没有公开过突发场景下的数字。与此同时,沙箱一生中的大部分时间是在等模型,而不是在跑代码——所以真正决定你账单的那条轴,是「什么都没执行时计价器在做什么」。请按突发行为与闲置计费来决策;隔离对照表反倒是容易的那部分。
MCP 规范只裁定了否定面——自 2026-07-28 版本起,服务器「绝不可」把它从客户端收到的令牌原样透传——却把 RFC 8693 令牌交换留在了路线图上;于是四个网关给出了四种不同的答案。agentgateway 与 ContextForge 做令牌交换;Obot 附上用户存好的上游令牌,并且正处在两种模型之间的迁移中;Docker MCP Gateway 则压根没有「用户」这个概念——这对一台工作站是诚实的,对一支集群则是出局的。按这条轴来选;同时请注意,在其他三家并不参赛的那条轴上,Docker 的隔离方案是四者中最强的。
四者都能让崩掉的运行从最后一个已完成步骤继续,所以那不是决策点。智能体的持久化记录是一份每一轮都在长大的对话记录,而不是几个小小的步骤结果——而这几个引擎的分歧在于:这份增长存在哪里、会撞上什么上限,以及你的模型调用允不允许待在会被重放的代码里。Temporal 会在第 51,201 个事件或 50 MB 历史处终止工作流;Inngest 把单步输出限制在 4 MB、单次运行状态限制在 32 MB;Restate 与 DBOS 则把这份增长推给你自己运维的存储。先按这个来定,再看计费形状,功能对照表就不重要了。
决定这件事的是两个二选一的问题,而不是任何功能清单:网关在不在请求路径上,以及谁持有厂商凭证。网关所做的一切会改变请求的事情——缓存、故障转移、限流、密钥轮换——都需要第一个条件;而你的爆炸半径与账单则全都由第二个条件推导出来。对智能体而言,这两个答案都要乘上步数——这正是为什么一个对聊天应用来说还行的选择,对一个循环来说可能在结构上就是错的。
关于这四个引擎发布过的每一个性能数字,都由某家厂商自己撰写,而它们没有一个测量了智能体记忆真正产生的并发写入负载。真正可核验的三件事——许可证、写入路径的并发模型、你的记忆框架有没有现成驱动——指向一个反直觉的结论。
2026-07-28 版 MCP 规范删掉了 initialize 握手与 session-id 头,于是一个服务器现在可以跑在一台普通的轮询负载均衡器后面。这个运维上的胜利是真的——但无状态是一种传输层性质,不是系统性质。会话没有消失;它的记账挪到了每一个请求上,而长时间运行的智能体真正需要的那份持久性,又通过 AWS 贡献的 Tasks 扩展、以显式句柄的形式回来了。在你为"更简单的协议"欢呼之前,请把这两件事放在一起读。
一家支付公司为「负责数 AI 用量」的那一层付出了据报道 70 亿美元,而就在七个月前,它刚买下负责为这些用量开票的那一层。稀缺的从来不是路由能力,而是一份归一化的记录:每一次模型调用花了多少、算在谁头上。如果这份记录住在你的请求路径里,你就要为智能体走的每一步付一笔百分比。
这四家宣称的首字节音频时延在 40 到 200 毫秒之间,而独立测试台量到的云端中位数是 188 到 313 毫秒——但真正毁掉一通电话的是离散度而不是中位数,其中一家的抖动接近另一家的四倍。价格在这片市场里相差约 2.5 倍,而它两个都预测不了。长尾是用部署方式买来的。
这四家把一次搜索定在每千次 1 到 16 美元之间,而这道价差不是毛利——它是各自在检索流水线上读到多深。改用"一整个研究回合"而不是"一次调用"来计价,排序就会翻转:价目表最便宜的那个,跑出来的回合成本是最贵那个的三倍。
你的沙箱厂商已经从这四者里替你挑好了一个,而这个选择决定了你的智能体能不能跑 pip install。按冷启动排序,得到的顺序恰好与按"智能体拿到多少个 Linux"排序相反——因为启动时间就是那个内核。回答一个问题:这段代码要不要装东西;整个选择面随即塌缩。
被引用的数字是 CPU 与内存比 Chromium 少 3–7 倍。但真正值得据以规划的推论是:每个任务一个全新浏览器,不再是一笔要靠复用会话摊销掉的成本——而会话复用正是浏览器智能体状态泄漏的所在。你为此付出的代价,是一条会静默失败的兼容性长尾。
四者都能表达同一条策略。但只有其中两个不需要调用方提供事实就能作答——而当调用方是一个正在读攻击者可控文本的智能体时,这就是全部的安全性质所在。第二个问题是检查预算:智能体每个任务要发出几十次授权调用,而过滤一次检索结果要发出上千次。
聊天产品要有好几百个并发用户,专用 GPU 才划得过按 token 计价;智能体只需要十来个工作单元,因为它每一步都要把整个上下文重发一遍。真正该决定你在这四家里选谁的,是这道算术题,而不是每百万 token 的单价。
四家之间的词错误率已接近尘埃落定,而那一两个点大多落在意图分类器根本不看的虚词上。真正决定一台语音智能体像不像人的,是话轮结束检测——它比底下的转写延迟大出好几倍,也是这四家真正存在分歧的那一件事。
四个横在你的智能体与用户 Gmail 或 Salesforce 之间的平台。它们打出的目录规模用了四种不同的计数单位,而且恰恰是你迟早会用不下的那部分;没人拿来营销的令牌保险库,才是你最不愿意自己造的那部分。真正无法事后补救的决定,是同意授权页面上写着谁的名字。
四家里有两家按每 vCPU 小时约九分钱计费那个智能体循环,两个价格相差 3.6%;另外两家干脆不为它收钱。它们真正在卖的,是一个存放对话的地方——而 AWS 在 2026 年 7 月 30 日把 Bedrock Agents Classic 对新客户关闭,是迄今最清楚的证据:托管运行时的哪一半你租得起。
四家都讲 CDP,所以自动化代码一天就能搬走,SDK 对比什么也决定不了。真正的选择是:谁持有已登录的 profile、谁持有重建它所需的凭据,以及你继承的是谁的出口 IP 信誉——外加一个事实:它们之间的延迟差距全部来自控制面。
功能表已经收敛,所以真正的决定在许可证与计费的计量单位——而每一种计量方式定价的,都是那份日后会变成你的黄金集、回归基线与微调语料的轨迹存档。按 OpenTelemetry 做仪表化、把这份流双写到一处你自己拥有的地方,平台就成了一个可替换的后端。
如今每家身份厂商都在卖"面向 AI 智能体的认证",而这个说法罩着两个方向相反的问题:让别人的智能体进得来,和让你的智能体出得去。先按方向来选——并且要留意:一个存着用户完整授权的令牌保险库,只是把凭据挪了个地方,并没有把它变小。
一个服务二十步智能体的沙箱,大约七分之六的寿命都在空转,等模型思考完。所以冷启动毫秒数与每 vCPU 小时单价——每份对比都拿来打头阵的两个数字——恰恰是最不要紧的两个。真正决定账单的是空闲时段计不计费,真正决定爆炸半径的是出站网络的默认设置。
重排序模型不碰索引、不持状态,换一个只要一个下午——这终于让"追排行榜"变得理性了,只可惜排行榜量的恰恰是这四家差异最小的那条轴。真正差出一个数量级以上的是计费单位和许可证,而这两样在智能体规模下咬得最狠。
这四者中有三个约束采样器,让非法输出根本产生不出来,而它们之间的选择坍缩成一个问题:你的 schema 会重复吗?第四个做的是另一类事,也是唯一能强制那些真正搞垮智能体的规则的——因为语法只保证枚举值是五个当中的一个,却对"是哪一个"只字不提。
这四者的每一份对比,开头都是固定 batch 下的每秒 token 数——而这恰恰是最难迁移到智能体流量上的那个数字:在那里,同一段提示词会带着几百个新 token 回来二十次。真正把它们区分开的,是 KV 缓存以什么为键、受约束解码在满 batch 下还能不能撑住,以及那道构建步骤要吃掉你一个季度里的多少。
7 月 28 日的规范废止了 initialize 握手与 Mcp-Session-Id 头,而目前所有解读都把它当成管道层的改动。它不是。放弃那条长连接,把 Sampling、Roots 与 Logging 一并推上了十二个月的弃用倒计时——而正是这几项,让 MCP 客户端不只是一个调用方,而是一个对等方。这份协议刚刚给"自己是什么"下了定论。
每一个 AI 网关主打的都是同一个功能:自动故障转移到第二家厂商。那个功能并不是可用性上的胜利——它是一次只在事故期间才被触发的、未经测试的部署,而且落到一个你的评估从未覆盖过的模型上。真正该拿来做选择的是:谁来运维这一跳,因为那才是你没法便宜地反悔的决定。
面向智能体的搜索 API,标价紧紧挤在每千次查询 5–8 美元这个区间,这让标价成了整场比较里最没意思的那个数字。真正相差一个数量级的,是每条结果往你的上下文里灌多少令牌——而在一个每步都重发全部对话记录的智能体循环里,那才是账单。
Moonshot 在 7 月 27 日把 2.8 万亿参数做成了免费下载——同时把自家 API 定价定得高于它所取代的上一代模型,而市面上没有任何一块 GPU 装得下这份权重。开放权重为智能体开发者换来的恰恰只有一样闭源 API 给不了的东西,而那样东西不是成本。
朴素的智能体循环在 30 分钟作业的第 29 分钟死掉。持久化执行引擎会把每一步记录到日志,下一个进程就能从上次中断的位置接着干——而 2026 正是各家超大规模云厂商也下场推出自家产品的年份。四款引擎围绕同一个原语竞争,但架构与账单差得很远。
12.8 万 token 的上下文窗口在前一千个 token 之后就开始衰减,会话一结束更是一干二净。智能体记忆基础设施市场在 2026 年突破 60 亿美元——因为"全部塞进上下文"已经不再是一条可行的策略——而四家框架对"记忆应该排什么、存什么、忘什么"做出了不同的下注。
从 Anthropic 推出至今两年,MCP 已经不是要不要用的问题——它是一种依赖。每家前沿厂商、每个主流 IDE,以及一支为公司每月节省 7000 工程师小时的 Pinterest 团队都在它上面构建。真正值得问的不再是"我要不要用 MCP",而是到了这种规模哪些地方在崩、2026 路线图打算怎么修。
四款向量库,四份几乎一致的功能清单——ANN、过滤、混合检索,一个不落。真正决定谁能在生产环境的智能体 RAG 栈中扛下去的那一点,在功能清单上根本看不见:索引相对于你主数据所在的位置。
四款产品都提供 trace、数据集和评测器,功能清单几乎重合。真正把它们分开的,是各自被设计去闭合的那条反馈回路:开发回路、CI、生产网关,还是模型监控漂移。
四款运行时都给智能体提供了一个真正能安全执行 Python 与 bash 的地方——营销页面承诺的也几乎一样。真正决定谁能扛住生产的那一点是:沙箱生命周期归谁所有。