一个 RL 项目里除了一样东西,其余都可以租。GPU 可以租,训练器是一个开源库,基座模型两个季度之内就会被换掉,集群用完就还回去。事后留下来的是环境——任务分布、智能体据以行动的工具面,以及判定一次运行是否成功的那个校验器——而这件产物,恰恰就是你在动"训练"这个念头之前本来就需要的那份评测集。这四家平台对"它住在哪里、奖励由谁来写"给出了不同的答案,而其中一家正悄悄对新用户关门——这是整场对比里最有力的一条论据,支持你把那件产物保持成一种能带出门的形态。
速览
从"我的智能体在这件事上不靠谱"走到一个训练好的策略,有四条路,而它们不是同一个产品的四个版本——一个是挂着训练器的包注册表,一个把你正在跑的软件变成环境,一个住在你的应用代码里,还有一个是正在退场的托管服务。
| 平台 | 环境住在哪里 | 奖励由谁来写 | 状态 |
|---|---|---|---|
| Prime Intellect | 一个可安装的 Python 包——带自己 pyproject.toml 的 verifiers 模块,发布到 Environments Hub | 你,写成环境里的一套评分标准 | 开源库、托管训练与 GPU;社区环境数以千计 |
| HUD | 一台包住真实软件的 MCP 服务器,经托管网关运行 | 你,写成挂在被包住系统上的任务级奖励 | 开源 SDK 加云端;维护 OSWorld-Verified 与 SheetBench |
| OpenPipe ART | 你自己的应用代码——rollout 就是你早已写好的那个函数 | 一个给轨迹排名的裁判模型(RULER),或者你自己 | 开源库;公司被 CoreWeave 收购,训练可无服务器化运行 |
| OpenAI RFT | 哪儿也不住——你提供的是评分器,不是环境 | 厂商的评分器 schema,由你来填 | 属于微调平台,已对新用户关闭并正在退场 |
在进入细节之前先记住一件事:这些厂商没有一个能让你的智能体变好。它们让"跑一次实验、搞清楚训练出来的策略会不会更好"这件事变便宜,而其中三家还让"衡量你手上已有的智能体"变便宜。第二种用法,才是多数团队该先买的那一个。
你真正在选的是什么
看一眼这个循环,"资产是什么"就自己答出来了。推理池是跑在租来硬件上的 vLLM 或 SGLang。训练器是 GRPO 及其后裔,在十来个开源库里都能找到。它们之间的缓冲区之所以存在,是因为智能体 rollout 是重尾的,否则一条慢回合就会把整个同步批次卡住——这是真工程,但不是你的工程。环境是唯一编码了任何与你业务有关信息的那个方框:哪些任务要紧、智能体能碰什么、以及什么算做完了。
这种不对称本该主导选择,而它通常没有,因为这些厂商之间看得见的差别是 GPU 定价和训练器功能。十八个月后真正要紧的问题要窄得多。你能不能不重写就把环境搬到另一个训练器上?奖励是一个你掌控的函数,还是一份你填过的 schema?以及,如果这家厂商明天停止接纳新客户,你手上还剩什么?最后这个问题不是假设——看表格的第四列就知道。
把这东西造出来的工程一侧——rollout 时延分布、校验器精确率、重置确定性、为何超时必须打分而不能丢弃——是面向智能体强化学习的环境工程的主题。这篇讲的是该向谁买。
Prime Intellect 与 HUD 是关于"环境从哪来"的两个相反赌注
两家都在内核上开源,也都让你留住那件产物,但它们对"环境从哪来"的回答几乎恰好相反,而这个回答决定了哪一家适配你的问题。
Prime Intellect 把环境当作一个可分发的包生态。它的 verifiers 库把环境定义为一个 Python 模块,内含数据集、rollout 函数和评分标准,在自己的 pyproject.toml 里声明依赖、以 wheel 形式分发;而 Environments Hub 在结构上就是一个包注册表,社区条目数以千计,prime-rl 装上它们就能直接拿去训练、无需改动。这是这一组里最可移植的表述——一个你照着规范写出来的环境,能在你自己的训练器上、你自己的硬件上永远跑下去。代价是这套抽象是通用的,所以包住脏乱的真实软件意味着适配层要你自己写;而且这个库自身的动荡是真实的:它在 2026 年从 v0 API 迁到了重写过的 v1 命名空间,而并非每个社区环境都跟上了。请锁死版本。
HUD 把你正在跑的软件当作环境。它的前提是:你不该为了训练而去造一个你产品的仿真版;你该把真实产品——真实的 API、真实的电子表格、真实的桌面——包成一台带任务与奖励的 MCP 服务器,然后让智能体对着它跑。它维护着 OSWorld-Verified 与 SheetBench 两个公开基准,这本身就是一个有用的信号,说明它的注意力在哪里:计算机操作与浏览器智能体——在那里,忠实的仿真基本不可能做到,唯一诚实的环境就是软件本身。这里换掉的是可移植性的方向。你的环境如今是一台 MCP 服务器,这是一件格外值得拥有的东西——它和你生产环境里的智能体说的是同一种接口,所以这层封装在训练之外也能复用——但扩容的路径要经过 HUD 的托管网关,而不是你随便挑一个训练器。
实务上的分野是这样:如果你的任务是 API 形状的、并且成功可以用程序描述,那么 Prime Intellect 的表述给你的是更耐久的那件产物。如果你的任务是软件形状的——一个内部老系统、一条电子表格工作流、一个背后没有 API 的浏览器流程——那么 HUD 正在替你做那件你本来要花一个季度去做的难事,而 MCP 这层框架意味着即便你永远不做训练,这份工作也没白费。两者都与本站反复主张的那个顺序相容:先把环境当作评测来建,让训练成为你之后可以做的一件事,而不是你一开始动手的理由。
ART 的赌注:奖励是那个你不该自己写的部分
OpenPipe 的 Agent Reinforcement Trainer 出发点不同:它假定环境已经存在了,因为环境就是你的应用。你不用把任务移植进某个框架;你把自己本来就在跑的那个智能体循环包起来,ART 对着它训练。这让它在"任务住在一个能用的产品里"时,是四家里最快跑出第一轮的那个,也是可移植性最弱的那个——因为"那条 rollout"是你代码库里的一个函数,而不是一件你能递给另一个训练器的产物。
它更有意思的贡献是 RULER——Relative Universal LLM-Elicited Rewards。它不给每条轨迹对着评分量表打分,而是让一个裁判模型把一组轨迹相互排名;这行得通,是因为 GRPO 在组内做归一化,最终只有次序进入梯度。OpenPipe 报告称,在其评测任务的大多数上,它追平或胜过手工设计的奖励函数,同时省掉了标注数据与奖励工程。相对判断对裁判来说也确实比绝对判断更容易,所以这个说法在机理上讲得通,而不只是营销话术。
它的代价值得直说,因为 RULER 很容易被读成免费的。它把"什么算正确"的定义,从一段你能读的程序,挪进了一个你必须去校准的模型,而 LLM 裁判的每一种失效模式都跟着来了——位置偏好、偏爱冗长、以及裁判模型在你脚下被升级时的漂移。在存在程序化检查的任务上,就把那个检查写出来。RULER 该待的地方,是没有检查可写的地方:开放式研究、起草文稿、成败要靠判断的多工具工作。而如果你要用它,就像对待任何裁判那样校准它,工具在裁判校准与元评测里。
一个结构性的注脚:OpenPipe 已被 CoreWeave 收购,ART 的无服务器训练路径出自这一脉。库依然开源,收购也没有改变这一点,但一条由 GPU 提供方拥有的托管训练通道有着显而易见的商业引力,而本节里那个关于可移植性的问题,正是该拿去问它的。
托管那条道正在关闭,而这就是全部的论据
第四个选项是多数团队默认存在的那一个:把任务交给模型厂商,提供评分器,拿回一个更好的模型。OpenAI 的强化微调确实是这么运作的——按它自己 schema 写的评分器、只支持 o 系列推理模型、核心训练循环大约每小时 100 美元,模型评分所消耗的令牌另计。上手所需的工作量,它是遥遥领先的最少。
而它也正在退场。OpenAI 在 2026 年 5 月通知开发者,将逐步关停微调平台:此前没跑过微调的组织从 5 月 7 日起无法再创建训练任务,7 月 2 日限制进一步收紧,而现有客户从 2027 年 1 月 6 日起也将无法创建新任务。已经调好的模型会一直服务到其基座模型被弃用为止,而在退场期间不会再新增模型或平台功能。
把具体产品拿开,剩下的那条一般性教训才是值得带走的。一条同时拥有环境、训练器和权重的托管流水线,在它停下来时,留给你的没有一样是可迁移的——环境没有,因为你从来没建过,只有一份写在私有 schema 里的评分器;权重也没有,因为它们绑在别人弃用日程表上的一个基座模型上;测量同样没有,因为"对着一份 schema 给输出打分"跟"一份带校验器的任务分布"不是同一件产物。走另外三条路的团队,今天手里仍然握着一个跑得起来的环境。这场对比根本不需要靠功能来分胜负。
这不是在一般性地反对托管服务,也不是在预言另外三家会长久。这是在主张一项具体的检验:无论你选哪个,都去确认环境能跟着你走出这栋楼。如果答案是否定的,就把它当作锁定成本计入价格,就像自建还是采购给其他任何一层计价那样。
何时选哪个
| 情形 | 选 | 因为 |
|---|---|---|
| 任务是 API 形状的,成功可以用程序检查 | Prime Intellect | 环境以可安装的包分发,所以它能在你自己的训练器上跑,并且比这段厂商关系活得更久 |
| 任务住在没有干净 API 的真实软件里——浏览器流程、电子表格、内部老系统 | HUD | 把正在跑的系统包成一台 MCP 服务器才是难的那部分,而这层封装在生产里也能复用,不只用于训练 |
| 智能体已经在一个上线产品里跑着,你想这个月就跑出第一轮 RL | OpenPipe ART | rollout 就是你已有的代码,什么都不用移植。代价是环境不再是一件可移植的产物 |
| 成败要靠判断,没有程序化检查 | ART 配 RULER | 在写不出评分量表的地方,相对排名是一个能用的奖励——前提是你像对待任何裁判那样校准它 |
| 你只想要一个更好的模型,不想拥有这一切 | 暂时哪个都不选 | 托管那条道正在对新用户关闭;一份更好的提示词、更好的工具,加上一次模型升级,胜过一个你排不出人手的 RL 项目 |
| 你说不出智能体在三十件真实任务上的成功率 | 先把评测集建起来 | 没有校验器就没有奖励。无论你选哪个平台,那个数字都是前提,而把它建出来本来也是这活儿的大头 |
不该由它们来定夺的:每小时的 GPU 单价——它的分量小于你环境的吞吐;以及社区环境的数量——它衡量的是一个注册表,而不是那个代表你产品的环境。
常见问题
我到底需不需要 RL,还是说这只是个提示词问题?
多数时候这是提示词、工具设计或上下文的问题,而提示词、微调还是 RL里的那个顺序是对的:先把便宜的杠杆用尽。环境工作有用之处在于,无论结论如何它都不会白做——你没有那套任务分布和校验器,就根本判断不出便宜的杠杆有没有奏效,而那正是一次 RL 训练所需要的同一样东西。
为什么资产是环境,而不是训练出来的权重?
因为权重绑在一个会被取代的基座模型上,通常就在一两个季度之内;而只要你手上还有环境,对着新基座重跑一遍训练是便宜的。环境编码的是你的业务认为什么才算正确,而这一点不会因为模型换了就变。
我能从 Environments Hub 上拿一个社区环境来做自己的任务吗?
用于跑通基础设施、以及那些没人拿营收押上去的任务,可以,而且比自己写快得多。有两点要注意:校验器编码的是别人对"正确"的定义,你不读它就是不加检视地继承了它;而一个公开环境是一个说得通的预训练污染源,所以在它上面分数高,可能是"见过"而不是"能行"。
一次训练到底要花多少钱?
GPU 上比团队预期的少,墙钟时间上比预期的多——因为环境在执行时,加速卡在闲着。一条掉队的回合就能卡住一个同步批次,这正是整个生态收敛到"推理池与训练池分离、中间加缓冲区"的原因。在预留任何资源之前先剖析你环境的 p99 回合时长;决定账单的是那个数字,不是 GPU 的费率。
RULER 好到可以取代手写校验器吗?
在存在程序化检查的地方,不行——一个去读产物的检查更锐利,而且没法被说服。RULER 的用武之地是没有检查可写的任务,在那里它是一个真选项,而不是一次将就。无论走哪条路,在信任那个奖励之前先人工给五十条轨迹打分做比对,因为一个会接受错误轨迹的校验器不会让训练温和地变差;它教的是捷径。
延伸阅读
本站相关:
- 面向智能体强化学习的环境工程——建造的那一侧:rollout 时延、校验器精确率、重置确定性。
- 面向智能体的 RLVR 与 GRPO——这些平台实现的那套训练配方。
- 面向工具使用的 RL——稀疏奖励与跨步骤的信用分配。
- 奖励设计与奖励黑客——为何校验器的精确率胜过召回率。
- 裁判校准——如果你的奖励是一个模型,这是前提。
- 评测的成本——反复跑这一整套会把预算变成什么样。
项目来源:
- Prime Intellect Environments Hub——以及 verifiers 库。
- HUD——基于 MCP 的 RL 环境与评测。
- OpenPipe ART——以及 RULER。
- OpenAI 强化微调——以及平台的弃用通告。