AI 博客

Prime Intellect、HUD、ART 与 OpenAI RFT:你在选的是环境住在哪里

训练器和 GPU 都可以租,基座模型每个季度换一次,所以一个 RL 项目唯一留得下来的东西是环境——任务分布、工具面,以及给一次运行打分的那个校验器。这四家平台对"那件产物住在哪里、奖励由谁来写"给出了不同答案,而其中那个提出要包下整条流水线的,正在对新用户关门。按环境的可移植性和校验器的归属来选;训练器的对比反倒是容易的那部分。

作者 智能体 AI 维基 30 分钟读完

一个 RL 项目里除了一样东西,其余都可以租。GPU 可以租,训练器是一个开源库,基座模型两个季度之内就会被换掉,集群用完就还回去。事后留下来的是环境——任务分布、智能体据以行动的工具面,以及判定一次运行是否成功的那个校验器——而这件产物,恰恰就是你在动"训练"这个念头之前本来就需要的那份评测集。这四家平台对"它住在哪里、奖励由谁来写"给出了不同的答案,而其中一家正悄悄对新用户关门——这是整场对比里最有力的一条论据,支持你把那件产物保持成一种能带出门的形态。

速览

从"我的智能体在这件事上不靠谱"走到一个训练好的策略,有四条路,而它们不是同一个产品的四个版本——一个是挂着训练器的包注册表,一个把你正在跑的软件变成环境,一个住在你的应用代码里,还有一个是正在退场的托管服务。

平台环境住在哪里奖励由谁来写状态
Prime Intellect一个可安装的 Python 包——带自己 pyproject.tomlverifiers 模块,发布到 Environments Hub你,写成环境里的一套评分标准开源库、托管训练与 GPU;社区环境数以千计
HUD一台包住真实软件的 MCP 服务器,经托管网关运行你,写成挂在被包住系统上的任务级奖励开源 SDK 加云端;维护 OSWorld-Verified 与 SheetBench
OpenPipe ART你自己的应用代码——rollout 就是你早已写好的那个函数一个给轨迹排名的裁判模型(RULER),或者你自己开源库;公司被 CoreWeave 收购,训练可无服务器化运行
OpenAI RFT哪儿也不住——你提供的是评分器,不是环境厂商的评分器 schema,由你来填属于微调平台,已对新用户关闭并正在退场
Where each platform leans A four by four matrix. Rows are Prime Intellect, HUD, OpenPipe ART and OpenAI RFT. Columns are open-source core, portable environment artifact, wraps your real software, and open to new users. Prime Intellect is strong on an open core with the verifiers library, strong on portability because environments ship as installable Python wheels, medium on wrapping real software, and open to new users. HUD is strong on an open core with hud-python, medium on portability because environments are MCP servers run through a hosted gateway, strong on wrapping real software since that is its whole premise, and open to new users. OpenPipe ART is strong on an open core, weak on portability because the rollout is code inside your own application rather than a distributable artifact, strong on wrapping real software since it trains on your production task, and open to new users. OpenAI reinforcement fine-tuning is weak on an open core with nothing published, weak on portability because graders follow a proprietary schema, weak on wrapping real software since it grades outputs rather than running a tool loop, and closed to new users as the fine-tuning platform winds down. Where each one leans OPEN CORE PORTABLE ENV YOUR SOFTWARE OPEN TO NEW USERS Prime Intellect Strong · verifiers Strong · wheels Medium Yes HUD Strong · hud-python Medium · MCP Strong · the premise Yes OpenPipe ART Strong · ART, RULER Weak · in-app code Strong · your task Yes OpenAI RFT Weak · none Weak · own schema Weak · grades output No · winding down Strong Medium Weak Strong is not better — it marks where a platform commits, and every commitment costs something elsewhere.
"强"不等于更好。它标出的是每家平台在哪里下了注,而每一次下注都要在另一列里付钱。

在进入细节之前先记住一件事:这些厂商没有一个能让你的智能体变好。它们让"跑一次实验、搞清楚训练出来的策略会不会更好"这件事变便宜,而其中三家还让"衡量你手上已有的智能体"变便宜。第二种用法,才是多数团队该先买的那一个。

你真正在选的是什么

The agentic RL loop, and which box each vendor sells A cycle of four boxes. A policy inference pool generates tokens and hands a proposed action to the environment, drawn as the large accent box in the centre right: it executes the tool call against real software, returns an observation, and at the end of an episode runs a verifier that emits a scalar reward. Completed trajectories flow into a rollout buffer, and the trainer pool consumes the buffer to update weights, then publishes new weights back to the inference pool. Annotations mark that the inference pool and trainer pool are rented commodities, that the buffer is plumbing, and that the environment plus its verifier is the only box that survives a change of base model, trainer or cloud. A footer band notes that a single slow episode stalls a synchronous batch, which is why the inference and trainer pools are disaggregated and run concurrently. Inference pool generates the next action vLLM or SGLang, rented COMMODITY proposed tool call Environment executes against real software returns the observation resets deterministically verifier emits the scalar reward THE ONLY BOX THAT OUTLIVES THE RUN finished trajectories Rollout buffer decouples generation from training so one slow episode stalls nothing Trainer pool GRPO and descendants publishes new weights COMMODITY updated weights Rent the two commodity boxes. Write the accent one — it is the asset, and it is also your eval harness.
这里有两个方框是你租来的商品,一个是管道。强调色那个,才是这个项目的产物。

看一眼这个循环,"资产是什么"就自己答出来了。推理池是跑在租来硬件上的 vLLM 或 SGLang。训练器是 GRPO 及其后裔,在十来个开源库里都能找到。它们之间的缓冲区之所以存在,是因为智能体 rollout 是重尾的,否则一条慢回合就会把整个同步批次卡住——这是真工程,但不是你的工程。环境是唯一编码了任何与你业务有关信息的那个方框:哪些任务要紧、智能体能碰什么、以及什么算做完了。

这种不对称本该主导选择,而它通常没有,因为这些厂商之间看得见的差别是 GPU 定价和训练器功能。十八个月后真正要紧的问题要窄得多。你能不能不重写就把环境搬到另一个训练器上?奖励是一个你掌控的函数,还是一份你填过的 schema?以及,如果这家厂商明天停止接纳新客户,你手上还剩什么?最后这个问题不是假设——看表格的第四列就知道。

把这东西造出来的工程一侧——rollout 时延分布、校验器精确率、重置确定性、为何超时必须打分而不能丢弃——是面向智能体强化学习的环境工程的主题。这篇讲的是该向谁买。

Prime Intellect 与 HUD 是关于"环境从哪来"的两个相反赌注

两家都在内核上开源,也都让你留住那件产物,但它们对"环境从哪来"的回答几乎恰好相反,而这个回答决定了哪一家适配你的问题。

Prime Intellect 把环境当作一个可分发的包生态。它的 verifiers 库把环境定义为一个 Python 模块,内含数据集、rollout 函数和评分标准,在自己的 pyproject.toml 里声明依赖、以 wheel 形式分发;而 Environments Hub 在结构上就是一个包注册表,社区条目数以千计,prime-rl 装上它们就能直接拿去训练、无需改动。这是这一组里最可移植的表述——一个你照着规范写出来的环境,能在你自己的训练器上、你自己的硬件上永远跑下去。代价是这套抽象是通用的,所以包住脏乱的真实软件意味着适配层要你自己写;而且这个库自身的动荡是真实的:它在 2026 年从 v0 API 迁到了重写过的 v1 命名空间,而并非每个社区环境都跟上了。请锁死版本。

HUD 把你正在跑的软件当作环境。它的前提是:你不该为了训练而去造一个你产品的仿真版;你该把真实产品——真实的 API、真实的电子表格、真实的桌面——包成一台带任务与奖励的 MCP 服务器,然后让智能体对着它跑。它维护着 OSWorld-Verified 与 SheetBench 两个公开基准,这本身就是一个有用的信号,说明它的注意力在哪里:计算机操作与浏览器智能体——在那里,忠实的仿真基本不可能做到,唯一诚实的环境就是软件本身。这里换掉的是可移植性的方向。你的环境如今是一台 MCP 服务器,这是一件格外值得拥有的东西——它和你生产环境里的智能体说的是同一种接口,所以这层封装在训练之外也能复用——但扩容的路径要经过 HUD 的托管网关,而不是你随便挑一个训练器。

实务上的分野是这样:如果你的任务是 API 形状的、并且成功可以用程序描述,那么 Prime Intellect 的表述给你的是更耐久的那件产物。如果你的任务是软件形状的——一个内部老系统、一条电子表格工作流、一个背后没有 API 的浏览器流程——那么 HUD 正在替你做那件你本来要花一个季度去做的难事,而 MCP 这层框架意味着即便你永远不做训练,这份工作也没白费。两者都与本站反复主张的那个顺序相容:先把环境当作评测来建,让训练成为你之后可以做的一件事,而不是你一开始动手的理由。

ART 的赌注:奖励是那个你不该自己写的部分

Three answers to who writes the reward Three columns comparing where the reward function comes from. In the first, you write a programmatic verifier that checks the artifact — tests pass, the row was written, the invariant holds; Prime Intellect and HUD both take this route, it gives the sharpest signal, and the labour is yours. In the second, drawn as the accent column, a judge model ranks a group of trajectories against each other rather than scoring them absolutely; OpenPipe's RULER works this way, it removes the hand-written reward and works on open-ended tasks, and the cost is that correctness now depends on a judge you have to calibrate. In the third, the vendor supplies the grader schema and you fill it in, as with OpenAI reinforcement fine-tuning; it is the least work and the least portable, and it grades outputs rather than a tool-using trajectory. You write it the tests pass the row was written the invariant holds PRIME INTELLECT / HUD sharpest signal available, and the labour is yours A judge ranks it group of trajectories, ordered no rubric, no labels works on open-ended tasks OPENPIPE RULER correctness now rests on a judge you must calibrate The vendor's schema graders in their format grades the output, not the run least work to start OPENAI RFT and the least portable thing you could have built
中间那一列是有意思的主张,而它是把正确性问题挪了个地方,不是解决了它。

OpenPipe 的 Agent Reinforcement Trainer 出发点不同:它假定环境已经存在了,因为环境就是你的应用。你不用把任务移植进某个框架;你把自己本来就在跑的那个智能体循环包起来,ART 对着它训练。这让它在"任务住在一个能用的产品里"时,是四家里最快跑出第一轮的那个,也是可移植性最弱的那个——因为"那条 rollout"是你代码库里的一个函数,而不是一件你能递给另一个训练器的产物。

它更有意思的贡献是 RULER——Relative Universal LLM-Elicited Rewards。它不给每条轨迹对着评分量表打分,而是让一个裁判模型把一轨迹相互排名;这行得通,是因为 GRPO 在组内做归一化,最终只有次序进入梯度。OpenPipe 报告称,在其评测任务的大多数上,它追平或胜过手工设计的奖励函数,同时省掉了标注数据与奖励工程。相对判断对裁判来说也确实比绝对判断更容易,所以这个说法在机理上讲得通,而不只是营销话术。

它的代价值得直说,因为 RULER 很容易被读成免费的。它把"什么算正确"的定义,从一段你能读的程序,挪进了一个你必须去校准的模型,而 LLM 裁判的每一种失效模式都跟着来了——位置偏好、偏爱冗长、以及裁判模型在你脚下被升级时的漂移。在存在程序化检查的任务上,就把那个检查写出来。RULER 该待的地方,是没有检查可写的地方:开放式研究、起草文稿、成败要靠判断的多工具工作。而如果你要用它,就像对待任何裁判那样校准它,工具在裁判校准与元评测里。

一个结构性的注脚:OpenPipe 已被 CoreWeave 收购,ART 的无服务器训练路径出自这一脉。库依然开源,收购也没有改变这一点,但一条由 GPU 提供方拥有的托管训练通道有着显而易见的商业引力,而本节里那个关于可移植性的问题,正是该拿去问它的。

托管那条道正在关闭,而这就是全部的论据

第四个选项是多数团队默认存在的那一个:把任务交给模型厂商,提供评分器,拿回一个更好的模型。OpenAI 的强化微调确实是这么运作的——按它自己 schema 写的评分器、只支持 o 系列推理模型、核心训练循环大约每小时 100 美元,模型评分所消耗的令牌另计。上手所需的工作量,它是遥遥领先的最少。

而它也正在退场。OpenAI 在 2026 年 5 月通知开发者,将逐步关停微调平台:此前没跑过微调的组织从 5 月 7 日起无法再创建训练任务,7 月 2 日限制进一步收紧,而现有客户从 2027 年 1 月 6 日起也将无法创建新任务。已经调好的模型会一直服务到其基座模型被弃用为止,而在退场期间不会再新增模型或平台功能。

把具体产品拿开,剩下的那条一般性教训才是值得带走的。一条同时拥有环境、训练器和权重的托管流水线,在它停下来时,留给你的没有一样是可迁移的——环境没有,因为你从来没建过,只有一份写在私有 schema 里的评分器;权重也没有,因为它们绑在别人弃用日程表上的一个基座模型上;测量同样没有,因为"对着一份 schema 给输出打分"跟"一份带校验器的任务分布"不是同一件产物。走另外三条路的团队,今天手里仍然握着一个跑得起来的环境。这场对比根本不需要靠功能来分胜负。

这不是在一般性地反对托管服务,也不是在预言另外三家会长久。这是在主张一项具体的检验:无论你选哪个,都去确认环境能跟着你走出这栋楼。如果答案是否定的,就把它当作锁定成本计入价格,就像自建还是采购给其他任何一层计价那样。

何时选哪个

情形因为
任务是 API 形状的,成功可以用程序检查Prime Intellect环境以可安装的包分发,所以它能在你自己的训练器上跑,并且比这段厂商关系活得更久
任务住在没有干净 API 的真实软件里——浏览器流程、电子表格、内部老系统HUD把正在跑的系统包成一台 MCP 服务器才是难的那部分,而这层封装在生产里也能复用,不只用于训练
智能体已经在一个上线产品里跑着,你想这个月就跑出第一轮 RLOpenPipe ARTrollout 就是你已有的代码,什么都不用移植。代价是环境不再是一件可移植的产物
成败要靠判断,没有程序化检查ART 配 RULER在写不出评分量表的地方,相对排名是一个能用的奖励——前提是你像对待任何裁判那样校准它
你只想要一个更好的模型,不想拥有这一切暂时哪个都不选托管那条道正在对新用户关闭;一份更好的提示词、更好的工具,加上一次模型升级,胜过一个你排不出人手的 RL 项目
你说不出智能体在三十件真实任务上的成功率先把评测集建起来没有校验器就没有奖励。无论你选哪个平台,那个数字都是前提,而把它建出来本来也是这活儿的大头

不该由它们来定夺的:每小时的 GPU 单价——它的分量小于你环境的吞吐;以及社区环境的数量——它衡量的是一个注册表,而不是那个代表你产品的环境。

常见问题

我到底需不需要 RL,还是说这只是个提示词问题?

多数时候这是提示词、工具设计或上下文的问题,而提示词、微调还是 RL里的那个顺序是对的:先把便宜的杠杆用尽。环境工作有用之处在于,无论结论如何它都不会白做——你没有那套任务分布和校验器,就根本判断不出便宜的杠杆有没有奏效,而那正是一次 RL 训练所需要的同一样东西。

为什么资产是环境,而不是训练出来的权重?

因为权重绑在一个会被取代的基座模型上,通常就在一两个季度之内;而只要你手上还有环境,对着新基座重跑一遍训练是便宜的。环境编码的是你的业务认为什么才算正确,而这一点不会因为模型换了就变。

我能从 Environments Hub 上拿一个社区环境来做自己的任务吗?

用于跑通基础设施、以及那些没人拿营收押上去的任务,可以,而且比自己写快得多。有两点要注意:校验器编码的是别人对"正确"的定义,你不读它就是不加检视地继承了它;而一个公开环境是一个说得通的预训练污染源,所以在它上面分数高,可能是"见过"而不是"能行"。

一次训练到底要花多少钱?

GPU 上比团队预期的少,墙钟时间上比预期的多——因为环境在执行时,加速卡在闲着。一条掉队的回合就能卡住一个同步批次,这正是整个生态收敛到"推理池与训练池分离、中间加缓冲区"的原因。在预留任何资源之前先剖析你环境的 p99 回合时长;决定账单的是那个数字,不是 GPU 的费率。

RULER 好到可以取代手写校验器吗?

在存在程序化检查的地方,不行——一个去读产物的检查更锐利,而且没法被说服。RULER 的用武之地是没有检查可写的任务,在那里它是一个真选项,而不是一次将就。无论走哪条路,在信任那个奖励之前先人工给五十条轨迹打分做比对,因为一个会接受错误轨迹的校验器不会让训练温和地变差;它教的是捷径。

延伸阅读

本站相关:

项目来源: