AI 博客

UI-TARS、Agent S3、cua 与 OpenAdapt 对比:你挑的是一个层,不是一个智能体

Agent S3 推荐 UI-TARS 作为它的定位模型,所以这四者里有两个是同一个栈的上下两半——而以「OSWorld」之名发表的五个数字,跨度有 63 个百分点。请按「你缺的是四个层里的哪一个」来选,并按那条真正把它们分开的轴来选:每次任务运行时,是不是都由一个模型来决定点哪里。

作者 智能体 AI 维基 24 分钟读完

Agent S3 的 README 推荐用 UI-TARS-1.5-7B 作为它的定位模型,这意味着星标最多的四个开源计算机操作项目里,有两个并不是竞品——它们是同一个栈的上半截与下半截。把另外两个也这样读,这场比较就不再是排行榜了:你挑的是四个层里自己缺的那一个,而唯一真正把它们分开的那根轴是,任务每跑一次,是不是都要由一个生成式模型来决定点哪里。

一眼概览

四个项目、四个层,而其中只有一个交付了「决定指针落在哪里」的那一部分。数字读自各仓库页面,时间为 2026 年 10 月 9 日。

项目它所占的层许可证交付了作决定的那部分吗?
UI-TARS(字节跳动) 定位模型 Apache-2.0 是——权重,在 Hugging Face 上
Agent S3(Simular) 围着模型的那套策略 Apache-2.0 不——它需要一个主模型和一个定位模型
cua(trycua) 机器,以及成群的机器 主体 MIT;见下文 部分——CUA-S1 小模型,用于狭窄的决定
OpenAdapt 一个「从演示到程序」的编译器 MIT 只在编译期——运行期一个都不用
Scores published under the name OSWorld Horizontal bars for five figures all reported as OSWorld results: 83.5 percent on OSWorld-Verified, 72.6 percent for Agent S3 with Behavior Best-of-N, 66 percent for Agent S3 alone, 44.33 percent for a leaderboard entry on OSWorld 2.0, and 20.6 percent for the best agent in the OSWorld 2.0 paper. Task success reported as “OSWorld” (%) 20 40 60 80 100 OSWorld-Verified Claude Opus 4.8, via a citing paper 83.5 OSWorld, 100 steps Agent S3 + Behavior Best-of-N 72.6 OSWorld, 100 steps Agent S3 alone 66.0 OSWorld 2.0, leaderboard Claude Opus 5, max effort — secondary source 44.3 OSWorld 2.0, paper best agent, binary completion at 500 steps 20.6
五个数字、一个基准名字、63 个百分点的跨度。没有一个是错的,也没有一对是可比的。

这四者里没有任何一个是另一个的同层对手

The four layers of a computer-use agent, and who ships each A task enters a policy layer that plans and retries, which calls a grounding model that turns a screenshot into a coordinate, which acts on a machine holding the desktop. A side path shows a compiler that records one demonstration and then drives the machine directly with no model in the run-time loop. Every run Policy — what to do next, and after a failure plan, memory, retry, subtask decomposition Agent S3 (needs a main model) Grounding — where on this screen screenshot in, coordinate or element out UI-TARS (Apache-2.0 weights) The machine — pixels, files, clipboard VM or container desktop, driver, fleet, bench cua · Bytebot (archived 7 Mar 2026) The application under test a real GUI with no API for what you need Once, then never again Record one demonstration a human does the task; the compiler mines the effect contract from the observed delta OpenAdapt (MIT) Compiled program deterministic action sequence, per-surface evidence: DOM, accessibility, OCR, anchors Verify the effect, then report VERIFIED only if an independent check agrees; otherwise HALTED_BEFORE_EFFECT no generative model in the run-time loop
四者里三个是彼此叠上去的。第四个在跑过一次之后,把上面两层替换掉。

一个计算机操作智能体有三件通常被当成一件来讲的工作。有某个东西决定下一步做什么、以及失败之后做什么:那是策略,它主要是提示词工程、规划与重试逻辑。有某个东西决定在一张 1,440 像素宽的截图上,「保存」那个控件在哪里:那是界面定位,它是一个独立的模型,有独立的失败模式。还有某个东西拥有像素、文件系统与剪贴板:那是机器。

按这个划分给四个项目排序,比较就自己理清了。UI-TARS 是一个为第二件工作端到端训练的视觉语言模型,以 Apache-2.0 权重发布;它的仓库给出 1.5 代在 ScreenSpot-V2 上 94.2、在 ScreenSpot-Pro 上 61.6——那是定位基准,不是任务基准。Agent S3 明确是第一件工作:它的配置要求一个主生成模型,并另外要求一个定位模型,而它推荐的那个正是 UI-TARS-1.5-7B。cua 是第三件工作,按机群规模来做,还附了一套评测外壳与轨迹导出。OpenAdapt 三件都不是——它是第四样东西,下文再说。

这就是星标数会误导人的原因。UI-TARS Desktop 有 39.2k 星、cua 有 29.1k,而 Agent S3 是 12.6k、OpenAdapt 是 1.8k——但 UI-TARS Desktop 是围着模型的一个应用外壳,而模型自己那个仓库停在 11.6k。这里的人气跟随的是「有多少人想试试桌面智能体」,不是「每个项目解决了问题的多大一块」。

为什么已发表的分数替你选不了

那张图里的数字内部有两样彼此独立的东西在动,而它们都比这几个项目中任意两者之间的差距更大。

第一样是「OSWorld」这个词指的是哪个基准。OSWorld-Verified 已接近饱和——一篇引用它的论文把 Claude Opus 4.8 放在 83.5%,并据此读出「桌面计算机操作大体已被解决」。而 2026 年 7 月发布的 OSWorld 2.0,含 108 项长程任务、正是围着早先那套未充分体现的那些现象构建的,它给同一个模型家族打出的是 500 步下 20.6% 的二元完成率与 54.8% 的部分得分,并让 GPT-5.5 在 13% 附近见顶。同一个名字下 63 个百分点的差别,不是关于智能体的分歧;它是一道基准代际的边界,而一个不带版本的分数是不可用的。关于这件事发生得有多频繁,见基准版图。

第二样是筛选预算。Agent S3 的头条是 OSWorld 100 步下 72.6%,其 README 指出这超过了约 72% 的人类表现。同一份 README 给出智能体单跑是 66%;多出来的 6.6 个点来自 Behavior Best-of-N——把任务跑好几遍,再挑一个。这个模式在它另外两个基准上重复出现:WindowsAgentArena 从 50.2% 升到从三次 rollout 中挑选后的 56.6%,AndroidWorld 从 68.1% 升到 71.6%。这是一项诚实且标注清楚的技术,而它同时是一个成本乘数、不是一项能力:三次 rollout 就是三倍的 token、三倍的墙上时间,以及——除非每次尝试都被沙箱隔开——三倍的副作用。拿它去跟一条人类基线比,你比的是 N 次尝试对一次——而这正是智能体评测中的人类基线整篇要讲的事。

把这两个效应都剔掉,剩下的差距小到不足以据以选择。那就按层来选。

人人都需要、却没人想维护的那一层

What each project ships, and what it does at run time Matrix of UI-TARS, Agent S3, cua and OpenAdapt against five columns: ships weights, ships the policy, ships the machine, keeps a generative model in the run-time loop, and verifies the effect before reporting success. Only UI-TARS is strong on weights and only OpenAdapt on effect verification. What ships, and what runs Modelweights Thepolicy Themachine Model in therun-time loop Verifies theeffect UI-TARS Apache-2.0 No App shell only Every step No Agent S3 No Apache-2.0 No Two models No cua CUA-S1 only No Fleet + bench Whatever you add No OpenAdapt No Compiled No None Effect contract
往下读最后一列。那是唯一一列里,四者有三个是空的。

机器是不起眼的那一层,也是决定这一切能否进生产的那一层——因为一个要驱动图形界面的智能体需要一个图形界面,而一个同时还是你笔记本的图形界面不是部署目标。cua 是认真的答案:macOS、Linux 与 Omarchy 上由虚拟机支撑的桌面、一个能在 macOS、Windows 与 Linux 上触达原生应用与浏览器的驱动、用于在 Apple 芯片上跑本地 macOS 与 Linux 虚拟机的 Lume、四种语言的 SDK,以及用来构建任务并导出轨迹供训练的 Cua Bench。如果你是在做评测或训练、而不是部署一个助手,那这就是这里唯一在做别人不做的那份工的项目。

两条须注意,都很实质。第一,「MIT」是仓库的头条、不是全部许可证:Cua Spaces——也就是那个桌面应用、你真会交到用户手上的那部分——是 FSL-1.1-MIT 下的源码可得,并在每次发布两年后转为 MIT;cua-som 是 AGPL-3.0-or-later,而可选的 cua-perception 扩展也不是 MIT。这是个合理的结构,而它同时正是那种会让「照着徽章做的许可证采购放行」失效的细节。第二,这里没有任何项目发布常规的 GitHub release,所以要固定版本就意味着固定一个提交、或一个组件版本字符串。

而那个警示性的例子,恰是多数清单文仍在推荐的那个。Bytebot——一个跑在容器化 Ubuntu 22.04 XFCE 桌面里、带 Firefox 与 VS Code 的自托管智能体,Apache-2.0,11.1k 星,支持 Helm 与 Compose 部署——已于 2026 年 3 月 7 日被其所有者归档,现为只读。它是个干净的设计,而它不是一个有人维护的依赖。如果你的候选名单来自一篇比较文章,请先看归档横幅、再看功能表;这是一周之内第二个类别,其中被链接得最多的项目其实已经冻结。

其中一个把模型从循环里拿了出来

OpenAdapt 是这里规模小一个数量级的项目,也是唯一一个在回答另一个问题的。你把任务演示一遍;openadapt flow record 把它录下来,openadapt flow compile 把录像变成一个包,而重放跑的是那个编译出来的程序,控制循环里没有生成式模型 API。用项目自己的说法,编译器的活是从观测到的增量里挖出副作用合约——它推断出这次演示到底改变了什么,而那就成了这次运行被据以评判的东西。

由此得出的那条性质,不管你是否采用它都值得你注意:只有当一个独立检查同意时,它才报告 VERIFIED。那份教程是通过一个「写入界面压根没碰过」的只读 API 去确认那条被保存的记录的;而一次无法确立自己副作用的运行,返回的是像 HALTED_BEFORE_EFFECT 或 RECONCILIATION_REQUIRED 这样的结果,而不是成功。这里其他每一个项目报告的,都是模型说它做了什么。这一个拒绝这么做。

那正是这个领域不断从另一头重新发现的同一道控制——核验副作用,而不是核验摘要——而这也是为什么「录制重放」这一层即便不能泛化,也值得留在你的地图上。这笔交换是显式的、毫不隐晦的:一个编译好的流程只在一个界面上做一件任务,布局一变就坏,这正是 OpenAdapt 要按界面声明证据来源的原因(浏览器里是 DOM、无障碍树、视觉与 OCR;原生桌面上是 UI Automation、Accessibility 或 AT-SPI;经 RDP 与 Citrix 时是像素、OCR 与锚点)。而对那条高频重复的路径——那个在没有 API 的应用里一天要填两百次的表单——花钱让一个视觉模型把同一串点击重新推导两百遍,是你毫无理由替自己选来的一笔成本和一份方差。

什么时候选哪个

情形选为什么
你的智能体点错的是元素,而不是步骤 UI-TARS 那是一次定位失败,而这是这里唯一交付了「你能固定版本、能本地跑、能微调」的权重的项目
你的定位没问题,但智能体会放弃或打转 Agent S3 规划、记忆与重试属于策略层;按它 README 所写,把定位指向 UI-TARS
你需要一百台桌面来做评测或造训练数据 cua 机群虚拟机、四语言 SDK、评测外壳与轨迹导出;给逐组件的许可证留出时间
一件重复任务、没有 API、量很大 OpenAdapt 编译一次、每次运行都核验副作用,并停止花钱让模型把一串已知序列重新决定一遍
你正拿某个 OSWorld 数字来比较它们 停下 要么报出基准版本与 rollout 次数,否则那个数字什么都不说明;然后去在你自己的界面上测
你的候选名单里有 Bytebot 换掉它 自 2026 年 3 月 7 日起已归档为只读;cua 覆盖同一需求且仍活跃

常见问题

UI-TARS 是 Agent S3 的替代品吗?

不是。Agent S3 需要一个定位模型,并推荐 UI-TARS-1.5-7B 来担这个角色,所以常见的配置是两个都用。如果你看到它们被摆在一起头对头评测,那两行里有一行量的是一个包含另一者的栈。

我该用 UI-TARS-2 吗?

就这个仓库来看,还不该。UI-TARS-2 在 2025 年 9 月被宣布,但 README 的引言、基准表与权重链接至今仍指向 1.5,页面上也没有发布任何 UI-TARS-2 的权重或数字。今天能固定版本的那个工件是 UI-TARS-1.5-7B。

为什么 cua 的许可证被说成「主体 MIT」?

因为各部分不同。仓库主体是 MIT,但 Cua Spaces 是 FSL-1.1-MIT、并在每次发布两年后转为 MIT,cua-som 是 AGPL-3.0-or-later,而 cua-perception 也不是 MIT。做采购评审时请读逐目录的许可证,而不是仓库徽章。

Behavior Best-of-N 是否让 Agent S3 强过了人类?

它让那个数字更高了。72.6% 对上大约 72% 的人类基线,是一个 best-of-N 的结果;智能体单跑是 66%。这项技术是正当的、标注清楚的,而它会把 token、延迟,以及——除非每次尝试都被隔离——副作用一并翻倍再翻倍。

这里哪一个我真能端到端自托管、完全不用 API key?

UI-TARS 加 cua,把 UI-TARS-1.5-7B 放在本地提供服务。Agent S3 需要一个主生成模型,它可以是一个 vLLM 端点,但通常是托管的。OpenAdapt 只在编译时需要模型,对一件你能演示出来的任务来说,这是这里最强的「不用 API key」的方案。

在选任何一个之前,我该量什么?

把你自己五十条轨迹上的失败分成「点错元素」与「走错步骤」两类。那一小时的标注会告诉你自己缺的是哪一层,而没有任何已发表的分数能做到。见失败分类与分诊。

延伸阅读

本站相关:

项目来源:

  • UI-TARS——模型仓库、论文与所报告的定位基准。
  • UI-TARS Desktop / Agent TARS——围着模型的那个应用外壳。
  • Agent S——Agent S3、它的模型要求与它的基准表。
  • cua——Spaces、Driver、Lume、CUA-S1 与 Cua Bench,以及逐组件的许可证。
  • OpenAdapt——录制、编译、重放、核验,以及副作用合约的那些结果。
  • OSWorld 2.0——那个 108 项长程任务的基准与它所报告的分数。