Agent S3 的 README 推荐用 UI-TARS-1.5-7B 作为它的定位模型,这意味着星标最多的四个开源计算机操作项目里,有两个并不是竞品——它们是同一个栈的上半截与下半截。把另外两个也这样读,这场比较就不再是排行榜了:你挑的是四个层里自己缺的那一个,而唯一真正把它们分开的那根轴是,任务每跑一次,是不是都要由一个生成式模型来决定点哪里。
一眼概览
四个项目、四个层,而其中只有一个交付了「决定指针落在哪里」的那一部分。数字读自各仓库页面,时间为 2026 年 10 月 9 日。
| 项目 | 它所占的层 | 许可证 | 交付了作决定的那部分吗? |
|---|---|---|---|
| UI-TARS(字节跳动) | 定位模型 | Apache-2.0 | 是——权重,在 Hugging Face 上 |
| Agent S3(Simular) | 围着模型的那套策略 | Apache-2.0 | 不——它需要一个主模型和一个定位模型 |
| cua(trycua) | 机器,以及成群的机器 | 主体 MIT;见下文 | 部分——CUA-S1 小模型,用于狭窄的决定 |
| OpenAdapt | 一个「从演示到程序」的编译器 | MIT | 只在编译期——运行期一个都不用 |
这四者里没有任何一个是另一个的同层对手
一个计算机操作智能体有三件通常被当成一件来讲的工作。有某个东西决定下一步做什么、以及失败之后做什么:那是策略,它主要是提示词工程、规划与重试逻辑。有某个东西决定在一张 1,440 像素宽的截图上,「保存」那个控件在哪里:那是界面定位,它是一个独立的模型,有独立的失败模式。还有某个东西拥有像素、文件系统与剪贴板:那是机器。
按这个划分给四个项目排序,比较就自己理清了。UI-TARS 是一个为第二件工作端到端训练的视觉语言模型,以 Apache-2.0 权重发布;它的仓库给出 1.5 代在 ScreenSpot-V2 上 94.2、在 ScreenSpot-Pro 上 61.6——那是定位基准,不是任务基准。Agent S3 明确是第一件工作:它的配置要求一个主生成模型,并另外要求一个定位模型,而它推荐的那个正是 UI-TARS-1.5-7B。cua 是第三件工作,按机群规模来做,还附了一套评测外壳与轨迹导出。OpenAdapt 三件都不是——它是第四样东西,下文再说。
这就是星标数会误导人的原因。UI-TARS Desktop 有 39.2k 星、cua 有 29.1k,而 Agent S3 是 12.6k、OpenAdapt 是 1.8k——但 UI-TARS Desktop 是围着模型的一个应用外壳,而模型自己那个仓库停在 11.6k。这里的人气跟随的是「有多少人想试试桌面智能体」,不是「每个项目解决了问题的多大一块」。
为什么已发表的分数替你选不了
那张图里的数字内部有两样彼此独立的东西在动,而它们都比这几个项目中任意两者之间的差距更大。
第一样是「OSWorld」这个词指的是哪个基准。OSWorld-Verified 已接近饱和——一篇引用它的论文把 Claude Opus 4.8 放在 83.5%,并据此读出「桌面计算机操作大体已被解决」。而 2026 年 7 月发布的 OSWorld 2.0,含 108 项长程任务、正是围着早先那套未充分体现的那些现象构建的,它给同一个模型家族打出的是 500 步下 20.6% 的二元完成率与 54.8% 的部分得分,并让 GPT-5.5 在 13% 附近见顶。同一个名字下 63 个百分点的差别,不是关于智能体的分歧;它是一道基准代际的边界,而一个不带版本的分数是不可用的。关于这件事发生得有多频繁,见基准版图。
第二样是筛选预算。Agent S3 的头条是 OSWorld 100 步下 72.6%,其 README 指出这超过了约 72% 的人类表现。同一份 README 给出智能体单跑是 66%;多出来的 6.6 个点来自 Behavior Best-of-N——把任务跑好几遍,再挑一个。这个模式在它另外两个基准上重复出现:WindowsAgentArena 从 50.2% 升到从三次 rollout 中挑选后的 56.6%,AndroidWorld 从 68.1% 升到 71.6%。这是一项诚实且标注清楚的技术,而它同时是一个成本乘数、不是一项能力:三次 rollout 就是三倍的 token、三倍的墙上时间,以及——除非每次尝试都被沙箱隔开——三倍的副作用。拿它去跟一条人类基线比,你比的是 N 次尝试对一次——而这正是智能体评测中的人类基线整篇要讲的事。
把这两个效应都剔掉,剩下的差距小到不足以据以选择。那就按层来选。
人人都需要、却没人想维护的那一层
机器是不起眼的那一层,也是决定这一切能否进生产的那一层——因为一个要驱动图形界面的智能体需要一个图形界面,而一个同时还是你笔记本的图形界面不是部署目标。cua 是认真的答案:macOS、Linux 与 Omarchy 上由虚拟机支撑的桌面、一个能在 macOS、Windows 与 Linux 上触达原生应用与浏览器的驱动、用于在 Apple 芯片上跑本地 macOS 与 Linux 虚拟机的 Lume、四种语言的 SDK,以及用来构建任务并导出轨迹供训练的 Cua Bench。如果你是在做评测或训练、而不是部署一个助手,那这就是这里唯一在做别人不做的那份工的项目。
两条须注意,都很实质。第一,「MIT」是仓库的头条、不是全部许可证:Cua Spaces——也就是那个桌面应用、你真会交到用户手上的那部分——是 FSL-1.1-MIT 下的源码可得,并在每次发布两年后转为 MIT;cua-som 是 AGPL-3.0-or-later,而可选的 cua-perception 扩展也不是 MIT。这是个合理的结构,而它同时正是那种会让「照着徽章做的许可证采购放行」失效的细节。第二,这里没有任何项目发布常规的 GitHub release,所以要固定版本就意味着固定一个提交、或一个组件版本字符串。
而那个警示性的例子,恰是多数清单文仍在推荐的那个。Bytebot——一个跑在容器化 Ubuntu 22.04 XFCE 桌面里、带 Firefox 与 VS Code 的自托管智能体,Apache-2.0,11.1k 星,支持 Helm 与 Compose 部署——已于 2026 年 3 月 7 日被其所有者归档,现为只读。它是个干净的设计,而它不是一个有人维护的依赖。如果你的候选名单来自一篇比较文章,请先看归档横幅、再看功能表;这是一周之内第二个类别,其中被链接得最多的项目其实已经冻结。
其中一个把模型从循环里拿了出来
OpenAdapt 是这里规模小一个数量级的项目,也是唯一一个在回答另一个问题的。你把任务演示一遍;openadapt flow record 把它录下来,openadapt flow compile 把录像变成一个包,而重放跑的是那个编译出来的程序,控制循环里没有生成式模型 API。用项目自己的说法,编译器的活是从观测到的增量里挖出副作用合约——它推断出这次演示到底改变了什么,而那就成了这次运行被据以评判的东西。
由此得出的那条性质,不管你是否采用它都值得你注意:只有当一个独立检查同意时,它才报告 VERIFIED。那份教程是通过一个「写入界面压根没碰过」的只读 API 去确认那条被保存的记录的;而一次无法确立自己副作用的运行,返回的是像 HALTED_BEFORE_EFFECT 或 RECONCILIATION_REQUIRED 这样的结果,而不是成功。这里其他每一个项目报告的,都是模型说它做了什么。这一个拒绝这么做。
那正是这个领域不断从另一头重新发现的同一道控制——核验副作用,而不是核验摘要——而这也是为什么「录制重放」这一层即便不能泛化,也值得留在你的地图上。这笔交换是显式的、毫不隐晦的:一个编译好的流程只在一个界面上做一件任务,布局一变就坏,这正是 OpenAdapt 要按界面声明证据来源的原因(浏览器里是 DOM、无障碍树、视觉与 OCR;原生桌面上是 UI Automation、Accessibility 或 AT-SPI;经 RDP 与 Citrix 时是像素、OCR 与锚点)。而对那条高频重复的路径——那个在没有 API 的应用里一天要填两百次的表单——花钱让一个视觉模型把同一串点击重新推导两百遍,是你毫无理由替自己选来的一笔成本和一份方差。
什么时候选哪个
| 情形 | 选 | 为什么 |
|---|---|---|
| 你的智能体点错的是元素,而不是步骤 | UI-TARS | 那是一次定位失败,而这是这里唯一交付了「你能固定版本、能本地跑、能微调」的权重的项目 |
| 你的定位没问题,但智能体会放弃或打转 | Agent S3 | 规划、记忆与重试属于策略层;按它 README 所写,把定位指向 UI-TARS |
| 你需要一百台桌面来做评测或造训练数据 | cua | 机群虚拟机、四语言 SDK、评测外壳与轨迹导出;给逐组件的许可证留出时间 |
| 一件重复任务、没有 API、量很大 | OpenAdapt | 编译一次、每次运行都核验副作用,并停止花钱让模型把一串已知序列重新决定一遍 |
| 你正拿某个 OSWorld 数字来比较它们 | 停下 | 要么报出基准版本与 rollout 次数,否则那个数字什么都不说明;然后去在你自己的界面上测 |
| 你的候选名单里有 Bytebot | 换掉它 | 自 2026 年 3 月 7 日起已归档为只读;cua 覆盖同一需求且仍活跃 |
常见问题
UI-TARS 是 Agent S3 的替代品吗?
不是。Agent S3 需要一个定位模型,并推荐 UI-TARS-1.5-7B 来担这个角色,所以常见的配置是两个都用。如果你看到它们被摆在一起头对头评测,那两行里有一行量的是一个包含另一者的栈。
我该用 UI-TARS-2 吗?
就这个仓库来看,还不该。UI-TARS-2 在 2025 年 9 月被宣布,但 README 的引言、基准表与权重链接至今仍指向 1.5,页面上也没有发布任何 UI-TARS-2 的权重或数字。今天能固定版本的那个工件是 UI-TARS-1.5-7B。
为什么 cua 的许可证被说成「主体 MIT」?
因为各部分不同。仓库主体是 MIT,但 Cua Spaces 是 FSL-1.1-MIT、并在每次发布两年后转为 MIT,cua-som 是 AGPL-3.0-or-later,而 cua-perception 也不是 MIT。做采购评审时请读逐目录的许可证,而不是仓库徽章。
Behavior Best-of-N 是否让 Agent S3 强过了人类?
它让那个数字更高了。72.6% 对上大约 72% 的人类基线,是一个 best-of-N 的结果;智能体单跑是 66%。这项技术是正当的、标注清楚的,而它会把 token、延迟,以及——除非每次尝试都被隔离——副作用一并翻倍再翻倍。
这里哪一个我真能端到端自托管、完全不用 API key?
UI-TARS 加 cua,把 UI-TARS-1.5-7B 放在本地提供服务。Agent S3 需要一个主生成模型,它可以是一个 vLLM 端点,但通常是托管的。OpenAdapt 只在编译时需要模型,对一件你能演示出来的任务来说,这是这里最强的「不用 API key」的方案。
在选任何一个之前,我该量什么?
把你自己五十条轨迹上的失败分成「点错元素」与「走错步骤」两类。那一小时的标注会告诉你自己缺的是哪一层,而没有任何已发表的分数能做到。见失败分类与分诊。
延伸阅读
本站相关:
- 界面定位——为什么「点哪里」是一个独立的模型、有独立的失败模式。
- 计算机操作与图形界面智能体——从头讲这个概念。
- 构建计算机操作智能体——把它交付出去的实战手册。
- 智能体评测中的人类基线——一次 best-of-N 对人的比较能说明什么、不能说明什么。
- 截图与 DOM 工件——留下一次定位失败所需要的证据。
- 基准版图——为什么版本比分数更要紧。
项目来源:
- UI-TARS——模型仓库、论文与所报告的定位基准。
- UI-TARS Desktop / Agent TARS——围着模型的那个应用外壳。
- Agent S——Agent S3、它的模型要求与它的基准表。
- cua——Spaces、Driver、Lume、CUA-S1 与 Cua Bench,以及逐组件的许可证。
- OpenAdapt——录制、编译、重放、核验,以及副作用合约的那些结果。
- OSWorld 2.0——那个 108 项长程任务的基准与它所报告的分数。