AI 博客

Claude Computer Use(收购 Vercept 后)、Codex 后台 CU、Operator 与 Gemini:四种让 AI 自己操作鼠标的下注方式

在 OSWorld 上拿到 72.5% 已经是地板而非里程碑——而三家实验室在"鼠标应该跑在哪里"这件事上做了架构上完全相反的下注。选错了就要永远跟自己的沙箱搏斗;选对了,模型两分钟能做完你 RPA 栈两周的活。

作者 智能体 AI 维基 33 分钟读完

Claude 在 OSWorld 上打出 72.5%,三家前沿实验室同时把赌注抬到桌面——问题不再是模型能否驱动一台电脑,而是这台电脑究竟放在哪里。Anthropic 押注你的沙箱,OpenAI 押注一台加固过的云端 Chromium,Google 押注浏览器标签页。截至 2026 年 6 月下旬,这三注并不收敛——决定哪一家适合你的,是架构,而不是榜单分数。

速览

四款已经出货的 computer-use 产品,背后是三种架构上完全相反的判断:鼠标到底应该跑在哪里。下表给出基本面,紧接的柱状图与矩阵则说明每一注究竟会把人带到哪里。

厂商 路径 部署形态 OSWorld %
Claude Computer Use(收购 Vercept 之后) 跨任意操作系统的 screenshot + 鼠标/键盘工具 你自己的 VM、容器或远程桌面 72.5%
OpenAI Codex Background CU + Operator 托管沙箱中的云端 Chromium OpenAI 基础设施;画面流回到你这边 38%(Operator,OSWorld)
Gemini Computer Use 运行在 Workspace + Chrome 中的浏览器标签页智能体 Google 基础设施,绑定已登录会话 32%
browser-use(开源基线) 可套用任意模型的开源 Playwright 循环 你的基础设施;自带模型 26%

截至 2026 年 6 月下旬的快照;基准数字每周都在变,榜单本身也仍有争议。

OSWorld benchmark (% success) — computer-use comparison Horizontal bar chart: Claude Computer Use leads at 72.5%, OpenAI Operator at 38%, Gemini Computer Use at 32%, and browser-use at 26%. OSWorld benchmark (% success) 0 25 50 75 100 Claude Computer Use 72.5% OpenAI Operator 38% Gemini Computer Use 32% browser-use (OSS) 26%
OSWorld 是少数能做到"同口径"对比的基准——Claude 比第二名领先 34.5 分,这一差距比身后三名彼此之间的距离总和还要大。
Computer-use feature comparison matrix Heatmap comparing Claude CU, OpenAI CUA, Gemini CU, and browser-use across Surface, Deployment, Safety model, Latency, and Open-weights. Fill color encodes strength: light (weak), soft orange (medium), solid accent (strong). Surface Deployment Safety model Latency Open-weights Claude CU Full desktop Your machine Human-in-loop Medium No OpenAI CUA Web only Their VM Containment Medium No Gemini CU Web only Their VM Containment Low No browser-use Web only Your machine Your responsibility Medium Yes Weak Medium Strong
每家的发力方向各有侧重。Claude 是唯一押注完整桌面的;OpenAI 在安全模型一列遥遥领先,因为"封装隔离"本身就是它的产品;browser-use 是唯一一行开放权重的。

Claude Computer Use

Claude Computer Use — your sandbox, portable harness Claude model on the left sends screenshot-and-input actions via a tool layer into a user-controlled machine or container on the right, which runs desktop apps, a terminal, the filesystem, and a browser. Claude Computer Use model Screenshot + Input mouse · keyboard tool layer YOUR MACHINE / VM / CONTAINER Desktop apps Electron · native GUI Terminal shell · scripts Filesystem read · write · watch Browser Chromium · web Portable, OS-agnostic — sandbox is yours
Claude 读屏并向你操控的宿主发出鼠标/键盘工具调用——VM、容器、远程桌面,乃至裸金属 Linux 都行。

收购 Vercept 之后的架构

Claude 的 computer_use 工具刻意做得很小。模型收到一张截图,决定下一步动作,发出寥寥几个原语之一:screenshotmouse_moveleft_clicktypekeyscroll。这层窄窄的接口就是全部抽象——它对屏幕另一端是什么毫无预设。Anthropic 提供了 Ubuntu 容器、Wayland 桌面以及远程 VNC 目标的参考脚手架,但协议本身在每种环境下都一样。这正是智能体循环被压到极限后的样子:感知像素缓冲,决定一个输入事件,执行,观察下一帧。它不假设浏览器、不假设 DOM、甚至不假设特定操作系统——只要能截图、能注入事件,Claude 就能驱动。

真正让这个最小工具一举拿下 OSWorld 的,是 Vercept 的整合。Vercept 构建了一整套感知栈,专门处理亚像素级控件定位、多显示器坐标、跨平台字体渲染漂移,以及那一长串让纯 VLM 翻车的 UI 细节(右键菜单、原生文件选择器、遮挡按钮的提示框等)。Anthropic 把它吸收进来,直接绑进模型的视觉通路。对外的 API 几乎没变;真实桌面任务的成功率大约翻了一倍。

"你的沙箱"为什么赢

因为运行时是你的,触达范围就是你的运行时能碰到的一切。这意味着那些没有网页对应物的桌面应用——Photoshop、Final Cut、Logic,乃至从未做过 SaaS 化的老牌 ERP 客户端。意味着真正能读写文件系统的终端,而非象征性的 Shell。意味着已经装好的凭据:一份 kubeconfig、一个已登录的 SSH agent、一个 1Password CLI、一个指向 staging 的数据库客户端。只能跑浏览器的智能体每碰到这些场景,就得绕回那台不掌管文件系统的托管 Chromium;Claude 不必绕,因为文件系统压根没有被抽象掉。让 Claude 在这四家中最难安全部署的那条性质(沙箱要你自己搭),恰恰是让它成为唯一能在标签页之外做事的那条性质。

收购的来龙去脉

Anthropic 在 2026 年 6 月初宣布收购 Vercept,同步更新了 Claude 4 系列的 computer-use 能力。公开的 computer_use 工具签名没有破坏性变更;变的是背后的感知质量。没有单独的"Vercept SDK"要装——整合是作为模型能力交付,而不是新的产品面。落到实处:所有已经跑着 Claude Computer Use 脚手架的人,在模型更新后不动一行脚手架代码,通过率就跳上去了。这就是这场赌注的完整形状——把工具面保持得扁平、无趣,把所有的工程量都压进背后的模型。

OpenAI Codex Background CU + Operator

OpenAI Codex Background CU + Operator — cloud VM, browser only GPT-5.6 on the left sends actions through a DOM event channel into an OpenAI-managed cloud VM on the right that contains only a sandboxed Chromium browser — no filesystem or native apps are accessible. GPT-5.6 Codex Background CU + Operator DOM event channel browser events only OPENAI CLOUD VM Sandboxed Chromium (browser only — no FS, no native apps) Audit trail Credential containment
OpenAI 替你跑浏览器。你只是看着它、在凭据时刻点确认、读它写出的审计日志;进程从不归你所有。

云端 VM 上的 Chromium 架构

OpenAI 押的是 Anthropic 的反面:那台电脑永远不应该碰到你的电脑。Operator 和 Codex Background CU 都跑在一台由 OpenAI 运营的 Linux VM 里,装着一台加固过的 Chromium,再没有什么值得一提的东西。智能体既通过 DOM 事件、也通过原始截图来动作,画面经由一个视频面板回流给用户,并且写下用户可以翻阅的完整动作日志。封装隔离不是事后贴上的特性——它就是架构本身。模型无法跑出 VM,因为 VM 就是它能触及的全部世界。

Codex Background CU(2026 年 4 月 16 日上线)

Codex Background CU 把同一套运行时延伸到了围绕开发工作展开的、异步长跑型 computer-use 任务。"Background"是关键词:智能体在没有人盯着画面的情况下运行,遇到凭据提示就暂停(在 Codex UI 中以审批请求出现),获批后继续。它和 Codex 本身的整合是这架构能跑通的原因——驱动浏览器的同一台 VM 上也躺着一份签出的仓库、一个可用的终端以及 Codex 自己的代码编辑工具,于是"去重现一个 bug、在面板里复现、然后写好修复"这一连串动作不必离开沙箱。它和 Operator 戴着同一副镣铐:触达范围在 VM 之内,不在你机器之上。

Operator 那个 87% 的订票数字——它到底在度量什么

Operator 对外最亮眼的数字是订票评测上的 87%——这个数字承重多少,听起来是多少,仅此而已。该评测是一个精挑细选过的端到端订票流程集合,覆盖少数几家主流站点,DOM 结构稳定、被反复打磨过。它不是 OSWorld,不是对桌面通用能力的衡量。在这个狭窄目标内,Operator 确实强——云端 Chromium 加上为网页流程微调的模型,正是处理可预测、可重复的表单的正确架构。出了这个目标——换一个 Operator 没见过的站点、换一个桌面应用、换一个终端——同样的架构就成了错的那个。把这个数字当作它真正的样子去读:一道领域专属的高水位线,不能外推到 OSWorld 的及格线。

2026 年初融入 ChatGPT Agent

2026 年初,OpenAI 把 Operator 的运行时折进了 ChatGPT 本身,归到"Agent"这一面之下,于是消费用户从同一条对话线程里就能调用 computer-use。架构没变——还是云端 VM,还是 Chromium,还是流式面板回灌——变的是分发渠道。落到现实就是:"能顺手帮你订机票的消费助理"这条路径,现在默认走的是 OpenAI 的沙箱;任何想做同样形态的企业方案,无论愿不愿意,都会继承同一套封装隔离的故事。

Gemini Computer Use

它的强项

Gemini 的押注在三家之中最窄,也最自洽:一个浏览器标签页智能体,为低延迟做了调优,对已登录的 Google Workspace 会话拥有头等舱级别的访问。Gmail、Calendar、Docs、Sheets、Drive——智能体在一个用户预期它就该熟悉的、已经认证好的上下文中走动。对于任何通过 Google SSO 登录的网页应用,同样的特性也成立。Gemini 在这些流程上的延迟显著低于 Operator,部分因为动作面更小(一个标签页,而不是一台 VM),部分因为 Google 花了两年时间把 Chrome 在被探针化的情况下调到飞快。"总结一下我的收件箱,然后回复其中三封紧急邮件"——这是它正确的形状。

它的盲区

页面之外,Gemini 不存在。没有桌面触达、没有终端、没有文件系统、没有原生应用驱动。这架构是有意的选择——浏览器标签页就是整个宇宙——代价是其他两种架构能做、而它做不到的一切。在 OSWorld 上,这层约束体现为三十出头的分数;不是因为模型弱,而是因为 OSWorld 的大多数任务发生在单个浏览器标签页之外。如果你的工作负载只在浏览器内、并且形状贴着 Workspace,Gemini 在这份名单里是单位任务成本最优的选项;如果不是,架构在你递上第一个提示词时就把你排除了。

横向对比

操作面

这是三家分歧最剧烈的一根轴。Claude 把操作面定义成"任何能截图、能接收输入事件的东西"——完整桌面、终端、文件系统、多显示器、原生应用,无所不包。OpenAI 把它收窄成"一台由我们运营的 Chromium 实例",这比单个标签页要宽(多标签页、下载到沙箱化的文件系统、Codex 版本里还有终端),但止步于 VM 边界。Gemini 进一步收窄成"已登录 Workspace 会话中的当前浏览器标签页"。三个同心圆——选择把赌注押在哪个圆上,会沿链路向下决定其余每一个架构选择。

部署形态

部署形态精确地镜像了操作面的选择:Claude 跑在你预备的任何东西上(你的 VM、你的容器、你的 Mac、你的远程 VDI),OpenAI 跑在 OpenAI 的基础设施上、把画面流回给你,Gemini 跑在 Google 基础设施上、装在一个已登录的浏览器上下文里。运营层面的后果是:谁来背哪种风险。选 Claude,你自己背沙箱搭建、操作系统加固和凭据卫生;好处是没有任何工作必须离开你的边界。选 OpenAI 或 Gemini,你把沙箱整体外包出去;代价是智能体看到的数据要穿过厂商的运行时,合规对话于是从"我们沙箱搭得对不对"挪到了"我们能否接受这家厂商的数据路径"。

安全模型

三家实验室对"什么东西阻止智能体造成破坏"给出了三种不同的原语。OpenAI 用封装隔离作答:智能体从字面上就无法触及 VM 之外的任何东西,凭据时刻会作为显式的"人机协同"审批浮现到流式 UI 里。Gemini 用作用域作答:浏览器标签页就是边界,已登录会话就是信任单元,Google 已有的账户安全机制(敏感流程的二次认证、异常检测)负责剩余重量。Claude 用委派作答:安全模型就是你搭出来的沙箱,可以比另外两家都强(内核级能力约束、临时性 VM、不留持久凭据),也可以远比它们弱(在你日常笔记本上、用你已登录的会话、零隔离地跑)——责任毫不含糊地落在你身上。挑那个默认失败模式与你真正能运营的能力相匹配的。

延迟

在它瞄准的工作负载上,Gemini 是三家中最快的,因为动作面小,且 Google 把浏览器标签页交互的往返路径调过。OpenAI 居中:VM 往返每个动作要多花几十到上百毫秒,而模型本身在更难的 Operator 与 Codex 流程上每一步要做更多推理。Claude 在每个动作上是最慢的——截图比 DOM 事件重得多,而模型为了应付桌面级广度,刻意在大多数步骤之间重新感知屏幕——但它也是三家中唯一能把另两家根本无从下手的整类任务做完的那个。正确的对比轴并不只是"单动作延迟";而是"完成这件实际工作的墙钟时间",在跨多个应用的桌面工作流上,Claude 单步那点开销,被它"不必跌出沙箱再交接给人"这件事远远盖过。

该选哪一个

使用场景 选 Claude,当…… 选 OpenAI,当…… 选 Gemini,当……
仅浏览器的网页任务 你想要最高的绝对成功率,并且愿意在自己的容器里跑浏览器。 你希望厂商替你跑一台加固过的 Chromium 并回流画面,凭据审批在 UI 里完成。 站点本身就在 Workspace 已登录的上下文里,单动作延迟比绝对通用性更重要。
桌面应用自动化 工作在 Photoshop、Logic、原生 ERP 客户端,或任何没有网页等价物的东西里——这是唯一够得着的架构。 不合适——Operator 与 Codex CU 都止步于 Chromium 边界。 不合适——Gemini 在浏览器标签页之外不存在。
终端驱动的开发工作 你希望同一个智能体在同一次会话里驱动浏览器、Shell 和编辑器,作用于你真实的仓库。 Codex Background CU 的 VM 自带终端和一份签出的仓库——前提是你能接受仓库住在 OpenAI 沙箱里。 不合适——没有终端这条面。
受监管企业(审计、凭据封装) 你能够搭出(并能证明)一套每次会话临时、内核隔离的沙箱,所有凭据都留在你的边界里。 你接受 OpenAI 云端 VM 作为封装边界,依赖其审计日志和人机协同的凭据审批。 你的合规体系已经把 Google Workspace 当作信任单元,并且你只需要浏览器标签页级别的触达。
消费助理 用户是想让助理在自己真实机器上碰真实应用的高级用户。 用户本来就活在 ChatGPT 里,对话内的"Agent"面是最自然的入口。 用户活在 Gmail、Calendar 和 Docs 里,希望助理在那个已登录的上下文中直接动手。

常见问题

Claude Computer Use 能在 Windows 上跑吗?

能,但受支持的路径是一台隔离的 Windows VM(Hyper-V、Parallels,或一台云端 Windows 桌面),而不是你日常使用的宿主机。Anthropic 的参考脚手架首先面向 Linux 容器,但 computer_use 工具本身与操作系统无关——任何能截图并能注入鼠标和键盘事件的环境都符合条件。坚持把它装进 VM 的理由和在 Linux 上一样:沙箱是你的责任,把智能体对准你真实的桌面,就把你真实的凭据也一并纳入了攻击面。

OpenAI 的云端 VM 拿着我的凭据有多安全?

从构造上说,比把智能体对着你本机跑要安全——智能体无法触及 VM 之外的任何东西,凭据时刻(登录、付款确认、敏感表单字段)会中断运行并作为显式审批浮现到流式 UI 里。代价是:你交出去的凭据(一份会话 Cookie、一段已保存密码、一段 2FA 验证码)会在任务期间留在 OpenAI 的运行时里。对大多数消费流程、对很多有合适数据处理协议托底的企业流程而言,这是可以接受的;对那些你已经承诺绝不能暴露给第三方 VM 的凭据,就不可接受了——此时 Claude 的"你的沙箱"模型才是架构上的合适解。

OSWorld 到底在度量什么?

OSWorld 是一个建立在真实 Ubuntu 环境上的真实桌面任务基准——文件管理、跨应用工作流、终端命令、浏览器流程、办公文档——以智能体是否到达正确终态来评分,而非按轨迹相似度评。它对仅浏览器的智能体故意刁难,因为它的大多数任务横跨不止一个应用。72.5% 意味着智能体能端到端完成大约四分之三的任务;同一套题目上人类基线在 90% 出头。本文把它框定为"地板而非里程碑"是这个意思:一年前榜首还在十几分;如今想被认真对待的下一个挑战者得先翻过 72.5%。

Vercept 的技术进了公开的 Claude API 吗?

进了——整合是作为模型能力交付,不是单独的 SDK。公开的 computer_use 工具签名没有变化,但背后的感知质量(控件定位、多显示器处理、字体渲染鲁棒性)因这次收购而提升。没有"启用 Vercept 模式"的开关;只要你在调用现在的 Claude computer-use 端点,你就在用它。

订机票哪个赢?

在自己车道里 Operator 赢——它那个 87% 是在一组精挑细选过的、面向知名站点的订票评测上跑出来的,云端 Chromium 架构正是处理可预测、可重复表单流程的正确形状。出了这条车道,比如 Operator 没调过的旅行站点,或那种需要碰桌面日历应用的行程,比较就重新开放了。当订票落在 Google 已登录上下文里时,Gemini 有竞争力。当任务彻底跨出浏览器时——比如导出确认 PDF、塞进一份 Keynote,再从原生客户端发出去——Claude 才赢。

开源选项怎么样(browser-use、CogAgent)?

browser-use 是被引用最多的开源基线——一个套在任意模型外面的 Playwright 循环,配上一个能打的通用模型,在 OSWorld 上大约 26%。CogAgent 以及更广义的 VLM 驱动开源谱系(UI-TARS、ShowUI、OS-Atlas)位于相近区间。用它们的理由不是与 Claude 的基准持平——没有一个接近——而是架构层面的控制权:开放权重、自己的推理路径、不依赖第三方运行时。对于做研究、对于闭源厂商不可用的部署环境、对于必须把模型交付到用户自家基础设施里的产品,开源基线是唯一可行的选项,而它与前沿的差距正在以快过闭源榜单暗示的速度收敛。

延伸阅读

本站相关:

  • 智能体循环——每个 computer-use 脚手架都在实现的"感知-决策-行动"循环,在 Claude 这里被压到了"照片加手指"的最小形态。
  • 工具、动作与环境——这套分类法把 computer_use 放在智能体可触达的其他工具面旁边对照。
  • 提示注入入门——OpenAI 云端 VM 的封装故事所对抗的威胁模型,也是你的 Claude 沙箱必须自行承担的那一份。

项目来源: