AI 博客

DeepSeek 在造自己的 Harness:那个基准分数里早已包含了脚手架

DeepSeek 用一套尚未发布的 harness 报出了 DeepSWE 成绩,而封闭测试三天里收到 712 个开源项目报名。智能体分数早就不再是对模型的测量——把每个公开数字都读成"模型 × harness"这一对,并通过钉死自己的 harness 来比较模型。

作者 智能体 AI 维基 27 分钟读完

DeepSeek 公布了 V4-Flash 的 DeepSWE 分数,并在同一份更新日志里注明:产出这个分数的 harness"很快"会发布——也就是说,眼下公司之外没有任何人能复现它。值得追的是这条线索,而不是那些内测邀请:智能体基准的结果早就不再是对模型的测量了,而各家实验室正在把这一对里的另一半也纵向整合进来。如果你靠公开分数来比较智能体,你比的是一批自己从没见过的脚手架;而解法今天就有——把你自己的 harness 钉死,在它里面换模型。

速览

截至 2026 年 8 月初,DeepSeek 究竟做了什么、说了什么。

时间事件为什么要紧
2026 年 3 月 DeepSeek 成立专门的 harness 组,招入崔天翼负责——他此前是香港量化机构 TSY Capital 的联合创始人,更早在 Jane Street 做工程师 这是一支常设团队,不是副业项目。脚手架有了归属和编制
2026 年 7 月 31 日 V4-Flash 完成重新后训练,据称在九项智能体基准上全面胜过体量更大的 V4-Pro-Preview,其中 DeepSWE 得分 54.4,而每百万输入令牌仍为 $0.14 DeepSWE 这个数字由厂商自报,且由 DeepSeek 自家尚未发布的 Harness 跑出
2026 年 8 月 1 日 崔天翼在 X 上发帖,招募开源项目参与 DeepSeek Harness 的封闭测试 这是脚手架已成为一款产品、而非内部工具的首次公开确认
截至 2026 年 8 月 4 日 据报道报名项目达 712 个,涵盖智能体框架、编码智能体,以及记忆与上下文工具 这个响应规模本身就是结论——生态把"实验室原生的 harness"当成了一件定义品类的事件

公开的范围既在意料之中,也正因如此才有分量:上下文管理、工具调用、文件读写、终端执行、依据测试反馈的自我纠正、记忆、MCP,以及把这些串起来的反馈回路。发布日期尚未给出。

Vendor-reported SWE-bench Verified scores, mid-2026 A horizontal bar chart of three vendor-reported SWE-bench Verified results as of mid-2026: Claude Opus 4.7 at 80.8 percent, DeepSeek V4-Pro at 80.6 percent, and GPT-5.5 at 74.9 percent. Each figure was produced by its own vendor under a scaffold the vendor chose, so the six-point spread mixes model capability with harness quality. SWE-bench Verified — every figure reported by the model's own vendor Percent of task instances resolved. Scale starts at 60 to make the gap legible. 60% 65% 70% 75% 80% Claude Opus 4.7 Anthropic-reported 80.8 DeepSeek V4-Pro DeepSeek-reported 80.6 GPT-5.5 OpenAI-reported 74.9 Two tenths of a point separate the top two. Neither run used the other's scaffold, and at least one of the three was produced with a harness that had not been released — so the ordering is a claim about pairs, not about models. Figures as published by each vendor, mid-2026. Treat any leaderboard mixing vendor-reported agentic numbers the same way.
头两名之间只差零点二个百分点,而这三次运行没有任何两次共用同一套脚手架。

脚手架就在那个数字里面,而且一直都在

The same model produces different agentic scores through different harnesses Two stacked paths from one set of model weights to a published benchmark number. In the upper path the weights run inside the lab's own unreleased harness — its context management, tool schemas, retry and test-feedback loop — and produce the vendor-reported score. In the lower path the same weights run inside a public harness a third party can install, producing a different, reproducible number. Only the second path can be replicated outside the lab. Lab harness — the scaffold ships later, or not at all Model weights one checkpoint In-house harness context mgmt · tool schemas retries · test feedback Benchmark tasks agentic, multi-step Published score vendor-reported The harness is doing real work here — how much context is kept, how a failing test is fed back, how many attempts a task gets. While it stays unreleased, nobody outside the lab can reproduce the number or separate the model's contribution from the scaffold's. Public harness — the scaffold is a dependency you can pin Model weights same checkpoint Named harness, version installable · configurable settings published with the run Benchmark tasks same task set Reproducible score model × harness, stated Same weights, same tasks, different number — and the difference is not noise. Holding the harness fixed is the only way a comparison across models means anything, which is why the harness belongs in the citation next to the model name. A published agentic score is a claim about a pair When one half of the pair is unavailable, the score is a system result reported by its own author — not a model measurement.
同样的权重、同样的任务、不同的数字——而这个差别不是噪声。

静态基准问模型一个问题,然后给答案打分。智能体基准要求一个系统跨多步完成一项任务,而在权重与分数之间横着一个庞大且带主张的程序:它决定多少代码库内容进入上下文、失败的测试怎么喂回去、工具报错是重试还是抛出、一项任务给几次尝试、工具 schema 长什么样,以及何时停下。这里的每一个决定都会挪动结果,其中若干项挪动的幅度超过相邻两代前沿模型之间的差距。

当大家还都用着差不多的开源脚手架时,这一点同样成立,但可以忍受,因为脚手架是一个共享的常量。变化在于:这个常量变成了一个各家实验室自己掌控、并针对自家权重去调的变量。DeepSeek 自己的更新日志在这一点上坦率得令人欣赏——DeepSWE 的结果出自一个计划稍后发布的内部 harness——而正是这份坦率,让这个案例适合被当成范例而不是指控。多数厂商自报的智能体数字背后都有某种私有脚手架,DeepSeek 特别之处主要在于它说了出来。

由此得到的推论很精确。当一家实验室用一套别人都没有的 harness 报出智能体分数时,这个数字是由系统作者自己发布的系统结果。它可能完全诚实,同时依然无法用于比较,因为读者分不清其中有多少来自模型。这与一个 MMLU 分数在认识论上是不同的对象,却被摆进了同一张表里。

实验室为什么要往里走,以及这为何是必然

三股力量指向同一个方向,而且没有一股是出于恶意。

剩下的分数长在循环里。在一项困难的智能体任务上,得 55 分的模型与得 62 分的模型之间的差距,往往不在知识,而在它被允许从多少个可挽回的错误里挽回过来。改进脚手架比改进权重更便宜地挪动这个数字,而且在预训练收益变平之后,它是唯一还在起作用的杠杆。

后训练与 harness 是共同演化的。如果你用强化学习在工具使用轨迹上训练一个模型,它训练时所处的那个环境就是一个 harness;而部署时最像它的那个 harness,能榨出最多能力。一家针对自家脚手架训练、然后把权重交给另一套脚手架的实验室,等于白送掉了自己花钱买来的一部分东西。这正是面向工具使用的 RL 里描述的那种耦合,只是从产品这一端看过去。

Claude Code 证明了 harness 才是生意。一款终端编码智能体的商业成功——一款价值就在于"围绕着谁都能租到的权重所搭的脚手架"的产品——把 harness 从成本中心重新定义成了客户真正付钱买的东西。一旦有一家实验室证明了这一点,每一家握有有竞争力权重的实验室都有理由造一个,而这正是我们在四款终端编码智能体里梳理过的那条脉络。

DeepSeek 这个案例特别的地方,在于它招募的方向。harness 团队没有闭门造好再发布,而是向开源智能体项目开放内测,三天里拉到 712 个报名。这是在竞逐生态的形状,而不只是在收反馈:一个在发布时框架、编码智能体和记忆工具就已经接好了的 harness,来的时候是一个生态而不是一款产品。它同时意味着,在别人来得及评估它之前,已经有一大批独立项目围着 DeepSeek 的循环调好了自己。

这对"比较"意味着什么

Three ownership positions for the agent harness Five properties compared across three positions: the lab ships weights only, the lab ships weights plus its own harness, and the harness comes from an independent third party. The properties are reproducibility of published scores, who tunes the scaffold to the model, switching cost between models, where improvement work accrues, and what a benchmark number actually measures. Whoever owns the harness owns the number Weights only Lab ships harness Independent harness Score reproducible outside If harness named Only once released Yes — pin a version Scaffold tuned to the model Not by the lab Tightly Generically, across models Cost of switching model Your integration High — rebuild loop Low — swap the endpoint Where the gains accrue Nowhere in particular To one lab To every model it supports What the number measures Model, loosely The pair, unstated The pair, stated The middle column is where the frontier is heading, and it is the only one where a buyer cannot check the claim. Nothing here says an in-house harness is wrong to build — it says the score it produces needs the scaffold published alongside it.
中间那一列是前沿正在去的方向,也是买方唯一无法核实的那一列。

按"对选模型的人而非卖模型的人"要紧的那条轴来比这三种形态。只发权重时,公开的智能体分数弱可复现——脚手架就是报告者当时用的那个,若他点了名,你还能近似地重跑一遍。用独立 harness 时,分数完全可复现,因为这一对的两半都能钉版本,而且脚手架的改进会抬升它支持的每一个模型。而当 harness 归实验室所有且尚未发布时,两条性质都不成立:数字核不了,调优只惠及唯一一份权重。

切换成本在这三种形态之间同样是反转的。独立 harness 让模型近乎可互换——改个端点、重跑评估即可;而一套针对自家权重调过的实验室 harness,会把换模型变成重建整个循环。这不是什么阴谋,而是把脚手架针对某一个训练分布狠调之后必然发生的事。但它确实是一道锁定的梯度,值得在采用之前而不是之后就定价,推理与四款智能体框架那次对比里的一样。

账本另一侧有一项真实的收益,把它一笔勾销是不对的。一家把"自己训练时所用的那套 harness"发出来的实验室,等于把"能从这个模型里榨出最多东西"的那份配置交到了用户手上——上下文策略、重试纪律、以及权重当初就是围着它们成形的那套工具 schema。对那些否则会自己攒一套、并且只做对七成的团队来说,第一方 harness 是一次实打实的能力提升;而对开放权重模型而言,它是"你能跑起来"和"你能跑得好"之间的差别。

如果你正基于这些模型做东西,该怎么办

钉死 harness,换模型。对多数团队的评估方式来说,这是最有用的一项改动:选定一套脚手架,把它的版本与配置钉死,让每一个候选模型都在它里面、在你自己的任务上跑一遍。你要发的就是这个 harness,所以只有它的数字才预测得了你的产品。一个在厂商榜单上排第二、在你循环里排第一的模型就是第一,反过来的情形也一样常见。

把 harness 当作评估记录里带版本的依赖项。你写下的任何结果,都应当带上模型版本、harness 版本,以及产出它的那份配置。缺了这三样,六周后的一次回退就无从归因——这是评估驱动开发里主张的那套纪律,延伸到脚手架上。

把每一个公开的智能体数字都读成一对,并追问缺的是哪一半。两个问题就能办完大半的事:这是哪套 harness 跑出来的,我能不能装上它?如果第二个问题的答案是不能,那么无论这个模型在别处表现如何,这个分数都该放进"有意思,未经核实"那一栏。这条对每一家实验室都适用,包括那些你喜欢其 harness 的。

像给模型迁移做预算一样,给 harness 迁移做预算。采用一套实验室原生的 harness,是比采用一个模型更深的承诺,因为它会把你的工具定义、上下文策略和错误处理都吸收进去。如果你要用,就把工具层藏在一个你自己拥有的接口之后,好让将来那次迁移是一次移植而不是一次重写——与模型弃用与迁移是同一套论证,只是往上挪了一层。

别得出"脚手架不重要"的结论。该学的恰恰是反过来的那条。如果一套 harness 能把智能体分数挪动好几个点,那么此刻你的 harness 正在对你的产品做同一件事,而它多半是你手上最缺乏测量的那个组件。多数团队从来没做过"钉死模型、只改自家上下文策略"这个实验;它很便宜,而且回报通常比上一次换模型还高。

什么才真正能解决这件事

能解决它的规范很小,而且完全在实验室的一念之间:把脚手架与分数一同公布,或者直截了当地说明这个分数无法被独立复现。静态基准好几年前就在这件事上收敛了——没人会不带提示词格式和示例数就报一个 MMLU 数字——而智能体评估只是还没跟上"它的脚手架比一个提示词模板大上一千倍"这个事实。

三件事就够了。在结果里点名 harness 及其版本。公布配置——上下文预算、重试策略、尝试次数、工具 schema——哪怕代码依然闭源。以及,当 harness 尚未发布时,就在写下那个数字的同一行里说明,DeepSeek 做到了,而这已经比多数人做得多。

在这个规范成形之前,担子落在读者身上;而它的实操形态,正是本文里唯一一条不花钱的建议:造一套你信得过的 harness,把它稳住,让模型在里面竞争。这也是唯一一种能回答你真正的那个问题的比较方式——你的问题从来不是"哪个模型最好",而是"在我的循环里、我的任务上、我的预算下,哪个模型最好"。

常见问题

什么是智能体 harness?

它是把模型权重变成一个智能体的那个程序:管理什么进入上下文窗口、定义工具 schema、执行工具调用、把结果与错误喂回去、决定何时重试何时停下,并跨步骤维护记忆。在一个多步基准里,harness 做出了成百上千个模型根本看不到的决定,其中若干项对最终分数的影响超过相邻两代前沿模型之间的差距。

DeepSeek Harness 是什么?

它是 DeepSeek 正在开发的一套智能体框架,覆盖上下文管理、工具调用、文件读写、终端执行、依据测试反馈的自我纠正、记忆与 MCP。面向开源智能体项目的封闭测试于 2026 年 8 月 1 日由 harness 团队负责人崔天翼宣布,据报道三天内报名项目达 712 个。发布日期尚未公布。

为什么 DeepSeek 的 DeepSWE 分数无法复现?

因为它是用 DeepSeek 自家的 harness 跑出来的,而公司的更新日志说该 harness 稍后才会发布。智能体分数是"模型与 harness 这一对"的属性,所以当其中一半拿不到时,第三方既无法重跑这次评估,也无法把模型的贡献与脚手架的贡献分开。DeepSeek 公开说明这一点,比"干脆不提脚手架"这个常见做法要好。

这是否意味着公开的基准分数一文不值?

不是——它意味着智能体分数是系统结果而非模型测量,应当被读作关于一对组合的主张。它们仍然告诉你一些东西:一家实验室报出高分,就证明了它的模型在某种配置下能达到这个水平。它们撑不住的是跨实验室的排名,因为那些运行里没有任何两次共用同一套脚手架。

我该不该采用某家实验室自己的 harness?

它是一次实打实的能力提升——实验室把自家权重当初就是针对其调优的那份配置发了出来——同时也是比采用一个模型更深的承诺,因为它会吸收掉你的工具定义、上下文策略和错误处理。如果你要用,就把工具层藏在一个你自己拥有的接口之后,让日后的迁移是一次移植而不是一次重写。

为我自己的产品该怎么比较模型?

钉死你的 harness,把版本与配置固定下来,让每一个候选模型在它里面、在你所在领域的任务上跑一遍。能预测你产品行为的数字,来自你真正要发布的那个循环;一个在厂商榜单上排第二的模型,在你的循环里可以排第一。

延伸阅读

本站相关:

信息来源: