DeepSeek 公布了 V4-Flash 的 DeepSWE 分数,并在同一份更新日志里注明:产出这个分数的 harness"很快"会发布——也就是说,眼下公司之外没有任何人能复现它。值得追的是这条线索,而不是那些内测邀请:智能体基准的结果早就不再是对模型的测量了,而各家实验室正在把这一对里的另一半也纵向整合进来。如果你靠公开分数来比较智能体,你比的是一批自己从没见过的脚手架;而解法今天就有——把你自己的 harness 钉死,在它里面换模型。
速览
截至 2026 年 8 月初,DeepSeek 究竟做了什么、说了什么。
| 时间 | 事件 | 为什么要紧 |
|---|---|---|
| 2026 年 3 月 | DeepSeek 成立专门的 harness 组,招入崔天翼负责——他此前是香港量化机构 TSY Capital 的联合创始人,更早在 Jane Street 做工程师 | 这是一支常设团队,不是副业项目。脚手架有了归属和编制 |
| 2026 年 7 月 31 日 | V4-Flash 完成重新后训练,据称在九项智能体基准上全面胜过体量更大的 V4-Pro-Preview,其中 DeepSWE 得分 54.4,而每百万输入令牌仍为 $0.14 | DeepSWE 这个数字由厂商自报,且由 DeepSeek 自家尚未发布的 Harness 跑出 |
| 2026 年 8 月 1 日 | 崔天翼在 X 上发帖,招募开源项目参与 DeepSeek Harness 的封闭测试 | 这是脚手架已成为一款产品、而非内部工具的首次公开确认 |
| 截至 2026 年 8 月 4 日 | 据报道报名项目达 712 个,涵盖智能体框架、编码智能体,以及记忆与上下文工具 | 这个响应规模本身就是结论——生态把"实验室原生的 harness"当成了一件定义品类的事件 |
公开的范围既在意料之中,也正因如此才有分量:上下文管理、工具调用、文件读写、终端执行、依据测试反馈的自我纠正、记忆、MCP,以及把这些串起来的反馈回路。发布日期尚未给出。
脚手架就在那个数字里面,而且一直都在
静态基准问模型一个问题,然后给答案打分。智能体基准要求一个系统跨多步完成一项任务,而在权重与分数之间横着一个庞大且带主张的程序:它决定多少代码库内容进入上下文、失败的测试怎么喂回去、工具报错是重试还是抛出、一项任务给几次尝试、工具 schema 长什么样,以及何时停下。这里的每一个决定都会挪动结果,其中若干项挪动的幅度超过相邻两代前沿模型之间的差距。
当大家还都用着差不多的开源脚手架时,这一点同样成立,但可以忍受,因为脚手架是一个共享的常量。变化在于:这个常量变成了一个各家实验室自己掌控、并针对自家权重去调的变量。DeepSeek 自己的更新日志在这一点上坦率得令人欣赏——DeepSWE 的结果出自一个计划稍后发布的内部 harness——而正是这份坦率,让这个案例适合被当成范例而不是指控。多数厂商自报的智能体数字背后都有某种私有脚手架,DeepSeek 特别之处主要在于它说了出来。
由此得到的推论很精确。当一家实验室用一套别人都没有的 harness 报出智能体分数时,这个数字是由系统作者自己发布的系统结果。它可能完全诚实,同时依然无法用于比较,因为读者分不清其中有多少来自模型。这与一个 MMLU 分数在认识论上是不同的对象,却被摆进了同一张表里。
实验室为什么要往里走,以及这为何是必然
三股力量指向同一个方向,而且没有一股是出于恶意。
剩下的分数长在循环里。在一项困难的智能体任务上,得 55 分的模型与得 62 分的模型之间的差距,往往不在知识,而在它被允许从多少个可挽回的错误里挽回过来。改进脚手架比改进权重更便宜地挪动这个数字,而且在预训练收益变平之后,它是唯一还在起作用的杠杆。
后训练与 harness 是共同演化的。如果你用强化学习在工具使用轨迹上训练一个模型,它训练时所处的那个环境就是一个 harness;而部署时最像它的那个 harness,能榨出最多能力。一家针对自家脚手架训练、然后把权重交给另一套脚手架的实验室,等于白送掉了自己花钱买来的一部分东西。这正是面向工具使用的 RL 里描述的那种耦合,只是从产品这一端看过去。
Claude Code 证明了 harness 才是生意。一款终端编码智能体的商业成功——一款价值就在于"围绕着谁都能租到的权重所搭的脚手架"的产品——把 harness 从成本中心重新定义成了客户真正付钱买的东西。一旦有一家实验室证明了这一点,每一家握有有竞争力权重的实验室都有理由造一个,而这正是我们在四款终端编码智能体里梳理过的那条脉络。
DeepSeek 这个案例特别的地方,在于它招募的方向。harness 团队没有闭门造好再发布,而是向开源智能体项目开放内测,三天里拉到 712 个报名。这是在竞逐生态的形状,而不只是在收反馈:一个在发布时框架、编码智能体和记忆工具就已经接好了的 harness,来的时候是一个生态而不是一款产品。它同时意味着,在别人来得及评估它之前,已经有一大批独立项目围着 DeepSeek 的循环调好了自己。
这对"比较"意味着什么
按"对选模型的人而非卖模型的人"要紧的那条轴来比这三种形态。只发权重时,公开的智能体分数弱可复现——脚手架就是报告者当时用的那个,若他点了名,你还能近似地重跑一遍。用独立 harness 时,分数完全可复现,因为这一对的两半都能钉版本,而且脚手架的改进会抬升它支持的每一个模型。而当 harness 归实验室所有且尚未发布时,两条性质都不成立:数字核不了,调优只惠及唯一一份权重。
切换成本在这三种形态之间同样是反转的。独立 harness 让模型近乎可互换——改个端点、重跑评估即可;而一套针对自家权重调过的实验室 harness,会把换模型变成重建整个循环。这不是什么阴谋,而是把脚手架针对某一个训练分布狠调之后必然发生的事。但它确实是一道锁定的梯度,值得在采用之前而不是之后就定价,推理与四款智能体框架那次对比里的一样。
账本另一侧有一项真实的收益,把它一笔勾销是不对的。一家把"自己训练时所用的那套 harness"发出来的实验室,等于把"能从这个模型里榨出最多东西"的那份配置交到了用户手上——上下文策略、重试纪律、以及权重当初就是围着它们成形的那套工具 schema。对那些否则会自己攒一套、并且只做对七成的团队来说,第一方 harness 是一次实打实的能力提升;而对开放权重模型而言,它是"你能跑起来"和"你能跑得好"之间的差别。
如果你正基于这些模型做东西,该怎么办
钉死 harness,换模型。对多数团队的评估方式来说,这是最有用的一项改动:选定一套脚手架,把它的版本与配置钉死,让每一个候选模型都在它里面、在你自己的任务上跑一遍。你要发的就是这个 harness,所以只有它的数字才预测得了你的产品。一个在厂商榜单上排第二、在你循环里排第一的模型就是第一,反过来的情形也一样常见。
把 harness 当作评估记录里带版本的依赖项。你写下的任何结果,都应当带上模型版本、harness 版本,以及产出它的那份配置。缺了这三样,六周后的一次回退就无从归因——这是评估驱动开发里主张的那套纪律,延伸到脚手架上。
把每一个公开的智能体数字都读成一对,并追问缺的是哪一半。两个问题就能办完大半的事:这是哪套 harness 跑出来的,我能不能装上它?如果第二个问题的答案是不能,那么无论这个模型在别处表现如何,这个分数都该放进"有意思,未经核实"那一栏。这条对每一家实验室都适用,包括那些你喜欢其 harness 的。
像给模型迁移做预算一样,给 harness 迁移做预算。采用一套实验室原生的 harness,是比采用一个模型更深的承诺,因为它会把你的工具定义、上下文策略和错误处理都吸收进去。如果你要用,就把工具层藏在一个你自己拥有的接口之后,好让将来那次迁移是一次移植而不是一次重写——与模型弃用与迁移是同一套论证,只是往上挪了一层。
别得出"脚手架不重要"的结论。该学的恰恰是反过来的那条。如果一套 harness 能把智能体分数挪动好几个点,那么此刻你的 harness 正在对你的产品做同一件事,而它多半是你手上最缺乏测量的那个组件。多数团队从来没做过"钉死模型、只改自家上下文策略"这个实验;它很便宜,而且回报通常比上一次换模型还高。
什么才真正能解决这件事
能解决它的规范很小,而且完全在实验室的一念之间:把脚手架与分数一同公布,或者直截了当地说明这个分数无法被独立复现。静态基准好几年前就在这件事上收敛了——没人会不带提示词格式和示例数就报一个 MMLU 数字——而智能体评估只是还没跟上"它的脚手架比一个提示词模板大上一千倍"这个事实。
三件事就够了。在结果里点名 harness 及其版本。公布配置——上下文预算、重试策略、尝试次数、工具 schema——哪怕代码依然闭源。以及,当 harness 尚未发布时,就在写下那个数字的同一行里说明,DeepSeek 做到了,而这已经比多数人做得多。
在这个规范成形之前,担子落在读者身上;而它的实操形态,正是本文里唯一一条不花钱的建议:造一套你信得过的 harness,把它稳住,让模型在里面竞争。这也是唯一一种能回答你真正的那个问题的比较方式——你的问题从来不是"哪个模型最好",而是"在我的循环里、我的任务上、我的预算下,哪个模型最好"。
常见问题
什么是智能体 harness?
它是把模型权重变成一个智能体的那个程序:管理什么进入上下文窗口、定义工具 schema、执行工具调用、把结果与错误喂回去、决定何时重试何时停下,并跨步骤维护记忆。在一个多步基准里,harness 做出了成百上千个模型根本看不到的决定,其中若干项对最终分数的影响超过相邻两代前沿模型之间的差距。
DeepSeek Harness 是什么?
它是 DeepSeek 正在开发的一套智能体框架,覆盖上下文管理、工具调用、文件读写、终端执行、依据测试反馈的自我纠正、记忆与 MCP。面向开源智能体项目的封闭测试于 2026 年 8 月 1 日由 harness 团队负责人崔天翼宣布,据报道三天内报名项目达 712 个。发布日期尚未公布。
为什么 DeepSeek 的 DeepSWE 分数无法复现?
因为它是用 DeepSeek 自家的 harness 跑出来的,而公司的更新日志说该 harness 稍后才会发布。智能体分数是"模型与 harness 这一对"的属性,所以当其中一半拿不到时,第三方既无法重跑这次评估,也无法把模型的贡献与脚手架的贡献分开。DeepSeek 公开说明这一点,比"干脆不提脚手架"这个常见做法要好。
这是否意味着公开的基准分数一文不值?
不是——它意味着智能体分数是系统结果而非模型测量,应当被读作关于一对组合的主张。它们仍然告诉你一些东西:一家实验室报出高分,就证明了它的模型在某种配置下能达到这个水平。它们撑不住的是跨实验室的排名,因为那些运行里没有任何两次共用同一套脚手架。
我该不该采用某家实验室自己的 harness?
它是一次实打实的能力提升——实验室把自家权重当初就是针对其调优的那份配置发了出来——同时也是比采用一个模型更深的承诺,因为它会吸收掉你的工具定义、上下文策略和错误处理。如果你要用,就把工具层藏在一个你自己拥有的接口之后,让日后的迁移是一次移植而不是一次重写。
为我自己的产品该怎么比较模型?
钉死你的 harness,把版本与配置固定下来,让每一个候选模型在它里面、在你所在领域的任务上跑一遍。能预测你产品行为的数字,来自你真正要发布的那个循环;一个在厂商榜单上排第二的模型,在你的循环里可以排第一。
延伸阅读
本站相关:
- 基准全景——智能体基准究竟在测什么,又在哪里失效。
- 评估驱动开发与 CI——把版本钉住,让回退可归因。
- 模式全景——harness 所实现的那些循环形态。
- 四款终端编码智能体——让这件事成为一个产品品类的那些 harness。
- Kimi K3 与开放权重的现实核对——开放模型这道题的另一半。
- 看懂基准测试——怎么给一个自报的数字打折扣。
信息来源:
- China's DeepSeek beefs up agentic AI with 'harness' tests as V4 model jolts Silicon Valley — South China Morning Post
- DeepSeek Harness 封闭测试面向开源 agent-harness 项目的招募帖 — X
- DeepSeek retrained V4-Flash beats its flagship Pro on nine agent benchmarks — Tech Times
- DeepSeek V4-Pro benchmarks and pricing — BenchLM
- SWE-bench——那个标题数字背后的任务集