SWE-bench Verified 已饱和——前五仅相差 0.7 分——领域转向了 SWE-bench Pro、HAL、Gaia2 与 tau2-bench;Verified 如今是审计信号,不是排名。
SWE-bench Verified 榜首五个模型仅相差 0.7 分,三家 Anthropic 条目在 93–95% 区间独走。榜单不再区分。领域转向 SWE-bench Pro(顶端约 59%)、Gaia2(最佳 pass@1 约 42%)、带 Telecom 的 tau2-bench,以及 Princeton 的 HAL(按"每解决一题的成本"加 5 维可靠性面板)。2026 年读智能体基准头条,必须知道每条头条用的是哪一份基准、饱和长什么样。这篇就是那张地图。
SWE-bench Verified 的饱和。
SWE-bench Verified 是 2024–2025 年打破"智能体头条纪律"的那份基准——从真实 GitHub issue 里精选的子集,"补丁能否让测试通过"的评分毫不含糊。它奏效的时间刚好长到让前沿实验室集中攻它。到 2026 年年中,榜首五个条目相互相差不到 0.7 分,三家 Anthropic 条目在 93.9–95.5% 区间独走,其余榜单挤在紧下方。前五之差小于一次提交的重跑噪声,这样的基准不是在排序,而是在公示"并列"。
2026 年读 Verified 的正确姿势,是 reading-benchmarks 所主张的:把它当审计信号,不是排行榜。一个在 Verified 上落到 45% 的模型告诉你一些东西(它连基本形式都做不到);一个 94% 对 93.5% 的模型什么可执行的信息都没告诉你。这个名次差小于任何一次评测运行的置信区间。榜单顶部按模型家族归因的问题因"Anthropic 独走"模式而更复杂——这既是纯能力的方向性证据、也是"对基准熟悉"的方向性证据;任何 2026 年放 Verified 榜单的幻灯片都欠一条这样的注脚。
SWE-bench Pro。
SWE-bench Pro 是 Scale AI 于 2026 年初推出的继任者,之所以出现,恰恰是因为上文所述的饱和。Pro 通过从更难的真实 issue 分布采样(更长的补丁、更多跨文件协调、更多集成测试依赖),并把评分收紧(多测试文件断言、编译通过不给部分分),把难度上限抬起来。Pro 榜首约 59%(GPT-5.4-xHigh),中位前沿模型在 40 出头。这是"还有可动空间"的基准。
Pro 另一件要紧的事,是把污染当法律威慑,而不是卫生问题。测试样本取自"未经归属就禁止用作训练数据"的许可证下的仓库;基准的公开立场是"在 Pro 样本上训练的模型就是在发布许可证违约"。这是 2026 年中期新基准的常见模式:不再是"我们希望你别拿这个训练",而是"拿这个训练会留下能挺过你法务审阅的书面记录"。规模化的效果尚未验证,但激励梯度指向此。
Gaia2 与异步智能体评测。
Gaia2 度量的是 Verified 与 Pro 无能为力的事:智能体两步之间世界发生变化时会怎样。任务被安置在异步环境里——底层状态(文件、工单、日历、外部服务)按自己的节奏变动,同时智能体在做规划——要成功,就要求它察觉、适配,有时还要撤销自己之前的动作。最佳 pass@1 约 42%(GPT-5 high);多数前沿模型在 25–35% 区间。较低的天花板是诚实的:静态基准奖励"可解谜题的形状",而真实部署不会递给你一份静态谜题。
Gaia2 里值得点名的创新是"写动作核验器"(write-action verifier)。智能体每一次写动作(建文件、关工单、调外部 API)都由一个"活在智能体上下文之外、无法被话术绕过"的任务专用核验器检查。核验器知道环境的时间约束("这个动作在 t=0 有效,但在 t=30 无效,因为底层工单被另一位角色关掉了"),这正是让异步设定可评分的关键。RAG 评测一文就"断言侧核验"讲过相关观点;Gaia2 把它推到了"多数智能体 bug 实际发生的动作层"。
tau2-bench。
tau2-bench 是 Sierra 对多轮客服基准的迭代,值得读的那块是 Telecom 子集。任务是带工具使用、策略遵循与语音变体的客服工作流;评分分三条:结果(工单是否解决)、策略合规(是否按升级规则)、成本(用几个回合、几次工具调用完成)。tau2 抓到而 SWE-bench 抓不到的,是"表面任务解决但违反策略,而只有策略感知的评分者能察觉"这类失败——在每一次生产部署里都会冒头、而所有代码类榜单里都不会。
2026 版加了 Telecom 与语音模式,正因为客服工作负载是当下企业智能体落地最深的地方,而更早的子集偏向"面向代码优化模型更容易的技术支持流"。Telecom 子集里,前沿模型的排序与 SWE-bench Pro 分歧最大,因为"策略遵循"和"结果 vs 合规"取舍与"代码能力"并不强相关。
HAL 与每解一题的成本。
Princeton 的整体智能体榜(HAL)补上了其他四份基准都缺的一块:一套同时报告"每解一题的成本"与"通过率"的评测框架,并在任务分数旁附一份五维可靠性面板(一致性、可预测性、鲁棒性、安全性、自我认知)。HAL 汇总九份底层基准的结果,让一个模型拿到"组合数字"而不是单一坐标轴上的一个排名,而"每解一题的成本"把一切拉回工程团队能真正据此规划的美元数字。
{
"model": "claude-opus-4.7",
"harness_version": "hal-2026.03",
"cost_per_solve_usd": 1.42,
"pass_at_1_mean": 0.61,
"reliability": {
"consistency": 0.88,
"predictability": 0.79,
"robustness": 0.71,
"safety": 0.94,
"self_awareness": 0.55
}
}
上面这份报告形状值得内化。一个智能体的单个通过率数字是方向性的;"$X 成本下的通过率"是可规划的;再叠一份可靠性面板,就能把"每次输出都一样"(高一致性、低自我认知)与"错的时候能察觉"(中一致性、高自我认知)区分开,两者是完全不同的生产属性,被单一数字掩盖。评判器校准一文就评判器分数讲了同样的话;HAL 把这套纪律推进到任务侧基准。
把污染当法律威慑。
每一份现代基准都在悄悄重建自己的"防污染叙事",2026 年的模式是"用许可证"而不是"用混淆"。2025 年前的做法("藏好测试集,希望模型训练方不去爬")在每一个被尝试的规模上都失败了;前沿模型训练方有算力爬到任何可达内容、有动机这么做。2026 的做法是给底层样本套上非宽松许可证,让"训了这些"变成一次"能被写进训练方 SBOM/数据溯源记录"的书面违约。它不是技术防御,而是法律防御;法律防御在技术防御失守的边际上起作用。
2026 agent benchmark headlines — snapshot
----------------------------------------------
SWE-bench Verified top-5 within 0.7 pts audit signal, not ranking
SWE-bench Pro top ~59% (GPT-5.4) harder distribution, tighter grader
Gaia2 best pass@1 ~42% async env, write-action verifiers
tau2-bench Telecom mixed by policy dim policy compliance + outcome + cost
HAL (Princeton) $/solve + 5-dim rel. portfolio across 9 benchmarks
----------------------------------------------
Contamination posture: licensing-based deterrent
2026 年读基准头条的两条要点。第一,先说出这条头条用了哪一份基准,再决定信不信排名;如果答案是 Verified,就把排名降格为审计信号。第二,问"每解一题的成本"数字;若未公开,就假定"领跑"的那款模型价格是最近对手的两到四倍——那是 Verified 榜首 Anthropic 独走条目里的众数模式。没有成本坐标轴的排名,是采购团队用不了的排名;一份不公开成本的基准文化,是"当前榜单的价值比看上去小得多"的文化。