一个智能体对留出的科学观测的预报水平,与发表该研究的那位科学家大致相当——47.4% 对 48.8%——然后在「它的解释是否说明了究竟发生了什么」这一项上,它拿到 29.4%,那位科学家是 69.7%。同一批运行、同一批任务,相差四十个点。这道劈分,再加上另一个「会改变外壳交出多少方法学帮助」的基准,合起来对你读过的每一个智能体分数提出了一项主张:那是一次在「帮助水平固定在某一档、评分对象已被替你选定」的条件下取得的读数。改动其中任何一项,数字就会挪动几十个点——这意味着你自己那份评测材料里的头条数字,回答的是一个你并没有问出的问题。
一眼概览
2026 年 10 月头几天出现的两篇论文,都瞄着科研工作而非编码,也都把一件基准通常固定住的东西变成了变量。
| 基准 | 形态 | 它把什么变成了变量 | 真正要紧的数字 |
|---|---|---|---|
| CompMat-Bench (arXiv 2610.00636) | 94 项任务,取自近期发表的计算材料学研究 | 给智能体多少方法学指引,与任务长度交叉 | 单任务在完整指引下通过率 66.0–90.4%——两条轴任何一条一动就往下掉 |
| EurekaBench (arXiv 2610.00492) | 26 项经专家核验的长时程任务,横跨六个学科,附带 306 条洞见 | 分数奖励的是一个预测,还是它背后的那个解释 | 预测 47.4% 对人类 48.8%;洞见 29.4% 对人类 69.7% |
你那个基准数字,是一次在某一档指引下取得的读数
CompMat-Bench 有意思的地方在它的设计,而不在它的分数。它从真实发表的研究中取出 94 项任务,预先跑掉昂贵的模拟,使复现出来的输入与结果能充当基准真值,并以固定规则而非 LLM 评判来打分。然后它在四种条件下评测:单任务与多步工作流,各自又分完整指引与削减指引。
第二条轴正是别人都不去改的那一条。每一个主流智能体基准都提供一个固定量的帮助——某种具体程度的任务陈述、某种质量的工具文档、某种预配置程度的环境——然后报出一个数字。帮助是常量,于是它从结果里消失了。CompMat-Bench 把它做成一项处理,而这项处理的效应很大:完整指引下单任务 66.0–90.4% 的通过率,会随工作流变长、指引被撤走而下滑。
请把这读作一项测量性质,而不是一项关于材料科学的发现。如果一个基准的分数对「它交出了多少程序性帮助」敏感,那么两个在某个模型上结论相左的基准,可能只是把帮助档位设在了不同位置;而一张为外壳排名的榜单,排的部分是「它们的作者往任务陈述里写了多少东西」。诚实的计量单位是一条随指引变化的曲线,而不是一个点——而基本上没人报曲线。
47.4 对 48.8,以及 29.4 对 69.7
EurekaBench 打的是另一件事的分。它的 26 项任务各自给出一项真实研究的观测——神经科学、计算机科学、化学、天体物理、地球物理、等离子体物理——并要求智能体发现能解释这些观测的机制。关键在于,这个基准附带了 306 条「一个正确机制理应支撑」的科学洞见,由专家预先列举。所以那个解释不是作为散文被打分的,而是作为一张核对表、对照一份预先登记的「正确答案必须蕴含什么」清单被打分的。
GPT 6 Astra 落在 47.4% 的预测准确率上,人类参考是 48.8%——近到如果按大多数智能体评测会报的那个指标来看,你会称之为齐平然后翻页。而在洞见分上它只拿到 29.4%,由人类发现的机制则是 69.7%。论文的说法是:智能体过度执迷于优化预测准确率,在某些地方甚至超过了人类科学家,同时在推导洞见上远远落后。
这背后的机制并不神秘,也不限于科学。预测准确率是一个信号充裕、近乎可微的目标:智能体可以试、可以对照留出数据检查、可以迭代。而「这个解释是否蕴含正确的后果」几乎不提供逐步信号,无法靠跑一段代码来检查,还奖励一种克制——拒绝去宣称数据并未钉住的机制。任何能花在拟合上的用力都会被花在拟合上。给智能体一个标量去最大化,它就会找到通往它的最便宜那条路——而这正是我们在奖励设计与奖励黑客里早已知晓的那个问题,只不过这一次它出现在评测里,而不是训练里。
为什么更好的外壳补不上这道落差
一个智能体基准出来分数偏低时,人的条件反射是去怪脚手架:更好的工具文档、更多重试、一个规划器、一轮核验。这两篇论文里有两个细节堵住了这条退路。
第一,CompMat-Bench 报告说余下的失败大多是科学推理错误,而不是软件错误。智能体不是没驱动好模拟器,而是选错了物理。外壳上的工作挪动的是软件类失败,推理类失败则原地不动——所以你靠改进外壳撞到的那个天花板,比你想补的那道落差要低。
第二,CompMat-Bench 的评分是对照复现基准真值、按固定规则进行的,没有 LLM 评判;而 EurekaBench 的洞见评分是对照一份专家列举的清单跑的。这拿掉了那句惯常的安慰——「评判模型误解了一个正确答案」。一个免评判模型的评分器没法被一份自信的报告说服,而这件事比听起来更重要:一个既产出结果、又产出关于结果的叙述的智能体,同时是生成者与辩护者,而读着这段叙述的 LLM 评判打的有一部分是辩护的分。我们在生成者—核验者落差里写过这种不对称;这两个基准正是「把它设计掉」之后的样子。
有一项真实的局限值得说明。两篇论文评测的智能体配置都很少——CompMat-Bench 报出的那个区间来自三个 LLM——而且所处领域都是「已有发表的基准真值」的领域,这会偏向那些当初可发表、因而本就可解的工作。两者都不是关于智能体能力的普遍论断。而那个方法学要点并不因这项局限而受损,因为它讲的是「这次测量对什么敏感」,而不是任何特定模型的位置。
帮助有四条通道,而你的评测固定住了其中三条
这样摊开来看,这两篇论文改动的是四条通道中的第二条与第四条。另外两条——任务如何陈述、环境被预先安排到何种程度——在几乎所有已发表的智能体评测里都仍是常量,包括这两篇。这值得知道,因为它为「任何单一分数能意味着什么」划了界;也因为第二条与第四条,恰是你这周就能在自家评测套件里便宜地改动的两条。
由此引出三项改动,按它要花你多少成本排序。
- 在每一次运行上记录指引档位,并在其中两档上汇报。显式定义档位——只给目标、目标加方法族、目标加参数、完整流程——然后在最高档与最低档各跑一遍你的套件。这两个数字之间的差距告诉你,你的结果里有多少是智能体、有多少是你的提示词。这是大多数团队没在采集的、信息量最大的那一个数字。
- 把「你在给什么打分」写下来。结果,还是解释。如果两者都重要,就都打分,并让它们留在各自的轴上,因为一个混合出来的单一分数会让模型只买下容易的那一半。这是结果评估与轨迹评估那个问题的更锋利版本:智能体可以答对而说不出为什么,而这算不算通过,是一个你应当有意去做的产品决策。
- 预先把蕴含列举出来。EurekaBench 那 306 条洞见是其设计中昂贵、枯燥而决定性的那一部分。换到你自己的领域,这是每个场景与一位领域专家花一个下午,而它能把「智能体给了一个看起来说得通的解释」换成一个你能拿去做回归的计数。没有它,你打分的对象就是叙述,而这正是语言模型最擅长产出、也最不该被据以评分的东西。
什么时候该看哪一个
| 如果你要判断的是…… | 去读 CompMat-Bench 的设计 | 去读 EurekaBench 的设计 |
|---|---|---|
| 你的智能体能否可靠地执行一个有据可查的流程 | 要——预先跑好的基准真值、规则评分、指引保持在高档 | 不要——问错了问题 |
| 你那套演示里到底是智能体还是你的提示词在起作用 | 要——四条件交叉就是它的全部方法 | 部分有用 |
| 一个你无法解释的答案是否可以接受 | 不要 | 要——它测的正是这道劈分 |
| 在自家评测里该不该信任一个 LLM 评判 | 要——它表明「基于规则的替代方案」是够得着的 | 要——用预先列举的蕴含取代观感 |
| 某个模型相对其他模型排第几 | 不要——三个配置、一个领域 | 不要——26 项任务 |
常见问题
一个预测准确率 47.4% 的智能体真的胜过了人类科学家吗?
按那个数字没有——47.4% 略低于 48.8% 的人类参考,这是齐平而不是胜出。EurekaBench 更宽的说法是:智能体过度优化预测准确率,并在某些地方于该项上超过人类科学家;而起支撑作用的结果是那条轴与洞见轴之间的解耦,而不是任何一条轴上的胜利。
「扣住指引不给」不就是把基准人为做难吗?
在生产里,不是——你应当把自己诚实拥有的全部帮助都给智能体。在评测里,这是把智能体的贡献与你的贡献分开的唯一办法。一个在「把已发表的方法学全文粘进提示词」的条件下测出的通过率,讲的是那份方法学。
这些结果对编码智能体有什么意义吗?
方法学有。指引这条轴存在于任何智能体评测里——一项 SWE 式任务,配上复现脚本、一个失败的测试和一条提示,与只给一个 issue 标题,是两种不同的条件,而两者都会被报成同一个分数。领域推理那条发现不可迁移;那一条讲的是材料物理。
我该停用 LLM 评判吗?
不该,但你该知道自己失去了什么。在基准真值可以被复现、并可按规则比较的地方,规则胜过评判——而这两篇论文表明,科学评测里属于这一类的比例相当大。在你保留评判模型的地方,请在一份标注集上校准它,并在评判模型本身变更时重新核对一致率。
这件事最小的可执行版本是什么?
在你自己的套件里取十项任务,给每一项都写一份精简的任务陈述和一份完整规格的任务陈述,两种都跑,再把两个通过率并排放。那一张表就是这项发现在你领域里的版本,代价是一天的工作。
延伸阅读
本站相关:
- 科学发现智能体——该怎么照这个造,包括申报指引档位与预先登记洞见清单。
- 智能体评测中的人类基线——为什么只有双方拿到同样帮助时,人类比较才有意义。
- 2026 年的基准全景——主流智能体基准究竟在测什么。
- 结果评估与轨迹评估——有意地选定被评分的对象。
- 读懂基准——如何给一个头条分数打折的简版。
原始来源:
- CompMat-Bench: Benchmarking AI Agents for Computational Materials Science(arXiv 2610.00636)
- EurekaBench: Measuring Agentic Ability to Discover New Scientific Insights(arXiv 2610.00492)