AI 博客

它追平了科学家,却没抓住要点

2026 年 10 月初发布到 arXiv 的两个基准,把其他所有智能体评测都当成常量的两件事变成了变量——外壳给了多少指引,以及分数奖励的是一个预测还是一个解释。两者都能把数字挪动几十个点;其中一个报出:智能体的预测准确率 47.4%,人类科学家 48.8%,而在该任务真正围绕的那条洞见上,是 29.4% 对 69.7%。

作者 智能体 AI 维基 23 分钟读完

一个智能体对留出的科学观测的预报水平,与发表该研究的那位科学家大致相当——47.4% 对 48.8%——然后在「它的解释是否说明了究竟发生了什么」这一项上,它拿到 29.4%,那位科学家是 69.7%。同一批运行、同一批任务,相差四十个点。这道劈分,再加上另一个「会改变外壳交出多少方法学帮助」的基准,合起来对你读过的每一个智能体分数提出了一项主张:那是一次在「帮助水平固定在某一档、评分对象已被替你选定」的条件下取得的读数。改动其中任何一项,数字就会挪动几十个点——这意味着你自己那份评测材料里的头条数字,回答的是一个你并没有问出的问题。

一眼概览

2026 年 10 月头几天出现的两篇论文,都瞄着科研工作而非编码,也都把一件基准通常固定住的东西变成了变量。

基准形态它把什么变成了变量真正要紧的数字
CompMat-Bench (arXiv 2610.00636) 94 项任务,取自近期发表的计算材料学研究 给智能体多少方法学指引,与任务长度交叉 单任务在完整指引下通过率 66.0–90.4%——两条轴任何一条一动就往下掉
EurekaBench (arXiv 2610.00492) 26 项经专家核验的长时程任务,横跨六个学科,附带 306 条洞见 分数奖励的是一个预测,还是它背后的那个解释 预测 47.4% 对人类 48.8%;洞见 29.4% 对人类 69.7%
CompMat-Bench evaluation conditions A two-by-two grid of evaluation conditions. Rows are single tasks and multi-step workflows; columns are full and reduced methodological guidance. The single-task, full-guidance cell is the only one carrying the published headline range of 66.0 to 90.4 percent pass rate; pass rates decline toward the workflow and reduced-guidance cells. 94 tasks, four conditions — the headline number lives in one cell FULL GUIDANCE REDUCED GUIDANCE SINGLE TASK WORKFLOW 66.0–90.4% published range, three LLMs lower method withheld lower steps compound lowest both withdrawn Most remaining failures are scientific-reasoning errors, not software errors — grading is rule-based, with no LLM judge.
已发表的那个区间属于四格中的一格。一个基准里装了四个,而只有最轻松那个角被引用。

你那个基准数字,是一次在某一档指引下取得的读数

CompMat-Bench 有意思的地方在它的设计,而不在它的分数。它从真实发表的研究中取出 94 项任务,预先跑掉昂贵的模拟,使复现出来的输入与结果能充当基准真值,并以固定规则而非 LLM 评判来打分。然后它在四种条件下评测:单任务与多步工作流,各自又分完整指引与削减指引。

第二条轴正是别人都不去改的那一条。每一个主流智能体基准都提供一个固定量的帮助——某种具体程度的任务陈述、某种质量的工具文档、某种预配置程度的环境——然后报出一个数字。帮助是常量,于是它从结果里消失了。CompMat-Bench 把它做成一项处理,而这项处理的效应很大:完整指引下单任务 66.0–90.4% 的通过率,会随工作流变长、指引被撤走而下滑。

请把这读作一项测量性质,而不是一项关于材料科学的发现。如果一个基准的分数对「它交出了多少程序性帮助」敏感,那么两个在某个模型上结论相左的基准,可能只是把帮助档位设在了不同位置;而一张为外壳排名的榜单,排的部分是「它们的作者往任务陈述里写了多少东西」。诚实的计量单位是一条随指引变化的曲线,而不是一个点——而基本上没人报曲线。

47.4 对 48.8,以及 29.4 对 69.7

EurekaBench: predictive accuracy against insight score Grouped bars comparing an agent and a human reference on two axes. On predictive accuracy the agent scores 47.4 percent against the human 48.8 percent, near parity. On the scientific-insight score the agent scores 29.4 percent against the human 69.7 percent, a gap of more than forty points. Score (%), agent vs human reference 20 40 60 80 100 Predictive accuracy agent 47.4 human 48.8 Scientific-insight score agent 29.4 human 69.7 Same runs, same tasks — 40.3 points apart on the axis the task was built around.
在好打分的那条轴上几乎齐平;在该任务真正围绕的那条轴上则是一个四十点的坑。

EurekaBench 打的是另一件事的分。它的 26 项任务各自给出一项真实研究的观测——神经科学、计算机科学、化学、天体物理、地球物理、等离子体物理——并要求智能体发现能解释这些观测的机制。关键在于,这个基准附带了 306 条「一个正确机制理应支撑」的科学洞见,由专家预先列举。所以那个解释不是作为散文被打分的,而是作为一张核对表、对照一份预先登记的「正确答案必须蕴含什么」清单被打分的。

GPT 6 Astra 落在 47.4% 的预测准确率上,人类参考是 48.8%——近到如果按大多数智能体评测会报的那个指标来看,你会称之为齐平然后翻页。而在洞见分上它只拿到 29.4%,由人类发现的机制则是 69.7%。论文的说法是:智能体过度执迷于优化预测准确率,在某些地方甚至超过了人类科学家,同时在推导洞见上远远落后。

这背后的机制并不神秘,也不限于科学。预测准确率是一个信号充裕、近乎可微的目标:智能体可以试、可以对照留出数据检查、可以迭代。而「这个解释是否蕴含正确的后果」几乎不提供逐步信号,无法靠跑一段代码来检查,还奖励一种克制——拒绝去宣称数据并未钉住的机制。任何能花在拟合上的用力都会被花在拟合上。给智能体一个标量去最大化,它就会找到通往它的最便宜那条路——而这正是我们在奖励设计与奖励黑客里早已知晓的那个问题,只不过这一次它出现在评测里,而不是训练里。

为什么更好的外壳补不上这道落差

一个智能体基准出来分数偏低时,人的条件反射是去怪脚手架:更好的工具文档、更多重试、一个规划器、一轮核验。这两篇论文里有两个细节堵住了这条退路。

第一,CompMat-Bench 报告说余下的失败大多是科学推理错误,而不是软件错误。智能体不是没驱动好模拟器,而是选错了物理。外壳上的工作挪动的是软件类失败,推理类失败则原地不动——所以你靠改进外壳撞到的那个天花板,比你想补的那道落差要低。

第二,CompMat-Bench 的评分是对照复现基准真值、按固定规则进行的,没有 LLM 评判;而 EurekaBench 的洞见评分是对照一份专家列举的清单跑的。这拿掉了那句惯常的安慰——「评判模型误解了一个正确答案」。一个免评判模型的评分器没法被一份自信的报告说服,而这件事比听起来更重要:一个既产出结果、又产出关于结果的叙述的智能体,同时是生成者与辩护者,而读着这段叙述的 LLM 评判打的有一部分是辩护的分。我们在生成者—核验者落差里写过这种不对称;这两个基准正是「把它设计掉」之后的样子。

有一项真实的局限值得说明。两篇论文评测的智能体配置都很少——CompMat-Bench 报出的那个区间来自三个 LLM——而且所处领域都是「已有发表的基准真值」的领域,这会偏向那些当初可发表、因而本就可解的工作。两者都不是关于智能体能力的普遍论断。而那个方法学要点并不因这项局限而受损,因为它讲的是「这次测量对什么敏感」,而不是任何特定模型的位置。

帮助有四条通道,而你的评测固定住了其中三条

Where guidance enters an agent evaluation A diagram of four channels through which help reaches an agent during an evaluation: the task statement, the method specification, the tool and environment scaffolding, and the grader's tolerance. All four feed the agent loop, which produces a run that is scored. The diagram marks which channels a conventional benchmark holds fixed and which the two new benchmarks vary. FOUR CHANNELS OF HELP Task statement what counts as done usually fixed Method specification parameters, procedure, hints CompMat-Bench varies this Tools & environment pre-run results, retries, limits usually fixed What the grader rewards prediction, or explanation EurekaBench splits this Agent loop plan, call tools, read results, write Prediction checkable against held-out data Explanation checkable against listed insights A single reported score is a reading taken with all four channels held at one setting. Move the second channel and the number moves; split the fourth and one score becomes two that disagree.
帮助经由四条通道抵达。一个孤立报出的分数把这四条都固定在某一档,然后忘了自己做过这件事。

这样摊开来看,这两篇论文改动的是四条通道中的第二条与第四条。另外两条——任务如何陈述、环境被预先安排到何种程度——在几乎所有已发表的智能体评测里都仍是常量,包括这两篇。这值得知道,因为它为「任何单一分数能意味着什么」划了界;也因为第二条与第四条,恰是你这周就能在自家评测套件里便宜地改动的两条。

由此引出三项改动,按它要花你多少成本排序。

  • 在每一次运行上记录指引档位,并在其中两档上汇报。显式定义档位——只给目标、目标加方法族、目标加参数、完整流程——然后在最高档与最低档各跑一遍你的套件。这两个数字之间的差距告诉你,你的结果里有多少是智能体、有多少是你的提示词。这是大多数团队没在采集的、信息量最大的那一个数字。
  • 把「你在给什么打分」写下来。结果,还是解释。如果两者都重要,就都打分,并让它们留在各自的轴上,因为一个混合出来的单一分数会让模型只买下容易的那一半。这是结果评估与轨迹评估那个问题的更锋利版本:智能体可以答对而说不出为什么,而这算不算通过,是一个你应当有意去做的产品决策。
  • 预先把蕴含列举出来。EurekaBench 那 306 条洞见是其设计中昂贵、枯燥而决定性的那一部分。换到你自己的领域,这是每个场景与一位领域专家花一个下午,而它能把「智能体给了一个看起来说得通的解释」换成一个你能拿去做回归的计数。没有它,你打分的对象就是叙述,而这正是语言模型最擅长产出、也最不该被据以评分的东西。

什么时候该看哪一个

如果你要判断的是……去读 CompMat-Bench 的设计去读 EurekaBench 的设计
你的智能体能否可靠地执行一个有据可查的流程要——预先跑好的基准真值、规则评分、指引保持在高档不要——问错了问题
你那套演示里到底是智能体还是你的提示词在起作用要——四条件交叉就是它的全部方法部分有用
一个你无法解释的答案是否可以接受不要要——它测的正是这道劈分
在自家评测里该不该信任一个 LLM 评判要——它表明「基于规则的替代方案」是够得着的要——用预先列举的蕴含取代观感
某个模型相对其他模型排第几不要——三个配置、一个领域不要——26 项任务

常见问题

一个预测准确率 47.4% 的智能体真的胜过了人类科学家吗?

按那个数字没有——47.4% 略低于 48.8% 的人类参考,这是齐平而不是胜出。EurekaBench 更宽的说法是:智能体过度优化预测准确率,并在某些地方于该项上超过人类科学家;而起支撑作用的结果是那条轴与洞见轴之间的解耦,而不是任何一条轴上的胜利。

「扣住指引不给」不就是把基准人为做难吗?

在生产里,不是——你应当把自己诚实拥有的全部帮助都给智能体。在评测里,这是把智能体的贡献与你的贡献分开的唯一办法。一个在「把已发表的方法学全文粘进提示词」的条件下测出的通过率,讲的是那份方法学。

这些结果对编码智能体有什么意义吗?

方法学有。指引这条轴存在于任何智能体评测里——一项 SWE 式任务,配上复现脚本、一个失败的测试和一条提示,与只给一个 issue 标题,是两种不同的条件,而两者都会被报成同一个分数。领域推理那条发现不可迁移;那一条讲的是材料物理。

我该停用 LLM 评判吗?

不该,但你该知道自己失去了什么。在基准真值可以被复现、并可按规则比较的地方,规则胜过评判——而这两篇论文表明,科学评测里属于这一类的比例相当大。在你保留评判模型的地方,请在一份标注集上校准它,并在评判模型本身变更时重新核对一致率。

这件事最小的可执行版本是什么?

在你自己的套件里取十项任务,给每一项都写一份精简的任务陈述和一份完整规格的任务陈述,两种都跑,再把两个通过率并排放。那一张表就是这项发现在你领域里的版本,代价是一天的工作。

延伸阅读

本站相关:

原始来源: