科学发现智能体。
2026 年 10 月初发布到 arXiv 的两个基准,在你动笔写代码之前就把设计问题定了下来:在 EurekaBench 上,一个智能体的预测准确率达到 47.4%,而人类科学家是 48.8%;可在「该任务真正围绕的那条洞见」上它只拿到 29.4%,人类是 69.7%。要是你照着「它本来就能赢的那个指标」去造这个智能体,你交付的会是一台以专家级准确率产出无从解释的相关性的机器——而这恰恰是科学家既用不了、也发不出去的那一种输出。解释才是产品,所以要让解释成为被评分的那件东西;并且要把「你给了多少方法学指引」做成一个显式记录的参数,而不是提示词里的一桩意外。
三件看起来是一件的活,而它们绝不该是一个智能体。
「一个做科研的智能体」把三件任务捆在了一起,它们的成功标准不同、核验方式不同、难度也天差地别。捆在一起是这类项目标志性的第一个错误,因为那意味着每一次失败都无法归因:你分不清智能体是把物理搞错了,还是把文件格式搞错了。
- 执行一个已知方法。为某个流程有据可查的模拟或仪器准备输入、把它跑起来、收集输出。核验是精确的——输入要么与参考一致,要么不一致。这在很大程度上是一个驱动工具的问题,也是今天真能跑通的那一部分。
- 分析给定的输出。拿已经存在的结果,抽取出研究所要的那个量。只要你有复现出来的基准真值,核验仍然是机械的。当下可用价值大多就落在这里。
- 提出一个机制。看着观测数据,产出一个能推广的解释。核验是一种判断:这个解释是否支撑该现象实际具有的那些洞见——而这正是智能体落后最远的那件活,落后的倍数已被开头那两个基准数字说清楚了。
在尝试第三件之前,先把前两件作为独立的智能体、带独立的评测交付出去。这个次序不是保守:而是第三件活的失败只有在前两件已知良好时才可读,而捆在一起的智能体恰好藏住的就是这个。
把贵的那一步预先跑掉;用规则评分,不要用评判模型。
人的本能是给智能体一份算力额度,让它自己去跑模拟。那会让每一次评测都花掉真金白银与真实工时,于是你就很少跑它,于是你永远不知道某次改动到底有没有用。CompMat-Bench——94 项任务,取自近期发表的计算材料学研究——走的是另一条路:昂贵的模拟是预先跑好的,复现出来的输入与结果成为基准真值,而评分用的是固定规则而非 LLM 评判。请在你自己的外壳里照抄这个形状。
# Two harness shapes for the same agent LIVE COMPUTE agent submits jobs, waits, reads results eval cost hours + real cluster spend per run grading whatever the agent says it found consequence you run the eval monthly and fly blind between PRE-RUN GROUND TRUTH outputs already computed and stored eval cost minutes, repeatable, parallel grading fixed rules against reproduced values consequence you can gate a prompt change on it # What this buys beyond speed a rule-graded score cannot be talked into agreeing with the agent (an LLM judge reading the agent's own narrative can, and will)
把实时算力留给那一小批必须是真的端到端运行,并把它当作一项单独立预算、单独审批的能力——提交一份计算作业是一个昂贵、缓慢、对外可见的副作用,这把它放进了与任何其他不可逆工具调用同一个类别。免评判模型的评分之所以重要还有第二个原因:一个自己撰写「我发现了什么」叙述的智能体,既是生成者又是说服者,而读着这段叙述的 LLM 评判打的是文笔的分。参见生成者—核验者落差,以及用 LLM 评判智能体讲评判模型到底在什么情况下站得住。
把指引做成你设定的参数,而不是你不知不觉养成的习惯。
这一步把「可测量的发现智能体」与「演示」区分开来。CompMat-Bench 在四种条件下评测——单任务与多步工作流,各自又分完整指引与削减指引——而在完整指引下单任务 66.0–90.4% 的通过率,会随着工作流变长、指引被撤走而一路滑落。余下的失败大多是科学推理错误而非软件错误,而这正是应当改变你造法的那条发现:更好的外壳并不能补上这道落差。
所以请显式定义指引档位,把档位记录在每一次运行上,并且绝不允许提示词在档位之间无声漂移。
# Guidance levels, declared per task and logged per run L0 goal only "explain the anomaly in this dataset" L1 + method family "use DFT"; no parameters L2 + parameters functional, cutoffs, convergence criteria L3 + full procedure the published methods section, verbatim # The rule that keeps the number honest a result reported without its guidance level is not a result L3 pass rate is a statement about your prompt L0 pass rate is a statement about the agent
有两个实际后果。在生产里,跑在「诚实前提下的最高指引档位」上——你要的是活儿干成,而故意扣着指引不给只是自我设限。在评测里,要在多个档位上各跑一遍并报出曲线,因为 L3 上的一个孤立数字讲的是你那份方法学写得有多好。同一条区分也出现在智能体评测中的人类基线里:只有当双方拿到同样的帮助时,这个比较才有意义。
把解释与预测分开打分。
EurekaBench 的设计把这道劈分做实了:26 项经专家核验的长时程任务,横跨神经科学、计算机科学、化学、天体物理、地球物理与等离子体物理,并附带 306 条「一个正确机制理应支撑」的科学洞见。它最醒目的结果是解耦。在同一批运行里,预测准确率与人类齐平,洞见却远不到人类水平的一半。一个在留出观测上优化损失的智能体会直奔那个墙角,因为「拟合」正是梯度形状的用力最擅长的事。
请造出两个分数,并在看板上让它们保持分开。
- 预测分——它能否预报留出的观测?机械、便宜,而且如果你让它当唯一的数字,你的智能体就会去优化它。
- 洞见分——所提出的机制,是否蕴含领域专家认定该现象支撑的那些具体论断?请像 EurekaBench 那样把这些论断预先列举出来,让打分成为对照一份预先登记清单的核对表,而不是对那篇报告的一种观感。
- 可证伪性——这个解释是否给出了一个「若它为假就会落空」的预测?一个拟合完美却不可证伪的机制,是此类系统标志性的失败输出,而它恰恰很容易被识别,因为它什么都不禁止。
预先登记洞见清单是本页上最便宜的高杠杆动作。它每个现象花掉一位领域专家一个下午,却能把「智能体写了一段看起来说得通的解释」换成一个计数。没有它,你打分的对象就是叙述,而叙述正是 LLM 最擅长产出、也最不该被据以评分的东西。
溯源,否则结果不算结果。
一项科学论断值多少,完全取决于它的审计链路值多少,而智能体恰是这条流水线上唯一没有自己记忆的环节。智能体报出的每一个数字,都必须能自动地往回追到产出它的那个东西,而不需要去要求智能体记住。
- 输入按内容哈希引用。每一份数据集、输入文件与参数集都按摘要引用,而不是按文件名——文件名会被覆盖,而一个归因到
run_final_v2.dat的结果等于谁都没归到。这和固定与验证是同一套纪律。 - 每一步记下代码与环境版本。求解器版本、各库版本、随机种子。科学软件会在小版本之间改掉默认值,而一个说不出自己求解器版本的结果既无法复现也无从辩护。
- 分析以代码形式存在,而不是以对话形式。智能体应当产出一份能生成该图的脚本,而该图应当由你的外壳运行这份脚本重新生成——而不是从对话记录里粘出来。参见Notebook 与数据科学智能体,那一页的全部主题就是「智能体报告了什么」与「重跑出来是什么」之间的同一道落差。
- 非确定性要申报,而不是被撞见。采样、并行归约与 GPU 非确定性都会动到末几位数字;请把你比较时所用的容差写明,正如可复现性与确定性所述。
要守住这条线:没有这条链路的论断不许离开系统,哪怕它是对的。放松它的代价不是一篇错论文;而是事后没人能把你对的结果与错的结果分开。
人坐在哪里,以及今年你真能交付什么。
把人放在智能体最弱、而弄错代价最高的那两道边界上:决定什么问题值得问,以及判断一个解释是否算得上解释。中间的部分——准备输入、驱动工具、抽取量、生成图、写出方法学的初稿——智能体配得上它的位置。
# A shippable scope, by job (Step 1) and guidance level (Step 3) execute known method L2–L3 autonomous, rule-graded, high volume analyse given outputs L1–L2 autonomous with provenance gate propose a mechanism L0–L1 drafts only, expert scores the insight # The metric to put on the wall not "discoveries made" expert-accepted insights per expert review-hour (and the denominator is the one that decides whether this is worth it)
那个分母是这整类智能体诚实的计量单位。一个每小时生成十二条看起来说得通的机制、却要让一位科学家花一天来分拣的系统,是把活儿挪了个地方,而不是把活儿干了——这与别处那笔人工复核成本的算术是同一笔。请从第一周就开始计量复核工时,别等演示把谁说服成「吞吐量就是目标」。
就从这里开始,按这个顺序:在你的领域里挑一篇已发表的研究,复现它的输入与结果并冻结为基准真值,写出基于规则的评分器,然后在同一项任务上分别以 L3 与 L0 跑一遍你的智能体。这两个数字之间的差距,是你这一季度能做的信息量最大的一次测量——它告诉你,当下这套演示里有多少是智能体、有多少是你。如果 L0 那个数字接近零,那你手上是一个执行型智能体,这本身是个真有用的产品;只是别把它当发现型智能体交付出去。
延伸阅读:研究智能体讲面向文献而非实验的工作,轨迹与过程评估讲如何给路径而不是答案打分,任务时程讲为什么通过率总是在多步条件下掉下去。