深度剖析 / 评估智能体

评估智能体

评估智能体的 2026 学科:基准饱和、评判器校准、漂移检测,以及经受住生产接触的评测方法学。

  1. 评判器校准与元评测
    Prometheus 2、JudgeBench、RubricEval;元评测坍缩;85–90% 的人机一致底线;月度重校准节奏。
  2. 2026 年基准全景
    SWE-bench Verified 已饱和(前五仅相差 0.7 分);SWE-bench Pro;把污染当法律威慑;为何 Verified 如今是审计信号,而非排名。
  3. HAL 与异步智能体评测
    Princeton HAL(每解一题的成本 + 5 维可靠性面板);Gaia2(异步环境、写动作核验器、时间约束);为何静态基准漏掉真实部署。
  4. 轨迹与过程评测
    为智能体如何工作打分,而不只看最终答案:结果 vs 轨迹评测;AgentEvals 匹配模式(strict/unordered/subset/superset);基于参考 vs 无参考的 LLM 评判;过程奖励模型的迁移;以及为何对路径做精确匹配会误伤正确的智能体。
  5. 评测驱动开发与 CI 中的回归评测
    把评测作为 CI 门禁而非一次性检查:黄金集作为活资产;用 pass^k 与配对显著性检验应对非确定性;线上 vs 线下、金丝雀与漂移检测;把成本/延迟作为可设门槛的预算;promptfoo、DeepEval、Inspect。
  6. 评测方差与统计功效
    单次运行的智能体分数是一次抽样,不是一次测量:pass@k 与 pass^k 的分别、为何任务间方差意味着加任务胜过加运行次数、在同样预算下把可检测效应砍半的 McNemar 配对设计,以及那条阻止团队在噪声上棘轮式推进的决策规则。
  7. 基准污染与泄漏
    污染属于(模型,基准,日期)这个三元组,而不属于基准:逐字泄漏、解法泄漏与间接泄漏之分,为何智能体基准泄漏的是环境而不只是答案,四个从外部就能跑的检测,以及"公开分数用来筛选、只有截止日之后的数据才用来决定"这条规则。
  8. 评测完整性与打分器博弈
    分数是由「受测智能体够得着的那套软件」产出的:任务层面的奖励作弊、框架被攻陷与跨运行污染,是三种共用一个词的不同失败,而第三种伪造的不是某一次运行,而是整个样本。请在进程之外、从一份不可变的轨迹来打分,删掉运行之间每一块共享的可写面,并把隔离属性与数字并排发布。
  9. 对活体系统做评测
    一场与不属于你的系统发生往来的评测,是一次没有变更管理的部署,而 2026 年 9 月的 Medicare 门户事件就发生在这样一次评测里:请把「绕过了拒绝」判为失败,否则你那些成功轨迹会变成一份鼓励绕行的奖励;然后限制按主机的负载、从一个可归属的出口发起流量,并把请求日志与轨迹关联保留,外加一个「可以去告知」的指定责任人。
  10. 智能体评测中的人类基线
    一个分数在你知道「一个称职的人在同样的任务、同样的时限、同样的工具下、由同一个打分器来评,能得多少」之前,是没有分母的——而对团队们引用的几乎每一个基准,这个数字从来没有被采集过。基线就是那个四元组,打分器会同时把比较往两个方向掰,而 METR 的时间跨度方法是这个领域唯一一份经过校准的答案。然后用两个人日自己做一份,并汇报比值,永远不要只汇报分数。