深度剖析 / 评估智能体
评估智能体
评估智能体的 2026 学科:基准饱和、评判器校准、漂移检测,以及经受住生产接触的评测方法学。
- 评判器校准与元评测Prometheus 2、JudgeBench、RubricEval;元评测坍缩;85–90% 的人机一致底线;月度重校准节奏。
- 2026 年基准全景SWE-bench Verified 已饱和(前五仅相差 0.7 分);SWE-bench Pro;把污染当法律威慑;为何 Verified 如今是审计信号,而非排名。
- HAL 与异步智能体评测Princeton HAL(每解一题的成本 + 5 维可靠性面板);Gaia2(异步环境、写动作核验器、时间约束);为何静态基准漏掉真实部署。
- 轨迹与过程评测为智能体如何工作打分,而不只看最终答案:结果 vs 轨迹评测;AgentEvals 匹配模式(strict/unordered/subset/superset);基于参考 vs 无参考的 LLM 评判;过程奖励模型的迁移;以及为何对路径做精确匹配会误伤正确的智能体。
- 评测驱动开发与 CI 中的回归评测把评测作为 CI 门禁而非一次性检查:黄金集作为活资产;用 pass^k 与配对显著性检验应对非确定性;线上 vs 线下、金丝雀与漂移检测;把成本/延迟作为可设门槛的预算;promptfoo、DeepEval、Inspect。
- 评测方差与统计功效单次运行的智能体分数是一次抽样,不是一次测量:pass@k 与 pass^k 的分别、为何任务间方差意味着加任务胜过加运行次数、在同样预算下把可检测效应砍半的 McNemar 配对设计,以及那条阻止团队在噪声上棘轮式推进的决策规则。
- 基准污染与泄漏污染属于(模型,基准,日期)这个三元组,而不属于基准:逐字泄漏、解法泄漏与间接泄漏之分,为何智能体基准泄漏的是环境而不只是答案,四个从外部就能跑的检测,以及"公开分数用来筛选、只有截止日之后的数据才用来决定"这条规则。