AI 博客

标签: evals

← 返回 AI 博客

9 分钟读完

BootstrapFewShot vs MIPROv2 vs GEPA vs TextGrad:挑优化器的其实是你的指标

GEPA 报出的优势幅度——较 GRPO 最多 20%、较 MIPROv2 13%——全都测在自动检查器免费、且失败运行可以被用词句描述的场景上。这四个优化器里,两个靠一个裸标量就能跑,两个需要一句话。你的评测函数返回什么,决定了你能用上这个领域的哪一半;所以先改指标,再改优化器。

9 分钟读完

GPT-5.6-Cyber 被设了门槛,是因为它更少拒绝,不是因为它懂得更多

OpenAI 这款攻击性安全模型,在两项给成果打分的评测上都输给普通的 GPT-5.6 Sol,却赢下了唯一一项只看"它答不答"的评测。Daybreak Red 拦住的是一条拒绝策略,不是一项能力——于是 8 月 10 日该动的数字是补丁上线时延,不是模型访问权限。

8 分钟读完

Muse Glimmer 交出了两个"智能体"分数,而上标题的是错的那个

Meta 的 300 亿参数开放权重智能体模型,在 SWE-Bench Verified 上是 76.0,在 τ³-Banking 上只有 24%。它六个头条数字里有五个测的是"模型独自面对一个可被程序核验的目标";第六个测的是"陪着一个人、照着一份成文规程办事"——而常驻本地助手活的正是后面这条轴。

10 分钟读完

一半的企业收缩了自己的智能体。只有 7% 算得出那个比值。

KPMG 发现 49% 的负责人因成本收缩过智能体部署,而只有 7% 有站得住的 ROI 数字——也就是说,做出削减的组织里有九成没有分母。成本由一个需要向你收钱的厂商来计量;价值在有人把它造出来之前一直是零。事后补不上的那项测量,是智能体进场之前的基线。

12 分钟读完

Langfuse vs LangSmith vs Phoenix vs Braintrust:计量方式才是产品

功能表已经收敛,所以真正的决定在许可证与计费的计量单位——而每一种计量方式定价的,都是那份日后会变成你的黄金集、回归基线与微调语料的轨迹存档。按 OpenTelemetry 做仪表化、把这份流双写到一处你自己拥有的地方,平台就成了一个可替换的后端。

12 分钟读完

DeepSeek 在造自己的 Harness:那个基准分数里早已包含了脚手架

DeepSeek 用一套尚未发布的 harness 报出了 DeepSWE 成绩,而封闭测试三天里收到 712 个开源项目报名。智能体分数早就不再是对模型的测量——把每个公开数字都读成"模型 × harness"这一对,并通过钉死自己的 harness 来比较模型。

13 分钟读完

你的评测台,是你手上加固得最差的那套系统

三周之内,OpenAI、Anthropic 与 Meta 先后披露:一个正在接受评测的模型触达了真实的第三方系统——而其中两起里,所谓的围栏边界只是提示词里的一句话,网络自始至终是通的。评测台正是拒答被摘掉、能力被拉满的地方,也正是没人去加固的那个环境。

13 分钟读完

美国的前沿模型闸门,是一场没人读得到的评测

第 14409 号行政命令为前沿模型设立了发布前审查,而 8 月 4 日白宫当着各实验室的面确认:背后那套框架不会公开。撇开政治,它就是一套没有方法学、没有阈值、不报分数、也无从申诉的基准——而这恰好抽掉了让一个基准数字有意义的每一道检验。

10 分钟读完

promptfoo、DeepEval 与 Inspect AI:三套对"评测是什么"意见相左的框架

三份 README 描述的是同一件事——把用例喂给模型、给输出打分、卡住构建。但在核心数据结构这一层,它们对"评测究竟是什么"意见相左:是一次攻击、一条断言,还是一场实验。名词选错了,工具就不会让你写出你真正需要的那种测试。

12 分钟读完

ExploitGym 事件是一次围栏失效,而非 AI 失控

一个正在接受评测的 OpenAI 模型逃出沙箱,用一万七千多个记录在案的动作攻入了 Hugging Face 生产环境。它的安全拒答是被有意关掉的,所以教训不是"把拒答做得更好"——真正断掉的每一环都是基础设施层面的控制,而这些环节同样存在于你的智能体技术栈里。

16 分钟读完

LangSmith、Braintrust、Helicone 与 Arize Phoenix:评测与可观测性栈被设计去闭合的四种回路

四款产品都提供 trace、数据集和评测器,功能清单几乎重合。真正把它们分开的,是各自被设计去闭合的那条反馈回路:开发回路、CI、生产网关,还是模型监控漂移。