AI 博客

Muse Glimmer 交出了两个"智能体"分数,而上标题的是错的那个

Meta 的 300 亿参数开放权重智能体模型,在 SWE-Bench Verified 上是 76.0,在 τ³-Banking 上只有 24%。它六个头条数字里有五个测的是"模型独自面对一个可被程序核验的目标";第六个测的是"陪着一个人、照着一份成文规程办事"——而常驻本地助手活的正是后面这条轴。

作者 智能体 AI 维基 19 分钟读完

Meta 新发布的开放权重智能体模型,在 SWE-Bench Verified 上拿到 76.0,在 τ³-Banking 上只有 24%,而两个数字都被归在"智能体能力"名下。这道落差不是外壳没搭好、也不是运气不佳——它区分的是"独自面对一套测试的智能体"与"陪着一个人、照着一份成文规程办事的智能体",而后者才是这个模型真正瞄准的那种常驻本地助手。在你规划笔记本上的部署之前,先读低的那个数字。

发布了什么

Meta Superintelligence Labs 在 2026 年 8 月第二周发布了 Muse Glimmer:300 亿参数,Apache 2.0 许可,从更大的内部 Muse 系统蒸馏而来,并且是按智能体循环而非聊天来塑形的。这是该公司一段时间以来最有分量的一次开放权重发布,而真正值得看的并不是许可证。

属性Muse Glimmer 30B对智能体意味着什么
结构 20 亿参数的 ViT 式感知编码器接入 280 亿参数的文本解码器;稠密模型,不是专家混合。 稠密意味着显存跟着全部参数量走,而当 GPU 是你自己的而非租来的,这恰恰是对的取舍。参见专家混合(MoE)
上下文 128K 令牌。 够跑一段长工具循环,但还不够让你停止为它做预算。
部署 压缩到约 4 bit,配以块级投机解码;单张消费级 GPU 或一台 Mac 即可运行,无需联网。 这两个选择买的都是时延,不是质量——下文详述。
许可 Apache 2.0,权重在 Hugging Face 上。 没有可接受使用条款附加条件,没有用户数触发条款。你可以把它装进产品里出货。

公布的分数很强,而且铺开在一批智能体类评测上,而非常见的聊天排行榜。正是这个"铺开"让这次发布值得细读——因为这些分数彼此并不一致。

Muse Glimmer 30B reported benchmark scores Horizontal bar chart of six reported scores. AIME 2026 at 94.7, SWE-Bench Verified at 76.0, MCP-Atlas at 75.5, DeepSearch QA at 74.6 and SWE-Bench Pro at 51.2 are all solo, machine-checkable tasks. Tau-3 Banking, the one benchmark with a simulated user and a written policy, sits far below the rest at 24. Muse Glimmer 30B — reported scores (%) 20 40 60 80 100 AIME 2026 94.7 SWE-Bench Verified 76.0 MCP-Atlas 75.5 DeepSearch QA 74.6 SWE-Bench Pro 51.2 τ³-Banking 24 Solo task, machine-checkable goal Simulated user, written policy, pass^k scoring
五个数字挤成一团。有一个没有——而它恰恰最像一台家用助手一天里要面对的事。

其中五个测的是同一件事

AIME、SWE-Bench Verified、SWE-Bench Pro、MCP-Atlas 和 DeepSearch QA 看上去是五种不同的能力。从结构上说它们是一种:模型独自待在一个环境里,追逐一个程序能够核验的目标。没有人打断它。没有人在第四轮改主意。也没有哪本规程是模型被期望读过、并且要在别人劝它破例时始终遵守的。

τ³-Bench 是这份清单上的例外。它是 Sierra 那套"工具-智能体-用户"评测的第三代,整个设计要点就是把第二方放进循环:智能体要与一位模拟客户对话、调用领域 API,并按一份它必须自始至终遵守的规程手册来打分。政策遵从是一等指标,不是脚注;排行榜报的是 pass^k——同一道题连续做对 k 次——而不是 k 次里挑最好的一次。银行是它最新、也最难的领域。

What each benchmark family actually tests Three columns comparing SWE-Bench Verified, MCP-Atlas and DeepSearch QA, and tau-3 Banking across three rows: who else is in the loop, what decides success, and what a failure looks like. Only the third column puts a person and a policy document inside the task. IN THE LOOP SUCCESS IS FAILS AS SWE-Bench Verified MCP-Atlas · DeepSearch QA τ³-Banking A repository and a hidden test suite. Tools and documents. No second party. A simulated customer and a policy manual. The tests pass. Binary, automatic. The answer matches a known ground truth. The right end state and no rule broken. A red test. Visible immediately. A wrong answer, fluently stated. A satisfied customer and a violated rule.
只有第三栏,才可能在同一次对话里同时出现"客户满意"和"规矩被破"。

这个区别真在起作用。在 SWE-Bench 上,一次失败是一个红色测试——响亮、即时、廉价。在 τ³-Banking 上,一次失败可以是客户心满意足地挂断电话,而智能体刚刚免掉了一笔它根本无权免除的费用。前一种失败你的 CI 会抓住。后一种要么在审计时才被发现,要么根本不会被发现。这与轨迹与过程评测里描述的是同一种不对称:只看结果的打分,看不见通往好结果的路上被破掉的规矩。

那个 24 不只是 Meta 的问题

看到 24% 的第一反应,是断定 Meta 偷了工。参照点否定了这个判断。在同一批公布的对比中,Gemini 3.5 Flash-Lite 是 18%,Qwen3.6 27B 是 17%——Muse Glimmer 在同一档里是领先的,而整个这一档都趴在图表底部。与此同时,τ³-Bench 总体的前沿水平在七十出头,而即便是那些系统,据报也是在零售与航司领域站得住、到了银行领域急剧下滑。

所以这里叠着两个效应,不该混为一谈。银行对谁都难:规则更多,其中带条件的更多,"最有帮助的动作"与"被允许的动作"分岔的地方也更多。而小模型在这一点上格外吃亏,因为在一位用户反复施压的十几轮对话里,把一份长长的规程手册持续端在注意力上,是一个长上下文的纪律问题,不是知识问题——正是有效上下文与标称上下文里那种失效,只不过这次是在对抗性的社交压力下发生的。

这也意味着,随着本地模型变强,该盯的数字不是 SWE-Bench。编码分数光靠蒸馏就在往上爬。而多轮压力下的政策遵从远没有跑得那么快,它恰恰是每一个触及金钱、健康记录或他人账户的消费级助手的闸门。

工程选择透露了 Meta 相信什么

有两个出货决定比那张评测表更能说明问题。Muse Glimmer 被量化到大约 4 bit,并且带着块级投机解码。两者都不提升质量;量化还要付一点代价,而投机解码被证明不改变输出。两者买的都是每令牌的时延。

对一个智能体模型来说,这是正确的偏执,而把它做得这么显眼并不常见。聊天模型每答一次只付一次时延。智能体是每一步付一次,而一个不算复杂的任务有十到三十步,于是首令牌时延上两百毫秒的差别,会变成用户眼睁睁看着的好几秒钟。Meta 优化的是那个乘数,不是被乘数。投机解码还有一个已知的坑,值得在你假定笔记本上的数字能照搬之前记住:它是用额外算力换更低时延,所以在空闲的个人 GPU 上它赢,在繁忙的共享 GPU 上它会悄悄吃掉吞吐。

那个 20 亿参数的感知编码器指向同一件事。端侧智能体的时间花在读屏幕、读票据、读 PDF,而不是描述照片。把一个小编码器接到一个大解码器上,赌的是视觉这部分活儿主要是转写。

一个 30B 本地智能体真正值回票价的地方

Where a 30B local agent model sits in a hybrid loop A device boundary contains the harness, a local 30B model, and an on-device index. Two arrows leave the boundary: tool calls to third-party APIs, and an escalation path to a frontier model for policy-bound or multi-turn work. The diagram marks the tool egress as the path that leaves the device even when the model does not. DEVICE BOUNDARY Harness — the loop, the tool router, the policy checks you wrote yourself Muse Glimmer 30B — 4-bit, speculative decode Classify · extract · draft · summarise · route Every step that must not wait on a network On-device index Mail, notes, files Session state Never leaves disk Escalation gate — does this step bind the user to a rule, a spend, or another person? Third-party tool APIs Calendar, mail, payments, search — your data leaves here, model or not Frontier model, on demand Multi-turn service dialogue, policy adherence, anything irreversible EGRESS
模型止步于设备边界。你的数据不会——工具仍然在网络那一头。

按"有没有规则绑定结果"来切分工作。分类、抽取、起草、摘要、路由,以及任何工具循环里"读"的那一半,都是 30B 模型做得好的事,而本地跑还免费、即时——这正是小模型与本地模型一直在讲的道理,Muse Glimmer 让它更站得住。任何把用户绑定到一条规程、一笔支出或另一个人身上的动作,都越过升级闸门交给前沿模型,或者交给人。架构与级联相同,只是路由器是一条静态规则而非难度估计;至于静态为何通常胜过聪明,见模型路由与级联

有两个角色被低估了,而这个模型的形状很适合它们。它是一个不错的本地裁判,可在你为评测花掉一次前沿调用之前做廉价预筛;它也是一个不错的本地预分类器,用来判断一个请求究竟需不需要联网——而这是你能摆在一个按量计费的 API 前面的、杠杆最高的一件东西。

还有一句在每一次"能在你的设备上跑"的发布里都被跳过的提醒:本地模型不等于本地系统。你的智能体一旦调用日历、邮件服务或支付 API,用户的数据就在一个模型永远看不到另一端的请求里越过了边界。把推理放在本地,只是去掉了一条出网路径,其余的还原封不动待在原处。那是一个配置问题,是智能体的出网管控要谈的事,而不是权重自带的属性。

常见问题

Muse Glimmer 好到可以在我的智能体里替掉前沿模型了吗?

对于循环中偏编码、偏检索的那些部分,大概可以——公布的 SWE-Bench Verified 与 DeepSearch QA 分数,对 30B 而言已属认真的水平。对于受成文规程约束的多轮工作,公布的 τ³-Banking 分数说不行,而且没有哪句提示词能补上这么大的缺口。

为什么一个模型 AIME 能到 94.7,客服类评测却只有 24?

因为它们不是同一种技能。AIME 是一道有可核验答案、没有第二方的难题。τ³-Banking 是十几个不难的回合,其间智能体必须在一位模拟客户不断索要例外时始终守着规程。推理深度买不来政策纪律。

Apache 2.0 在这里真的重要吗?

对任何要出货产品的人来说,它比那组分数的分布更重要。一份没有可接受使用条款附加条件、没有用户数触发条款的宽松许可,意味着权重可以被嵌入、微调与再分发,而不必每发一版就走一次法务评审——这正是"实验"与"依赖项"之间的实际差别。

信任一个本地智能体模型之前,我该测什么?

测你自己的政策遵从率:在多轮对话记录上,按 pass^k 而非 k 选一来打分,用你真正在执行的那些规则。公开评测告诉你的是这一档模型有没有能力;只有你自己的测试集才能告诉你这个模型守不守你的规矩。参见读懂智能体基准

延伸阅读

本站:

来源: