Meta 新发布的开放权重智能体模型,在 SWE-Bench Verified 上拿到 76.0,在 τ³-Banking 上只有 24%,而两个数字都被归在"智能体能力"名下。这道落差不是外壳没搭好、也不是运气不佳——它区分的是"独自面对一套测试的智能体"与"陪着一个人、照着一份成文规程办事的智能体",而后者才是这个模型真正瞄准的那种常驻本地助手。在你规划笔记本上的部署之前,先读低的那个数字。
发布了什么
Meta Superintelligence Labs 在 2026 年 8 月第二周发布了 Muse Glimmer:300 亿参数,Apache 2.0 许可,从更大的内部 Muse 系统蒸馏而来,并且是按智能体循环而非聊天来塑形的。这是该公司一段时间以来最有分量的一次开放权重发布,而真正值得看的并不是许可证。
| 属性 | Muse Glimmer 30B | 对智能体意味着什么 |
|---|---|---|
| 结构 | 20 亿参数的 ViT 式感知编码器接入 280 亿参数的文本解码器;稠密模型,不是专家混合。 | 稠密意味着显存跟着全部参数量走,而当 GPU 是你自己的而非租来的,这恰恰是对的取舍。参见专家混合(MoE)。 |
| 上下文 | 128K 令牌。 | 够跑一段长工具循环,但还不够让你停止为它做预算。 |
| 部署 | 压缩到约 4 bit,配以块级投机解码;单张消费级 GPU 或一台 Mac 即可运行,无需联网。 | 这两个选择买的都是时延,不是质量——下文详述。 |
| 许可 | Apache 2.0,权重在 Hugging Face 上。 | 没有可接受使用条款附加条件,没有用户数触发条款。你可以把它装进产品里出货。 |
公布的分数很强,而且铺开在一批智能体类评测上,而非常见的聊天排行榜。正是这个"铺开"让这次发布值得细读——因为这些分数彼此并不一致。
其中五个测的是同一件事
AIME、SWE-Bench Verified、SWE-Bench Pro、MCP-Atlas 和 DeepSearch QA 看上去是五种不同的能力。从结构上说它们是一种:模型独自待在一个环境里,追逐一个程序能够核验的目标。没有人打断它。没有人在第四轮改主意。也没有哪本规程是模型被期望读过、并且要在别人劝它破例时始终遵守的。
τ³-Bench 是这份清单上的例外。它是 Sierra 那套"工具-智能体-用户"评测的第三代,整个设计要点就是把第二方放进循环:智能体要与一位模拟客户对话、调用领域 API,并按一份它必须自始至终遵守的规程手册来打分。政策遵从是一等指标,不是脚注;排行榜报的是 pass^k——同一道题连续做对 k 次——而不是 k 次里挑最好的一次。银行是它最新、也最难的领域。
这个区别真在起作用。在 SWE-Bench 上,一次失败是一个红色测试——响亮、即时、廉价。在 τ³-Banking 上,一次失败可以是客户心满意足地挂断电话,而智能体刚刚免掉了一笔它根本无权免除的费用。前一种失败你的 CI 会抓住。后一种要么在审计时才被发现,要么根本不会被发现。这与轨迹与过程评测里描述的是同一种不对称:只看结果的打分,看不见通往好结果的路上被破掉的规矩。
那个 24 不只是 Meta 的问题
看到 24% 的第一反应,是断定 Meta 偷了工。参照点否定了这个判断。在同一批公布的对比中,Gemini 3.5 Flash-Lite 是 18%,Qwen3.6 27B 是 17%——Muse Glimmer 在同一档里是领先的,而整个这一档都趴在图表底部。与此同时,τ³-Bench 总体的前沿水平在七十出头,而即便是那些系统,据报也是在零售与航司领域站得住、到了银行领域急剧下滑。
所以这里叠着两个效应,不该混为一谈。银行对谁都难:规则更多,其中带条件的更多,"最有帮助的动作"与"被允许的动作"分岔的地方也更多。而小模型在这一点上格外吃亏,因为在一位用户反复施压的十几轮对话里,把一份长长的规程手册持续端在注意力上,是一个长上下文的纪律问题,不是知识问题——正是有效上下文与标称上下文里那种失效,只不过这次是在对抗性的社交压力下发生的。
这也意味着,随着本地模型变强,该盯的数字不是 SWE-Bench。编码分数光靠蒸馏就在往上爬。而多轮压力下的政策遵从远没有跑得那么快,它恰恰是每一个触及金钱、健康记录或他人账户的消费级助手的闸门。
工程选择透露了 Meta 相信什么
有两个出货决定比那张评测表更能说明问题。Muse Glimmer 被量化到大约 4 bit,并且带着块级投机解码。两者都不提升质量;量化还要付一点代价,而投机解码被证明不改变输出。两者买的都是每令牌的时延。
对一个智能体模型来说,这是正确的偏执,而把它做得这么显眼并不常见。聊天模型每答一次只付一次时延。智能体是每一步付一次,而一个不算复杂的任务有十到三十步,于是首令牌时延上两百毫秒的差别,会变成用户眼睁睁看着的好几秒钟。Meta 优化的是那个乘数,不是被乘数。投机解码还有一个已知的坑,值得在你假定笔记本上的数字能照搬之前记住:它是用额外算力换更低时延,所以在空闲的个人 GPU 上它赢,在繁忙的共享 GPU 上它会悄悄吃掉吞吐。
那个 20 亿参数的感知编码器指向同一件事。端侧智能体的时间花在读屏幕、读票据、读 PDF,而不是描述照片。把一个小编码器接到一个大解码器上,赌的是视觉这部分活儿主要是转写。
一个 30B 本地智能体真正值回票价的地方
按"有没有规则绑定结果"来切分工作。分类、抽取、起草、摘要、路由,以及任何工具循环里"读"的那一半,都是 30B 模型做得好的事,而本地跑还免费、即时——这正是小模型与本地模型一直在讲的道理,Muse Glimmer 让它更站得住。任何把用户绑定到一条规程、一笔支出或另一个人身上的动作,都越过升级闸门交给前沿模型,或者交给人。架构与级联相同,只是路由器是一条静态规则而非难度估计;至于静态为何通常胜过聪明,见模型路由与级联。
有两个角色被低估了,而这个模型的形状很适合它们。它是一个不错的本地裁判,可在你为评测花掉一次前沿调用之前做廉价预筛;它也是一个不错的本地预分类器,用来判断一个请求究竟需不需要联网——而这是你能摆在一个按量计费的 API 前面的、杠杆最高的一件东西。
还有一句在每一次"能在你的设备上跑"的发布里都被跳过的提醒:本地模型不等于本地系统。你的智能体一旦调用日历、邮件服务或支付 API,用户的数据就在一个模型永远看不到另一端的请求里越过了边界。把推理放在本地,只是去掉了一条出网路径,其余的还原封不动待在原处。那是一个配置问题,是智能体的出网管控要谈的事,而不是权重自带的属性。
常见问题
Muse Glimmer 好到可以在我的智能体里替掉前沿模型了吗?
对于循环中偏编码、偏检索的那些部分,大概可以——公布的 SWE-Bench Verified 与 DeepSearch QA 分数,对 30B 而言已属认真的水平。对于受成文规程约束的多轮工作,公布的 τ³-Banking 分数说不行,而且没有哪句提示词能补上这么大的缺口。
为什么一个模型 AIME 能到 94.7,客服类评测却只有 24?
因为它们不是同一种技能。AIME 是一道有可核验答案、没有第二方的难题。τ³-Banking 是十几个不难的回合,其间智能体必须在一位模拟客户不断索要例外时始终守着规程。推理深度买不来政策纪律。
Apache 2.0 在这里真的重要吗?
对任何要出货产品的人来说,它比那组分数的分布更重要。一份没有可接受使用条款附加条件、没有用户数触发条款的宽松许可,意味着权重可以被嵌入、微调与再分发,而不必每发一版就走一次法务评审——这正是"实验"与"依赖项"之间的实际差别。
信任一个本地智能体模型之前,我该测什么?
测你自己的政策遵从率:在多轮对话记录上,按 pass^k 而非 k 选一来打分,用你真正在执行的那些规则。公开评测告诉你的是这一档模型有没有能力;只有你自己的测试集才能告诉你这个模型守不守你的规矩。参见读懂智能体基准。
延伸阅读
本站:
- 端侧智能体架构——如何搭出上面那种混合切分,同时不把设备边界当成安全边界。
- 任务时长视野——为什么可靠性那个数字,大约只有人人引用的能力数字的五分之一。
- 小模型与本地模型——跑小模型的长期理由,以及它到哪儿为止。
- 预填充、解码与 KV 缓存——为什么在循环里,卡住你的是时延而不是参数量。
- 为智能体自建推理——GPU 归你自己之后,运维上会变的那些事。