Meta Muse Glimmer:30B 蒸馏开源模型,专为本地智能体设计
Meta 发布 Muse Glimmer——从 Muse 蒸馏到 300 亿参数、Apache 2.0 许可的多模态模型,目标是本地跑的智能体。工具调用与检索类基准领先同级开源模型,但在桌面与终端操作上输给 Qwen3.6-27B;生态当天跟进,硬件支持却分了档。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
发布了什么
Muse Glimmer 是 Meta 从自家 Muse 蒸馏出来的 300 亿参数多模态模型,采用 Apache 2.0 许可,明确面向本地智能体场景:隐私敏感的应用、降低成本,或者装配 Claw / Hermes 那类本地助手。发布当天即有 transformers、llama.cpp、vLLM 与 Inference Endpoints 的支持。
跑分里赢的部分
对比 Gemma4-31B 与 Qwen3.6-27B(均为 Thinking 模式),智能体类基准领先明显:
- MCP Atlas 75.5,对 54.2 与 62.5
- DeepSearch QA 74.6,对 61.7 与 71.1
- WildClawBench 47.6,对 37.6 与 43.2
- GAIA2 43.3,对 36.4 与 40.0
- SWE-Bench Pro 51.2,对 36.9 与 50.2
输的部分,以及为什么它更值得看
同一张表里有 5 项输给 Qwen3.6-27B,而且输的方向很集中:
- OSWorld-Verified 65.9 对 75.6
- TerminalBench 2.1 51.7 对 60.7
- SkillsBench(带 Skills)44.3 对 46.6
- GDPval-AA 953 对 1141
- SWE-Bench Verified 76.0 对 77.2
赢的那些偏工具调用与检索,输的那些偏操作真实系统——桌面环境、终端会话。这个分野比总分有用:如果你的智能体主要在调 API、查资料,它是同级里最强的;如果它要去点桌面、跑终端,Qwen3.6-27B 目前更稳。
还有一个绝对值低到应该说出来:τ³-Banking 只有 23.5,而对手是 15.1 与 16.7。它赢了,但三家都远不及格——多轮、带约束的业务对话仍然是这一档开放模型共同的短板。
生态当天跟上了,但分了档
Ollama 同一天发布 v0.32.7 支持 Muse Glimmer,但只在 Apple Silicon 的 MLX 引擎上;NVIDIA 与 AMD 的支持要等 v0.32.8,发稿时那还是预发布版本。
这正是本站《模型与推理引擎的支持路径》那四级判据的现场:「支持」不是布尔值。当天能在 Mac 上跑起来,不等于能在生产的 NVIDIA 机器上跑起来,更不等于跑得快、跑得对。
蒸馏这次是主角,不是脚注
Muse Glimmer 本身就是蒸馏产物,而同一天 Hugging Face 上还有一篇系统论文在解决蒸馏本身的成本:把教师模型的 top-K logits 离线缓存,于是教师不必与学生同时占显存;再配一个分块融合的 KL 损失,避免物化「词表 × 序列长度」那张大矩阵。作者称这让长上下文的能力恢复训练能在单卡上完成。
把两件事放在一起读才完整:一个 30B 的开放权重模型能不能出现,取决于把大模型压小的成本降到了什么程度。
为什么是现在
为什么重要
开放权重的智能体模型第一次把「本地跑得动」和「工具调用够强」做进了同一个 30B 模型,而且它公开承认自己在桌面与终端操作上落后——这让选型可以按任务形状做,而不是按总分做。
背景
技术背景
Muse Glimmer 从 Meta 的 Muse 蒸馏到 30B,Apache 2.0 许可,支持多模态工具调用、目标检测与推测解码(transformers 与 llama.cpp 两条路径)。它的公开基准表同时列出了赢的项与输的项,对比对象是 Gemma4-31B 与 Qwen3.6-27B 的 Thinking 模式。
关注人群
谁该关注
下一步
学习路径
- 先读基准表里输的那 5 项,判断你的任务更像「调工具」还是「操作系统」
- 确认你的目标硬件属于哪一级支持:能加载、有原生建模、有性能路径、还是有正确性保障
- 在自己的任务上跑一次对照,不要直接采信厂商表格里的相对领先幅度
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- τ³-Banking 只有 23.5,多轮带约束的业务对话还差在哪一步?
- NVIDIA / AMD 的支持从预发布走到稳定要多久,期间的输出质量是否一致?
- 离线 top-K 蒸馏能否被复现到其他开放模型上,还是依赖 Meta 的教师模型?
来源参考