模型 · 第 2026-08-10

Meta Muse Glimmer:30B 蒸馏开源模型,专为本地智能设计

Meta 发布 Muse Glimmer——从 Muse 蒸馏到 300 亿参数、Apache 2.0 许可的多模态模型,目标是本地跑的智能体。工具调用与检索类基准领先同级开源模型,但在桌面与终端操作上输给 Qwen3.6-27B;生态当天跟进,硬件支持却分了档。

Hugging Face Blog2026-08-10值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

前沿模型端侧 AIAI 智能体多模态

记录

信号正文

发布了什么

Muse Glimmer 是 Meta 从自家 Muse 蒸馏出来的 300 亿参数多模态模型,采用 Apache 2.0 许可,明确面向本地智能体场景:隐私敏感的应用、降低成本,或者装配 Claw / Hermes 那类本地助手。发布当天即有 transformersllama.cppvLLM 与 Inference Endpoints 的支持。

跑分里赢的部分

对比 Gemma4-31B 与 Qwen3.6-27B(均为 Thinking 模式),智能体类基准领先明显:

  1. MCP Atlas 75.5,对 54.2 与 62.5
  2. DeepSearch QA 74.6,对 61.7 与 71.1
  3. WildClawBench 47.6,对 37.6 与 43.2
  4. GAIA2 43.3,对 36.4 与 40.0
  5. SWE-Bench Pro 51.2,对 36.9 与 50.2

输的部分,以及为什么它更值得看

同一张表里有 5 项输给 Qwen3.6-27B,而且输的方向很集中:

  • OSWorld-Verified 65.9 对 75.6
  • TerminalBench 2.1 51.7 对 60.7
  • SkillsBench(带 Skills)44.3 对 46.6
  • GDPval-AA 953 对 1141
  • SWE-Bench Verified 76.0 对 77.2

赢的那些偏工具调用与检索,输的那些偏操作真实系统——桌面环境、终端会话。这个分野比总分有用:如果你的智能体主要在调 API、查资料,它是同级里最强的;如果它要去点桌面、跑终端,Qwen3.6-27B 目前更稳。

还有一个绝对值低到应该说出来:τ³-Banking 只有 23.5,而对手是 15.1 与 16.7。它赢了,但三家都远不及格——多轮、带约束的业务对话仍然是这一档开放模型共同的短板。

生态当天跟上了,但分了档

Ollama 同一天发布 v0.32.7 支持 Muse Glimmer,但只在 Apple Silicon 的 MLX 引擎上;NVIDIA 与 AMD 的支持要等 v0.32.8,发稿时那还是预发布版本。

这正是本站《模型与推理引擎的支持路径》那四级判据的现场:「支持」不是布尔值。当天能在 Mac 上跑起来,不等于能在生产的 NVIDIA 机器上跑起来,更不等于跑得快、跑得对。

蒸馏这次是主角,不是脚注

Muse Glimmer 本身就是蒸馏产物,而同一天 Hugging Face 上还有一篇系统论文在解决蒸馏本身的成本:把教师模型的 top-K logits 离线缓存,于是教师不必与学生同时占显存;再配一个分块融合的 KL 损失,避免物化「词表 × 序列长度」那张大矩阵。作者称这让长上下文的能力恢复训练能在单卡上完成

把两件事放在一起读才完整:一个 30B 的开放权重模型能不能出现,取决于把大模型压小的成本降到了什么程度。

为什么是现在

为什么重要

开放权重的智能体模型第一次把「本地跑得动」和「工具调用够强」做进了同一个 30B 模型,而且它公开承认自己在桌面与终端操作上落后——这让选型可以按任务形状做,而不是按总分做。

背景

技术背景

Muse Glimmer 从 Meta 的 Muse 蒸馏到 30B,Apache 2.0 许可,支持多模态工具调用、目标检测与推测解码(transformers 与 llama.cpp 两条路径)。它的公开基准表同时列出了赢的项与输的项,对比对象是 Gemma4-31B 与 Qwen3.6-27B 的 Thinking 模式。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

在本地或私有环境部署智能体的工程团队正在评估开放权重能否替代闭源 API 的技术决策者关注蒸馏与模型压缩路线的研究者
可能影响的领域
本地智能体部署开放权重模型选型推理引擎适配模型蒸馏与压缩

下一步

学习路径

  1. 先读基准表里输的那 5 项,判断你的任务更像「调工具」还是「操作系统」
  2. 确认你的目标硬件属于哪一级支持:能加载、有原生建模、有性能路径、还是有正确性保障
  3. 在自己的任务上跑一次对照,不要直接采信厂商表格里的相对领先幅度

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • τ³-Banking 只有 23.5,多轮带约束的业务对话还差在哪一步?
  • NVIDIA / AMD 的支持从预发布走到稳定要多久,期间的输出质量是否一致?
  • 离线 top-K 蒸馏能否被复现到其他开放模型上,还是依赖 Meta 的教师模型?

来源参考

Hugging Face Blog

Meta大型科技公司2026-08-10
打开原始来源https://hf-mirror.com/blog/muse-glimmer