Ollama v0.32.4:Apple GPU 上的 Laguna 支持与推测解码草稿量化
Ollama v0.32.4 通过 MLX 引擎为 Apple GPU 增加 Laguna 模型支持,让推测解码的草稿模型输出头按指定精度量化,并修复了 Qwen3 MoE 在专家量化精度不一致时的解码问题,打包的 gate/up 投影在 M5 Max 上提速约 4–9%。注意:本版的 MLX Laguna 路径存在会降低 NVFP4 模型输出质量的缺陷,已在两天后的 v0.32.5 修复——要在 Apple GPU 上跑 Laguna 请直接用 v0.32.5。
基础信息较完整,适合持续跟踪并等待更多验证。
版本脉络
这条信号的版本脉络
这是这条线上最新的一条,下面是它承接的早前信号。
- 2026-07-08Ollama v0.31.2:本地大模型运行时发布稳定版
- 2026-07-14Ollama v0.32.0:本地运行时转型智能体工作台
- 2026-07-25Ollama v0.32.4:Apple GPU 上的 Laguna 支持与推测解码草稿量化当前最新
延续 v0.32.0 的智能体入口,重点回到执行层:Apple GPU 的 Laguna 支持、草稿模型输出头量化与 Qwen3 MoE 解码修复。
记录
信号正文
更正(2026-07-28)
下面第 1 条改动——MLX 引擎支持 Laguna——在本版中是带缺陷发布的:MLX 的 Metal 后端存在一个 bug,会让 NVFP4 精度的模型输出质量下降,其中 Laguna 受影响最明显。官方在两天后的 v0.32.5 中修复了它,那一版除此之外没有任何其他改动。
所以:要在 Apple GPU 上跑 Laguna,请直接用 v0.32.5,不要停在本版。 本站没有把 v0.32.5 单独收录为一条技术信号——它是一次单点修复,不构成新的技术信号;但它修的正是本条信号的头条功能,所以更正写在这里。
三条改动
v0.32.4 是一次内容不多但都落在同一条主线上的版本:
- MLX 引擎支持 Laguna,把这一模型家族带到 Apple GPU 上运行;
- 推测解码的草稿模型输出头按请求精度量化——此前草稿模型的输出头可能保留在更高精度上,浪费了推测解码本该带来的显存与带宽收益;
- 修复 Qwen3 MoE 在专家量化精度不一致时的解码,同时把打包的 gate/up 投影做了加速,官方给出的数据是在 M5 Max 上约 4–9%。
主线是什么
三条改动指向同一件事:端侧运行 MoE 模型的量化路径正在被逐条打磨。MoE 的每个专家可以用不同精度存储,这在服务器端是节省显存的常规手段,但到了统一内存的 Apple 芯片上,量化不一致会直接反映为解码错误或性能塌陷。草稿模型输出头的量化同理——推测解码本身就是拿精度换吞吐,如果草稿这一侧没量化干净,收益会被吃掉一大块。
与前一版本的关系
本站已收录 Ollama v0.32.0「本地运行时转型智能体工作台」这一更大的方向性信号。v0.32.4 不改变方向,但它显示这条路线的底座——端侧推理性能——仍在持续投入,而不是在功能层铺开后就停在原地。
为什么是现在
为什么重要
端侧跑 MoE 模型的瓶颈已经从「能不能加载」转移到「量化路径干不干净」。这一版把草稿模型输出头量化和专家精度不一致两个坑同时补上,是本地推理走向可用的具体一步。
背景
技术背景
MoE 允许不同专家使用不同量化精度,混合精度在统一内存架构上更容易触发解码错误。推测解码的收益取决于草稿模型的开销,草稿输出头若未按请求精度量化,会削弱吞吐收益。
关注人群
谁该关注
下一步
学习路径
- 先弄清 MoE 的专家路由与逐专家量化
- 再理解推测解码里草稿模型的开销从哪来
- 最后在自己的机器上实测 4–9% 这类数字是否可复现
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 推测解码草稿量化后的实际加速比,在长上下文下还能保持吗?
- 统一内存架构下,混合专家精度的最佳组合是什么?
来源参考