工具 · 第 2026-07-25

Ollama v0.32.4:Apple GPU 上的 Laguna 支持推测解码草稿量化

Ollama v0.32.4 通过 MLX 引擎为 Apple GPU 增加 Laguna 模型支持,让推测解码的草稿模型输出头按指定精度量化,并修复了 Qwen3 MoE 在专家量化精度不一致时的解码问题,打包的 gate/up 投影在 M5 Max 上提速约 4–9%。注意:本版的 MLX Laguna 路径存在会降低 NVFP4 模型输出质量的缺陷,已在两天后的 v0.32.5 修复——要在 Apple GPU 上跑 Laguna 请直接用 v0.32.5。

Ollama Releases2026-07-25值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

端侧 AI推理与部署

版本脉络

这条信号的版本脉络

这是这条线上最新的一条,下面是它承接的早前信号。

  1. 2026-07-08Ollama v0.31.2:本地大模型运行时发布稳定版
  2. 2026-07-14Ollama v0.32.0:本地运行时转型智能体工作台
  3. 2026-07-25Ollama v0.32.4:Apple GPU 上的 Laguna 支持与推测解码草稿量化当前最新

延续 v0.32.0 的智能体入口,重点回到执行层:Apple GPU 的 Laguna 支持、草稿模型输出头量化与 Qwen3 MoE 解码修复。

记录

信号正文

更正(2026-07-28)

下面第 1 条改动——MLX 引擎支持 Laguna——在本版中是带缺陷发布的:MLX 的 Metal 后端存在一个 bug,会让 NVFP4 精度的模型输出质量下降,其中 Laguna 受影响最明显。官方在两天后的 v0.32.5 中修复了它,那一版除此之外没有任何其他改动。

所以:要在 Apple GPU 上跑 Laguna,请直接用 v0.32.5,不要停在本版。 本站没有把 v0.32.5 单独收录为一条技术信号——它是一次单点修复,不构成新的技术信号;但它修的正是本条信号的头条功能,所以更正写在这里。

三条改动

v0.32.4 是一次内容不多但都落在同一条主线上的版本:

  1. MLX 引擎支持 Laguna,把这一模型家族带到 Apple GPU 上运行;
  2. 推测解码的草稿模型输出头按请求精度量化——此前草稿模型的输出头可能保留在更高精度上,浪费了推测解码本该带来的显存与带宽收益;
  3. 修复 Qwen3 MoE 在专家量化精度不一致时的解码,同时把打包的 gate/up 投影做了加速,官方给出的数据是在 M5 Max 上约 4–9%。

主线是什么

三条改动指向同一件事:端侧运行 MoE 模型的量化路径正在被逐条打磨。MoE 的每个专家可以用不同精度存储,这在服务器端是节省显存的常规手段,但到了统一内存的 Apple 芯片上,量化不一致会直接反映为解码错误或性能塌陷。草稿模型输出头的量化同理——推测解码本身就是拿精度换吞吐,如果草稿这一侧没量化干净,收益会被吃掉一大块。

与前一版本的关系

本站已收录 Ollama v0.32.0「本地运行时转型智能体工作台」这一更大的方向性信号。v0.32.4 不改变方向,但它显示这条路线的底座——端侧推理性能——仍在持续投入,而不是在功能层铺开后就停在原地。

为什么是现在

为什么重要

端侧跑 MoE 模型的瓶颈已经从「能不能加载」转移到「量化路径干不干净」。这一版把草稿模型输出头量化和专家精度不一致两个坑同时补上,是本地推理走向可用的具体一步。

背景

技术背景

MoE 允许不同专家使用不同量化精度,混合精度在统一内存架构上更容易触发解码错误。推测解码的收益取决于草稿模型的开销,草稿输出头若未按请求精度量化,会削弱吞吐收益。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

在 Apple 芯片上做本地推理的开发者评估端侧部署可行性的架构师关注推测解码实际收益的性能工程师
可能影响的领域
端侧推理性能MoE 量化路径推测解码收益Apple 芯片部署

下一步

学习路径

  1. 先弄清 MoE 的专家路由与逐专家量化
  2. 再理解推测解码里草稿模型的开销从哪来
  3. 最后在自己的机器上实测 4–9% 这类数字是否可复现

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 推测解码草稿量化后的实际加速比,在长上下文下还能保持吗?
  • 统一内存架构下,混合专家精度的最佳组合是什么?

来源参考

Ollama Releases

Ollama开源社区2026-07-25
打开原始来源https://github.com/ollama/ollama/releases/tag/v0.32.4