工具 · 第 2026-07-25

vLLM v0.26.0:为 Inkling 万亿参数模型补齐推理全栈

vLLM 发布 v0.26.0,来自 212 位贡献者的 411 个提交。最重要的一条是为 Thinking Machines 开源的 Inkling 模型家族提供完整支持栈:基础建模、分段 CUDA Graph、Hopper 架构的 FA4 相对注意力,以及 MTP=1 的推测解码。

vLLM Releases2026-07-25值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

推理与部署前沿模型

版本脉络

这条信号已有后续

你正在读的是这条线上较早的一条,之后还有 1 条,最新的是「vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈」。

  1. 2026-06-30vLLM v0.24.0:开源高吞吐推理引擎发布新稳定版
  2. 2026-07-11vLLM v0.25.0:Model Runner V2 成为默认执行引擎的大版本
  3. 2026-07-25vLLM v0.26.0:为 Inkling 万亿参数模型补齐推理全栈当前
  4. 2026-08-10vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈最新

承接 v0.25.0 的 Model Runner V2 默认化,继续往架构适配走。

记录

信号正文

这次发布做了什么

vLLM v0.26.0 汇集了 212 位贡献者(其中 61 位是新面孔)的 411 个提交,是一次体量很大的版本。发布说明把「新增 Inkling 模型家族的完整支持栈」放在了第一条。

为什么是 Inkling

Inkling 是 Thinking Machines 在 7 月中旬开源的万亿参数级多模态 MoE 模型——本站已经把它作为当日头条信号收录。开源权重和「能在主流推理引擎上跑起来」之间,通常还隔着几周到几个月的适配工作:注意力核、图捕获策略、量化路径、并行切分,每一项都要针对具体架构重写。v0.26.0 把这段距离压缩到了十天左右。

支持栈包含四个层次:

  • 基础建模:模型结构本身在 vLLM 内的实现;
  • 分段 CUDA Graph(piecewise CUDA graph):把前向过程切成可以分别捕获的片段,让 MoE 这类含动态路由的结构也能吃到 CUDA Graph 的调度收益,而不必整图捕获;
  • Hopper FA4 相对注意力:针对 H100 一代硬件的注意力核实现;
  • MTP=1 推测解码:多 token 预测形态的推测解码,用小步长的草稿换取解码吞吐。

值得注意的信号

把这四条放在一起看,重点不是「又一个模型被支持了」,而是开源推理栈对新架构的适配周期正在明显缩短,并且适配是成套的——不是先能跑通、几个版本后才补上性能路径。对于要在本地或自有集群上评估新开源模型的团队,这直接改变了「等多久才能真正测起来」的预期。

为什么是现在

为什么重要

开源万亿参数模型从「放出权重」到「主流推理引擎上可用」的间隔被压到了十天量级,而且是基础建模、图捕获、注意力核、推测解码一次配齐。这改变了自建推理团队评估新模型的排期假设。

背景

技术背景

分段 CUDA Graph 解决的是 MoE 动态路由与整图捕获冲突的问题;FA4 相对注意力是面向 Hopper 架构的注意力核;MTP=1 推测解码属于多 token 预测形态,用草稿模型的小步长预测换取解码阶段吞吐。三者叠加才构成一条可用的生产推理路径。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

自建或自运维推理服务的平台团队需要在本地评估新开源模型的算法与评测团队关注 MoE 与推测解码落地成本的架构师
可能影响的领域
推理服务容量规划开源模型选型周期MoE 架构的部署成本解码吞吐优化

下一步

学习路径

  1. 先理解 MoE 架构为什么让图捕获和量化变复杂
  2. 再看推测解码如何用草稿模型换解码吞吐
  3. 最后结合自有硬件(是否 Hopper)判断这套支持栈能吃到多少收益

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 在非 Hopper 硬件上,这套支持栈能保留多少性能收益?
  • MTP=1 推测解码对长上下文任务的加速比是多少?
  • 分段 CUDA Graph 是否会成为后续 MoE 模型的默认适配路径?

来源参考

vLLM Releases

vLLM Project开源社区2026-07-25
打开原始来源https://github.com/vllm-project/vllm/releases/tag/v0.26.0