vLLM v0.26.0:为 Inkling 万亿参数模型补齐推理全栈
vLLM 发布 v0.26.0,来自 212 位贡献者的 411 个提交。最重要的一条是为 Thinking Machines 开源的 Inkling 模型家族提供完整支持栈:基础建模、分段 CUDA Graph、Hopper 架构的 FA4 相对注意力,以及 MTP=1 的推测解码。
基础信息较完整,适合持续跟踪并等待更多验证。
版本脉络
这条信号已有后续
你正在读的是这条线上较早的一条,之后还有 1 条,最新的是「vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈」。
- 2026-06-30vLLM v0.24.0:开源高吞吐推理引擎发布新稳定版
- 2026-07-11vLLM v0.25.0:Model Runner V2 成为默认执行引擎的大版本
- 2026-07-25vLLM v0.26.0:为 Inkling 万亿参数模型补齐推理全栈当前
- 2026-08-10vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈最新
承接 v0.25.0 的 Model Runner V2 默认化,继续往架构适配走。
记录
信号正文
这次发布做了什么
vLLM v0.26.0 汇集了 212 位贡献者(其中 61 位是新面孔)的 411 个提交,是一次体量很大的版本。发布说明把「新增 Inkling 模型家族的完整支持栈」放在了第一条。
为什么是 Inkling
Inkling 是 Thinking Machines 在 7 月中旬开源的万亿参数级多模态 MoE 模型——本站已经把它作为当日头条信号收录。开源权重和「能在主流推理引擎上跑起来」之间,通常还隔着几周到几个月的适配工作:注意力核、图捕获策略、量化路径、并行切分,每一项都要针对具体架构重写。v0.26.0 把这段距离压缩到了十天左右。
支持栈包含四个层次:
- 基础建模:模型结构本身在 vLLM 内的实现;
- 分段 CUDA Graph(piecewise CUDA graph):把前向过程切成可以分别捕获的片段,让 MoE 这类含动态路由的结构也能吃到 CUDA Graph 的调度收益,而不必整图捕获;
- Hopper FA4 相对注意力:针对 H100 一代硬件的注意力核实现;
- MTP=1 推测解码:多 token 预测形态的推测解码,用小步长的草稿换取解码吞吐。
值得注意的信号
把这四条放在一起看,重点不是「又一个模型被支持了」,而是开源推理栈对新架构的适配周期正在明显缩短,并且适配是成套的——不是先能跑通、几个版本后才补上性能路径。对于要在本地或自有集群上评估新开源模型的团队,这直接改变了「等多久才能真正测起来」的预期。
为什么是现在
为什么重要
开源万亿参数模型从「放出权重」到「主流推理引擎上可用」的间隔被压到了十天量级,而且是基础建模、图捕获、注意力核、推测解码一次配齐。这改变了自建推理团队评估新模型的排期假设。
背景
技术背景
分段 CUDA Graph 解决的是 MoE 动态路由与整图捕获冲突的问题;FA4 相对注意力是面向 Hopper 架构的注意力核;MTP=1 推测解码属于多 token 预测形态,用草稿模型的小步长预测换取解码阶段吞吐。三者叠加才构成一条可用的生产推理路径。
关注人群
谁该关注
下一步
学习路径
- 先理解 MoE 架构为什么让图捕获和量化变复杂
- 再看推测解码如何用草稿模型换解码吞吐
- 最后结合自有硬件(是否 Hopper)判断这套支持栈能吃到多少收益
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- 在非 Hopper 硬件上,这套支持栈能保留多少性能收益?
- MTP=1 推测解码对长上下文任务的加速比是多少?
- 分段 CUDA Graph 是否会成为后续 MoE 模型的默认适配路径?
来源参考