vLLM v0.25.0:Model Runner V2 成为默认执行引擎的大版本
vLLM 发布 v0.25.0:558 个提交、232 位贡献者参与的大版本。Model Runner V2 正式成为所有稠密模型的默认执行引擎,在上一版本量化模型支持的基础上完成了推理执行栈的代际切换。
基础信息较完整,适合持续跟踪并等待更多验证。
版本脉络
这条信号已有后续
你正在读的是这条线上较早的一条,之后还有 2 条,最新的是「vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈」。
- 2026-06-30vLLM v0.24.0:开源高吞吐推理引擎发布新稳定版
- 2026-07-11vLLM v0.25.0:Model Runner V2 成为默认执行引擎的大版本当前
- 2026-07-25vLLM v0.26.0:为 Inkling 万亿参数模型补齐推理全栈
- 2026-08-10vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈最新
承接 v0.24.0 稳定版:Model Runner V2 从量化模型扩到所有稠密模型,推理执行栈完成代际切换。
记录
信号正文
vLLM v0.25.0 是推理执行栈切换的收官版本:Model Runner V2(MRv2)正式成为所有稠密模型的默认执行引擎。这次发布汇集了 558 个提交、232 位贡献者(其中 64 位是新贡献者),延续了上一个版本(v0.24.0)打下的量化模型支持基础。
对使用者来说,这是一次「默认值变更」级别的升级:过去需要显式开启的新执行引擎,现在开箱即用。执行引擎决定了批处理调度、KV 缓存管理和算子路径,直接影响吞吐与延迟表现,因此升级前后值得用自己的真实负载做一轮基准对比,而不是只看官方数字。
结合同期 Hugging Face 宣布 Transformers 后端在 vLLM 中达到原生速度,可以看到开源推理生态正在收敛:vLLM 负责极致的服务优化,模型实现层则越来越多地交给标准化的建模库。对自建推理服务的团队而言,vLLM 的大版本节奏(v0.24 → v0.25 两个月内完成执行栈切换)本身就是一个值得跟踪的信号。
为什么是现在
为什么重要
推理引擎的默认执行栈切换会直接改变吞吐、延迟和 GPU 成本曲线。vLLM 是目前自建大模型服务最主流的开源选择,它的大版本升级几乎影响所有自托管推理团队。
背景
技术背景
Model Runner V2 是 vLLM 重写的模型执行层,负责调度、KV 缓存与算子路径。v0.24 先以量化模型为试点,v0.25 将其推广为全部稠密模型的默认值——这是典型的「灰度到默认」的执行栈迁移路径。
关注人群
谁该关注
下一步
学习路径
- 先理解推理引擎在服务栈中的位置:模型实现、执行引擎、服务编排各自负责什么
- 用官方文档跑通 vLLM 的基本部署,观察吞吐与显存占用
- 在自己的真实负载上对比 v0.24 与 v0.25 的表现,验证默认值变更的影响
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- MRv2 对 MoE 与多模态模型的支持进度如何?
- 你的负载在 v0.25 上的吞吐/延迟变化是多少?
- Transformers 后端与原生实现在你的目标模型上还有差距吗?
来源参考