工具 · 第 2026-07-11

vLLM v0.25.0:Model Runner V2 成为默认执行引擎的大版本

vLLM 发布 v0.25.0:558 个提交、232 位贡献者参与的大版本。Model Runner V2 正式成为所有稠密模型的默认执行引擎,在上一版本量化模型支持的基础上完成了推理执行栈的代际切换。

vLLM Releases2026-07-11值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

推理与部署

版本脉络

这条信号已有后续

你正在读的是这条线上较早的一条,之后还有 2 条,最新的是「vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈」。

  1. 2026-06-30vLLM v0.24.0:开源高吞吐推理引擎发布新稳定版
  2. 2026-07-11vLLM v0.25.0:Model Runner V2 成为默认执行引擎的大版本当前
  3. 2026-07-25vLLM v0.26.0:为 Inkling 万亿参数模型补齐推理全栈
  4. 2026-08-10vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈最新

承接 v0.24.0 稳定版:Model Runner V2 从量化模型扩到所有稠密模型,推理执行栈完成代际切换。

记录

信号正文

vLLM v0.25.0 是推理执行栈切换的收官版本:Model Runner V2(MRv2)正式成为所有稠密模型的默认执行引擎。这次发布汇集了 558 个提交、232 位贡献者(其中 64 位是新贡献者),延续了上一个版本(v0.24.0)打下的量化模型支持基础。

对使用者来说,这是一次「默认值变更」级别的升级:过去需要显式开启的新执行引擎,现在开箱即用。执行引擎决定了批处理调度、KV 缓存管理和算子路径,直接影响吞吐与延迟表现,因此升级前后值得用自己的真实负载做一轮基准对比,而不是只看官方数字。

结合同期 Hugging Face 宣布 Transformers 后端在 vLLM 中达到原生速度,可以看到开源推理生态正在收敛:vLLM 负责极致的服务优化,模型实现层则越来越多地交给标准化的建模库。对自建推理服务的团队而言,vLLM 的大版本节奏(v0.24 → v0.25 两个月内完成执行栈切换)本身就是一个值得跟踪的信号。

为什么是现在

为什么重要

推理引擎的默认执行栈切换会直接改变吞吐、延迟和 GPU 成本曲线。vLLM 是目前自建大模型服务最主流的开源选择,它的大版本升级几乎影响所有自托管推理团队。

背景

技术背景

Model Runner V2 是 vLLM 重写的模型执行层,负责调度、KV 缓存与算子路径。v0.24 先以量化模型为试点,v0.25 将其推广为全部稠密模型的默认值——这是典型的「灰度到默认」的执行栈迁移路径。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

推理平台与服务工程师关注 GPU 成本的 MLOps 负责人自托管开源模型的技术团队
可能影响的领域
自托管模型推理服务GPU 成本与容量规划开源推理生态标准化

下一步

学习路径

  1. 先理解推理引擎在服务栈中的位置:模型实现、执行引擎、服务编排各自负责什么
  2. 用官方文档跑通 vLLM 的基本部署,观察吞吐与显存占用
  3. 在自己的真实负载上对比 v0.24 与 v0.25 的表现,验证默认值变更的影响

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • MRv2 对 MoE 与多模态模型的支持进度如何?
  • 你的负载在 v0.25 上的吞吐/延迟变化是多少?
  • Transformers 后端与原生实现在你的目标模型上还有差距吗?

来源参考

vLLM Releases

vLLM Project开源社区2026-07-11
打开原始来源https://github.com/vllm-project/vllm/releases/tag/v0.25.0