工具 · 第 2026-07-08

vLLM 的 Transformers 后端达到原生速度:450+ 架构移植高性能推理

Hugging Face 与 vLLM 宣布:vLLM 中的 Transformers 建模后端在 Qwen3 4B/32B 稠密模型和 235B FP8 MoE 上全面追平甚至反超 vLLM 手写原生实现。模型作者只需一个 --model-impl transformers 开关,就能让 Transformers 实现直接获得 vLLM 级推理性能,无需移植。

Hugging Face Blog2026-07-08值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

推理与部署工作流

记录

信号正文

Transformers 库支持 450 多种模型架构,长期扮演着「参考建模库」的角色:模型作者先在 Transformers 里实现,再由 vLLM、SGLang、MLX、llama.cpp 等推理框架逐个移植。去年 vLLM 集成了 Transformers 作为建模后端,让模型无需移植即可运行——但性能一直落后于手写原生实现。

这次的更新改变了这一点。Hugging Face 在三个差异很大的 Qwen3 模型上做了头对头对比:单卡 4B 稠密模型、张量并行的 32B 稠密模型、以及 8×H100 上数据并行 + 专家并行的 235B FP8 MoE。结果是 Transformers 后端在全部三档上追平或反超原生实现。使用方式只是一个开关(--model-impl transformers),与现有并行配置完全兼容;目前的例外是线性注意力类模型(官方表示即将支持)。

这件事的生态意义大于单点性能:模型实现只需写一次 Transformers 版本,就能同时获得可读的参考实现和生产级推理性能,「参考实现 vs 高性能实现」的二选一正在消失。对推理团队来说,新架构模型的可用时间差(Transformers 先可用、vLLM 原生实现晚数周)也随之消失。

为什么是现在

为什么重要

它消除了「参考实现」与「高性能实现」之间的移植成本:新模型在 Transformers 里实现一次,就能立即以 vLLM 级性能上线。这会显著缩短新架构从发布到可生产部署的时间差。

背景

技术背景

Transformers 提供建模代码(前向计算与权重定义),vLLM 提供连续批处理、自定义注意力内核等服务优化,两者通过 --model-impl 契约组合。基准对比在相同服务配置下只切换代码路径(native / transformers before / after)。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

跟进新模型架构的推理工程师维护自有模型实现的模型作者评估推理框架选型的平台团队
可能影响的领域
新模型的上线周期推理框架选型开源建模库生态分工

下一步

学习路径

  1. 理解建模库与推理引擎的分工:模型实现、执行优化分别在哪一层
  2. 用 --model-impl transformers 与原生实现各跑一次相同负载,对比吞吐
  3. 跟踪线性注意力等尚未支持的架构类型的进展

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 你在用的模型架构是否在 450+ 支持列表里?
  • 线性注意力模型的支持何时落地?
  • SGLang、MLX 等其他推理框架会跟进类似的后端模式吗?

来源参考

Hugging Face Blog

Hugging Face创业公司2026-07-08
打开原始来源https://hf-mirror.com/blog/native-speed-vllm-transformers-backend