机器学习
混合专家模型(MoE)架构
理解稀疏激活如何让总参数、推理算力与显存占用三者脱钩——读懂开源旗舰模型规格表和估算部署成本的前提概念。
前沿模型推理与部署
这个概念是什么意思
混合专家模型(Mixture of Experts, MoE)把稠密网络中的前馈层替换为多个「专家」子网络,每个 token 经路由器只激活其中少数几个。结果是三个此前绑定的量被拆开了:总参数决定模型容量(和显存下限),激活参数决定单次推理的计算成本,而路由质量决定这份容量被利用得多好。Inkling 的「1 万亿总参数、41B 激活」正是这种脱钩的直观例子——推理算力接近一个 41B 稠密模型,但知识容量远超之。
工程上最常被误读的一点:稀疏激活省的是算力,不是显存。所有专家的权重都必须在显存里待命(路由是逐 token 决定的),所以 1T 总参数的模型即便量化后仍需数百 GB 显存,部署门槛是数据中心级的多卡/多机。这也解释了为什么 MoE 是「大容量、可控推理成本」的路线,而不是「大模型跑在小硬件上」的路线。
读规格表时的三个检查点:一看总参/激活参数比(容量与算力的杠杆率);二看专家数与共享专家设计(路由粒度);三看推理引擎的 MoE 支持成熟度——执行引擎对专家并行、专家卸载的支持程度,直接决定纸面规格能否变成实际吞吐。
关系网络
在关系网络中的位置
这个概念相邻的技术信号与相关技能,点击节点可继续探索。
混合专家模型(MoE)架构
技术 · 9
- 模型之间只传 17 比特:一座桥补上一半差距
- FreeToken:消费级机器不是缩水的服务器,是异构资源
- vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈
- BigBang-v1:把数据生产系统本身当成优化对象,以及一处对不上的口径
- SGLang v0.5.17:Kimi K3 首日可服务,以及一个认识会话的前缀缓存
- Ollama v0.32.4:Apple GPU 上的 Laguna 支持与推测解码草稿量化
- vLLM v0.26.0:为 Inkling 万亿参数模型补齐推理全栈
- Inkling:Thinking Machines 开源万亿参数多模态 MoE 模型
- vLLM v0.25.0:Model Runner V2 成为默认执行引擎的大版本
可解释
这个概念能解释的技术信号
搭配技能