模型 · 第 2026-07-15

Inkling:Thinking Machines 开源万亿参数多模态 MoE 模型

Thinking Machines 开源 Inkling:约 1 万亿总参数、41B 激活参数的 MoE 多模态模型,原生处理文本/图像/音频输入,支持 1M 上下文,训练数据覆盖 45 万亿 token 的文本、图像、音频与视频。发布即获得 Transformers、vLLM、SGLang、llama.cpp、Unsloth 的支持。

Hugging Face Blog2026-07-15立即关注

多个信号同时成立,建议优先评估这条技术变化。

多模态推理与部署前沿模型

记录

信号正文

Inkling 是一个开源权重的旗舰级多模态语言模型:总参数约 1 万亿,通过 256 专家的 MoE 架构每次仅激活 41B 参数,训练语料覆盖 45 万亿 token 的文本、图像、音频与视频,上下文窗口达到 1M。

架构上有几处值得注意的选择:多模态输入不走独立编码器,而是用层级式 MLP 模块直接处理图像/文本/音频;注意力机制混合了全局与滑动窗口两种模式,位置编码采用 relative attention 并加入了一层短一维卷积;模型内置投机式多 token 预测(MTP)层加速推理,并支持从 none 到 max 的可调推理强度——这组设计基本对齐了当前闭源旗舰模型的公开技术特征。

发布形态同样面向实际部署:BF16 权重需要约 2TB 显存,NVFP4 量化版本压到约 600GB,发布当天即获得 Transformers、vLLM、SGLang、llama.cpp、Unsloth 的支持,也可通过 Hugging Face Inference Providers 直接试用。这意味着开源阵营第一次把「万亿参数、原生多模态、1M 上下文」这组旗舰规格同时放进了一个可自托管的模型——尽管 600GB 起步的显存需求决定了它仍是数据中心级的选择。

为什么是现在

为什么重要

开源权重第一次同时具备万亿参数、原生多模态与 1M 上下文这组旗舰规格,直接改变「开源 vs 闭源 API」的选型格局;而 600GB 起步的显存需求也把自托管的容量规划难度抬到了新档位。

背景

技术背景

MoE 稀疏激活让 1T 总参数只需 41B 激活算力,是「大容量、可控推理成本」的主流路线。但显存必须装下全部专家权重:即便 NVFP4 量化后仍需约 600GB,对应 8×80GB 级别的多卡甚至多机部署——权重开放不等于部署门槛消失。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

模型选型与技术决策者推理平台与 MLOps 工程师多模态应用开发者
可能影响的领域
开源旗舰模型格局多模态应用开发自托管推理容量规划

下一步

学习路径

  1. 先理解 MoE 的稀疏激活机制:总参数、激活参数、显存占用三者为什么脱钩
  2. 对照 BF16 / NVFP4 两档显存需求,估算自托管 Inkling 的硬件与成本下限
  3. 用 Hugging Face Inference Providers 的免费额度在自己的任务上先做质量评估,再决定是否投入部署

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • NVFP4 量化相对 BF16 的质量损失在你的任务上有多大?
  • vLLM / SGLang 对 MTP 投机解码层的支持成熟度如何?
  • 1M 上下文在真实长文档任务中的有效利用率是多少?

来源参考

Hugging Face Blog

Thinking Machines创业公司2026-07-15
打开原始来源https://hf-mirror.com/blog/thinkingmachines-inkling