Inkling:Thinking Machines 开源万亿参数多模态 MoE 模型
Thinking Machines 开源 Inkling:约 1 万亿总参数、41B 激活参数的 MoE 多模态模型,原生处理文本/图像/音频输入,支持 1M 上下文,训练数据覆盖 45 万亿 token 的文本、图像、音频与视频。发布即获得 Transformers、vLLM、SGLang、llama.cpp、Unsloth 的支持。
多个信号同时成立,建议优先评估这条技术变化。
记录
信号正文
Inkling 是一个开源权重的旗舰级多模态语言模型:总参数约 1 万亿,通过 256 专家的 MoE 架构每次仅激活 41B 参数,训练语料覆盖 45 万亿 token 的文本、图像、音频与视频,上下文窗口达到 1M。
架构上有几处值得注意的选择:多模态输入不走独立编码器,而是用层级式 MLP 模块直接处理图像/文本/音频;注意力机制混合了全局与滑动窗口两种模式,位置编码采用 relative attention 并加入了一层短一维卷积;模型内置投机式多 token 预测(MTP)层加速推理,并支持从 none 到 max 的可调推理强度——这组设计基本对齐了当前闭源旗舰模型的公开技术特征。
发布形态同样面向实际部署:BF16 权重需要约 2TB 显存,NVFP4 量化版本压到约 600GB,发布当天即获得 Transformers、vLLM、SGLang、llama.cpp、Unsloth 的支持,也可通过 Hugging Face Inference Providers 直接试用。这意味着开源阵营第一次把「万亿参数、原生多模态、1M 上下文」这组旗舰规格同时放进了一个可自托管的模型——尽管 600GB 起步的显存需求决定了它仍是数据中心级的选择。
为什么是现在
为什么重要
开源权重第一次同时具备万亿参数、原生多模态与 1M 上下文这组旗舰规格,直接改变「开源 vs 闭源 API」的选型格局;而 600GB 起步的显存需求也把自托管的容量规划难度抬到了新档位。
背景
技术背景
MoE 稀疏激活让 1T 总参数只需 41B 激活算力,是「大容量、可控推理成本」的主流路线。但显存必须装下全部专家权重:即便 NVFP4 量化后仍需约 600GB,对应 8×80GB 级别的多卡甚至多机部署——权重开放不等于部署门槛消失。
关注人群
谁该关注
下一步
学习路径
- 先理解 MoE 的稀疏激活机制:总参数、激活参数、显存占用三者为什么脱钩
- 对照 BF16 / NVFP4 两档显存需求,估算自托管 Inkling 的硬件与成本下限
- 用 Hugging Face Inference Providers 的免费额度在自己的任务上先做质量评估,再决定是否投入部署
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- NVFP4 量化相对 BF16 的质量损失在你的任务上有多大?
- vLLM / SGLang 对 MTP 投机解码层的支持成熟度如何?
- 1M 上下文在真实长文档任务中的有效利用率是多少?
来源参考