机器学习
模型选型与约束匹配
选模型不是挑最强的那个,而是先找出哪个约束最先咬人——延迟、隐私、成本,还是任务本身根本不需要那么大的模型。
这个概念是什么意思
「用哪个模型」这个问题,很少由「哪个最强」决定。真正决定答案的是延迟、隐私、成本、任务复杂度这四个约束里,哪一个先咬人。通常只有一个先咬人,而它一旦确定,候选集会立刻小掉一个数量级。
有一整类任务,大模型是形状不对,而不只是贵
Liquid AI 的 LFM2.5-Encoders 是两个 230M 与 350M 的开源编码器,支持 8,192 token 上下文,长上下文场景下在 CPU 上比 ModernBERT-base 快约 3.7 倍。它瞄准的是被生成式模型遮住的那一半生产负载:意图路由、策略检查、PII 识别、文本分类。
这些任务的共同点是输出是一个标签,不是一段话,而且整天在跑、大多跑在 CPU 上。对它们来说,旗舰模型不是贵一点,是形状不对——你为一个用不上的能力付了延迟、成本和运维复杂度。
参数量不是尺寸
Inkling 是约 1 万亿总参数、41B 激活参数的 MoE 模型。这两个数字都回答不了「我跑不跑得动」:真正决定的是显存,BF16 约 2TB,NVFP4 约 600GB。
所以看规模要同时看三个数:
- 总参数——决定权重占多大。
- 激活参数——决定每个 token 实际算多少。
- 目标精度下的显存占用——决定你需要几张卡。
只报总参数的比较没有信息量。
承诺的日期不是可用的日期
Kimi K3 发布时是 2.8 万亿参数、承诺月内开放权重。在权重真正落地之前,它对一个自托管团队的价值是零。把「已宣布」和「已可用」记成两列,选型表才不会骗自己。
「选多大」之外,还有「选哪一层」
GitHub 在 Copilot 改成按 API 列表价计费之后,正面回答了「既然能直接调 API,为什么还要付 Copilot」:你要自己拥有哪一层——是模型调用本身,还是围绕它的编辑器、仓库、终端、组织策略与计费控制这一整套外壳。
模型选型和边界选型是同一个决定的两半。 先定你必须拥有哪一层,再去比价格;反过来做,比出来的价格没有意义。
交给谁
判断推理引擎对某个模型的支持到了哪一级、多久能真正跑起来,是「模型与推理引擎的支持路径」;目标是一台具体的机器,是「端侧模型部署与硬件适配」;要为很多人提供服务,是「推理服务容量规划」;而读一份发布公告并决定该不该换代,是「旗舰模型发布解读与换代判断」。
关系网络
在关系网络中的位置
这个概念相邻的技术信号与相关技能,点击节点可继续探索。
- 90 亿个变异预先算好:把模型变成一份资源
- 模型之间只传 17 比特:一座桥补上一半差距
- FreeToken:消费级机器不是缩水的服务器,是异构资源
- GPT-6 Astra 发布:越权行为从 48% 降到 0
- Muse Glimmer 开源:30B 压进消费级显卡,报错不停下
- 智能体记忆不是开关,是要按模型标定的剂量
- 同一个集群多出 33 个点的利用率:变的只是分配顺序
- Qwen3.8-27B 开源:消费级显卡跑得动,尺子却是自己命名的
- 开放模型生态半年报:点赞与下载,只有一个仓库同时上榜
- Gemini 3.7 Flash:主力档三周一迭代,价格砍半
- Meta 重回开放权重:一封长文、一个独立董事会,和一组本地部署的数字
- SL2T:手语识别第一次离开实验室,进了输入法
- Meta Muse Glimmer:30B 蒸馏开源模型,专为本地智能体设计
- BigBang-v1:把数据生产系统本身当成优化对象,以及一处对不上的口径
- LFM2.5-2.6B:一个在智能体外壳里训练出来的端侧模型
- LFM2.5-Encoders:能在 CPU 上跑长文档的小编码器,长上下文比 ModernBERT 快 3.7 倍
- vLLM v0.26.0:为 Inkling 万亿参数模型补齐推理全栈
- Copilot 与裸 API:为编码智能体的「外壳」付费,到底买到了什么
- Kimi K3:Moonshot 发布 2.8 万亿参数旗舰,承诺月内开放权重
- 端侧小语言模型
可解释
这个概念能解释的技术信号
搭配技能