工程落地
端侧模型部署与硬件适配
判断一台具体的机器能不能跑、跑得值不值:定量化档位、选运行时、配卸载与上下文,最后用首 token 延迟和稳态吞吐验收——而不是看参数量猜。
端侧 AI推理与部署
这项技能能帮你做什么
端侧部署的第一个判断不是「这个模型好不好」,而是这台机器的内存带宽和显存够不够。参数量只决定权重占多大,真正决定体验的是每生成一个 token 要把多少字节从内存搬到计算单元。
按顺序定下四个量,顺序反过来就会返工:
- 量化档位。先看权重压到几 bit 还不塌,再决定 KV cache 和推测解码的草稿输出头要不要单独定精度。Ollama v0.32.4 修的正是 MoE 专家精度不一致导致的解码问题——「整个模型一个档位」这种想法在混合结构上已经不成立。
- 运行时。llama.cpp / MLX / vLLM 各自吃不同的硬件路径:Apple 芯片上要走 MLX 才拿得到 GPU,消费级 N 卡走 CUDA,纯 CPU 只能靠小模型和低比特硬扛。运行时选错,再好的芯片也是闲着。
- 卸载与上下文。放不下就得决定哪几层留在显存、上下文开多长。上下文长度直接吃 KV cache,它常常比权重更早把显存打满。
- 验收指标。用首 token 延迟和稳态 tokens/s 两个数收尾,并且必须在目标设备上实测:同一份模型在 M5 Max 和一台四年前的笔记本上是两个产品。
三个常见误判:
- 拿「跑起来了」当「跑得动」。 交换到磁盘也能出字,但每秒一个 token 的助手没人会用第二次。
- 只测短提示。 长上下文下显存占用和延迟都是另一条曲线,短提示的漂亮数字骗不了真实使用。
- 把端侧当成免费。 省下的是 API 费用,换来的是分发、升级和一堆设备型号的适配成本——这笔账要和「本地与云混合推理架构」一起算。
这项能力的边界很清楚:它止于单机。一旦要为多人同时提供服务,问题就变成排队、批处理和副本数,交给「推理服务容量规划」。
关系网络
在关系网络中的位置
这项技能相邻的技术信号与背景概念,点击节点可继续探索。
端侧模型部署与硬件适配
技术 · 16
- 模型之间只传 17 比特:一座桥补上一半差距
- FreeToken:消费级机器不是缩水的服务器,是异构资源
- Muse Glimmer 开源:30B 压进消费级显卡,报错不停下
- Qwen3.8-27B 的第三方实测:模型很好,出厂默认值不好
- Qwen3.8-27B 开源:消费级显卡跑得动,尺子却是自己命名的
- 开放模型生态半年报:点赞与下载,只有一个仓库同时上榜
- Meta 重回开放权重:一封长文、一个独立董事会,和一组本地部署的数字
- SL2T:手语识别第一次离开实验室,进了输入法
- Meta Muse Glimmer:30B 蒸馏开源模型,专为本地智能体设计
- LFM2.5-2.6B:一个在智能体外壳里训练出来的端侧模型
- LFM2.5-Encoders:能在 CPU 上跑长文档的小编码器,长上下文比 ModernBERT 快 3.7 倍
- Gemini Robotics 2:全身控制,与一个可编排的推理层
- Ollama v0.32.4:Apple GPU 上的 Laguna 支持与推测解码草稿量化
- Ollama v0.32.0:本地运行时转型智能体工作台
- Ollama v0.31.2:本地大模型运行时发布稳定版
- 端侧小语言模型
用已发布信号练习
这项技能有助于评估的技术信号
背景概念