机器学习
模型量化与数值精度
把权重和激活从高精度压到低比特,是让大模型跑进有限显存的主要手段;代价是精度损失,而损失落在哪一层决定了它是无感还是灾难。
推理与部署端侧 AI
这个概念是什么意思
量化的基本动作很简单:用更少的比特存同一个数。真正难的是决定哪些部分可以被压、压到多少。
三件事值得先弄清楚:
1. 不是所有层都一样敏感。 注意力的输出投影、归一化参数、路由器(router)和输出头(output head)对精度远比中间的前馈层敏感。实践中常见的做法是把这些留在较高精度,其余压到 4-bit 或 8-bit——所以你会在发布说明里反复看到「保留输出头精度」「router 保持原精度」这类描述。
2. 混合精度会带来一致性问题。 MoE 架构允许每个专家单独存储,于是不同专家用不同量化类型是完全可能的。这在服务器端是省显存的常规手段,但一旦解码路径没有处理好精度不一致,表现就是输出异常或性能塌陷,而不是一个干净的报错。
3. 量化会和其他优化互相影响。 推测解码里草稿模型的开销直接决定净收益,如果草稿的输出头没有按请求精度量化,省下来的时间会被重新吃掉。图捕获、注意力核的选择也都和数据类型绑定。
判断一条量化相关的信号是否重要,可以问三个问题:它动的是哪一层?精度损失有没有被量化评估(而不是只给个速度数字)?它和现有的推理路径(推测解码、图捕获、并行切分)是否兼容?
关系网络
在关系网络中的位置
这个概念相邻的技术信号与相关技能,点击节点可继续探索。
模型量化与数值精度
技术 · 10
- FreeToken:消费级机器不是缩水的服务器,是异构资源
- Muse Glimmer 开源:30B 压进消费级显卡,报错不停下
- Qwen3.8-27B 的第三方实测:模型很好,出厂默认值不好
- Qwen3.8-27B 开源:消费级显卡跑得动,尺子却是自己命名的
- Meta 重回开放权重:一封长文、一个独立董事会,和一组本地部署的数字
- Meta Muse Glimmer:30B 蒸馏开源模型,专为本地智能体设计
- SGLang v0.5.17:Kimi K3 首日可服务,以及一个认识会话的前缀缓存
- Ollama v0.32.4:Apple GPU 上的 Laguna 支持与推测解码草稿量化
- vLLM v0.26.0:为 Inkling 万亿参数模型补齐推理全栈
- Ollama v0.32.0:本地运行时转型智能体工作台
可解释
这个概念能解释的技术信号
搭配技能