评估与分析
推理服务容量规划
估算并发、显存与成本三者的关系,判断一次推理栈升级或模型更换对自托管服务意味着什么。
推理与部署可观测性
这项技能能帮你做什么
推理引擎的大版本升级(如 vLLM 的 Model Runner V2 代际切换)会直接改变吞吐、延迟和 GPU 成本曲线,容量规划就是把这些变化翻译成可决策的数字。核心方法:先定延迟预算(P95 首 token 时间和整体响应时间),再由目标并发反推批量大小、KV 缓存占用和显存配置;量化方案与模型尺寸的选择应服从这个预算,而不是反过来。每次推理栈升级前,用一组固定的代表性请求做基准回放,比较升级前后的吞吐/延迟/成本三条曲线,而不是只看版本说明里的峰值数字。对本地与云混合部署(如 Ollama 的本地/云双轨),还要把两侧的容量分开核算:本地受限于单机显存,云端受限于配额与预算。这项技能让「要不要跟进这次升级」从直觉判断变成有数字支撑的决策。
关系网络
在关系网络中的位置
这项技能相邻的技术信号与背景概念,点击节点可继续探索。
推理服务容量规划
技术 · 14
- 平均成功率 77%,五次全对只有 53%:智能体的一致性差距
- 90 亿个变异预先算好:把模型变成一份资源
- FreeToken:消费级机器不是缩水的服务器,是异构资源
- 同一个集群多出 33 个点的利用率:变的只是分配顺序
- Cloudflare Computer:不给智能体一个容器,给它一台机器
- vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈
- 一次 180 万美元的智能体账单:超预算 860%,五个月后才被发现
- SGLang v0.5.17:Kimi K3 首日可服务,以及一个认识会话的前缀缓存
- LFM2.5-Encoders:能在 CPU 上跑长文档的小编码器,长上下文比 ModernBERT 快 3.7 倍
- Ollama v0.32.4:Apple GPU 上的 Laguna 支持与推测解码草稿量化
- vLLM v0.26.0:为 Inkling 万亿参数模型补齐推理全栈
- Ollama v0.32.0:本地运行时转型智能体工作台
- vLLM v0.25.0:Model Runner V2 成为默认执行引擎的大版本
- vLLM 的 Transformers 后端达到原生速度:450+ 架构免移植高性能推理
用已发布信号练习
这项技能有助于评估的技术信号
背景概念