评估与分析

推理服务容量规划

估算并发、显存与成本三者的关系,判断一次推理栈升级或模型更换对自托管服务意味着什么。

当前热门学习成本中等
推理与部署可观测性

这项技能能帮你做什么

推理引擎的大版本升级(如 vLLM 的 Model Runner V2 代际切换)会直接改变吞吐、延迟和 GPU 成本曲线,容量规划就是把这些变化翻译成可决策的数字。核心方法:先定延迟预算(P95 首 token 时间和整体响应时间),再由目标并发反推批量大小、KV 缓存占用和显存配置;量化方案与模型尺寸的选择应服从这个预算,而不是反过来。每次推理栈升级前,用一组固定的代表性请求做基准回放,比较升级前后的吞吐/延迟/成本三条曲线,而不是只看版本说明里的峰值数字。对本地与云混合部署(如 Ollama 的本地/云双轨),还要把两侧的容量分开核算:本地受限于单机显存,云端受限于配额与预算。这项技能让「要不要跟进这次升级」从直觉判断变成有数字支撑的决策。

关系网络

在关系网络中的位置

这项技能相邻的技术信号与背景概念,点击节点可继续探索。

用已发布信号练习

这项技能有助于评估的技术信号

背景概念

与这项技能搭配的知识