软件架构

本地与云混合推理架构

把「哪些请求留在本地、哪些上云」当成一个架构决策:隐私、延迟、成本与能力四个约束的显式权衡。

进阶
端侧 AI推理与部署

这个概念是什么意思

端侧模型能力的提升没有消灭云端推理,而是把问题变成了分流:同一个产品里,简单、隐私敏感或离线场景的请求走本地小模型,复杂推理走云端大模型。Ollama v0.32.0 把默认入口换成智能体并默认挂载云端模型,就是这种混合形态成为主流默认的信号。设计混合架构时有四个显式约束要排序:隐私(哪些数据绝不能出设备)、延迟(本地省去网络往返,但大模型本地跑反而更慢)、成本(云端按 token 计费、本地按硬件摊销)、能力(任务失败率超过阈值就必须升级到更强模型)。常见的工程形态是「本地先试 + 置信度路由」:本地模型先答,低置信度或超时再升级云端,同时把路由决策记录下来供后续调优。这个概念解释了为什么端侧和云端的发布节奏值得同时关注。

关系网络

在关系网络中的位置

这个概念相邻的技术信号与相关技能,点击节点可继续探索。

可解释

这个概念能解释的技术信号

搭配技能

使用这个概念的技能