软件架构
本地与云混合推理架构
把「哪些请求留在本地、哪些上云」当成一个架构决策:隐私、延迟、成本与能力四个约束的显式权衡。
端侧 AI推理与部署
这个概念是什么意思
端侧模型能力的提升没有消灭云端推理,而是把问题变成了分流:同一个产品里,简单、隐私敏感或离线场景的请求走本地小模型,复杂推理走云端大模型。Ollama v0.32.0 把默认入口换成智能体并默认挂载云端模型,就是这种混合形态成为主流默认的信号。设计混合架构时有四个显式约束要排序:隐私(哪些数据绝不能出设备)、延迟(本地省去网络往返,但大模型本地跑反而更慢)、成本(云端按 token 计费、本地按硬件摊销)、能力(任务失败率超过阈值就必须升级到更强模型)。常见的工程形态是「本地先试 + 置信度路由」:本地模型先答,低置信度或超时再升级云端,同时把路由决策记录下来供后续调优。这个概念解释了为什么端侧和云端的发布节奏值得同时关注。
关系网络
在关系网络中的位置
这个概念相邻的技术信号与相关技能,点击节点可继续探索。
本地与云混合推理架构
技术 · 10
- 模型之间只传 17 比特:一座桥补上一半差距
- FreeToken:消费级机器不是缩水的服务器,是异构资源
- Qwen3.8-27B 的第三方实测:模型很好,出厂默认值不好
- Qwen3.8-27B 开源:消费级显卡跑得动,尺子却是自己命名的
- Cloudflare Computer:不给智能体一个容器,给它一台机器
- 开放模型生态半年报:点赞与下载,只有一个仓库同时上榜
- LFM2.5-2.6B:一个在智能体外壳里训练出来的端侧模型
- Ollama v0.32.4:Apple GPU 上的 Laguna 支持与推测解码草稿量化
- Ollama v0.32.0:本地运行时转型智能体工作台
- Ollama v0.31.2:本地大模型运行时发布稳定版
可解释
这个概念能解释的技术信号
搭配技能