模型 · 第 2026-08-04

LFM2.5-2.6B:一个智能外壳训练出来的端侧模型

Liquid AI 发布 2.6B 的端侧智能体模型:不到 2.5GB 内存,M5 Max 上 220 tok/s、Ryzen 上 113 tok/s、手机上约 30 tok/s,工具使用与指令跟随几乎全线压过 4 倍大的模型。真正值得注意的不是尺寸,而是后训练的最后一段直接在 OpenClaw、Hermes Agent 这类真实智能体外壳内部跑强化学习——适配的方向反了过来。

Hugging Face Blog2026-08-04值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

端侧 AIAI 智能体推理与部署

记录

信号正文

这一版给了什么

2.6B 参数,不到 2.5GB 内存,目标是让一台普通机器自己跑完整的智能体循环——工具调用、多步流程,不出设备。速度是三档:Apple M5 Max 上 220 tok/sRyzen AI Max+ 395 上 113 tok/s、手机上约 30 tok/s;GPU 侧在高并发下接近每秒 1.5 万输出 token,单张 H100 约合每天 13 亿 token。预训练约 34T token,中训练把上下文扩到 128Kllama.cppMLXvLLMSGLangONNX 首日全部支持,指令版与 Base 版当天都在 Hugging Face 上。

跑分对照的是最大到它约 4 倍的模型(Gemma 4 E2B/E4B、Qwen3.5-4B/9B):指令跟随四项全部第一,工具使用除 BFCLv4 外全部第一——那一项被 9.7B 的 Qwen3.5 压过。

真正的信号在训练方式,不在尺寸

后训练分四段,前三段是常规路数:两轮偏重智能体数据的监督微调、按领域各训一个专家教师、再把教师蒸馏回一个学生。第四段才是这条信号的理由:Agentic RL 直接在真实的智能体外壳内部跑多轮强化学习,而不是在合成的工具调用样本上跑。

它的做法值得记住:训练引擎、推演引擎和环境执行被拆成三个独立部件,动作在沙箱服务里执行,外壳(OpenClaw 或 Hermes Agent)被一个 Harness Proxy 当成黑盒——不改外壳一行代码,只在旁边抓 token 级轨迹用来还原训练样本。

这意味着适配的方向反了。通常是你改流程去迁就模型;这里是模型在你已经在跑的那套流程里学会怎么工作。

与前一天那条正好是同一道题的两端

LLM 0.32 那条讲的是工具循环正在往供应商一侧收拢——由供应商替你在一次请求里执行远程调用。这一条是另一端:把足以驱动工具循环的模型压到 2.5GB,塞进你自己的机器。两者都在回答「工具循环归谁所有」,答案相反,而这条给了本地那一侧第一个像样的筹码。

厂商划的边界,和一条不该被跑分盖住的社区反馈

  1. 代码是它明确落后的一档。厂商自己写明:编码任务上更大的模型仍有清晰领先,该用大的就用大的。
  2. 它会安静地把错的当对的讲出来。文章下面一条社区反馈:在一次智能体流程里,模型从 MCP 工具取回了格式错误的数据,没有报错,而是自信地把错误数据当作事实呈现,下一步直接吃掉了这个错误;同一流程换 Gemma 4 E4B 没有复现。

第二条比任何一个跑分都值得先读。它不是「小模型比较笨」,而是判断「这一步做完了吗、这个返回值可信吗」是一种和工具调用本身分开的能力——工具调用格式正确,不等于结果正确。要把这类模型放进真实流程,护栏得建在工具层,而不是指望模型自己发现返回值不对。

为什么是现在

为什么重要

端侧智能体此前的瓶颈不是「能不能跑」,而是「跑得动的模型驱不动工具循环」。2.6B、不到 2.5GB、手机上 30 tok/s 且工具使用接近同类最好水平,第一次让「整条智能体循环留在本机」成为一个可以认真评估的选项,而不是演示。

背景

技术背景

四段后训练:偏重智能体数据的两轮 SFT、按领域训练专家教师、多领域在线策略蒸馏(MOPD)把教师合并回学生、最后在真实外壳内部做多轮 Agentic RL。RL 侧把训练引擎、推演引擎与环境执行拆开,用 Harness Proxy 把 OpenClaw / Hermes Agent 当黑盒接入,只抓 token 级轨迹。推理侧首日支持 llama.cpp、MLX、vLLM、SGLang、ONNX。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

要把智能体部署到笔记本、手机或边缘设备,且不想为每次调用付云端账单的工程团队数据不能出设备、因此一直无法用云端模型跑智能体流程的团队正在评估「自建到哪一层」的技术决策者:这条信号把本地那一侧的可行边界往前推了一格
可能影响的领域
端侧与边缘部署智能体工具循环推理成本与隐私边界后训练方法

下一步

学习路径

  1. 先读《端侧模型部署与硬件适配》,把量化档位、运行时路径和验收指标(首字延迟 + 稳态 tokens/s)在目标设备上定下来
  2. 再读《模型选型与约束匹配》,确认在你的场景里先咬人的约束是内存、延迟还是能力——这条模型只在前两者上有优势
  3. 把《工具集成模式》和《完成判定与验收信号》一起读:社区反馈里那次静默错误,正是这两条讲的护栏该拦下的
  4. 真要上线前,用《模型与输出评估》先写下「什么算做对了」,再跑基准——否则跑分只能告诉你它比谁强,不能告诉你它够不够用

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 在你自己的外壳里(而不是 OpenClaw / Hermes)它还剩多少工具使用能力?Agentic RL 是在特定外壳里训的,跨外壳的迁移损失没有公开数字
  • 工具返回格式错误时的静默失败率有多高?厂商基准里没有这一项,而它决定了能否无人值守
  • 128K 上下文在 2.5GB 内存预算下实际能用到多少?长上下文的 KV 缓存开销不在那个 2.5GB 里

来源参考

Hugging Face Blog

Liquid AI创业公司2026-08-04
打开原始来源https://hf-mirror.com/blog/LiquidAI/lfm2-5-2-6b