LFM2.5-2.6B:把「本机 Agent」跑成 220 tokens/s,2.5GB 内存硬扛 Hermes Agent / OpenClaw
边缘 LLM 在过去半年里换了主角:从「能不能在手机上聊天」变成「能不能在手机上跑 Agent」。Liquid AI 在 2026 年 8 月 4 日放出的 LFM2.5-2.6B,正是为这条新赛道定制的旗舰:2.6B 参数 dense 模型,128K 上下文,词表扩到 128K,总内存占用压在 2.5GB 以下,但所有 agentic benchmark 都在和 9B 量级的 Qwen3.5-9B 掰手腕。
模型规格与训练数据
LFM2.5-2.6B 是一款面向 agentic 工作流的 dense 模型,总参数 2.6B,预训练数据约 34T tokens。Liquid AI 这次没走 MoE 路线(8B-A1B 才用 MoE),2.6B 选 dense 的目的是让权重在边缘硬件上更易调度。词表从 LFM2 时代的约 64K 翻倍到 128K,方法是「在原地续接 BPE,子词均值初始化」,而不是重新训模型;mid-training 还专门跑了一个 128K context-extension 阶段,以便应对 agent 工作流里的长输入。
后训练走的是一条四阶段管线。Liquid AI 把这套管线讲得很细:
- Supervised Fine-Tuning(SFT):两段 SFT,第一段广覆盖,第二段重点塑形 agent 任务、推理和工具调用;SFT 训练数据量约为 LFM2.5-8B-A1B 的 7 倍。
- Teacher Specialization:从同一个 SFT checkpoint 分支出多个领域专家,每个专家在自己的领域(reasoning、knowledge、code、tool use、long context 等)用 RLVR(可验证奖励的强化学习)深耕。
- Multi-Domain On-Policy Distillation(MOPD):学生模型在自己的 policy 下 rollout,不同 prompt 按领域路由到对应教师,教师提供 token 级监督——既保持学生分布稳定,又能让多个领域能力在一个模型里收敛。
- Agentic Reinforcement Learning(Agentic RL):在真实 agent 环境里多轮 RL,用 GRPO 优化;训练里直接调用 Hermes Agent、OpenClaw 等 harness,让模型「在它将来要跑的沙盒里」学。
值得注意的工程细节是,Harness Proxy 把 agent harness 当成 black box,透明地捕获 token 级轨迹来重建 RL 样本,这意味着 LFM2.5-2.6B 学到的不是「通用 tool use」,而是「在 Hermes Agent / OpenClaw / Pi 这一类 harness 里稳定工作」。
Benchmark:小四倍的体量,工具调用打到接近 9B
官方在 BFCLv4、ToolSandbox、PinchBench、τ³-Bench、Claw-Eval、BrowseComp+、AIME25、IFBench、Multi-IF、IFStruct、AA-Omniscience、LiveCodeBenchv6 这一长串 benchmark 上做了对比。横向对手是 gemma-4-E2B-it(5.1B)、gemma-4-E4B-it(8B)、Qwen3.5-4B(4.7B)、Qwen3.5-9B(9.7B)——也就是体量上几乎都是 LFM2.5-2.6B 的 1.5× 到 4×。
LFM2.5-2.6B 在所有指令遵循 benchmark 上全部领先:Multi-IF 拿到 80.07,而 Qwen3.5-9B 只有 62.55;IFStruct 拿到 85.49,Qwen3.5-9B 78.50;AA-Omniscience-Public 拿到了 -29.50 的成绩,远好于 Qwen3.5-9B 的 -50.43。工具调用维度,BFCLv4 是 56.88(略输 Qwen3.5-9B 的 60.13),ToolSandbox 77.83(超过 Qwen3.5-9B 的 76.44),PinchBench 68.22(略输 Qwen3.5-9B 的 71.45)。AIME25 数学 51.87,输给 Qwen3.5-9B 的 56.07 但远好于 Gemma-4-E4B 的 34.27。
一句话总结官方在博客里给出的判断:LFM2.5-2.6B 在所有指令遵循 benchmark 和几乎所有工具调用 benchmark 上领先,只在数学和代码生成上稍微输给 9B 量级。
推理速度:手机能跑、H100 能打 1.3B tokens/天
部署侧 Liquid AI 给出的数字非常具体:
- M5 Max(CPU):220 tokens/s,内存 < 2.5GB。
- Ryzen AI Max+ 395(CPU):113 tokens/s。
- 手机:30 tokens/s,跑得动完整的 multi-step agent 流程。
- NVIDIA H100 SXM5:SGLang 0.5.16、1,024 input / 256 output、BF16 测下来,高并发下接近 15K output tokens/s,折算下来单卡每天能吐约 1.3B tokens。
day-one 支持的推理栈包括 llama.cpp(GGUF)、MLX(Apple Silicon)、vLLM、SGLang、ONNX,覆盖 Apple、AMD、Qualcomm、NVIDIA 全平台。Hugging Face 上开源的权重包含 base(LFM2.5-2.6B-Base)和 post-trained(LFM2.5-2.6B)两个版本。
为什么「本机 Agent」这件事现在变得重要
把 Agent 完全放在本机跑,核心价值不是「能跑」,而是「去掉每 token 的边际成本」。Liquid AI 在博客里把这个动机写得很直白:当 token spend 不再是约束时,agent 可以被高度并行化,后台跑 background task,消耗百万 tokens 也不会让账单跳——这对开发者写 agent 的方式是一个根本性的变化。
而把 LFM2.5-2.6B 选为「旗舰」也很合理:LFM2-8B-A1B(1.5B 激活 MoE)在 6 月已经给边缘 LLM 抬过一次天花板,LFM2.5-VL-450M 在 6 月把边缘 VLM 拉到亚秒级。这次 2.6B dense 把目标定在「能稳定接 Hermes Agent / OpenClaw / Pi 这类 harness」,等于是在「8B 边缘 MoE」和「350M / 450M 极小模型」之间,填了一个「刚刚好能跑完整 agent」的甜点位。
评论与局限
从工程视角,LFM2.5-2.6B 的亮点不在参数,而在「把 agent 训练和 harness 训练绑在了一起」。通常的 LLM 训练只到 tool use 这一层,agent 行为是在 harness 那一层被 heuristic + prompt 堆出来的;Liquid AI 反过来,在 RL 阶段直接把 Hermes Agent / OpenClaw 当训练环境,等于把「系统提示、工具协议、多轮交互模式」都写进了模型权重。这种做法对自家 harness 友好,但也带来一个开放问题:模型在其他 harness 上的迁移性会不会打折?官方没有给出跨 harness 的对照数据。
另一个值得关注的限制是,BrowseComp+(OpenClaw)和 PinchBench 都只在 OpenClaw 上跑——这两个 benchmark 与「任务型 multi-step agent」高度相关,但评测本身就跑在 OpenClaw 里,没法完全区分「模型能力」与「harness 适配度」。对想复现或独立验证的开发者,这一点需要小心。
最后一点:代码生成仍然是 9B 模型的领域。LiveCodeBenchv6 上 LFM2.5-2.6B 是 59.41,Qwen3.5-9B 是 69.86——差距是 10 个点。官方博客自己也很坦诚:「for more complex agentic tasks or coding-heavy workloads, larger models may still be a better fit」。2.6B 拿下的是「跑得起来、跑得便宜、跑得私密」,而不是「拿下所有最强模型」。
结尾
LFM2.5-2.6B 在 BFCL、ToolSandbox、IFBench、Multi-IF 这一类「agent 真实工作能力」的 benchmark 上,用自己的体量给出了接近甚至超过 9B 模型的成绩;M5 Max 上 220 tokens/s、内存 < 2.5GB,把这个成绩塞进了边缘设备。Hermes Agent、OpenClaw、Pi 的用户可以在 Hugging Face 直接下载权重,接进现成的 harness 试跑。
「本机 Agent」从口号到可量化产品的距离,Liquid AI 用这个 2.6B 模型量出来了——剩下的只是开发者愿不愿意把云上的 token 账单砍掉,换成本地的小时耗电。
参考链接:
- Liquid AI 官方博客:LFM2.5-2.6B: Deploy Agents Everywhere
- Hugging Face 模型页:LiquidAI/LFM2.5-2.6B
- Hugging Face 博客:Deploy local agents everywhere with LFM2.5-2.6B
- Liquid AI 文档:LFM2.5-2.6B - Liquid Docs