Liquid AI 在 8 月 12 日发布了 LFM2.5-VL-3B,官方称之为其迄今最强视觉语言模型。3.1B 参数、开源权重、非推理(non-reasoning)设计——答案直接给出、不写思考链,换来的是低延迟,专门为端侧实时应用准备。(官方博客:https://www.liquid.ai/blog/lfm2-5-vl-3b)

四个核心升级,全部对准「让 Agent 在本地看得懂屏幕」

相比上一代 LFM2-VL-3B,这次升级集中在四个方向:

  1. 屏幕/UI 理解:模型对手机、网页、桌面三类数字屏幕有较强理解,ScreenSpot-v2 平均 80.7 分,大幅领先大得多的 Gemma-4-E4B(51.2),也高于 Qwen 3.5 4B(78.5),仅次于 InternVL-3.5-4B(84.1)。
  2. 函数调用:VL 产品线首次支持工具调用,ToolSandbox 从 26.4 直接翻倍到 59.5,BFCL v4 从 20.5 升至 32.5,与 Gemma-4-E2B 相当、领先 Qwen3.5-2B。
  3. Grounding:靠合成 grounding 数据扩量,RefCOCO precision@1 从 57.1 拉到 87.9,提升 30 个百分点。
  4. 多图输入:BLINK 从 50.2 升到 61.5,MuirBench 从 34.9 升到 58.3。

训练配方:34T tokens、128K 词表、SigLIP2 视觉编码器

架构沿用 LFM2.5-VL-1.6B / 450M 的设计,基于刚发布的 LFM2.5-2.6B 文本基座,集成 SigLIP2 400M NaFlex 编码器。预训练约 34T tokens;为支持非拉丁文字,词表原地扩展到 128K;视觉预训练 token 量扩了 4 倍。后训练管线是 SFT(含大模型知识蒸馏 + Antidoom 训练)+ 多奖励 RL。

在 28 项基准的平均分上,LFM2.5-VL-3B 拿到 69.4,显著超过大得多的 Gemma-4-E4B(8B,59.7),距离 4.7B 的 Qwen3.5-4B(70.1)只差 0.7%。

速度:手机 20 tokens/s,单卡 H100 约 11K tokens/s

端侧数据:Apple M5 Max 解码 228 tokens/s、AMD Ryzen AI Max+ 395 为 116 tokens/s、内存占用约 3GB;Galaxy S26 Ultra 手机上约 20 tokens/s——一个能读懂屏幕的视觉模型,可以完全私有地跑在你自己手机里。GPU 侧,因为非推理设计首 token 延迟低,5 帧视频输入时首 token 约 34ms,而 Gemma 系列约 200ms;vLLM 0.26 压测下高并发吞吐约 11K tokens/s,约为 4B 级模型 2 倍,单张 H100 一天可产出近 1B output tokens。

评论:端侧 VLM 的「第一次可用」时刻

我的看法:这份发布说明的价值不在跑分,而在它标注了端侧视觉 Agent 的工程临界点。之前 3B 级 VLM 普遍做不好三件事——读屏幕、调用工具、框选物体,而这恰是本地自动化 Agent 最需要的。LFM2.5-VL-3B 把三项一次拉齐,且开源权重、llama.cpp/MLX/vLLM/SGLang/ONNX 全部 day-one 支持。当屏幕理解和函数调用在 3GB 内存里就能跑通,「云上 Agent」不再是唯一选项——隐私敏感场景(个人设备操作、本地文档处理)第一次有了成体系的开放方案。对开发者而言,值得关注的是它的对比对象始终是 Gemma 和 Qwen 的同档模型:边缘多模态这条赛道,正在从「演示」走向「选型」。