背景:手机跑得动的 LLM,缺一份公开账

过去两年,小尺寸 LLM(LFM2、Qwen3.5、Granite-4 等)都在讲一个故事:模型能在手机或笔记本上跑出可用质量。但"跑得动"和"跑得稳"之间的真实差距,从来没有公开账可看 —— 模型方放的是 fp16 跑分,设备方放的是营销视频,中间缺一道独立测试。Artificial Analysis 联合 Liquid AI 推出的 Pipette 基准,补的就是这一环:把"模型 + 量化 + runtime + 设备 + workload"五元组拆开实测,公开给所有人看(artificialanalysis.ai)。

这套基准的出现节点很关键。8 月底 Google 刚刚因为 AI 数据中心抢走 DRAM,要求 Android 应用开发商在 2027 年 2 月前压缩内存占用;同期微软内部数据显示,AI 工程师账单失控,28 天烧 2.8 万美元。两条新闻指向同一个事实:在数据中心 AI 越跑越贵的同一时间,业内对"推理能不能从云挪到端"的需求是真实的。但端侧推理不是装上 APK 就能跑 —— 量化精度、运行时、KV cache 内存预算、上下文长度,每一个都会决定同一个模型在你设备上是不是真能用。

基准的玩法

测试对象是量化后能装进 8GB 内存的模型(含 8K 上下文的 KV cache),采用 Q4_K_M 或更小的 GGUF 量化,推理框架是 llama.cpp。设备覆盖 iPhone 17 Pro(12GB)、Galaxy S26 Ultra(12GB)、MacBook Pro M5 Max,以及即将上线的 AMD Ryzen AI Max+ 395 + Radeon 8060S。评测维度包括 BFCL(工具调用子集,640 题)、IFBench(指令遵循,294 题)、AA-Omniscience(知识与反幻觉,6000 题)、GPQA Diamond(科学推理,198 题)、MATH-500(数学,500 题),五项等权平均给出综合智力分数;推理侧用 1024 token prompt + 256 token response,记录 end-to-end 时延、prefill/decode 吞吐、峰值 RAM。每个评测跑 5 次取 pass@1,推理跑之前还要做平台特定的"温度和负载稳定"检查,降低环境噪声。

首批发布覆盖 23 个模型,涵盖 Liquid AI 全系 LFM2.5、Qwen3.5/3.6 系列、Gemma 4 E2B/E4B/12B、IBM Granite 4.0/4.1、Mistral Ministral 3、Llama 3.2 1B/3B、TII Falcon-H1R-7B、Allen AI Olmo-3-7B-Think、Ornith-1.0/1.5-9B、Nanbeige4.2-3B、InclusionAI Ling-3.0-tiny、OpenBMB MiniCPM5-1B、NVIDIA Nemotron Nano 9B v2、AI9Stars G9v3 3B,以及 Prism ML 的 1-bit Bonsai-27B 和 Ternary-Bonsai-27B 两个极低比特模型(Liquid AI 8/24 公告)。

数据里的几个反直觉

MoE 在端侧不一定省内存。 LFM2.5-8B-A1B 是 MoE,每 token 只激活 1.5B 参数(总 8.5B)。在 Galaxy S26 Ultra、2048 输入 token、Q4_K_M 配置下,它解码比 Qwen3.5-4B 快 2.4 倍,比 Ministral-3-3B-Instruct-2512 快 2.6 倍。但峰值 RAM 仍有 5.29 GiB —— 因为所有专家权重都要占内存,激活稀疏不等于"模型小"。这条对所有把 MoE 当成"小模型替代品"部署的人都是个提醒。

速度与质量是两条独立轴。 MiniCPM5-1B 和 LFM2.5-1.2B-Instruct 都是 ~1B 级别,Q4_K_M 量化,在 iPhone 17 Pro 上 2048 输入 + 256 输出,MiniCPM5-1B 用时 3.47 秒,LFM2.5-1.2B-Instruct 用时 4.12 秒(MiniCPM 快 15.8%)。但同一批量化产物跑 MATH-500,LFM2.5-1.2B-Instruct 高 9.0 分。两个轴都没有支配另一条。这意味着部署时必须明确优先级:是延迟敏感(选 MiniCPM),还是数学能力敏感(选 LFM),没有银弹。

架构微调比参数大小更影响长上下文行为。 Granite-4.0-H-350M 和 Granite-4.0-350M 同样 350M 参数、同样 Q4_K_M,在 Galaxy S26 Ultra 上从 256 输入扩展到 4096 输入时,H 版本保持 78.4% 的 decode 吞吐,普通版只保 33.8%。架构层面多花的设计,比单纯缩参数更能扛上下文压力。这给"参数越大越好"的常规直觉又添了一个反例。

两个跑分接近的模型,在不同任务上可能完全反转。 Granite-4.1-8B 和 Ministral-3-8B-Instruct-2512,Q4_K_M、在 M5 Max 上 2048 输入,decode 吞吐差 2.4%,峰值 RAM 差 1.2%。但同样的量化产物跑 IFBench,Granite 高 7.3 分;跑 GPQA Diamond,Ministral 反过来高 14.0 分。换句话说,跑分接近不代表可以互替 —— 任务分布决定哪个更合适。

所以这事的意义

Pipette 把"模型卡分数"和"在你手机上的实际表现"之间的鸿沟,用一个公开、可复现的评测盖住了。三件以前很难说清的事现在有数据:同一参数量的不同架构在不同上下文长度下退化速度差别巨大;MoE 在端侧的"小激活大内存"特征会击穿"参数越少越省"的常识;量化后的质量损失高度任务相关,不能用一个 benchmark 推全场。Liquid AI CEO Ramin Hasani 的官方说法是"on-device behavior is a property of the deployed system, not the model in isolation" —— 这次的基准把这个判断变成了可量化的东西。

接下来半年的行业动作可能会围绕这份榜单展开:AMD 的 Ryzen AI Max+ 395 与 Radeon 8060S 还没在榜单上,NPU 路径也因为各家 kernel 覆盖度不一致暂时没纳入对比。可以预见的是,端侧 LLM 的选型逻辑会从"看 QPS 跑分表"转向"在目标设备、目标量化、目标上下文长度下的 Pareto 曲线",这是这次发布给整个行业留的最实在的东西。