Bad Theory Labs 把 Liquid AI 的 LFM2.5-2.6B 重新包装成了一个 1.5 GB 的 Mac 本地 Agent —— 名为 Macaw,模型权重走 MLX 4-bit 量化,97 个 macOS 工具(邮件、日历、文件、音乐、系统设置)直接由本地模型调度,无需联网、无需账号,在 M2 上测出 10/10 工具调用准确率、平均 1.21 秒响应、40.3 tok/s 解码速度。代码 MIT 开源,权重挂在 Hugging Face 上,只要 Apple Silicon、macOS 14+、8 GB 内存就能跑起来。

这件事真正值得讨论的不是又一个"端侧 AI 助手",而是它揭示的三个工程现实。

第一,2.6B 的小模型已经够用

LFM2.5 是 Liquid AI 在 2025 年下半年发布的混合架构小模型,主打"端侧推理 + 长上下文 + 多模态"组合。Macaw 在它之上做的事很克制:不微调权重,只注入系统提示把模型身份改成"Mac 控制助手",其余能力完全靠 prompt 引导出来的工具调用。这条路线暗示,2026 年的端侧 LLM 不需要再做大规模 SFT,只要底层基座的指令对齐做得够干净,3B 以下的模型就能承担真实世界的工具编排任务。

第二,4-bit 量化 + MLX 是当前 Apple Silicon 上最稳的本地推理组合

BF16 原权重大约 5 GB,在 8 GB 内存的 Mac mini 上几乎要逼到 swap;4-bit MLX 量化版压到 1.5 GB,留给系统和其他 app 充足余量。Bad Theory Labs 把 BF16 和 MLX 两套权重都放出来了,MLX 跑 Metal GPU、BF16 走 Transformers 后端兼容任意设备,这是 2026 年"消费级硬件能跑 AGI 级体验"叙事的最小可工作单元。

第三,工具调用准确率从"大致能用"跨到了"真能用"

BenchLM 类的 AI 评测早就告诉我们,SWE-Bench、τ-Bench 这类 Agent 榜单上,前沿模型(Claude 4.x、Gemini 3.x、GPT-5.x)和 7B-30B 开源模型之间还差着 8 个月左右的距离。但 Macaw 这种"封闭环境 + 严格工具集"的场景里,2.6B 模型居然能拿到 10/10。原因是 macOS 工具集是确定性的 API,不需要模型理解动态网页和反爬机制;Hark Handoff 那种 CUA(Computer Use Agent)才是真正考验通用 Agent 能力的高难度任务。所以"端侧 LLM 已经能干 Siri 干不了的事"这个论断成立,但前提是把任务边界画清楚

授权结构与商业化逻辑

回到 Macaw 本身,它最大的限制也写在官网:"LFM Open License v1.0 把商用门槛卡在年营收 1000 万美元以下"。也就是说个人开发者、小团队、独立产品可以放心用,但如果拿它做商业产品的底座,撞到营收红线就要重新谈授权。这个授权结构其实很聪明 —— Liquid AI 用这种方式把 LFM 系列变成了"个人开发者默认底座",但保留了大客户单独谈判的窗口。

给中文 AI 圈留下的启发

Macaw 给中文 AI 圈留下的最大启发是什么?"边缘 AI"这个词在 2026 年下半年不再已经是一种营销话术,而是已经能交付的工具。1.5 GB 权重、零联网、MIT 代码、装上就能用的本地 Agent,这意味着任何想搭一个不依赖云端 API 的小工具的独立开发者,门槛已经低到几乎为零。接下来的问题是:Apple Intelligence 什么时候才会把 Siri 真正升级到这个水平?如果答案是"永远不会",那么 Macaw 这类项目反而会吃掉 Siri 的市场份额。

最后留一个反问:Macaw 现在 97 个工具,看起来够用,但用户一定会问"为什么不支持我的工作流" —— 当个人定制化成为标配,模型本身反而不是壁垒,工具链和系统集成的深度才是。这条赛道里,开源 + 本地 + 极致轻量,会比"更大的模型"更容易长期胜出。