本地跑 Agent 的开发者长期面对一个结构性的尴尬:vLLM、SGLang 这类引擎为数据中心批处理而生,单会话性能是被牺牲的那一头;llama.cpp、Ollama 走通用兼容路线,不为任何具体硬件压榨极限;oMLX、ds4 这类专精引擎又缺生态完整性。换句话说,几乎没有引擎认真为「本机同时挂几个长会话 Agent」这个场景做过设计。9 月 30 日,一支 YC S25 团队在 Hacker News 发布了开源推理引擎 Magnitude,思路是把性能调优这件事搬到你自己的设备上做。

它做了什么不同

Magnitude 用 Rust 写成,自带 GPU kernel 运行时与自动调优器,以 Apache 2.0 协议开源。官方给出的技术路线有三条:第一,内核带弹性参数,模型运行前先在你的实际设备上编译调优,让通用内核摸到专用内核的性能天花板;第二,内存动态分配,启动只预留权重所需,Agent 会话变长内存堆才增长,会话结束即释放,机器同时还能干别的;第三,混合分页注意力,借鉴 SGLang 的 radix cache 思路让并发会话共享前缀缓存,同时按内存邻接优化排布,避免单会话性能被并发拖垮。README 列出的技术灵感包括 FlashAttention、FlashInfer、TurboQuant。

官方自报的数字

统一配置为 Qwen 3.6 35B A3B(4-bit 量化)、64k 上下文、关闭投机解码,对比对象 llama.cpp:Mac M4 Pro 48GB 上解码快 92%(30→57 tok/s),预填快 9%(466→507 tok/s),单 Agent 内存省 28%;DGX Spark 上解码快 19%(49→58 tok/s),预填快 23%(2033→2507 tok/s),内存省 27%。产品形态是桌面应用,一键接入 Pi、OpenCode、Hermes、Codex、Claude Code 等客户端,其余工具走 OpenAI 兼容接口;Agent 需要时自动拉起模型,闲置后自动关闭。发布约一天,HN 帖 187 分 88 评,仓库 star 约 6k。

自报数字要打折听

值得肯定的是切入角度:单会话延迟与多 Agent 并存,是本地推理的真实痛点——数据中心引擎不屑于优化,通用引擎的目标函数又不是这个。但全部跑分都是厂商自测:单一模型、单一量化、关闭投机解码,恰好是自家最优的配置区间;「快 2 倍」的宣传语取的是 Metal 解码的最好数字,CUDA 侧只有 19%。第三方复现出现之前,更稳妥的读法是把它当成一个有诚意的方向验证,而不是已定论的胜负。路线图里的专家流式加载(把 MoE 专家放进内存/磁盘、按需搬进 GPU)值得盯——那才是小显存跑大模型的钥匙。

对每天在本地挂 Agent 的开发者,这多了一个免费且开源的选项;对推理引擎格局,「Agent 时代的本机引擎」这个生态位正在被快速填补。问题留给读者:当 Agent 真的常驻你的本机,你现在的推理引擎,是为这个场景优化的吗?

参考:官方 HN 发布帖 https://news.ycombinator.com/item?id=49911995 ;GitHub 仓库 https://github.com/magnitudedev/magnitude