本地推理一直有个老问题:开源模型的参数量一路上涨,用户的内存却不会跟着涨,消费级配置面对 75B 级 MoE 基本没有好选择。llama.cpp 在 9 月 4 日放出的 v0.4.0,主攻的就是这个瓶颈(GitHub release)。
权重按需读取:--lazy-mode 改变加载模型的方式
这版最核心的变化是 lazy tensor reading(PR #27794):张量不再一次性全部读进内存,而是推理用到哪块、从磁盘读哪块,运行时开关是 --lazy-mode(#27969)。配套一组内存治理改动:防止模型加载阶段的 RAM 峰值(#27483)、给量化器加内存上限参数 max_buf_size(#27795)、量化过程改为 row-slab 流式处理(#27830)。这套组合拳直接指向小内存跑大权重的场景。
新选项 --n-cpu-ffn(#26622)配合逐层专家路由/FFN(#28323),让 MoE 的前馈部分按层指派到 CPU 或 GPU,混合部署粒度从整个模型细化到了每一层。
新架构支持:Qwen3.8-Flash-Next 与 75B 的 Nemotron-3-Puzzle
新模型列表有四个名字:Qwen3.8-Flash-Next(对应新的 qwen4exp 架构,#27742)、NVIDIA Nemotron-3-Puzzle-75B-A9B(#25444)、Nemotron 3.5 的 DSpark 支持(#27804),以及 nanbeige4.2-3B(#27730)。泼盆冷水:Qwen3.8-Flash-Next 目前是 initial support,release notes 明确写着优化尚未完成,qwen4exp 还跟着一串修复(PR #27941、#28123、#28023)。
多模态方向,DeepSeek-V4 视觉输入处理被修复(#28154),新增 DeepSeek-V4-Flash-Vision-Exp 支持(#28133),视频输入参数 --video-* 进了主线(#24318)。
底层 ggml 升到 0.23.0:稀疏 attention 与 RDMA
引擎之下,ggml 从 0.22.0 升到 0.23.0,两项新能力最值得注意:稀疏 flash attention(新算子 ggml_flash_attn_ext_set_n_kv_max),已应用在 DeepSeek-V4/GLM 和 qwen4exp 上(#27970);Apple RDMA 作为 RPC 传输层(#26421),配合 RPC 事件与异步后端 API(#18626),多机分摊大模型推理的路径越走越宽。
服务端也更新:per-slot 上下文限制(#24124)让共享同一 server 的请求互不挤占上下文;preserve_reasoning 默认开启(#28174)。
所以呢
127k star 的体量,说明在自己机器上跑模型的需求真实且普遍。而最普遍的硬件约束恰恰不是算力,是内存装不下权重——v0.4.0 的懒加载、量化内存上限、逐层路由全部打在这个点上。内存吃紧又想跑新开源 MoE 的用户值得升级;但专为 Qwen3.8-Flash-Next 来的,建议再等等,initial support 和优化到位之间,通常还差几个小版本。