9 月 10 日 DeepSeek 发布 V4.1 Flash,552B 总参、16B 激活,fp4 专家加 fp8 稠密层;三天后,开源推理引擎 Colibri 发布 v1.11.0,新增的第九个模型家族引擎把这 510 GB 的官方 checkpoint 直接从 SSD 流式读进内存——不做任何格式转换,纯 CPU 跑通。

先说引擎定位。Colibri 是纯 C 写的 MoE 推理引擎,每个模型家族一个 .c 文件,运行时零依赖:不调 BLAS、无 Python、不强制 GPU。核心思路是把 VRAM、RAM、SSD 视作同一套推理存储层级,routed experts 平时躺在磁盘上,路由证明需要时才搬进来。仓库目前 31.1k stars、2230 次提交、Apache 2.0,九个家族从 744B 的 GLM-5.2/5.3 覆盖到 2.8T 的 Kimi K3。

V4.1 引擎:203 GB 记忆永不进 RAM

Release notes 的细节密度很高。552B checkpoint 磁盘占用 510 GB,其中 203 GB 是名为 Engram 的双份 n-gram 记忆,共 3.84 亿行,永不进 RAM,每次按需从盘上读几百字节。稠密层是 fp8(32×32 ue8m0 分块),专家权重 fp4,布局与 Kimi K3 引擎已支持的 mxfp4 字节一致——「零转换」的技术底座就在这里。README 给出的对照:V4.1 Flash 每 token 只需读 4.5 GB 专家权重,GLM-5.2 是 12.7 GB。32 层视觉塔、DSML 格式工具调用、DSpark 三段投机解码全部实现;CI 对照团队自写的 torch 纯 CPU 参考实现逐 token 校验——官方 forward 依赖 tilelang GPU kernel,CPU 上根本跑不了——视觉塔对到 5e-06。

78.7 秒到 25.1 秒:把失败也写进文档

冷缓存、每轮清缓存、同 prompt 同 seed 实测:一轮对话从 78.7 秒优化到 25.1 秒(0.305 → 0.957 tok/s),手段是批量专家读取(READ_DEPTH 默认 8,实测拐点)、注意力矩阵按位置块整读、expert-major MoE 布局,且每一步与被替换版本 bit-exact。五轮多轮会话 1.14–1.58 tok/s。慢吗?慢。但这个团队把失败也写了进去:两种把专家读取藏进矩阵乘的预取方案,实测更差,删掉,连同数字一起写进 docs/deepseek-v41.md,给下一个尝试者留起点。

开源权重的第二战场

这个 release 的新闻性不在速度,在生态响应:模型发布三天,第三方纯 C 引擎原生直读 checkpoint。这与 8 月底 WARP 把 313B GLM-5.3-Flash 专家搬进 NVMe、Cohere 的单文件 megakernel 是同一条赛道的三种解法——引擎层正成为开放权重真正落地的战场。API 会涨价、限流、停服;能在一台没有 GPU 的机器上持有而不是租用模型,这份选择权是引擎给的。

所以下次看到「重磅开源」,别只看跑分——看看几天内有没有引擎把它跑起来,那才是开放权重含金量的真实刻度。

参考:github.com/JustVugg/colibri/releases/tag/v1.11.0(Release Notes)· github.com/JustVugg/colibri(README)