Multiverse Computing 7 月 23 日宣布,基于其量子软件背景衍生的 CompactifAI 压缩技术,把 Meta 的 Llama 3.3 70B 模型在 Intel Xeon 6 Performance-core 服务器上跑出 3.86 tokens/s 的输出吞吐,相比未压缩基线提升 93.6%,256 并发场景吞吐提升 107%,延迟下降 51.7%,磁盘占用从 130 GiB 降到 65 GiB,精度保留 97% 以上。这套方案同时支持 Llama 4 Scout、DeepSeek R1、Mistral Small 3.1 等开源旗舰,搭配 vLLM CPU 与 AMX 矩阵扩展,为「不上 GPU 也能跑大模型」的私有化场景补上一块硬通货。技术看点不在于「再压一次 INT4」,而在于压缩后的「healing」再训练——把量化的精度损失通过一轮针对性继续训练消化掉,WinoGrande 等基准反而比原模型高 6.86%,这种「越压越准」的反直觉结果,正是过去一年大模型推理优化从单纯降精度转向「压缩 + 修复」联合优化的代表性样本。对国内做端侧、CPU 推理和私有化部署的团队来说,这条路线比纯 GPU 推理更具工程现实意义:同一台 Xeon 服务器,容量翻倍、并发能力提升,既不用赌新卡供应,也能保住绝大多数问答质量。