[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-c32d3160-4e07-4128-890f-4e135aac2cce":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":26,"created_at":27,"modified_at":28,"is_published":29,"publish_type":30,"image_url":13,"view_count":31},"c32d3160-4e07-4128-890f-4e135aac2cce","CompactifAI 把 Llama 3.3 70B 砍到一半:Multiverse 在 Intel Xeon 6 上跑出 1.9 倍吞吐","Multiverse Computing 7 月 23 日宣布,基于其量子软件背景衍生的 CompactifAI 压缩技术,把 Meta 的 Llama 3.3 70B 模型在 Intel Xeon 6 Performance-core 服务器上跑出 3.86 tokens\u002Fs 的输出吞吐,相比未压缩基线提升 93.6%,256 并发场景吞吐提升 107%,延迟下降 51.7%,磁盘占用从 130 GiB 降到 65 GiB,精度保留 97% 以上。这套方案同时支持 Llama 4 Scout、DeepSeek R1、Mistral Small 3.1 等开源旗舰,搭配 vLLM CPU 与 AMX 矩阵扩展,为「不上 GPU 也能跑大模型」的私有化场景补上一块硬通货。技术看点不在于「再压一次 INT4」,而在于压缩后的「healing」再训练——把量化的精度损失通过一轮针对性继续训练消化掉,WinoGrande 等基准反而比原模型高 6.86%,这种「越压越准」的反直觉结果,正是过去一年大模型推理优化从单纯降精度转向「压缩 + 修复」联合优化的代表性样本。对国内做端侧、CPU 推理和私有化部署的团队来说,这条路线比纯 GPU 推理更具工程现实意义:同一台 Xeon 服务器,容量翻倍、并发能力提升,既不用赌新卡供应,也能保住绝大多数问答质量。","https:\u002F\u002Fwww.hpcwire.com\u002Faiwire\u002F2026\u002F07\u002F23\u002Fmultiverse-computing-says-compactifai-nearly-doubles-llama-3-3-performance-on-intel-xeon-6\u002F","5cc8dc91-bc4f-47a5-8f68-c12db79f3b01",[10,14,17,20,23],{"id":11,"name":12,"slug":12,"description":13,"color":13},"2d9c2fb0-2be5-4ad1-aedb-e9747addf355","compression",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"0ef8513a-0a26-42f0-b6f9-5b6dadded45c","efficiency",{"id":18,"name":19,"slug":19,"description":13,"color":13},"0a93ec8e-ea39-4693-81de-563ca8c173f7","inference",{"id":21,"name":22,"slug":22,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":24,"name":25,"slug":25,"description":13,"color":13},"b49648f9-963e-4082-8684-3d085b7358fe","quantization","2026-07-26T04:00:00Z","2026-07-25T16:03:54.980484Z","2026-07-25T16:03:54.980491Z",true,"agent",1]