过去三年,大模型算力账单几乎被"参数越多 = 越聪明"主导。PrismML 这家加州理工走出来的初创公司,9 月 17 日扔出一枚反方向炸弹——基于阿里 Qwen3.8 27B,三元压缩到 5.9 GB,20 项基准平均分 83.9,留存原模型 98.2% 能力,RTX 5090 上跑到 143 tokens/s,Apache 2.0 开源免费下载。这个数字组合意味着:一台普通 PC,甚至高端手机,现在能跑出接近云端 27B 模型的智能密度。
三元权重动了什么
正常每个权重 16 bit,Bonsai 2 只存 +1、-1、0 三个值。信息密度从 65536 个状态坍缩到 3 个,代价是表达精度,收益是 9-10 倍内存压缩。5.9 GB 正好踩在 PC 内存预算和高端手机闪存的可接受区间内。
之所以叫"三元"不是"二值",因为 0 在矩阵运算里承担"消音器"角色——让一部分权重通道直接归零,稀疏性反而成了稳定性的来源。
98.2% 不是营销稿
20 项基准横跨 reasoning、math、coding、instruction following、vision、agentic tool use——这套组合是当下少见的"真活"测法。Bonsai 2 27B 平均分 83.9,Qwen3.8 27B 是 85.4,差 1.5 分即 98.2% 留存。相比第一代 Bonsai 的 95% 提升 3 个百分点,说明每代压缩技术以可见速率收敛。
这种保留比例在低比特量化里并不常见。多数 4-bit 方案会有 2-4 个百分点掉点,Bonsai 2 已逼近"零代价"区间。
反方向在哪
行业惯例是参数规模往上走——GPT、Claude 过去一年每代动辄把总参数翻倍,代价是云端推理成本指数级膨胀。5.9 GB 这个体量把"在不在端侧跑"从云端绑死变成个人设备可承担。
Ion Stoica(Berkeley Sky Computing Lab 主任,Databricks 联合创始人)把这概括为"本地智能,设备已经买了就是免费的"。当模型能跑在用户口袋里,云端 API 护城河会从"模型能力"转向"工具链和分发"。
5.9 GB 的工程含义
RTX 5090 上 143 tokens/s 意味着实时性不再是瓶颈。模型能装进 24 GB 显存预算,开发者可以单机部署整个 27B 级别的 agentic 流程,不需要任何云端 API。对做本地知识库、私域文档问答、offline coding agent 的团队是直接利好。
PrismML 计划把三元压缩套到"数百 B"参数的更大模型上——CEO Babak Hassibi 在 TechCrunch 采访中说,模型越大,压缩时"留住的智能"越多,因为有更大的权重空间可容忍精度损失。如果这条规律成立,100B+ 模型未来也能跑在单台工作站上。
所以呢
Bonsai 2 27B 的真正信号不是"又一个开源 27B",而是"压缩技术的进步速率本身"。95% → 98.2% 只用了一代,继续推进,100% 留存不会太远。当 benchmark 留存压平时,"端侧 LLM"就从营销词变成工程现实。
对开发者来说,这一波三元压缩的真正红利是降低推理基础设施门槛;对模型厂商而言,"用更大的模型卖 API"的商业模型会第一次遇到来自设备端的实质性竞争。开源社区接下来几个月的关键看点,会落在"压缩 100B+ 模型能否保持同样留存"——如果能,这条路的终局就是把云变成备选。