把 27B 推理模型塞进单张消费级显卡,过去靠蒸馏出小模型牺牲能力,OrcaRouter 给出另一条路:直接把权重量化到平均 3.21 比特。9 月 28 日,这家路由服务商在 Hugging Face 开源了其首个开源权重模型 OrcaSAQ2 27B(Apache-2.0),底座是阿里的 Qwen3.8-27B。
压缩数字一览
原始 BF16 检查点 54 GB,量化后只剩 12.3 GB,体积缩小 77.2%,约 4.4 倍压缩。保真度方面,WikiText-2 困惑度从 5.6468 涨到 5.6482,仅 +0.02%;Top-1 token 一致率 93.2%;平均 KL 散度 0.031。这些数字全部来自官方模型卡的自报测量:同一组权重与 BF16 参考走同一条评测路径得出。
架构上保留了底座的混合注意力:64 层里 48 层 Gated DeltaNet 加 16 层全注意力,隐藏层 5120,词表 248,320;262K 上下文、thinking 模式、工具调用和 MTP 投机解码头完整保留,代价是视觉塔被砍、只支持纯文本。
落到实际部署
12.3 GB 的检查点意味着 16 GB 显卡装完权重还剩约 3.7 GB 给 KV cache,官方给的实用起点是约 32K 交互上下文,架构上限 262K。推理走 vLLM,在 15.7 GiB 显存上限下实测:单流 MTP 关闭 65.3 tok/s,MTP 开启 90.1 tok/s,吞吐提升 38%;8 流并发 332 tok/s,16 流 333 tok/s。MTP 会吃额外算力和 KV 容量,高并发场景需实测两种配置再选。
Agentic benchmark 同样是厂商自报:SWE-bench Verified 70.0%,Terminal-Bench 2.1 58.4%。模型卡标注这些是公开参照点而非严格同 harness 对比——70.0 分来自一个 12.06 GB 的 27B 检查点,已经压过了 Qwen3-Coder-480B-A35B 的 69.6。
为什么盯住长程 agent
模型卡里最有信息量的不是压缩比,而是评测哲学:困惑度问的是下一个 token 分布像不像,长程评测问的是多次决策后还能不能把任务做完。量化误差在单轮问答里看不出来,但在 plan → act → observe → recover 循环里会复利式放大:一次工具调用选错,后续每一步都建立在被污染的状态上。
这正是低比特量化在 agent 时代的核心风险:短 benchmark 掩盖退化,长轨迹暴露退化。OrcaSAQ2 把 BF16 保真度指标和下游任务指标并排公布,至少在方法论上是对的。
两点冷水
第一,量化方法本身是专有的。所谓 SAQ(敏感度感知量化)只是名字,校准策略、精度分配、打包技术全部未披露,想复现或基于它做研究的人拿到的只是一个压缩结果。第二,所有数字都是厂商自报:模型卡自己写明「公开分数用了不同的 agent 栈,不应被解读为严格的模型排名」,llm-releases.com 收录时也标注 vendor-reported。Apache-2.0 开源的是权重,不是方法。
所以呢
如果量化确实接近无损,agent 的部署经济学就要重算:一张 16 GB 卡跑 27B 长程 agent,和租用云端旗舰 API 之间的成本差距会被大幅拉开。但记住这句话——重点不是 3 比特,重点是 3 比特之下还有什么活了下来。在你自己的长轨迹任务上实测,比任何 benchmark 都可信。
原文与全部数字见官方模型卡:https://huggingface.co/orcarouter/OrcaSAQ-2-27B