技术背景
字节模型蒸馏在低算力下长期被 token 模型碾压,但 Meta FAIR 在 9 月 11 日公开的论文《Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models》里,第一次用严格控制变量的 scaling law 研究给出了反直觉的结论:字节模型起步更慢,渐近精度却更高。
研究团队来自 Meta FAIR 与华盛顿大学(Mike Lewis、Luke Zettlemoyer、Srinivasan Iyer 等),作者把学生模型的 token 化方案切成三组 —— 经典 token、纯 byte、byte+end-of-token(EOT) —— 同时把训练目标切成蒸馏与交叉熵两组,在保持层-参数量匹配(约 1.28B layer 参数 / 1.81B token 参数)的前提下,把训练量一直推到 1 万亿字节。
实验的关键设计是"先把教师的 token logits 转换成 byte logits"。为此论文提出两种一次性转换:Marginalize-It(近似,把首字节之后未匹配的尾部概率重新归一化)与 End-Of-Token(精确,在词表中加 <eot> 标记 token 边界)。前者是 baseline,后者保留教师分布的全部概率质量。
把六组实验在八项 benchmark(多选 QA、语言生成、机器翻译)上跑出来的 scaling 曲线叠加后,趋势出乎意料。低算力阶段,Token-1B 蒸馏模型几乎在所有任务上领先;但随着 FLOPs 增长,token 曲线快速饱和,字节曲线反而保持陡峭爬升。论文的渐近预测是:End-Of-Token 蒸馏比 Token 蒸馏渐近准确率高约 4%,比 Marginalize-It 蒸馏高约 1.9%。
更值得工程圈关注的两个数字:其一,End-Of-Token 蒸馏仅用 1/6 的训练数据就能追平 Token 蒸馏的最终性能,这意味着同样的算力预算下,字节学生模型在数据采购和训练时间上的成本压到极致;其二,把词表从约 10 万 token 砍到 256 字节,蒸馏时不需要 top-k 截断,logit 存储成本降到约 1/5,这对蒸馏流水线的工程开销是数量级影响。
论文还把渐近预测与开源权重模型对照:End-Of-Token 蒸馏 1B 模型渐近平均精度可望比 Llama 3.2-1B、Gemma-3-1B-pt、Gemma 2B 分别高 6.5%、8.1%、2.1%。这一结论对应的是外推的 scaling law,并非当下真实 checkpoint 已超过这些模型——读者别把"渐近潜力"误读成"今日成绩"。
我自己更看重方法论上的两点提示。第一,BPB(Bits-Per-Byte)这个常见 validation 指标,在跨 token 化方案、跨训练目标时并不能直接对比——同一 BPB 对应的下游准确率可以差出几十个百分点。后续选学生模型时,光盯 validation loss 不够,必须配套看下游任务的 scaling law。第二,蒸馏 logit 的存储成本长期被低估。10 万 token 的词表,top-100 截断下每条样本仍要存 100×float;而 256 字节词表几乎可以全量存。Meta FAIR 这一刀切下去,本质上把"是否能跑大蒸馏"的瓶颈,从算力挪到了 logit I/O。
所以这次研究更像是给字节路径"正名",而不是宣告 token 模型终结。Token 在中低算力预算下仍是更快的选择,字节模型的价值会随数据/算力放大才显现。对国内做小模型蒸馏、字节级多模态预训练(比如想统一文本/图像/音频的字节表示)的团队,这是一份直接可借鉴的 scaling law 模板。