一台树莓派上跑大模型,问答接近满分——但这份能力可能不是模型真有,而是压缩过程制造出来的错觉。8 月 16 日提交到 arXiv 的论文《Large Models for Small Devices》(编号 2608.15693)用一组跨硬件实测,给边缘 AI 部署泼了一盆冷水:压缩得好的模型,不一定部署得好。
三档硬件上的对照实验
研究团队(Subhransu Das、Jiaming Cheng 等 9 位作者)先调研了 20 多篇在真实受限硬件上报告过压缩结果的工作,提炼出部署指南,然后自己动手做对照实验:3 个约 1B 参数的 LLM 家族,配合 6 个图像分割模型,分别施加结构化剪枝、GGUF 量化、LoRA 恢复三种处理,再部署到 GPU、CPU 和树莓派三类平台,覆盖问答和分割两类任务。
结论第一层很直白:没有任何单一技术在所有任务上通吃。
- 问答任务,量化完胜:Qwen3.5 0.8B 在 Q5_K_M GGUF 量化下拿到 93.85 的 SQuAD F1 和 92 的 EM;而同精度的结构化剪枝,在 1% 的剪枝率下就损失了 16 个 F1。
- 分割任务,排名反转:默认量化根本不减少参数量和 MACs,而剪枝能把模型体积砍掉近 80%,mIoU 却几乎不变。
剪枝反而让模型变胖
更反直觉的是文件体积:剪枝本该让模型更小,但它会破坏 k-quant 超块的对齐结构,最终部署产物反而膨胀 21% 到 49%。叠加剪枝后模型倾向生成更长、格式更不合规的输出,树莓派上的推理延迟最高被抬到 3.4 倍。换句话说,你以为在省资源,实际可能在浪费资源。
最狠的发现:压缩能制造能力假象
论文里最值得警惕的一幕是:一个经 LoRA 恢复的模型变体,输出格式完全可解析,在 BoolQ 上还有 71% 的 strict 准确率——看起来一切正常。但拆开预测分布,100 个预测里有 97 个被押到了同一个类别,平衡准确率只有 52.6%,几乎等于瞎猜。
这意味着压缩带来的损伤可以不是「明显变笨」,而是「静默坍缩成单类别预测器」。常规 benchmark 只看 accuracy 时,这类退化完全会被漏检——模型看起来还在答题,实际上只是在无脑押同一个答案。团队用 neural-flow 图分析和 prefill/decode 两阶段延迟分解,解释了这些现象背后的机理。
所以呢
对要在边缘设备上部署模型的团队,这篇论文给的操作建议浓缩成三句话:先定任务再选压缩方案,NLP 优先量化,结构敏感的 CV 场景再评估剪枝;评测不能只看 accuracy,必须加平衡准确率这类对预测分布敏感的指标;最终一定要在目标硬件上实测延迟,而不是看压缩率的纸面数字。论文实验代码和产物已在 GitHub 开源(github.com/Arnavvvkumar/deployment),原文见 arXiv:2608.15693。
在所有人都在谈把大模型塞进小设备的当下,这篇论文提醒的是另一件事:塞进去不难,难的是确认塞进去的还是原来那个模型。