端侧跑一个视觉-语言大模型,瓶颈到底是什么?算力、显存、还是带宽?arXiv 2607.20981 这篇综述给出的答案有点反直觉:**不是任何一个,而是它们彼此作用之后才产生的问题**。 Jay Gor 等六位作者把视觉 token 压缩、KV cache 优化、MoE 路由、低比特量化、边缘部署这六条过去常被独立优化的技术线,放到同一张地图上。他们指出,这些优化从来不是正交的:视觉 token 压缩会改变下游特征分布,打乱 MoE 的路由决策;量化过的 router logits 又会反过来让专家分配发生偏移;KV cache 淘汰策略直接决定多模态证据能保留多少;而硬件约束常常把"算力省下来"的收益,重新变成内存与通信瓶颈。 这种交叉效应意味着——以单点指标宣称"压缩 4 倍无损"或"量化到 2-bit 几乎不掉点"的论文,放在端到端流水线里看很可能要打折扣。综述新提的 **Temporal Routing Consistency** 诊断指标,就是用来检测视频 MoE 模型在时间维度上路由是否还稳定——一个过去几乎没人盯过、但对长视频理解至关重要的健康度信号。 工程取舍图谱由此被重新画过:精度 vs token 预算、静态 vs 自适应压缩、稀疏路由效率 vs 专家塌缩、低比特推理 vs 模态特异性退化——这些 trade-off 不能再各管一摊。综述最后点出四个开放方向:路由感知压缩、跨模态 cache 管理、硬件感知协同设计、以及统一的边缘智能 benchmark。 说到底,边缘端的多模态 LLM 不是一个"挑最快算法就能跑"的命题,而是**联合设计**工程——单点优化的红利,正在被彼此咬合的系统成本一口口吃掉。对于正在做端云协同、设备级 Agent、车载或机器人本地推理的团队,值得把整张闭环图先画出来,再谈选哪条优化路径。