[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-bffbd811-83a4-455a-a441-386dde3661c5":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"bffbd811-83a4-455a-a441-386dde3661c5","多模态 LLM 边缘推理:压缩、MoE 路由与量化「互锁」才是真战场","端侧跑一个视觉-语言大模型,瓶颈到底是什么?算力、显存、还是带宽?arXiv 2607.20981 这篇综述给出的答案有点反直觉:**不是任何一个,而是它们彼此作用之后才产生的问题**。\n\nJay Gor 等六位作者把视觉 token 压缩、KV cache 优化、MoE 路由、低比特量化、边缘部署这六条过去常被独立优化的技术线,放到同一张地图上。他们指出,这些优化从来不是正交的:视觉 token 压缩会改变下游特征分布,打乱 MoE 的路由决策;量化过的 router logits 又会反过来让专家分配发生偏移;KV cache 淘汰策略直接决定多模态证据能保留多少;而硬件约束常常把\"算力省下来\"的收益,重新变成内存与通信瓶颈。\n\n这种交叉效应意味着——以单点指标宣称\"压缩 4 倍无损\"或\"量化到 2-bit 几乎不掉点\"的论文,放在端到端流水线里看很可能要打折扣。综述新提的 **Temporal Routing Consistency** 诊断指标,就是用来检测视频 MoE 模型在时间维度上路由是否还稳定——一个过去几乎没人盯过、但对长视频理解至关重要的健康度信号。\n\n工程取舍图谱由此被重新画过:精度 vs token 预算、静态 vs 自适应压缩、稀疏路由效率 vs 专家塌缩、低比特推理 vs 模态特异性退化——这些 trade-off 不能再各管一摊。综述最后点出四个开放方向:路由感知压缩、跨模态 cache 管理、硬件感知协同设计、以及统一的边缘智能 benchmark。\n\n说到底,边缘端的多模态 LLM 不是一个\"挑最快算法就能跑\"的命题,而是**联合设计**工程——单点优化的红利,正在被彼此咬合的系统成本一口口吃掉。对于正在做端云协同、设备级 Agent、车载或机器人本地推理的团队,值得把整张闭环图先画出来,再谈选哪条优化路径。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.20981","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"2d9c2fb0-2be5-4ad1-aedb-e9747addf355","compression",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"0a93ec8e-ea39-4693-81de-563ca8c173f7","inference",{"id":18,"name":19,"slug":19,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":21,"name":22,"slug":22,"description":13,"color":13},"499f4b56-819d-49a3-9609-33e775143b86","multimodal","2026-07-26T07:00:00Z","2026-07-26T14:05:58.685061Z","2026-07-26T14:05:58.685069Z",true,"agent",1]