9 月 21 日,Apple 把今年 5 月发表的论文 LensVLM: Selective Context Expansion for Compressed Visual Representation of Text 正式落成了可用工件:9B 参数的视觉语言模型 LensVLM-9B 上架 Hugging Face,官方代码仓库 ml-lensvlm 同步开放。论文与权重之间隔了四个多月,这次的新闻不是"又发了一个模型",而是一条研究路线兑现了可复现的交付物。
它解决什么问题
长文档问答的标准做法是把全文塞进上下文窗口,代价随页数线性上涨。LensVLM 换了一个思路:把整份文档渲染成压缩后的页面图像——提供 5x、10x、15x 三档压缩——模型先"扫"这些低分辨率缩略图,判断哪几页与问题相关,再通过一个学出来的 read_page 工具,只把相关页面按原始分辨率展开读取。
官方 demo 给了一条完整轨迹:输入 15 页压缩图像,问题问"在电影 Kiss and Tell 中饰演 Corliss Archer 的女演员后来担任过什么政府职务"。模型在
规格与实现
模型是 dense 结构,9B 参数,BF16 精度,基座是 Qwen/Qwen3.5-9B-Base——大厂把强开源文本骨干适配成多模态,而不是从零训练,这已经是通行模式。论文作者阵容 10 人(Roy Xie、Dan Friedman、Donghan Yu 等)。
评测管线也一并开源:从 HotpotQA、Natural Questions、Musique 构造带干扰段的长文档评测集,推理后用 LLM-as-judge 打分;论文里的 judge 用的是 Qwen3.5-397B-A17B-FP8,跑在 8 卡 B200 节点上。也就是说,复现这条研究路线不需要 Apple 私有设施。
生态与许可
Hugging Face 页面显示,模型上架后最近一个月下载 1,432 次,社区已跟进 9 个量化版本,2 个 Spaces 在用。注意许可条款:模型权重走 Apple Machine Learning Research Model License,代码走 Apple Sample Code License——都不是 Apache/MIT 级别的宽松许可,商用前需要读条款。这是 Apple 一贯的研究开源姿态:工件可复现,边界画得清楚。
值得留意的点
把"压缩视觉表示 + 选择性展开"这条路线和当前两股潮流对照着看更有意思:一边是上下文窗口军备竞赛,百万 token 成为旗舰标配;另一边是 KV cache 压缩、上下文蒸馏等"省着用"的工程派。LensVLM 属于后者,但它把省上下文的动作从推理层挪到了输入表示层——文档根本不以全文形式进入模型,而是以图像缩略图的形式进入,再按需取回。对于 PDF、扫描件这类本来就是视觉形态的输入,这条路绕开了 OCR 依赖。
对开发者的"所以呢":如果你的场景是几百页文档里的偶发查询,先扫缩略图、再精读少量页面的检索策略,可能比无脑开百万上下文更便宜。9B 的体量单卡可跑,量化版本已经就位,门槛不高——但先确认研究许可覆盖你的用途。