8 月 12 日,Cohere Labs 在 Hugging Face 上发布了 North-Micro-Vision-Instruct:一个 2.4B 参数的开放权重视觉语言模型(VLM),采用 Apache 2.0 许可证。这是 Cohere 至今最小的 VLM,定位也很明确——不做全能选手,而是给文档理解、OCR、视觉定位(grounding)这类垂直场景提供一个"拎得动、改得动"的紧凑底座。

原生分辨率是核心卖点

大多数 VLM 处理图像的第一步是把输入压成固定大小的小方图,文档的纵横比、小字号、表格线条在压缩中直接丢失。North Micro Vision 反其道而行:视觉输入保持原生分辨率,上限 1654×2339 像素——正好是一页 A4 纸按 200 dpi 扫描的规格,且保留纵横比。对于票据、表单、财报截图这类"细节就是信息"的输入,这个设计比参数量本身更有说服力。

架构:三件套,每个都有出处

模型由三部分组成:

  • 视觉编码器:400M 参数,自研,从 Google 的 SigLIP 2 SO400M checkpoint 继续预训练。关键技术是 C-RoPE——2D RoPE 与双线性插值的 1D 位置嵌入相结合,支撑原生分辨率输入。
  • Projector:遵循 DeepStack 思路,把视觉编码器多层的 patch embedding 注入语言模型的早期层,让 LLM 接触不同抽象层级的视觉表征。
  • 语言模型:2B 参数的 North Micro LLM,沿用 Command A+ 的混合注意力架构——3 层滑动窗口注意力(带 RoPE)交替 1 层全局注意力(无位置嵌入)。

训练课程:一条"从粗到细"的分辨率爬坡

训练分四个阶段:先在 384×384 固定分辨率上用 1000 万样本(60% 稠密描述 + 40% OCR)对齐视觉编码器和 projector;再分两步把分辨率拉到 1024×1024 和 A4@200dpi,联合训练全模型;第三阶段用 5000 万样本做多模态指令微调,数据配比里 OCR、图表、grounding/计数合计超过六成;最后用 50 万偏好样本做安全与格式优化——用的是简化版 MPO(去掉 BCO 损失,DPO 混合 15% 的 SFT 辅助损失)。

这套"OCR 重课程"直接反映在成绩单上。

Benchmark:强项真的强,弱项也真的弱

对照组包括 Ministral-3 (3.8B)、LFM2.5-VL (1.6B)、Phi-3.5-vision (4.2B)、Gemma-4-E2B (5.1B)、Qwen3-VL-2B、Qwen3.5-2B、SmolVLM 2.2B:

项目 North Micro Vision 说明
DocVQA 0.921 对照组仅次于 Qwen3.5-2B 的 0.926
ChartQA 0.808 对照组第一
OCRBench 0.792 仅次于 LFM2.5-VL 和 Qwen3.5
RefCOCO(平均) 0.732 SmolVLM 2.2B 仅 0.018,Ministral-3 仅 0.317
MMMU 0.329 对照组垫底区
MMLU 0.504 明显低于通用模型

最扎眼的是 RefCOCO:0.732 对 0.018,同尺寸开源模型的视觉定位能力差距拉开了几十倍量级——bounding box 在训练时统一归一化到 0-1000 坐标系,grounding/计数数据占了指令微调的 13.3%。反过来,MMMU 0.329、MMLU 0.504 说明它的通用知识与 STEM 推理就是放弃了。Cohere 自己的结论也是"benchmark 剖面在文档理解与视觉定位上最强"。

生态位与评论

Cohere 过去的主场是企业级文本模型(Command R、Aya 系列),这次是它以完全宽松的许可进入开源多模态领域的一步。官方博客把发布放在"sovereign AI"叙事下:清晰许可 + 开放权重 + 透明评测。生态跟进也算快:MLX-VLM 权重已由社区贡献(可在 Apple Silicon 上跑)、NVIDIA 提供了 AutoModel 微调配方、Axolotl 支持微调,官方 vLLM 支持"即将推出"。

我的看法:2-3B 级"专才模型"正在成为一条独立赛道。LFM2.5-VL-3B 主打手机端、Muse Glimmer 30B 主打本地 Agent,North Micro Vision 则把"原生分辨率 + 文档/grounding"做成自己的标签。对选型者的启示很直接——看榜单总分没用,要看你的任务剖面:如果你的场景是单据识别、表单抽取、截图问答,2.4B 的它可能比 5B 的通用模型更好用还更便宜;但让它做数学题或开放域问答,就是用错了工具。

开源协议给了二次开发的空间,而文档场景恰恰是企业最愿意花力气微调的领域。这个"小而尖"的打法,值得持续观察。

参考:https://huggingface.co/blog/CohereLabs/meet-north-micro-vision-instruct