企业 RAG 的第一公里,长期卡在文档解析上。合同、保单、发票、论文——这些真正躺着企业知识的地方,往往是最难喂给模型的:表格错位、阅读顺序断裂、删除线和斜体这类改变语义的样式直接丢失。ParseBench 的评测数据把这件事量化得很直白:AWS Textract 在 Semantic Formatting 维度只有 2.8 分,Google Document AI 也只有 33.0 分——传统文档智能服务在「格式即含义」的场景里几乎是盲的。
Cohere 本周交出的答案是 Parse:一个面向企业文档的视觉语言模型。它的输入输出很干脆——复杂多模态文件进,干净的 Markdown 出,表格和嵌入图像以结构保留,支持九种主要商业语言,并为视觉元素返回 bounding box。用 Cohere 自己的话说,这是「市面上最强性价比」的文档解析方案。
官方评测:79.2 分卡在专用与通用之间
在 Cohere 提交的 ParseBench 评测中(三个维度平均),Parse 拿到 79.2,高于 Mistral OCR 4 的 74.5、Databricks AI Parse 的 72.4 和 LlamaParse Cost Effective 的 78.3;对比超大规模云厂商的方案优势更大——比 AWS Textract 和 Google Document AI 高出 20 分以上。分维度看,Tables 87.0、Content Faithfulness 86.6 是强项,Semantic Formatting 64.0 则明显落后于 frontier LLM。
官方也把边界说得很清楚:在他们的评测集里,只有 GPT-5.5(84.4)、Opus 4.8(84.3)和 Gemini 3.5 Flash(81.8)三个通用大模型压过 Parse——而这三者都是「显著更大」的通用模型。换句话说,这个专用小模型(第三方追踪站 AI/TLDR 转述其参数量为 2.3B)用几分之一的成本,打到了 frontier 门槛前。
值得肯定的还有评测口径的透明度:Cohere 在脚注里说明使用了 2026 年 8 月修正后的评分规则——修复了此前会虚高 Semantic Formatting 的粗体/标题检测 bug,并对所有竞品用同一规则重跑;同时明确排除了 Layout 和 Chart 两个维度,理由是产品定位使然、而非能力缺陷,图表数据抽取计划留给下一个版本。
单价与吞吐:把解析做成「水电煤」
$1.50 每 1000 页的 API 定价,配合生产级吞吐——在 8 卡 H100 节点上每秒 36 页、每分钟 2160 页,约为 dots.mocr 的 1.4 倍、Chandra OCR 2 的 2.2 倍(官方基准,所有模型均以 vLLM 部署测量)。对于合规行业,Parse 可以跑在私有云或本地环境,也可走单租户的 Model Vault:50% GPU 利用率时成本再降 23%,满载时降 61%。
Cohere 算了一笔账:一个每月处理约 1300 万页的应付账款流程,用 Model Vault 替代 API 每月省约 1.2 万美元、每年约 14.4 万美元;对比定价 $10/千页的云厂商文档服务,单一流程每年可省约 147 万美元。Parse 现已通过 Cohere API、Model Vault、Microsoft Foundry 和 AWS SageMaker 四个渠道可用,并作为 Compass 检索栈的一环与 Embed、Rerank 打包成「文档到答案」管线。
所以呢
这次发布真正值得看的不是某个跑分,而是一个趋势的又一次确认:文档解析正在从「通用 LLM 顺手做一下」分裂出一个独立的专用模型层——小参数、极致单价、高吞吐,直接切走 hyperscaler 存量 Document AI 的市场。对企业的理性策略也随之清晰:精度敏感的少量文档交给 frontier LLM,百万页级的规模化管线交给 $1.5/千页的专用模型。RAG 第一公里的成本,终于开始按「每千页」计价了。
(原始来源:Cohere 官方博客 https://cohere.com/blog/parse)