Cohere发布Parse 5文档解析VLM,2.3B参数支持多格式
Cohere 官方发布 Parse 5
Cohere 官方发布 Parse 5
> 2.3B 参数 > 8192 上下文窗口 > 支持输入 PDF、PPT、JPEG > 支持英、法、德、意、西、葡、日、韩、阿拉伯语
Parse 5 是一个专用文档解析视觉语言模型(VLM),核心任务是把 PDF、PPT、图片等非结构化企业文档,一次性转换成干净的、机器可读的 Markdown 结构化数据。
体验地址 https://huggingface.co/spaces/CohereLabs/cohere-parse
为什么官方说"超越 OCR"?
传统 OCR 只做文字识别,Parse 5 是端到端单次前向传播(前面没有独立的 OCR 阶段),一次输出: · 文本:按正确阅读顺序排列(多栏排版不乱序) · 表格:渲染为结构化 HTML,能处理旋转表格、合并单元格等复杂情况 · 表单:提取键值对 · 图片:生成文字描述,并附带边界框(bounding box)坐标 · 语义格式:保留删除线、斜体、上下标、标题层级等"会改变数据含义"的样式
两种输出模式: · markdown(默认):整页 Markdown,表格内联为 HTML,图片以  引用 · blocks:结构化内容块数组,每个块带类型(text/table/image)和边界框,适合做版面分析和引用溯源
性能:ParseBench 79.2 分
超过 Mistral OCR 4(74.5)、Databricks AI Parse(72.4)、Azure Document Intelligence(69.3)
需要知道的三个重要前提 · 只测了 5 个维度中的 3 个。ParseBench 完整维度是:表格、内容忠实度、语义格式、版面定位(Layout)、图表(Charts)。Cohere 排除了后两项: · Layout 被排除是因为 Parse 5 设计上只对表格和图片输出边界框,不对文本块输出——Cohere 称这是"有意的输出格式选择"; · Charts 被排除是因为 Parse 5 把图表当作"带描述的图片"处理,不做图表数据提取(官方称下个版本才支持)。 · 在全 5 维度上,LlamaParse Agentic(84.9)仍是榜首。Cohere 的"领先"声明限定在三维度和同价位专用解析器范围内。 · 评分规则刚改过(2026 年 8 月修复了粗体/标题检测的计分 bug,旧规则会虚高语义格式分),Cohere 用新规则重跑了所有竞品,这一点相对公允。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力