返回
RSS InfoQ (AI/数据工程) AI 逐段翻译 发布 2026-09-03 14:06 收录于 09-04

Cohere发布Parse 5多模态文档解析模型

DataHot 速览

Cohere发布Parse 5,一个23亿参数的多模态文档解析模型,可将财务报表、论文等复杂PDF转换为Markdown,并输出边界框坐标用于视觉定位。ParseBench基准基于2000多个企业页面评估,Parse 5在表格抽取、内容保真、语义格式等维度平均得分79.2。它采用自定义4亿参数视觉编码器和2B语言模型,目标是替代基于规则的OCR管线。

为什么值得关注:文档解析是从非结构化数据到可分析数据的关键入口,该产品展示了多模态模型在企业数据接入与治理环节的落地进展,数据平台从业者值得关注。

译文

AI 逐段翻译

Cohere 已正式发布 Parse 5(parse-v5.0),这是一个专有的多模态基础模型,专门用于解决开发者从复杂企业文档中提取结构化数据这一长期挑战。该模型于 2026 年 8 月 27 日推出,这是一个拥有 23 亿参数的视觉语言模型(VLM),能将包含财务报告和科学论文在内的视觉丰富型 PDF 转换为干净的 Markdown,同时提供精确的边界框坐标用于视觉定位。

在架构上,Parse 5 针对高容量企业工作负载进行了优化,具备 8K 令牌的上下文窗口,能够同时处理多样化的文本和视觉输入。该模型基于 Cohere Labs 的开权重 North-Micro-Vision-Instruct 架构,依赖于一个高效的流水线。它利用一个自定义训练的 4 亿参数原生分辨率 视觉编码器(初始化自 SigLIP 2 SO400M),该编码器采用二维旋转位置嵌入(RoPE)和学习的一维位置嵌入来保留文档的空间结构。一个专门的 投影器 将这些提取的视觉特征直接映射到语言模型的嵌入空间中。

核心推理引擎是一个基于 Cohere 的 Command A+ 架构 的内部 20 亿参数语言模型(North Micro LLM)。该系统采用 集成(“DeepStack”) 方法,将来自视觉编码器多个层的补丁嵌入注入到语言模型的早期层中,使其能够在多个抽象级别访问视觉表示。通过直接输出结构良好的 Markdown,该模型有望消除基于规则的脆弱 OCR 流水线的需求。

为了量化模型的准确性,Cohere 使用 ParseBench(一个严格的、基于规则的数据集,包含超过 2000 个经过人工验证的企业页面,涵盖保险、金融和政府领域)对 Parse 5 进行了评估。该评估测试了关键的效能维度,如表格提取、内容忠实度和语义格式,这些维度在传统解析器处理时经常导致生产工作流中断。在这些基准测试中,Cohere Parse 5 在表格提取、内容忠实度和语义格式方面取得了平均 79.2 分。这一表现使其在当前工具生态系统中具有很强的竞争力。虽然像 LlamaParse Agentic Plus 这样的高级配置以 90.20 的总体得分领先 ParseBench 排行榜,但 Parse 5 超越了其他值得关注的替代方案,包括得分 75.05 的 Mistral OCR 和 Google Gemini 3 Flash (Thinking High)。

对开发者而言,在 Markdown 输出之外包含边界框坐标,确保下游应用能够将提取的数据视觉定位回源文档。这项能力对于需要严格审计追踪和验证的监管行业至关重要。

Python

import cohere

# Initialize the Cohere V2 Client
co = cohere.ClientV2("YOUR_COHERE_API_KEY")

# Open your complex enterprise PDF
with open("quarterly_earnings_report.pdf", "rb") as file:
    document_content = file.read()

# Call the Parse API for Markdown extraction
response = co.models.parse(
    model="parse-v5.0",
    document=document_content,
    output_format="markdown"
)

# Access the structured output
print("Extracted Markdown:\n", response.text)
# Bounding boxes for visual grounding
print("Layout Elements:\n", response.bounding_boxes)

cURL

curl --request POST \
  --url https://api.cohere.com/v2/parse \
  --header 'Authorization: Bearer YOUR_COHERE_API_KEY' \
  --header 'Content-Type: multipart/form-data' \
  --form 'model=parse-v5.0' \
  --form 'document=@quarterly_earnings_report.pdf' \
  --form 'output_format=markdown'

API 可通过 Cohere 平台 Microsoft Azure AI Foundry 以及 AWS 上的 Amazon SageMaker 访问,为构建检索增强生成(RAG)或自主代理系统的团队提供了无缝集成的路径。对于希望在全面集成之前评估该工具的开发者,可以通过 Coerce 的 API 仪表板、通过一个免费的 Hugging Face Space 进行基于 UI 的测试,以及在本地使用 Hugging Face 上的开权重 North-Micro-Vision-Instruct 基础模型进行测试。

像 Reddit 这样的在线社区中的讨论显示出人们对 Cohere Parse 的技术能力和实际实现的浓厚兴趣。在 r/Rag 的一次讨论中,一位用户正在构建一个依赖 pypdf 并配有 Mistral OCR 回退的摄取栈,他强调了 Cohere Parse 在表格提取、阅读顺序改进、图像描述和定价方面的吸引力。然而,这位用户也指出了集成方面的摩擦,询问关于 OpenRouter 的可用性,并请求支持原生 PDF 文件输入,以避免在将 PDF 传递给 API 之前需要逐页渲染。此外,在 r/LocalLLaMA 中,用户对开权重 North-Micro-Vision-Instruct 的发布作为一款有前景的 OCR 模型反应积极,同时指出紧凑的 24 亿参数规模正是为原型设计和任务特定微调而设计的。该工具的发布同样在 r/AIDeveloperNews 上因其能够将包括表格和嵌入图片在内的复杂文件转换为干净的 Markdown 而受到强调。

随着 Parse 5 的推出,Cohere 巩固了其超越纯文本处理的扩展,提供了一款针对企业文档分析的细微需求而量身定制的稳健、经济高效的多模态工具。通过优先考虑较低延迟下的可靠输出格式化,该公司继续瞄准处理杂乱、现实世界非结构化数据的开发者。

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存