今天,Mistral AI 发布了其最新的文档理解模型 OCR 4。此次新版本在提取文本的基础上,新增了边界框、区块分类和内联置信度分数。它支持 10 个语系的 170 种语言,并可在单个容器中运行,实现完全自托管部署。OCR 4 还可作为企业搜索、RAG 和特定领域检索管道的文档摄入组件。
摘要
- OCR 4 不仅返回文本,还返回边界框、类型化区块标签和逐词置信度分数。
- 它支持 10 个语系的 170 种语言,在稀有和低资源语言上表现更佳。
- 独立标注员对 OCR 4 的偏好度超过了所有被测试的系统,平均胜率达 72%。
- 定价为每 1000 页 4 美元,使用 Batch-API 折扣后降至 2 美元。
- 一个端点即可同时提供原始提取和基于模式的 Document AI 输出。
Mistral OCR 4
Mistral OCR 4 能够从各类文档中提取并结构化内容。前几代模型侧重于将页面转换为干净的文本和表格。而 OCR 4 则返回整个文档的结构化表示。
每个区块都通过边界框进行定位,并按类型进行分类。区块类型包括标题、表格、公式、签名等。系统会按页和按词生成内联置信度分数。
因此,下游系统不仅能了解文档的内容,还能知道每个元素的位置、扮演的角色以及模型的置信度。这些额外的上下文对于引用、编辑和人工复核至关重要。
OCR 4 支持常见的企业格式,包括 PDF、DOC、PPT 和 OpenDocument。该模型足够紧凑,可在单个容器中部署。企业客户可选择自行管理部署,以满足数据驻留和合规性要求。
基准测试
Mistral 将 OCR 4 与 AI 原生 OCR 模型、前沿通用模型、企业文档服务以及 Mistral OCR 3 进行了对比。
多位独立标注员一致认为,OCR 4 优于所有参与测试的主流系统。在对比测试集中,其平均胜率达到 72%。该评估使用了来自第三方供应商、涵盖 12 种以上语言的 600 多份文档。标注员逐份文档将各竞品输出与 OCR 4 的输出进行排名比较。
在自动化基准测试中,OCR 4 在公开的 OlmOCRBench 上获得 85.20 分,在 OmniDocBench 上获得 93.07 分,在 Mistral 内部的多语言爬取评估(Crawl Multilingual)中得分 0.98。
两个客户数据提供了更多背景信息。Rogo 报告称,与领先的智能体解析器相比,其实现了大致相当的精度,同时成本降低约 8 倍,延迟降低约 17 倍。Anaqua 测得每页处理速度比其原有供应商快约 4 倍。
分割,而非仅仅是文本
边界框是 Mistral 用户最常要求的功能。它们能定位文本,用于上下文内高亮显示以及构建可靠的数据流水线。
区块类型和置信度分数服务于不同的任务。它们驱动着基于来源的引用、内容编辑以及人工参与的验证流程。这种结构支持多种下游工作负载。
经过清洗和分类的区块,能成为更优的 RAG 检索单元。智能体获得了对文档进行操作的结构化原语,而不仅仅是读取文档。连接器则能接收到一致、类型化的输出,用于数据摄取和索引构建。
OCR 4 同时也是 Mistral 搜索工具包(Search Toolkit)的一个数据摄取组件,该工具包现已公开预览。搜索工具包是 Mistral 开源的、可组合的搜索框架。其结构化输出为检索和评估工作流提供了可直接用于引用的输入。
应用场景与示例
OCR 4 既支持高吞吐量的流水线,也支持交互式文档工作流。
- 文档解析与提取:将多语言合同转换为干净、结构化的 Markdown 格式,以便进行索引。
- 检索增强生成(RAG):将分类后的区块输入搜索工具包,以获取带有引用的、基于来源的答案。
- 智能体工作流:为处理发票的智能体提供类型化字段和边界框,使其能自动填写表单。
- 置信度门控流水线:将低置信度区域路由至人工审核员,其余部分则自动批准。
- 企业搜索:将 OCR 4 作为数据源组件,用于整个档案库的数据摄取和实体提取。
早期用户将 OCR 4 应用于发票结构化字段提取和企业档案数字化。其他用户则用它从技术报告中提取纯净文本,或为企业搜索提供支持。
Mistral 官方发布中关于适用范围说明:OCR 4 是一款文档理解模型,而非决策工具。它不适用于医疗诊断、法律判决或高风险金融决策。同样不适合安全关键系统、实时处理,或原始音频/视频等非文档输入。
对比:纯提取模式 vs 文档 AI 模式
OCR 4 通过单一 API 端点提供服务。每次请求都运行相同的模型。它始终返回提取内容、边界框、区块类型、置信度分数和 Markdown 格式。区别在于你在其上层叠加多少功能。
| 能力 | 纯提取模式 | 文档 AI 模式(同一端点) |
|---|---|---|
| 输出 | Markdown、边界框、区块类型、置信度 | 按你定义的结构化 JSON 模式 |
| 工作原理 | 原始 OCR 响应 | OCR 输出输入至 mistral-small-2603 |
| 图像标注 | 不应用 | 基于模式的逐图视觉语言调用 |
| 自定义提示词 | 否 | 是,指导解读或摘要生成 |
| 最佳适用场景 | 流水线、智能体、批量导入 | 业务用户、试点项目、无需解析逻辑 |
| 价格 | 每 1,000 页 4 美元(批量 2 美元) | 每 1,000 页 5 美元 |
| 自托管 | 企业可用 | 企业可用 |
决策规则很简单。需要原始提取内容?直接使用 OCR 4。需要将输出重塑为特定模式或添加领域字段标注?在同一个调用中添加文档 AI 参数即可。
使用 API
基础提取只需提供文档 URL,即可返回结构化页面。设置 include_blocks=True 可获取带类型的区块和边界框。
import os
from mistralai.client import Mistral
client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])
ocr_response = client.ocr.process(
model="mistral-ocr-latest",
document={
"type": "document_url",
"document_url": "https://arxiv.org/pdf/2201.04234"
},
include_blocks=True, # typed blocks + bounding boxes
table_format="html", # None (inline), "markdown", or "html"
include_image_base64=True
) 响应是一个包含 pages 数组的 JSON 对象。每个页面携带 markdown、图片、表格、超链接、尺寸和置信度分数。如需构建人工审核流程,可请求逐词置信度。
ocr_response = client.ocr.process(
model="mistral-ocr-latest",
document={"type": "document_url",
"document_url": "https://arxiv.org/pdf/2201.04234"},
confidence_scores_granularity="word" # or "page" for aggregates
) "word"设置会为每个页面和每个表格条目添加 word_confidence_scores 数组。对于大批量任务,Mistral 建议使用批量推理服务,可将每页成本降低一半。
立即体验:交互式输出浏览器
下方嵌入的可视化内容展示了 OCR 4 的结构化输出。您可以在示例文档之间切换,开启或关闭边界框与区块类型,并打开置信度热力图。Markdown 和 JSON 选项卡并排显示了两种输出格式。示例数据仅供示意,并非实时 API 调用。