# Mistral OCR 4

- 来源：Mistral AI：News（网页）
- 发布时间：2026-06-23 22:24
- AIHOT 分数：68
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmqqqkqoh0chzslp5i6l20j5q
- 原文链接：https://mistral.ai/news/ocr-4

## 精选理由

Mistral OCR 4 把 bounding box 和置信度输出做进了产品，自托管部署和多语言能力很务实，做文档 RAG 和智能体的团队可以认真看看。

## AI 摘要

Mistral AI 发布 OCR 4，新增边界框、块分类（标题、表格、方程式、签名等）及逐页逐词置信度分数。支持 170 种语言、10 个语系，可单容器全自托管部署。在 OlmOCRBench 上得分 85.20，独立标注者偏好率平均 72%。定价每 1000 页 $4，Batch API 享 50% 折扣。可通过 API 或 Mistral Studio 的 Document AI 调用。

## 正文

今天，我们正式发布 Mistral OCR 4，该模型在提取文本的同时，还支持边界框、区块分类和内联置信度分数。该模型覆盖 10 个语系的 170 种语言，可在单个容器中运行以实现完全自托管部署，并可作为企业搜索、RAG 以及特定领域检索管道的输入组件。OCR 4 是一个小型、专注的模型，本文将介绍其新特性、在公开和内部基准测试上的表现、这些基准测试已知的局限性，以及何时使用模型 API 与 Document AI 的指导建议。

视频 1 亮点 突破性性能。独立标注员对 OCR 4 的偏好度超过了所有被测试的领先 OCR 和文档 AI 系统，胜率平均达到 72%，同时在 OlmOCRBench 上获得了最高总分（85.20）。方法论和已知的评分限制请参见下方基准测试部分。分割，而不仅仅是文本。除了提取的文本，OCR 4 还返回边界框、类型化区块分类（标题、表格、公式、签名等）以及内联置信度分数。边界框是我们最常被要求的功能，它能够定位文本，用于上下文高亮显示和可靠的数据管道。同时，区块类型和置信度分数驱动了基于来源的引用、内容编辑以及人工介入验证。与 Mistral 搜索工具包（公开预览版）集成。OCR 4 是搜索工具包的输入组件，该工具包是 Mistral 在 AI Now 峰会上宣布的开源、可组合的搜索框架。其结构化输出为工具包在 RAG 和企业搜索中的输入、检索和评估工作流提供了可直接用于引用的输入。多语言覆盖。支持 10 个语系的 170 种语言，在多个竞争系统表现不佳的稀有和低资源语言上取得了可衡量的进步。在您自己的基础设施上运行。OCR 4 足够紧凑，可以部署在单个容器上，将文档数据保留在您的环境中以满足数据驻留、主权和合规性要求，同时支持经济高效的高吞吐量批处理。自管理部署对企业客户开放。概述

Mistral OCR 4 能够从各类文档中提取并结构化内容。前几代技术主要专注于将页面转换为清晰的文本和表格，而 OCR 4 则返回文档的结构化表示。每个区块都通过边界框进行定位、按类型分类，并逐页逐词生成内联置信度分数。因此，下游系统不仅能获取文档内容，还能了解每个元素的位置、所扮演的角色，以及模型对每个区域的置信度。

这种结构支持多种下游工作负载：用于 RAG 的语义分块：清晰、分类明确的区块成为更好的检索单元。用于智能体的结构化基元：智能体从阅读文档转变为对文档执行操作（如填写表单、处理发票、合规检查）。用于连接器的结构化内容：为数据摄取和索引管道提供一致、类型化的输出。

OCR 4 支持常见的企业格式，包括 PDF、DOC、PPT 和 OpenDocument，并支持跨越 10 个语系的 170 种语言，其中包括许多系统处理不佳的稀有语言和低资源语言。作为一个可部署在单个容器中的紧凑模型，它既适用于对成本敏感的场景，也适用于高吞吐量的部署。该模型可以完全自托管，允许有数据主权要求的组织将文档数据保留在自己的基础设施内。

开发者可通过 API 集成该模型，团队也可以在 Mistral Studio 中使用 Document AI，通过应用层面的无代码路径访问同一引擎。通过 API 使用 Mistral OCR 4 的价格为每 1000 页 4 美元，Batch API 可享受 50% 折扣，将成本降至每 1000 页 2 美元。Document AI 的价格为每 1000 页 5 美元。基准测试

“我们在一个包含大量图表和图形的金融问答数据集上，将 Mistral OCR 4 与领先的智能文档解析器进行了基准测试，结果达到了同等精度，但成本大约降低了 8 倍，延迟降低了 17 倍。对于大规模的生产用例，这种差异会迅速累积放大。”

- Aidan Donohue，Rogo 公司 AI 工程师

为了评估 OCR 4，我们将其与领先的原生 AI OCR 模型、前沿通用模型、企业文档服务以及我们自己的 Mistral OCR 3 进行了对比。人类偏好评估

自动化基准测试存在上述评分偏差，因此我们通过一项针对反映实际使用场景的文档进行的人工对比评估来加以补充。我们收集了 600 多份涵盖 12 种以上语言的文档，这些文档来自第三方供应商，旨在代表真实的行业用例，并请独立标注员逐份文档对每个竞品输出与 OCR 4 的输出进行盲评。

在所有测试系统中，标注员在大部分文档上都更偏好 OCR 4。由于这是基于真实文档的人工判断，而非与固定参考答案进行字符串比对，因此它规避了影响自动化评分的许多标注和格式噪声。整体性能

“Mistral OCR 每页处理速度大约是我们现有供应商的 4 倍，对于大批量案卷处理工作流而言，这是一个令人印象深刻的结果，因为速度对于管理客户的知识产权时间线至关重要。”

—— Ivan Mihailov，Anaqua 公司 AI 工程师

除了在人类偏好评估中排名第一外，OCR 4 在我们测试的模型中，还在公开的 OlmOCRBench 基准测试中取得了最高总分（85.20），并在我们内部的 Crawl Multilingual 评估中领先（0.98），超越了原生 AI 解决方案和企业级解决方案。

在 OmniDocBench 上，OCR 4 取得了 93.07 的分数。我们报告这一数据时附带一个说明：OlmOCRBench 和 OmniDocBench 在对某些输出进行评分时都存在已知的局限性，单一的汇总分数既可能低估也可能高估实际性能。

在审计我们分数背后的不匹配项时，发现大多数并非模型错误，而是基准测试比较输出结果的方式所产生的人为产物。常见的类别包括：**真实标注错误**。部分参考标注本身就有误：存在缺失或多余的文本、对已编辑区域的转录错误，或者拼写错误（例如，参考文献中引用的作者姓名拼写错误，但模型从页面中正确读取了该姓名）。输出结果与源文档匹配，却仍被标记为错误。**等效数学符号**。不同但渲染效果完全相同的 LaTeX 代码被计为不匹配。渲染出的公式是正确的，但字符串比较却不对。**公式分段**。一个表达式是作为一个整体公式输出，还是拆分成多个内联片段输出，会影响匹配结果，即使渲染后的内容完全相同，因为匹配器无法对齐这些片段。**多栏阅读顺序**。跨栏边界的单词（例如 "certifi-cates"）以及栏序假设，会导致正确的提取结果被判定为阅读顺序错误。**区块类型归属**。该基准测试不期望输出中包含页眉/页脚。为解决此问题，我们在评分前从输出中剥离了页眉页脚。但测试随后会检查一个恰好也是页面标题的字符串（该标题本应存在），并将其错误地标记出来。

这些人为产物主要集中在数学、科学和多栏文档中，并且它们更倾向于惩罚正确的输出，而非奖励错误的输出。因此，我们将总体分数视为方向性参考，而非决定性结论。

我们报告这些数字是为了说明 OCR 4 的当前水平，并建议您在自己的文档上进行评估。性能详情。

多语言表现概览。在我们内部的多语言评估中，OCR 4 在所有八个语系组别中均处于领先地位——包括英语、西欧语言、东欧语言、中东语言、中文、东亚语言、东南亚语言以及稀有语言（如印地语、日语、格鲁吉亚语、孟加拉语、亚美尼亚语、希伯来语、希腊语、古吉拉特语、泰米尔语、马拉雅拉姆语、卡纳达语、泰卢固语）。在稀有语言和低资源语言上，差距最为显著：许多竞品系统在这些语言上性能急剧下降，而 OCR 4 依然保持高准确率。英语 西欧语言 东欧语言 中东语言 中文 东亚语言 东南亚语言 稀有语言

OCR 4 既支持高吞吐量流水线，也支持交互式文档工作流，具体包括：**文档解析与提取**：处理复杂、多语言的文档。检索增强生成（RAG）：为语义分块和基于来源的答案生成提供结构化、已分类、可引用格式的内容。配合搜索工具包，OCR 4 的输出可直接输入检索流水线。智能体工作流：为 AI 智能体提供结构原语，以完成表单填写、发票处理、合规审查等任务，尤其适用于法律、金融服务和医疗保健领域。利用置信度分数构建结构化数据流水线，实现人工审核员的高效介入：用于表单/发票提取、内容脱敏以及合规驱动流程。企业搜索与知识库：将 OCR 作为数据源组件，用于自定义数据摄取和实体提取。

早期用户正在将 OCR 4 应用于将发票转化为结构化字段、数字化公司档案、从技术和科学报告中提取干净文本，以及驱动企业搜索。

关于适用范围外的说明。OCR 4 是一个文档理解模型，而非决策者。它不适用于医疗诊断、法律建议或裁决、高风险金融决策、安全关键系统、实时/延迟敏感处理，或非文档输入（如原始音频、视频等）。OCR 4 API：了解您的选择

Mistral 的 OCR 4 通过单一 API 端点提供。
