# 阿里云开源 0.8B 文档解析模型 OvisOCR2，端到端模型首次超越流水线方法登顶 OmniDocBench

- 来源：IT之家（RSS）
- 发布时间：2026-07-24 14:48
- AIHOT 分数：59
- AIHOT 链接：https://aihot.virxact.com/items/cmrykywyx026irolga90gufnq
- 原文链接：https://www.ithome.com/0/981/138.htm

## AI 摘要

阿里云开源发布文档解析模型 OvisOCR2，以 96.58 的综合得分在 OmniDocBench v1.6 上登顶，成为首个超越流水线方法的端到端模型。该模型基于 Qwen3.5-0.8B 后训练得到，采用端到端技术路线，可直接将文档图像输出为 Markdown 格式。项目以 Apache 2.0 许可证开源，兼容 vLLM 等主流推理框架。

## 正文

IT之家 7 月 24 日消息，今日，阿里云开源发布文档解析模型 OvisOCR2。该模型以 96.58 的综合得分刷新 OmniDocBench v1.6 榜单纪录，成为首个超越流水线方法并登顶该榜单的端到端模型，官方称“这是文档解析领域迎来技术路线的重要突破”。

端到端模型首次超越流水线方法

IT之家从官方公告获悉，文档解析是大模型落地的关键基础设施，企业知识库、RAG 检索、智能问答等场景均需将 PDF、扫描件等非结构化文档转化为结构化文本。

此前该领域由“流水线方法”主导，通常由版面分析模型和内容识别模型两部分组成，前者负责识别文档布局，后者负责文字、公式、表格等内容的识别，最后拼接输出。这种方式虽成熟，但存在维护成本高、误差累积、部署复杂等固有瓶颈。

OvisOCR2 采用端到端技术路线：输入一张文档图像，模型在一次生成中输出符合自然阅读顺序的 Markdown 表示，覆盖文本、公式、表格和视觉区域。过去需要多个模型协作完成的工作，现在由一个模型一步到位。

在 OmniDocBench v1.6 上以 96.58 分登顶，首次证明端到端模型可超越流水线方法。

小参数大能力，0.8B 实现 SOTA

OvisOCR2 由 Qwen3.5-0.8B 后训练得到。团队构建了真实文档与合成文档互补的数据引擎体系，合成文档专门补充表格与公式交织、多栏版式、长输出等复杂场景。训练方案融合监督微调（SFT）、强化学习（RL）、在线策略蒸馏（OPD）和模型融合四阶段流程，形成多阶段递进式的训练流程，充分释放紧凑模型的潜力。

▲ OvisOCR2 数据引擎体系

项目已开源发布，无缝融入千问生态

OvisOCR2 以 Apache 2.0 许可证开源，兼容 vLLM 等主流推理框架，与 Qwen3.5 推理生态衔接，开发者无需额外适配即可集成。

模型获取方式

Hugging Face

魔搭

技术报告
