腾讯EVIE与百度PaddleOCR-VL对比:Document AI转向视觉检索

凡人小北 · @frxiaobei · X·2026-08-30 20:54·1小时前
AI 导读

腾讯EVIE与百度PaddleOCR-VL对比显示Document AI正从“先转文字再理解”转向视觉检索。PaddleOCR-VL约1B参数可直接结构化文字、表格、公式与图表;EVIE则将整页作为视觉信息Embedding,在视觉空间完成检索,再按需解析。两者拼出“视觉检索→文档解析→LLM推理”的下一代Document RAG雏形。

凡人小北@frxiaobei
52AI 编辑部评分,满分 100

腾讯EVIE与百度PaddleOCR-VL对比:Document AI转向视觉检索

2026-08-30 20:54· 1小时前
AI 导读

腾讯EVIE与百度PaddleOCR-VL对比显示Document AI正从“先转文字再理解”转向视觉检索。PaddleOCR-VL约1B参数可直接结构化文字、表格、公式与图表;EVIE则将整页作为视觉信息Embedding,在视觉空间完成检索,再按需解析。两者拼出“视觉检索→文档解析→LLM推理”的下一代Document RAG雏形。

最近把腾讯刚出的 EVIE 和百度 PaddleOCR-VL 放在一起看,感觉 Document AI 正在发生一个很重要的变化。

过去做 RAG,有一个几乎没人质疑的前提:

先把世界变成文字,再让 AI 理解。

PDF 先 OCR,表格转 Markdown,图片提取文字,然后切 Chunk、Embedding、进向量库。

PaddleOCR-VL 已经把这条路线做得非常极致:1B 左右的模型,可以直接理解文字、表格、公式、图表,把复杂文档结构化。

但腾讯 EVIE 走了另一条路。 它甚至不急着读文档,而是直接把整页当成视觉信息做 Embedding,在视觉空间里完成检索。

所以一个很有意思的变化出现了: 以前是 Parse Everything → Search Text。

以后可能是: See Everything → Retrieve → Parse Only What Matters → Reason。

这不只是少做一次 OCR。

更重要的是 AI 不再要求现实世界先被压缩成文字,才能进入它的检索和推理系统。

表格的位置、图表的趋势、字体、颜色、空间关系,本来就是信息。把它们 OCR 成一串文字,本身就是一次有损压缩。

所以 EVIE 和 PaddleOCR-VL 在我看来并不是竞争关系,反而刚好拼出了下一代 Document RAG 的雏形:

Visual Retrieval → Document Parsing → LLM Reasoning

过去我们想的是怎么让 AI 读懂更多文档。

下一阶段的问题可能变成: 既然模型已经有眼睛了,为什么还要先把世界翻译成文字给它看?

https://huggingface.co/tencent/EVIE-Preview-4.5B?utm_source=chatgpt.com

来源:凡人小北· x.com