# 腾讯EVIE与百度PaddleOCR-VL对比：Document AI转向视觉检索

- 来源：凡人小北 (@frxiaobei)
- 发布时间：2026-08-30 20:54
- AIHOT 分数：52
- AIHOT 链接：https://aihot.virxact.com/items/cmtfu4rvq01ylrooefozxl88b
- 原文链接：https://x.com/frxiaobei/status/2094045976428421276

## AI 摘要

腾讯EVIE与百度PaddleOCR-VL对比显示Document AI正从“先转文字再理解”转向视觉检索。PaddleOCR-VL约1B参数可直接结构化文字、表格、公式与图表；EVIE则将整页作为视觉信息Embedding，在视觉空间完成检索，再按需解析。两者拼出“视觉检索→文档解析→LLM推理”的下一代Document RAG雏形。

## 正文

最近把腾讯刚出的 EVIE 和百度 PaddleOCR-VL 放在一起看，感觉 Document AI 正在发生一个很重要的变化。

过去做 RAG，有一个几乎没人质疑的前提：

先把世界变成文字，再让 AI 理解。

PDF 先 OCR，表格转 Markdown，图片提取文字，然后切 Chunk、Embedding、进向量库。

PaddleOCR-VL 已经把这条路线做得非常极致：1B 左右的模型，可以直接理解文字、表格、公式、图表，把复杂文档结构化。

但腾讯 EVIE 走了另一条路。
它甚至不急着读文档，而是直接把整页当成视觉信息做 Embedding，在视觉空间里完成检索。

所以一个很有意思的变化出现了：
以前是 Parse Everything → Search Text。

以后可能是：
See Everything → Retrieve → Parse Only What Matters → Reason。

这不只是少做一次 OCR。

更重要的是 AI 不再要求现实世界先被压缩成文字，才能进入它的检索和推理系统。

表格的位置、图表的趋势、字体、颜色、空间关系，本来就是信息。把它们 OCR 成一串文字，本身就是一次有损压缩。

所以 EVIE 和 PaddleOCR-VL 在我看来并不是竞争关系，反而刚好拼出了下一代 Document RAG 的雏形：

Visual Retrieval → Document Parsing → LLM Reasoning

过去我们想的是怎么让 AI 读懂更多文档。

下一阶段的问题可能变成：
既然模型已经有眼睛了，为什么还要先把世界翻译成文字给它看？

https://huggingface.co/tencent/EVIE-Preview-4.5B?utm_source=chatgpt.com
