最近把腾讯刚出的 EVIE 和百度 PaddleOCR-VL 放在一起看,感觉 Document AI 正在发生一个很重要的变化。
过去做 RAG,有一个几乎没人质疑的前提:
先把世界变成文字,再让 AI 理解。
PDF 先 OCR,表格转 Markdown,图片提取文字,然后切 Chunk、Embedding、进向量库。
PaddleOCR-VL 已经把这条路线做得非常极致:1B 左右的模型,可以直接理解文字、表格、公式、图表,把复杂文档结构化。
但腾讯 EVIE 走了另一条路。 它甚至不急着读文档,而是直接把整页当成视觉信息做 Embedding,在视觉空间里完成检索。
所以一个很有意思的变化出现了: 以前是 Parse Everything → Search Text。
以后可能是: See Everything → Retrieve → Parse Only What Matters → Reason。
这不只是少做一次 OCR。
更重要的是 AI 不再要求现实世界先被压缩成文字,才能进入它的检索和推理系统。
表格的位置、图表的趋势、字体、颜色、空间关系,本来就是信息。把它们 OCR 成一串文字,本身就是一次有损压缩。
所以 EVIE 和 PaddleOCR-VL 在我看来并不是竞争关系,反而刚好拼出了下一代 Document RAG 的雏形:
Visual Retrieval → Document Parsing → LLM Reasoning
过去我们想的是怎么让 AI 读懂更多文档。
下一阶段的问题可能变成: 既然模型已经有眼睛了,为什么还要先把世界翻译成文字给它看?
https://huggingface.co/tencent/EVIE-Preview-4.5B?utm_source=chatgpt.com