# 百度Unlimited OCR再登HuggingFace总榜前三

- 来源：Berryxia.AI (@berryxia)
- 发布时间：2026-07-22 16:12
- AIHOT 分数：47
- AIHOT 链接：https://aihot.virxact.com/items/cmrvud0v8011ibipz0ydw3wav
- 原文链接：https://x.com/berryxia/status/2079841995649163623

## AI 摘要

百度开源的Unlimited OCR模型再次登上HuggingFace全球模型总趋势榜第三，GitHub Star突破1.65万，下载量达224万。该模型仅30亿参数，支持32K上下文，可一次性解析整本100页PDF，跨页保留文本、公式、表格和阅读顺序，错误率低于0.11。其R-SWA机制使KV Cache规模恒定，实现免费本地运行。

## 正文

兄弟们，这几天真的是国产模型的高光时刻啊，又有模型海外刷屏！

Yann LeCun 转发，Unlimited-OCR 开源模型再次登上 HuggingFace 总榜🔥

Unlimited OCR 模型又火了！

之前还分享过它家出品的几个OCR的新模型，这个模型因为我没有本地部署的资源，因此还没有实测，结果这个模型在海外又出圈了！

近日，图灵奖获得者、AI 科学家杨立昆（Yann LeCun）转发推荐百度开源的 Unlimited OCR，该项目再次登上 HuggingFace 全球模型总趋势榜，目前位列第三，再次超过 GLM-5.2。

截至目前，Unlimited OCR 的 GitHub Star 已突破 1.65万，HuggingFace 下载量达到 224万，热度仍在持续攀升。

要知道，上个月发布时它就已经疯过一轮：发布次日登顶 GitHub Daily Trending 总榜、Python 榜，5 天 Star 破万，横扫 GitHub、HuggingFace 四大榜单第一。

如今时隔一月再次冲入全球趋势榜前三，Unlimited OCR 正在从一次出圈走向持续增长，成为近期全球开发者社区关注度最高的开源 AI 项目之一。

海外开发者直接炸了👇

🔹知名播客主持人 Mario Nawfal：30 亿参数，一次性解析整本 100 页 PDF，无需分页、无上下文丢失。40 页之后错误率低于 0.11，而其他所有 OCR 工具到这个阶段已经无法正常工作了。

🔹GrowthSchool 创始人 Vaibhav Sisinty：传统 OCR 逐页切割，跨页表格断裂、阅读顺序丢失。Unlimited-OCR 一次性处理整个文档，32K 上下文，文本、公式、表格、阅读顺序全部跨页保留，完全免费本地运行。

🔹网友 Superman：中国开源了一个「花生大小」的 OCR，只有 30 亿参数，本地运行，免费，永久。大多数人还不知道它的存在。

🔹网友 Macro Bombastic：这正是能彻底摧毁 SaaS 敲诈的办法，免费、本地化、准确率 93%，简直太棒了。

持续刷屏的背后是长程解析的技术突破

过去 OCR 处理长文档只能「逐页解析+结果拼接」，输出越长 KV Cache 越膨胀，推理越慢显存越贵。

Unlimited OCR 提出的 R-SWA 机制借鉴人类抄书的方式：始终盯着原文，只保留最近生成的「工作记忆」。

数十页文档一次连续解析，KV Cache 恒定规模，效率和显存成本两个都要，为端到端长文档解析提供了新的技术方案。

免费、开源、本地跑，感兴趣的快去试试👇🏻
GitHub：http://github.com/baidu/Unlimited-OCR
