Echo's blog
Echo's blog
· 1 min read · 资讯

百度开源Unlimited OCR:一张图里有多少信息AI都能一次读完

你有没有过这样的体验:扫描了一份几十页的合同,OCR 软件断断续续识别,表格歪了、页码乱跳、图表里的文字干脆一片空白。最后你只能对着满屏错字叹气,老老实实自己敲一遍。

这种让人抓狂的痛点,百度最近开源的 Unlimited OCR 项目,给出了一个完全不同的答案。

一张图里有多少信息,AI 都能一次读完#

xh_illust_20260624_unlimited-ocr_13

传统 OCR 的思路是把一张大图切割成若干小块,一块块识别再拼接。遇到版面复杂的长文档,拼接过程就像拼一千块的拼图,只要有一块对不上,整段文字的逻辑就断了。更别提跨栏排版、图片中的文字这类老难题,传统方案往往直接放弃。

Unlimited OCR 的核心突破在于”one-shot long-horizon parsing”:它不再分块,而是把整张图片作为一个整体,一次性完成识别。这个”一次读完”的能力,让它可以处理超长文本序列、复杂的栏位布局,甚至图文混排的场景。无论是一页书还是整本报告,它都能保持上下文连贯,不会丢行、不会乱序。一次推理,整页尽收眼底,信息密度再高也不怕。

百度出品,MIT 协议开源#

xh_illust_20260624_unlimited-ocr_14

项目在 GitHub 上一经发布就获得了超过 3400 星,热度背后是社区对新一代 OCR 的期待。百度选择用 MIT 协议开源,意味着任何人都可以自由使用、修改和商用,没有授权门槛,不卡企业部署。

配套的 arXiv 论文详细介绍了背后的技术方案:通过改进的 Transformer 架构和长序列注意力机制,模型真正学会了理解”整页图片”的全局语义,而不是机械地识别单个字符再拼凑。对于科研团队和中小开发者来说,这意味着可以直接拿现成的预训练模型去跑自己的业务场景,不必从零训练,成本大幅降低。

普通用户能拿它做什么#

xh_illust_20260624_unlimited-ocr_15

如果觉得 OCR 只是一个技术名词,那 Unlimited OCR 对普通人的意义远不止代码仓库里的几行更新。

一个学生可以拍下整本教材,AI 一次读完生成可搜索的笔记;一位律师可以把成堆的卷宗丢进扫描仪,系统直接输出结构清晰的文字版本;做数据分析的人面对截图里的表格,不再需要手动录入。当 OCR 从”能识别”进化到”一遍读完且不出错”,很多重复劳动就真的可以交给机器了。

曾经高端扫描仪和商用软件才能做到的精度,如今一个开源模型就能跑在自己的笔记本上。这背后是 AI 技术走向普惠最真实的写照。Unlimited OCR 的出现,让 OCR 不再是专业软件的专利,而是所有人都能随手调用的能力。

来源:GitHub | Hacker News

Related Posts

Comments

Copied
Copied to clipboard