查看: 7|回复: 0

想给产品加 OCR?装完 Tesseract 再调一堆参数,中英混排还是糊成一团。

[复制链接]

10

主题

4

回帖

38

积分

新手上路

积分
38
发表于 昨天 21:44 | 显示全部楼层 |阅读模式
想给产品加 OCR?装完 Tesseract 再调一堆参数,中英混排还是糊成一团。

docTR 是个基于 PyTorch 的文字识别库,几行代码就能把 PDF 或图片里的文字整页抓出来。

它走两步:先把每个词在页面上的位置框出来,再把框里的字符读出来。定位和识别用的是两套模型,想换哪套都行。

GitHub:http://github.com/mindee/doctr

开出版面分析后,标题、正文、表格、页眉页脚会被自动分区标注,提取完立刻知道每段文字属于哪里。

扫描件常见的歪斜、旋转也有专门选项处理;输出要正框还是斜框,你自己定。

Hugging Face 上有在线 demo,也提供 Colab,不想装环境就直接网页丢张图先试效果。

项目最早由 Mindee 打磨出来,现在由 t2k 团队接手维护,最近还在持续提交更新。

给自己的项目接一层 OCR,用它比从零训练模型省心得多。


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部