查看: 5|回复: 0

Firecrawl 又开源了一个 PDF 处理库:pdf-inspector。

[复制链接]

16

主题

1

回帖

50

积分

注册会员

积分
50
发表于 1 小时前 | 显示全部楼层 |阅读模式
Firecrawl 又开源了一个 PDF 处理库:pdf-inspector。

Rust 编写,主打快速分类 + 文本提取,不用 OCR 就能处理文本型 PDF:

① 自动判断 PDF 是文本版还是扫描版
② 提取带坐标信息的文字,并转成 Markdown
③ 支持 Python、Node.js 和 WebAssembly
④ 文本型 PDF 本地处理通常 200ms 内
官方测试称,大约 54% 的文档可以直接跳过 OCR,减少外部服务调用。

不过扫描版 PDF 还是得配合 OCR,主要适合处理文本型文档。
🔗 https://github.com/firecrawl/pdf-inspector

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部