Rust 编写,主打快速分类 + 文本提取,不用 OCR 就能处理文本型 PDF:
① 自动判断 PDF 是文本版还是扫描版
② 提取带坐标信息的文字,并转成 Markdown
③ 支持 Python、Node.js 和 WebAssembly
④ 文本型 PDF 本地处理通常 200ms 内
官方测试称,大约 54% 的文档可以直接跳过 OCR,减少外部服务调用。
不过扫描版 PDF 还是得配合 OCR,主要适合处理文本型文档。
🔗 https://github.com/firecrawl/pdf-inspector