刚发现一个宝藏项目MinerU,70.8k star,省了自己写AI工具的时间
1️⃣ 把PDF、扫描件直接转成干净的Markdown/JSON,公式、表格、排版全给你保留好。实测喂给Claude写总结,比直接丢原文准确率高一大截,不再乱编内容了。
2️⃣ 内置深度学习模型做版面分析,双栏、复杂嵌套表格都能拆对。之前用别的开源库转那种扫描版论文,结果乱成一坨,换这个一把过,真的省心
3️⃣ 不光能转,还自动抽元数据、去页眉页脚,输出直接就是LLM-ready的格式。接入Agent工作流不用再写一堆预处理代码,开箱即用。
开源协议宽松,商用也没问题。
这项目是上海AI Lab放出来的,属于有顶尖研究团队持续维护的那种
我上周拿它批量转了一批财报PDF,跑了几百份没崩过。
同类工具一般只能处理规整电子版,这种带复杂排版的扫描件才是真考验,它扛住了。
你们现在处理PDF转Markdown用的啥工具,有踩过什么坑吗?
🔗 https://github.com/opendatalab/MinerU