处理长文本时,最麻烦的往往不是让 AI 总结,而是把里面的关键信息准确抽出来。

处理长文本时,最麻烦的往往不是让 AI 总结,而是把里面的关键信息准确抽出来。

Google 开源的 LangExtract,就是专门干这个的。

给它几个示例,它就能用 LLM 从非结构化文本里提取指定信息,而且每条结果都能对应回原文位置,方便检查来源。

几个实用点:

① 自动分块,支持长文档并行处理
② 支持 Gemini、OpenAI,也能接本地 Ollama
③ 自带 HTML 可视化,提取结果直接在原文里高亮
④ 不需要专门微调模型,给示例就能开始用

合同、报告、论文、小说这类长文本,都可以拿来试试。
🔗 https://github.com/google/langextract



分类