传统爬虫抓下来往往是一堆无用 HTML,而 Crawl4AI 的目标很明确:把网页内容整理成适合大模型读取的 Markdown。
它开源免费,不需要 API Key,也没有按调用次数收费,适合拿来做 AI 知识库、RAG、网页分析等场景。
项目基于 Apache 2.0 协议,社区活跃,目前已经成为 GitHub 上非常受欢迎的 AI 爬取工具之一。
如果你在做 Agent、搜索增强或者自动化工作流,这个项目值得研究。
🔗 http://github.com/unclecode/crawl4ai