先收藏。这种权限,公司通常要先见销售、再签合同!
1.Firecrawl
丢一个网址,它把整站爬完、把JS渲染完,吐出结构化数据。十三万星,进过全站前一百。不少AI创业公司底层就在用。
https://github.com/firecrawl/firecrawl
2.Crawl4AI
网页变成Markdown,模型直接读。不用密钥,不用注册,不按页收费。有人嫌十六刀一个月的爬虫,几天自己写了一个。五万一千星。
https://github.com/unclecode/crawl4ai
3.browser-use
AI像人一样开浏览器:点、滑、登录、填表、抽数据。苏黎世联邦理工两个人做的,一年快到九点五万星。普通爬虫够不着的页,它能进。
https://github.com/browser-use/browser-use
4.Crawlee
专业爬虫框架。换代理、重试、指纹、队列,整套都有。别家卖好几千的技术栈,这儿开源。
https://github.com/apify/crawlee
5.Scrapy
工业级老牌。百万页也能啃,导出干净。付费工具未必跑到这个规模,它免费跑了十几年。
https://github.com/scrapy/scrapy
6.MarkItDown
微软的。PDF、Office、网页、图片,转成Markdown。很多数据管道就卡在这一步,现在源码公开。
https://github.com/microsoft/markitdown
7.Scrapling
站点改版它跟着改,往隐身方向做。防爬商家当卖点收的那一层,开源了。
https://github.com/D4Vinci/Scrapling
8.scrcpy
电脑镜像安卓手机,没网页的App也能动手。十三万星以上。
https://github.com/Genymobile/scrcpy
9.AutoScraper
给一个例子,它自己找规律,把剩下的页扒完。不用手写选择器。
https://github.com/alirezamika/autoscraper
10.curl-impersonate
curl换了一套浏览器指纹,请求看起来像真人开着Chrome。贵的爬虫接口底层玩的就是这个。
https://github.com/lwthiker/curl-impersonate
公司把这种访问卖到两千刀一个月。代码在上面。