查看: 5|回复: 0

10个GitHub仓库,能把网页洗成AI能吃的数据! 先收藏。这种权限,公司通常要先见销售、再签合同!

[复制链接]

9

主题

1

回帖

29

积分

新手上路

积分
29
发表于 昨天 22:25 | 显示全部楼层 |阅读模式
10个GitHub仓库,能把网页洗成AI能吃的数据!

先收藏。这种权限,公司通常要先见销售、再签合同!

1.Firecrawl
丢一个网址,它把整站爬完、把JS渲染完,吐出结构化数据。十三万星,进过全站前一百。不少AI创业公司底层就在用。
https://github.com/firecrawl/firecrawl

2.Crawl4AI
网页变成Markdown,模型直接读。不用密钥,不用注册,不按页收费。有人嫌十六刀一个月的爬虫,几天自己写了一个。五万一千星。
https://github.com/unclecode/crawl4ai

3.browser-use
AI像人一样开浏览器:点、滑、登录、填表、抽数据。苏黎世联邦理工两个人做的,一年快到九点五万星。普通爬虫够不着的页,它能进。
https://github.com/browser-use/browser-use

4.Crawlee
专业爬虫框架。换代理、重试、指纹、队列,整套都有。别家卖好几千的技术栈,这儿开源。
https://github.com/apify/crawlee

5.Scrapy
工业级老牌。百万页也能啃,导出干净。付费工具未必跑到这个规模,它免费跑了十几年。
https://github.com/scrapy/scrapy

6.MarkItDown
微软的。PDF、Office、网页、图片,转成Markdown。很多数据管道就卡在这一步,现在源码公开。
https://github.com/microsoft/markitdown

7.Scrapling
站点改版它跟着改,往隐身方向做。防爬商家当卖点收的那一层,开源了。
https://github.com/D4Vinci/Scrapling

8.scrcpy
电脑镜像安卓手机,没网页的App也能动手。十三万星以上。
https://github.com/Genymobile/scrcpy

9.AutoScraper
给一个例子,它自己找规律,把剩下的页扒完。不用手写选择器。
https://github.com/alirezamika/autoscraper

10.curl-impersonate
curl换了一套浏览器指纹,请求看起来像真人开着Chrome。贵的爬虫接口底层玩的就是这个。
https://github.com/lwthiker/curl-impersonate

公司把这种访问卖到两千刀一个月。代码在上面。






本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部