主 题:【开源干货】被商业爬虫收费恶心到了,老哥怒写 5 万星开源爬虫 Crawl4AI
发 布 者:SkyLightVPS
标签分类: 技术
时 间:2026-09-05 09:53:37
内容预览:搞过大模型、RAG 或者本地知识库的应该都知道,把网页内容扒下来洗成干净的 Markdown 是最恶心的一步。之前海外那帮做云端抓取提取的,像什么 Firecrawl、Jina,后面基本都搞商业化收费,一个月几十刀,按页扣费看着都肉疼。推特上有个国外老哥也是被这种按月扣费的服务恶心到了,一生气干脆自己撸了个开源项目 crawl4ai,结果直接在 GitHub 冲到了 5 万多星。这玩意儿说白了就是专给大模型喂数据用的爬虫,丢个网址进去,它会自动把页面里的垃圾广告、侧边栏、弹窗都给过滤掉,直接吐出来格式非常规整的纯净 Markdown 或者 JSON。平时那种带 JavaScript 动态渲染、无限瀑布流滚动的页面它也能搞定,本地装个 Python 库或者用 Docker 就能跑起来,不用配什么 API Key,也不用绑卡。自己搭 Agent 或者本地跑小模型需要喂网页语料的可以去看看,省得再给商业 API 交冤枉钱了。项目地址:https://github.com/unclecode/crawl4ai
直达链接: https://www.nodeseek.com/post-912527-1
发 布 者:SkyLightVPS
标签分类: 技术
时 间:2026-09-05 09:53:37
内容预览:搞过大模型、RAG 或者本地知识库的应该都知道,把网页内容扒下来洗成干净的 Markdown 是最恶心的一步。之前海外那帮做云端抓取提取的,像什么 Firecrawl、Jina,后面基本都搞商业化收费,一个月几十刀,按页扣费看着都肉疼。推特上有个国外老哥也是被这种按月扣费的服务恶心到了,一生气干脆自己撸了个开源项目 crawl4ai,结果直接在 GitHub 冲到了 5 万多星。这玩意儿说白了就是专给大模型喂数据用的爬虫,丢个网址进去,它会自动把页面里的垃圾广告、侧边栏、弹窗都给过滤掉,直接吐出来格式非常规整的纯净 Markdown 或者 JSON。平时那种带 JavaScript 动态渲染、无限瀑布流滚动的页面它也能搞定,本地装个 Python 库或者用 Docker 就能跑起来,不用配什么 API Key,也不用绑卡。自己搭 Agent 或者本地跑小模型需要喂网页语料的可以去看看,省得再给商业 API 交冤枉钱了。项目地址:https://github.com/unclecode/crawl4ai
直达链接: https://www.nodeseek.com/post-912527-1