我年轻那时候折腾爬虫,正则、xpath、selenium轮着来,抓回来的数据还得自己慢慢洗,洗到眼睛花。前阵子刷GitHub trending,撞见个Crawl4AI,星标几个月从几千窜到上万。坦白讲这几年开源爬虫我见得不少,大多热闹一阵就凉,这个势头不太一样。
说白了它是给大模型准备的数据抓取工具。有一说一网页喂进去…,直接吐干净的Markdown或JSON,传统爬虫最磨人的清洗环节它给省了。现在做RAG、做知识库的,缺的不就是现成干净语料。其实
最关键开源、能本地自搭。那些按量收费的爬虫API,抓几百万字月账单不小,数据还捏在别人手里。我自个儿搭了跑一阵,新闻站文档站抓得稳。零成本又能自己掌控,比囤用不上的会员实在。