最近刷到 Crawl4AI 的 star 数窜得很快,대박。我之前做爬虫都是 Scrapy 或者 Playwright 自己拼,爬下来一堆 HTML 还得手动洗成干净文本,去噪、分块、转 Markdown,每一步都烦死。这个库有意思的地方是它把"给大模型喂干净数据"直接做成默认能力,不是事后补救那种叙事。你丢个网址进去,出来就是 LLM 能直接吃的 Markdown,连智能分块都帮你切好,基本省掉最磨人的脏活。
说白了开发者现在不满足于"先爬后洗"那套老流程,更想要一个为 AI 专门产粮的工具,场景切得挺准。它文档也清楚,README 例子能直接跑,开源项目第一关往往是别人三分钟能不能上手,它过了。星标暴涨背后其实是 AI 落地普遍卡在数据清洗这环,喂不对料,模型再强也白搭。但冷静看,现在拿它做 prototyping 很香,真上生产级高并发,稳定性还得再跑半年验证。我个人看法是别急着全信,先当趁手的小刀用着。