返回深读目录

firecrawl:把网页变成AI能直接读的干净数据

firecrawl 是一个把任意网页转成 markdown、结构化 JSON 或截图的工具,今天在涨星榜上,星数 179201。

自己写爬虫抓网页,最烦的是目标站点用 JS 渲染,请求回来是一堆空壳,还得配代理、处理限流、解析 DOM。抓一篇两篇还行,抓一百篇就开始跟反爬斗智斗勇,最后拿到的正文里混着导航栏和广告。

它的做法是给一个 URL,直接吐干净内容。比如把一篇产品文档的链接丢进去,拿回来的是去掉侧边栏和页脚的 markdown,能直接塞进知识库或喂给模型。整站抓取也一样,给一个域名,它把站内所有 URL 的内容批量拉下来,不用你一个个拼链接。

它有个 Actions 设计,能在提取前先对页面做点击、滚动、输入、等待这些操作。很多页面的关键内容藏在“展开更多”后面,或者要滚动才加载。以前得写脚本模拟这些交互再抓,现在把动作写进抓取流程里,省掉了单独维护一套浏览器自动化脚本这一步。

它开源,也提供云端 API,上手路径是注册拿 key 后直接用,不用自己搭代理池。抓取涉及大量外部请求,跑之前确认目标站点的 robots 和使用条款。

适合要搭知识库、做智能体、需要批量把网页喂给模型的人。省掉的是写爬虫和处理脏数据这两件事。

如果你感兴趣但不会装,评论区或私信喊我一声。