我要提问
ARTICLE DETAIL

资讯详情

前沿编程新知与开发实战干货的深度解读。

Firecrawl 网页抓取快速指南:5 分钟把任意网页变成 LLM 可用的数据

Firecrawl 网页抓取快速指南:5 分钟把任意网页变成 LLM 可用的数据 Firecrawl 网页抓取快速指南5 分钟把任意网页变成 LLM 可用的数据【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl上周我想每天存一份盯了很久的商品价格记录手写 HTML 解析连改两次都崩了。Firecrawl 是一个开源的网页抓取 API给它一个 URL它还你干净的 Markdown 或结构化 JSON代理轮换和 JS 渲染都内置了。本文带你 5 分钟跑通第一个网页抓取调用。30 秒看懂项目Firecrawl 适合谁用它的位置在 LLM 和真实网页之间你不必碰 HTML它把网页加工成能直接喂给模型的数据。做 RAG、数据分析、Agent 应用又不想自己写爬虫的人就是它的目标用户。能力你拿到什么Scrape 单页抓取任意 URL 转成 Markdown、HTML、截图或结构化 JSONSearch 搜索不只链接而是每个结果页的完整正文Crawl 整站爬取一个请求抓完整站用limit控制 URL 数Map 站点发现瞬间列出站内全部 URL支持按关键词筛选Actions 页面操作点击、滚动、输入、等待之后再提取应对交互页面Batch 批量抓取异步抓取上千个 URL两个可参考的官方数字覆盖约 96% 的网页含 JS 重度页面百万页面规模下 P95 延迟 3.4 秒。SDK 覆盖 Python、Node.js、Go、Java、Rust 等 9 种语言默认遵守 robots.txt。5 分钟跑通从装依赖到抓下第一个网页装依赖按语言选一条Python 用pip install firecrawl-pyNode 用npm install firecrawl。到官网注册即可拿到免费额度的 API Key存进环境变量FIRECRAWL_API_KEYSDK 默认从这里读取。之后最小调用长这样from firecrawl import Firecrawl app Firecrawl(api_keyfc-YOUR_API_KEY) doc app.scrape(https://example.com, formats[markdown]) print(doc.markdown)跑出来的结果是目标页干净的 Markdown 正文标题层级、表格都保留导航栏和脚本标签不见了。这就是后面所有玩法的起点。挑一个场景马上用把新闻列表按模型落库想每天存一份 Hacker News 首页做分析写 CSS 选择器解析 HTML 的话页面一改版代码就废。仓库里的 Hacker News 抓取器 换了个思路先用 Pydantic 定义要什么字段让 Firecrawl 的 AI 照着填。from firecrawl import FirecrawlApp from pydantic import BaseModel class NewsItem(BaseModel): title: str rank: str upvotes: str data app.scrape_url(https://news.ycombinator.com/, params{formats: [extract], extract: {schema: NewsItem.model_json_schema()}})执行后整页新闻的标题、排名、点赞数逐条填好自动写入带时间戳的 JSON 文件形如firecrawl_hacker_news_data_2025_01_15.json。之后页面怎么改版都不怕要改的只是模型。让程序自己多页翻查做调研一次抓取只看一页但找某城市 2000 美元以下的一居室这类任务要翻很多页。公寓调研示例 用的是deep_research能力给一句自然语言查询它自动搜索、跟链接、筛选再抓下一批页面循环多轮。要调的只有三个参数maxDepth迭代轮数示例设 3、timeLimit总时长上限 180 秒、maxUrls最多分析 20 个 URL。脚本注册了一个on_activity回调搜索、抓取、分析每一步都实时打印在终端。几分钟后拿到的不是一堆链接而是价格、位置、设施逐条列出的候选清单最后由 Claude 做排序推荐。先让 AI 挑页面再批量提取公司情报做市场调研时往往只知道公司名不知道该翻哪些页面。Gemini 网页提取示例 把它拆成三步先用 SerpAPI 搜出一批结果再让大模型从中挑出最有价值的 URL只输出一个 JSON 列表最后把选中的 URL 连同提示词发给 Firecrawl 的/v1/extract接口一次性批量抽取字段。几十秒后你拿到一份结构化的公司档案主营业务、规模、联系方式全部按你要求的格式返回。定时抓取搭一个自动价格监控系统开头那个价格记录需求仓库里的 Amazon 价格跟踪示例 就是现成答案定义一个含商品名、价格等字段的 Pydantic 模型定时抓商品页、追加进数据库用 Streamlit 画历史曲线调度交给 GitHub Actions 的 cron不用自己维护定时器。仓库另有一篇定时抓取教程细讲 cron 写法和各种免费调度方案。避坑与常见问题被反爬挡住了怎么办不用管。代理轮换、限速处理和 JS 渲染都是 Firecrawl 内置的这正是它替代手写 requests 的意义所在。怎么先看到抓取效果用官网 Playground 在线试满意后再写进代码也可以直接 curl 调 REST 接口绕开 SDK 单独排查。字段抽错了怎么办把 schema 里字段的description写得更具体一些AI 提取的准确率会明显提升。输出格式怎么选formats可以任意组合 markdown、html、json、screenshot。只喂模型时 markdown 最省 token需要留证据链就同时加截图。进阶还有两件事整站爬取时先用limit小批量试跑确认范围再放大不想让数据出内网的话可以自托管。仓库根目录的 docker-compose.yaml 里打包了 API、worker、Redis、Playwright 和 Postgresgit clone https://gitcode.com/GitHub_Trending/fi/firecrawl cd firecrawl docker compose up跑完就是一套完整的本地服务无需等云端部署。现在就开始接下来就做一个动作跑pip install firecrawl-py或npm install firecrawl注册拿到密钥发出你的第一个 scrape 请求。完整功能看 README各场景的可运行示例都在 examples 目录 里照着改参数即可。【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表