news 2026/8/31 10:27:22

Firecrawl 完全指南:5 分钟把任意网页变成 LLM 就绪的数据

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Firecrawl 完全指南:5 分钟把任意网页变成 LLM 就绪的数据

Firecrawl 完全指南:5 分钟把任意网页变成 LLM 就绪的数据

【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 🔥项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl

按这套流程走完,你的脚本五分钟就能吐出干净的 Markdown 和结构化 JSON:不用写选择器,不用配代理。Firecrawl 是一个开源的网页抓取 API,URL 进去,大模型能直接用的数据出来。

它是什么:网页和大模型之间的数据接口

一句话定位:给 AI 应用喂"网页上下文"的 API,渲染、反爬、清洗整条链路它替你跑完。核心能力如下:

能力一句话说明典型用法
Search搜索网络,直接返回结果页的完整正文app.search("firecrawl", limit=5)
Scrape单个 URL 转 Markdown、HTML、截图或结构化 JSONapp.scrape(url, formats=["markdown"])
Agent只描述需求,它自主搜索并取回数据app.agent(prompt="查 Notion 的定价")
Crawl / Map一次请求抓完整站,或瞬间列出全部 URLapp.crawl(url, limit=100)app.map(url)

第一次跑通:最小配置与首次调用

  1. 装依赖:Python 用户执行pip install firecrawl-py,JavaScript 用户执行npm install firecrawl
  2. 拿密钥:到官网注册,领一个fc-开头的 key,配成环境变量FIRECRAWL_API_KEY
  3. 首次调用
from firecrawl import Firecrawl app = Firecrawl(api_key="fc-YOUR_API_KEY") doc = app.scrape("firecrawl.dev", formats=["markdown"]) print(doc.markdown)

跑完之后,控制台打印出来的是一整段结构完整的正文:标题层级、表格都保留,导航、脚本等噪音全部剥掉了。这就是后面所有玩法的起点。

三个真实场景:批量提取、自动调研与定时抓取

把 Hacker News 首页落成结构化 JSON

你想每天存档首页榜单,但选择器解析法碰上改版就崩。examples/hacker_news_scraper/ 的做法是先写 Pydantic 模型声明要哪些字段,再调scrape_url并传formats: ["extract"]和模型的 schema,AI 按字段逐个回填:

app = FirecrawlApp() data = app.scrape_url( "https://news.ycombinator.com/", params={ "formats": ["extract"], "extract": {"schema": NewsData.model_json_schema()}, }, )

跑一次,首页 30 条新闻的标题、链接、点赞数、排名就进了带时间戳的 JSON 文件。以后页面改版,你只需要维护模型,不用碰解析逻辑。

用一句话查遍符合条件的房源

单次抓取只能看一页,而"找 2000 美元以下的一居室"这类任务要跨很多页。examples/deep-research-apartment-finder/ 调deep_research,参数只有三个:maxDepth(迭代轮数,示例为 3)、timeLimit(秒级总时长上限,示例 180)、maxUrls(分析 URL 上限,示例 20)。

它在后台自己搜索、跟链接、抓下一批页面,还注册了on_activity回调把每步动作打印出来。几分钟后你拿到的是一页整理好的候选清单,房源按价格、设施、位置逐项列清,最后交给 Claude 排序推荐。

让商品价格的变动按天自动入库

盯价格靠手刷太累,而"定时 + 抓取"是这类数据的天然组合。examples/blog-articles/amazon-price-tracking/ 的思路:脚本周期性抓商品页、抽出当前价格、追加落盘,调度则完全交给 GitHub Actions 的 cron,不需要常驻进程。

效果是每天多一条价格记录,界面上画出一条趋势曲线,跌破阈值还能接通知。

进阶技巧与常见问题

两个参数级技巧:

  • formats可以一次传多种输出,比如 markdown 和 screenshot 一起要:markdown 喂模型省 token,截图留作人工核对的证据。
  • 抓整站先用limit小批量试跑确认范围再放大;只想要站内少数页面时,app.map(url, search="pricing")能按关键词直接筛出相关 URL,省掉全量爬取。

常见问题:

  • 站点反爬很强怎么办?代理轮换、限速处理和 JS 渲染内容都是内置的,官方口径覆盖率能到 96% 的网页,这块不用你操心。
  • 某个字段老抽错?把 schema 里该字段的description写得更具体,提取准确率会明显提升。
  • 能自托管吗?可以。仓库根目录自带docker-compose.yaml,执行docker compose up即可整套起本地服务,细节见 SELF_HOST.md。

Firecrawl 的价值,是把"从网页到可用数据"这段最琐碎的路压缩成一次 API 调用。完整能力清单看 README,能直接跑的演示都在 examples/ 里。

【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 🔥项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 10:27:17

408操作系统复习:抓住资源管理主线,攻克进程与内存高频考点

准备408统考的同学,操作系统这科很特别。它不像数据结构那样需要大量写代码,也不像组成原理那样细节密集,但它是四科里最容易让人“看懂了却做不对”的一门。很多人把操作系统知识点过了一遍,合上书发现脑子里只有进程、线程、页表…

作者头像 李华
网站建设 2026/8/31 10:27:14

NAJM 示例拆解:时尚品牌 editorial 排版与留白的 5 个关键细节

NAJM 示例拆解:时尚品牌 editorial 排版与留白的 5 个关键细节 【免费下载链接】hallmark Anti-AI-slop design skill for Claude Code, Cursor, and Codex. 项目地址: https://gitcode.com/GitHub_Trending/hal/hallmark NAJM 是 Hallmark 项目内置的一个时…

作者头像 李华
网站建设 2026/8/31 10:25:44

Agent Skills 实战:从提示词到可复用的大模型技能包

这次我们来看一个近期讨论度很高的方向:Agent Skills。很多人已经习惯用大模型写代码、写文档、做数据分析,但总觉得结果不稳定:同一个问题换一种问法,输出质量就明显波动。Agent Skills 要解决的问题,就是把这些“靠临…

作者头像 李华
网站建设 2026/8/31 10:23:07

llama.cpp AMD显卡快速部署完整指南

llama.cpp AMD显卡快速部署完整指南 【免费下载链接】llama.cpp LLM inference in C/C 项目地址: https://gitcode.com/GitHub_Trending/ll/llama.cpp 你第一次运行 llama-cli 做本地推理,进度条却在加载模型前停住,日志里一行 "no GPU"…

作者头像 李华
网站建设 2026/8/31 10:23:00

基于YOLO的安全带检测系统实战:从数据标注到边缘部署

简介:本资源是一个基于YOLO算法的实时安全带检测系统完整实现,面向深度学习初学者、计算机视觉开发者及智能交通安防领域实践者,解决车辆驾乘人员未系安全带行为的自动识别与预警问题,适用于车载终端、驾校监管、共享汽车安全审计…

作者头像 李华
网站建设 2026/8/31 10:22:30

几百张发票和快递单,如何变成随手可搜的电子档案

几百张发票和快递单,如何变成随手可搜的电子档案 【免费下载链接】paperless-ngx A community-supported supercharged document management system: scan, index and archive all your documents 项目地址: https://gitcode.com/GitHub_Trending/pa/paperless-ng…

作者头像 李华