Firecrawl快速上手:5步把网页接入大模型

发布时间:2026/8/28 10:05:52
Firecrawl快速上手:5步把网页接入大模型 Firecrawl快速上手5步把网页接入大模型【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl你想让大模型实时读懂网页就得先解决取数这件事JS渲染、反爬、清洗HTML全要自己动手。Firecrawl是开源的网页抓取API把任意网页直接转成大模型能用的Markdown或结构化JSON代理轮换、限流这些脏活它替你干。读完这篇你能把单个页面变成干净Markdown、整站爬取一个文档库并把联网能力接到AI Agent上。关键词Firecrawl 网页抓取 APIFirecrawl 自部署Firecrawl 快速上手 API KeyFirecrawl 整站爬取 MarkdownFirecrawl RAG 知识库搭建Firecrawl MCP 大模型接入为什么不用自己写爬虫了Firecrawl的定位很直接给大模型和AI应用提供现成的网络数据。它不是给你一个浏览器让你操作而是给你一组API输入URL或一句话输出干净数据。开源免费核心代码AGPL-3.0协议SDK和部分UI组件为MIT协议另有托管服务可选覆盖广官方称覆盖96%的网页含重度JS页面P95延迟3.4秒输出即喂料干净Markdown、结构化JSON、截图直接省token脏活内置代理、速率限制、JS拦截内容零配置处理Agent友好一条命令接入任意AI Agent或MCP客户端功能看明白了先跑通比什么都重要。下面给你两条路云上用API Key最快本地用Docker Compose最可控。10分钟拿到API Key跑通第一次抓取走托管服务是最短路径三步在官网注册拿到以fc-开头的API Key安装对应语言的SDKPython是pip install firecrawl-pyNode.js是npm install firecrawl发第一次请求from firecrawl import Firecrawl app Firecrawl(api_keyfc-YOUR_API_KEY) doc app.scrape(https://example.com, formats[markdown]) print(doc.markdown)预期看到页面标题和正文以Markdown字符串返回没有多余HTML标签。想先不动代码试试手感官网playground可以在浏览器里直接测请求。如果你的数据不能出内网或者想自己控制抓取引擎那就自己部署一套。自部署一条docker compose起私有实例克隆仓库git clone https://gitcode.com/GitHub_Trending/fi/firecrawl进入目录执行cd firecrawl docker compose up -d等容器就绪。默认只有API对主机暴露端口3002向3002端口发一个scrape请求能返回Markdown就算通了这套Compose会起API和worker、Playwright负责JS页面、Redis、RabbitMQ、NuQ PostgreSQL默认队列后端。FoundationDB只是可选队列后端默认不用碰。 首次运行三件事默认USE_DB_AUTHENTICATIONfalseAPI无鉴权仅限可信内网使用公网暴露前必须补齐认证PostgreSQL、Redis、RabbitMQ端口不要对公网发布变量以根目录docker-compose.yaml引用的为准更多说明见SELF_HOST.md。跑通之后进入正题拿到网页的4个核心任务。4个核心任务任意页面都能拿到Firecrawl的能力浓缩成几个端点scrape、search、map、crawl、agent、interact。不按界面讲按完成一件事走一遍。任务1单页转Markdown调用scrape填两个东西url和formats。formats可组合markdown、html、screenshot等。预期markdown字段是清洗后的正文metadata里有title和sourceURL截图需求就在formats里加一项。任务2搜索并直接拿全文调用search填query和limit比如limit5。它不只返回链接列表而是每条结果都带该页的完整内容——不用再自己挨个去爬。预期一个数组每项含url、title、markdown以及你要的json、screenshot。任务3列出站点全部链接调用map填url。想要更快定位再填一个search参数比如searchpricing返回的URL会按相关性排序。预期links数组每项含url、title、description。爬整站前先用它摸一下规模比直接开爬省credit。任务4整站爬取调用crawl填url、limit如100、scrapeOptions.formats如[markdown]。注意它是异步的先返回job id再用id轮询状态直到status变成completed。SDK会自动帮你轮询裸调HTTP才需要自己轮。预期data数组每页一条Markdown外加total、completed、creditsUsed三个数方便你核算成本。单站爬通了接下来把参数配成适合你业务的方案。下面三个剧本可以直接抄。3个场景剧本参数直接抄作业场景A文档站RAG知识库流程map摸底 →crawl整站 → Markdown喂进向量库。对象参数建议值理由规模摸底map searchsearchapi先按关键词确认站点规模爬取页数crawl limit100首跑封顶控制credit消耗输出格式scrapeOptions.formats[markdown]Markdown token最省场景B监控竞品商品页流程scrape抓页面 →agent带schema抽价格 → 存库定期重跑。仓库examples/目录里有完整的价格追踪示例照它抄即可。对象参数建议值理由商品页scrape formats[markdown, screenshot]Markdown出价格截图留底核对价格字段agent schema定义price数字字段输出直接入库不再解析抽取模型agent modelspark-1-mini便宜60%价格抽取属简单任务场景C给AI Agent装上网不写代码让Agent自己联网方式得到什么怎么开CLIAgent可用全部Firecrawl命令装npx -y firecrawl-clilatest init --all --browser装完重启AgentMCP任意MCP客户端可搜索、抓取客户端加一个firecrawl-mcp条目环境变量填FIRECRAWL_API_KEY基础任务都通了剩下的是按需开开关。进阶能力开关用到哪个开哪个Interact何时页面要点搜索框、点按钮、滚动才能出数据。怎么开先scrape拿到scrape_id再对它发interact用自然语言下指令。得到动作结果output和一个liveViewUrl可实时看操作画面。Batch Scrape何时手里有一批几百上千个URL。怎么开把URL列表一次提交formats照旧。得到异步任务跑完一次性返回所有Markdown。Agent模型选择何时抽取任务难度分档。spark-1-mini便宜60%多数任务够用spark-1-pro是默认档留给跨站对比、复杂导航、数据必须准的场景。K8s / Helm何时要上生产环境。怎么开仓库内examples/kubernetes/下有firecrawl-helm chart和cluster-install清单。得到版本化的部署起点注意它们只是起点不是替你做完的生产方案。参数配好了剩下最容易卡住的几个点查这张表就行。避坑速查常见报错与解法你看到的现象先判断怎么解决401 / key无效key是否fc-前缀、变量名对不对换托管的改key自部署首跑本身无鉴权不需要keycrawl成功了却没内容返回的是job id异步任务按id轮询状态或直接用SDK自动等待整站爬得太久limit没设首跑limit100封顶满意再放大JS页面无正文自部署的Playwright容器是否起来确认Playwright服务状态托管侧默认已处理自部署API被公网访问默认无鉴权USE_DB_AUTHENTICATIONfalse限可信内网上生产前补齐认证和TLS个别URL抓不到robots.txt默认遵循robots.txt别绕过目标站点规则最后按这个清单走一遍你就有了一条能长期跑的数据管道。行动清单从零到稳定运行拿key托管或docker compose up -d自部署跑通第一次scrape用map摸底一个你真正要用的站点确认规模从上面3个剧本里挑一个抄参数搭出第一条管道跑几天看输出质量按需调limit、formats和模型档位上生产前开认证、规划持久化与备份、盯资源占用一句叮嘱网页数据不是一次抓完就完事的——页面结构会变、反爬会升级把爬取成功率和输出质量当成日常指标盯着这条管道才会越跑越稳。【免费下载链接】firecrawlThe context API to search, scrape, and interact with the web at scale. 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考