如何把爬取的数据存入MongoDB:thal项目Mongoose使用完整指南

发布时间:2026/8/20 20:09:19
如何把爬取的数据存入MongoDB:thal项目Mongoose使用完整指南 如何把爬取的数据存入MongoDBthal项目Mongoose使用完整指南【免费下载链接】thal项目地址: https://gitcode.com/gh_mirrors/tha/thal很多刚接触爬虫的朋友都会遇到同一个问题数据好不容易抓下来了却不知道如何把爬取的数据存入MongoDB。今天这篇教程就以开源项目thal为例完整演示如何用 Mongoose 在 Node.js 中定义数据模型、写入爬取结果、避免重复数据并验证数据是否成功落库。整个过程无需深厚后端功底跟着步骤操作即可跑通爬取 → 存储的完整链路。为什么爬虫数据适合存 MongoDBMongoDB 是一种 Schema-less 的 NoSQL 文档数据库它的核心优势在于结构灵活爬取到的字段经常变化MongoDB 无需预先建表改起来非常省事JSON 天然契合Node.js 爬虫处理的数据本身就是 JSON 格式写入 MongoDB 几乎零转换成本扩展简单数据量大了以后可以横向扩展适合长期积累型爬虫任务但无 Schema也是一把双刃剑爬虫数据来源复杂很容易混入脏数据。这时就需要Mongoose出场了——它相当于 MongoDB 的 ORM可以给松散的文档加上结构和约束让写入的数据保持整洁规范。爬虫项目环境准备两步安装在开始写代码之前需要先安装两个基础工具这也是本项目运行的前提Node.js8.0 以上版本用于运行爬虫脚本MongoDB本地安装后默认端口是27017克隆并初始化项目后先安装爬虫依赖 Puppeteer再安装我们要重点讲的 Mongoose$ npm i --save puppeteer $ npm i --save mongoose小提示Puppeteer 会自带一个 Chromium 内核安装时会自动下载第一次安装可能稍慢请耐心等待。最快配置方法用 Mongoose 定义 User 模型Mongoose 的核心概念是Model模型它对应 MongoDB 中的一个Collection集合。只要定义好模型之后写入的每条数据都会自动遵循这套结构。在 thal 项目中模型定义在 models/user.js 这个文件里完整代码如下const mongoose require(mongoose); const userSchema new mongoose.Schema({ username: String, email: String, dateCrawled: Date }); module.exports mongoose.model(User, userSchema);这段代码做了三件事定义 Schema规定每条用户数据包含username用户名、email邮箱、dateCrawled爬取时间三个字段指定字段类型三个字段分别是 String、String、Date类型不匹配的数据会被拦截导出模型mongoose.model(User, userSchema)创建名为User的模型对应 MongoDB 中的users集合也就是说模型就是数据的模具塞进User的数据都会按照这个模具成型从根源上保证了数据质量。爬取数据写入 MongoDB 的核心findOneAndUpdate 去重写入爬虫最怕的就是数据重复。同样一个用户第一页抓到过翻到第三页又出现了如果不做处理数据库里就会堆满重复记录。thal 项目给出了一个非常优雅的解决方案使用 Mongoose 的Model.findOneAndUpdate方法配合upsert选项实现存在即更新、不存在才新增的去重写入逻辑。相关代码在 index.js 中function upsertUser(userObj) { const DB_URL mongodb://localhost/thal; if (mongoose.connection.readyState 0) { mongoose.connect(DB_URL); } const conditions { email: userObj.email }; const options { upsert: true, new: true, setDefaultsOnInsert: true }; User.findOneAndUpdate(conditions, userObj, options, (err, result) { if (err) { throw err; } }); }这段代码的关键点有三个新手一定要理解conditions查询条件以email为唯一标识判断这条数据是否已存在upsert: true如果邮箱不存在就执行插入如果存在就执行更新一步到位new: true更新后返回最新文档方便后续处理在实际爬取循环中只需要一行代码就能把抓到的用户信息交给 Mongoose 处理upsertUser({ username: username, email: email, dateCrawled: new Date() });每次爬取都会自动记录当前时间到dateCrawled字段方便后续分析数据的新鲜度。连接 MongoDB 的时机判断注意上面代码中的一个细节mongoose.connection.readyState 0判断的是当前是否处于未连接状态只有未连接时才调用mongoose.connect()。这样做的好处是避免在循环爬取中反复建立数据库连接节省系统资源。验证结果如何确认爬取的数据已存入 MongoDB数据写入后怎么确认真的存进去了打开终端进入 MongoDB 命令行验证$ mongo use thal db.users.find().pretty()如果能看到多条包含username、email、dateCrawled字段的用户记录说明爬取的数据已经成功存入 MongoDB 了。也可以通过统计条数来快速确认 db.users.find().count()项目里的showAllCounts函数做的就是这个事它会用User.count({})统计当前users集合中的文档总数运行爬虫脚本后在控制台输出类似There are 68 users saved的结果。上图是爬虫运行时看到的搜索结果页面页面顶部的用户总数比如 70,134 users会被解析出来用于计算需要遍历的总页数。爬虫入门的完整流程回顾为了让新手对整个流程有整体认知这里把 thal 项目的完整数据链路串一遍启动浏览器Puppeteer 启动无头 Chrome跳转 GitHub 登录页自动登录通过 CSS 选择器定位输入框填入账号密码完成登录如上图所示在 Chrome 开发者工具中右键元素选择 Copy → Copy selector就能拿到定位用的选择器这是 Puppeteer 操控页面的基础操作。搜索并解析访问搜索 URL用page.evaluate在页面上下文中提取用户名和邮箱翻页遍历根据用户总数计算总页数循环抓取每一页的结果去重写入调用upsertUser通过 Mongoose 把数据写入 MongoDB上图是登录后搜索用户看到的效果——有些用户会公开邮箱有些不会所以爬虫只提取有邮箱的记录。爬虫存储数据时的常见坑频繁请求被限制爬虫跑得太快容易被目标网站的反爬机制盯上。GitHub 会弹出类似下面的提示页面遇到这种情况建议在翻页之间加入随机延时并且不要并发发起过多请求。另外要注意GitHub 搜索结果的页数是有限制的超过一定页码后会返回 404所以遍历时做好边界判断。异步写入未完成Mongoose 的写入操作是异步的如果爬虫主流程跑完后立刻去查数据可能发现记录还没写入。可以在脚本结尾适当等待写入完成或者用回调/await 确保数据落库后再退出进程。结语通过 thal 项目我们可以清楚地看到把爬取的数据存入 MongoDB 并不复杂。核心就三步——用 Mongoose 定义模型、用findOneAndUpdate去重写入、用 mongo 命令验证结果。这套Puppeteer 爬取 Mongoose 存储的组合拳既是入门爬虫存储的最佳实践也为后续构建更大规模的爬虫系统打下了坚实基础。如果你正在学习 Node.js 爬虫强烈建议完整阅读项目根目录的 README.md里面有从页面截图、自动登录到翻页遍历的全部源码讲解配合 models/user.js 和 index.js 一起看理解会更透彻。快动手试试把爬取的数据存进你的 MongoDB 吧【免费下载链接】thal项目地址: https://gitcode.com/gh_mirrors/tha/thal创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考