如何一次拿全B站完整评论数据:BilibiliCommentScraper上手教程与避坑指南

发布时间:2026/8/15 14:20:17
如何一次拿全B站完整评论数据:BilibiliCommentScraper上手教程与避坑指南 如何一次拿全B站完整评论数据BilibiliCommentScraper上手教程与避坑指南【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper想做一次B站评论数据分析结果光收集数据就耗掉一个周末——这大概是许多人第一次接触获取B站完整评论数据时的真实写照。手动翻页翻到眼花普通小工具又只能抓到最上面那几十条。开源工具 BilibiliCommentScraper 就是为了打破这个僵局而生的它能把视频评论区里的内容一条不落地抓下来连层层叠叠的回复也不放过。一句话认识它一个会替你翻页的数据搬运工BilibiliCommentScraper 是一个用 Python 写成的 B站评论爬虫。它不走官方接口而是驱动 Chrome 浏览器像真人一样打开视频页面、不断向下滚动、点击查看全部按钮把网页上所有能看到的评论原样读出来再整理成你熟悉的表格文件。用一句话概括就是**你在浏览器里能看到什么它就能替你存下什么。**你不需要会写代码只要会用记事本就能让它开工。凭什么值得用它帮你省掉五件麻烦事**第一件翻页的麻烦。**热门视频评论区动辄几千上万条靠人手滚动根本看不完。它模拟浏览器持续滚动加载一次能处理约920条一级评论每条一级评论下的回复还会逐页展开直到翻完为止。**第二件层级丢失的麻烦。**B站评论区是树状结构有人发一条评论别人在底下回复回复还能被继续回复。很多工具只抓表面一层对话关系全丢了。它把一级评论和二级评论分开记录谁回复了谁、回复的是哪条翻看表格时一目了然。**第三件重复劳动的麻烦。**要分析的视频往往不止一个。你只需把视频链接写进一个清单文件它就会挨个处理每个视频输出一份独立的表格互不干扰。**第四件功亏一篑的麻烦。**爬数据最怕中途断电断网之前全白干。它会定期把进度写进 progress.txt——你可以把它理解成夹在书里的书签程序中断后重新运行会自动翻回上次停下的那一页继续读。**第五件盯着看的麻烦。**它遇到小问题会自己重试遇到实在爬不了的视频会记进错误清单然后跳过、继续下一个。把任务挂上你去睡一觉醒来数据基本就齐了。它能给你什么一份字段齐全的评论数据表每一条抓下来的评论都会带上完整的身份信息表格里每一列都有它的用处字段说明编号该评论在一级评论中的序号隶属关系一级评论还是二级评论被评论者昵称 / ID回复对象是谁一级评论对应 up 主昵称 / 用户ID评论者是谁评论内容完整正文发布时间精确到分钟点赞数热度参考有了这些字段后续做情感分析、找高赞观点、画用户互动关系图都有现成的原料。上图是它导出的 CSV 在表格软件里打开的样子左侧是编号和隶属关系中间是评论双方的信息右侧是时间和点赞数结构一目了然。从0到1四步让它跑起来第一步准备好两样东西一台装了Python 3的电脑一个Chrome 浏览器建议更新到最新版。如果还没装 Python去官网下载安装包一路点下一步即可安装时记得勾选Add to PATH。第二步安装依赖并获取代码在命令行里执行pip install selenium beautifulsoup4 webdriver-manager再把这套工具克隆到本地git clone https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper cd BilibiliCommentScraper第三步填一份视频清单用记事本打开项目里的 video_list.txt每行放一个视频链接想爬几个写几个https://www.bilibili.com/video/BV17M41117eg https://www.bilibili.com/video/BV1QF411q73H保存退出即可。第四步运行并登录一次python Bilicomment.py程序会先弹出 Chrome 窗口提示你登录B站。扫码或输入账号都行登录成功后回到命令行按回车它就会开始干活。登录状态会被保存下来下次运行不用再登一遍——除非 cookies 失效那时删除 cookies.pkl 重新登录即可。爬完后每个视频都会生成一个以视频 ID 命名的 CSV 文件比如BV17M41117eg.csv放在代码同级目录双击就能打开。三个让效果翻倍的小技巧**技巧一控制加载量别让浏览器累趴下。**评论特别多的视频滚动加载会占用大量内存网页可能直接崩溃。打开 Bilicomment.py你会看到两个关键参数MAX_SCROLL_COUNT默认45对应约920条一级评论和max_sub_pages默认150限制每条一级评论展开的回复页数。给它们设一个合理上限既能保住数据量又能让程序安稳跑完。**技巧二用随机延时降低被限流的概率。**连续处理很多视频时访问太频繁容易被平台盯上。可以引入随机延时让每次等待时长不确定import random time.sleep(random.uniform(1, 5))把代码里固定的time.sleep(2)替换成这种写法即可具体区间按需调整。**技巧三不想从头爬直接改进度文件。**假如清单里第二个视频你暂时不想要了不用删掉重来只需打开 progress.txt把video_count的值加 1程序就会跳过它继续。类似地first_comment_index对应一级评论序号sub_page对应二级评论页码想跳哪里改哪里全由你说了算。新手上路最容易踩的五个坑Q1CSV 文件用 Excel 打开全是乱码怎么办别慌数据没坏。这份 CSV 是 UTF-8 编码老版本 Excel 默认不认。最简单的办法先用记事本打开确认内容正常或者用 Excel 的数据→从文本/CSV 导入把编码选成 UTF-8。用代码读也可以# 如果还没装 pandas先执行 pip install pandas import pandas as pd df pd.read_csv(BV17M41117eg.csv, encodingutf-8)Q2提示 Permission denied怎么处理通常是你要写入的 CSV 或 progress.txt 正被别的程序占着——比如你自己开着的 Excel。关掉占用它的程序或者以管理员身份运行一般就能解决。Q3爬到的评论数量比页面上显示的总数少是漏数据了吗大概率不是。B站的评论数是虚标的页面顶部那个总数往往大于实际可见的评论。怎么验证你在网页里手动滚到最底部看最后几条评论和表格最后几行对得上就说明能看到的都抓全了。Q4爬热门视频时浏览器崩溃或卡住怎么办先别急着重启。程序遇到网页崩溃会尝试自动重启并续爬。真正要担心的是连滚动都还没滚完就崩溃的情况那多半是内存不够。把MAX_SCROLL_COUNT调小或者分批处理先抓一部分再说。Q5表格里出现 $NAME? 这样的报错这是 Excel 对以-开头的昵称比如 -Ghauster的误判不是数据问题。把整列设为文本格式或者把该单元格重新输入一次就正常了。现在轮到你动手了说到底BilibiliCommentScraper 解决的就是一件朴素的事**让获取B站完整评论数据从一件苦差事变成一条流水线。**你只需要准备一份清单、运行一条命令、登录一次剩下的交给它就好。如果你正准备做观众反馈分析、用户行为研究或者只是好奇自己视频的评论区里藏着哪些高赞观点不妨今天就装上试试。先从评论量小的视频练手跑通流程后再挑战热门视频你会很快体会到数据自己跑完一整晚的踏实感。【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考