发布时间:2026/8/14 2:35:19
B站视频评论爬虫:如何完整爬取一级与二级评论并导出CSV? B站视频评论爬虫如何完整爬取一级与二级评论并导出CSV【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper凌晨一点你为了写一份视频用户调研正对着B站评论区一页一页往下翻。翻了二十分钟才存下八十来条评论楼中楼的回复更是理不清谁在回谁——手都酸了数据还残缺。这不是你手速的问题是方法的问题。BilibiliCommentScraper这个开源的B站视频评论爬虫正是为这种场景准备的把一级评论、二级评论、昵称、用户ID、发布时间、点赞数一次性完整搬进 CSV你只管睡觉它替你熬夜。不调接口它把自己伪装成真人市面上不少爬虫走 B 站 API省事是真省事可拿到的往往只有前几十条评论层级也丢得七七八八。BilibiliCommentScraper 换了一条更笨、也更稳的路——用 Selenium 驱动真实浏览器模拟真人浏览网页。你在网页上怎么操作它就怎么操作不断向下滚动逼页面把评论一条条加载出来遇到查看全部就点开二级评论一页翻不完就一页一页翻到底。模拟真人浏览意味着页面能看到的评论它都能拿到包括 API 接口通常不给的楼中楼。这对你意味着什么意味着你不用再对着残缺数据做情感分析、写调研报告数据底座完整了后面的分析才站得住。一张速查卡从零到 CSV 只要三行命令别急着研究代码先看全流程有多短步骤操作1安装依赖pip install selenium beautifulsoup4 webdriver-manager2在video_list.txt里写入视频链接每行一个3运行python Bilicomment.py首次按提示扫码登录一次登录这步值得多说一句。它会在本地生成cookies.pkl把你的登录态存下来。之后每次运行都自动带登录状态不用反复扫码你要做的只是把新视频链接追加进video_list.txt然后回车。批量管理多个视频就是这么简单——每个视频会生成一个以视频 ID 命名的独立 CSV互不干扰。断点续爬断电、断网、浏览器崩了都吓不跑它来做一个情景模拟你感受一下你在爬一个评论上万的热门视频进度走到 60%笔记本没电了。第二天开机重新运行程序它直接问都不问接着上次的第 37 条一级评论继续爬CSV 文件也在原来的基础上继续追加不重复、不丢数据。秘密藏在progress.txt里。这个文件像一张精确到毫米的书签记录着第几个视频、第几条一级评论、二级评论翻到第几页。程序每次落笔前都会更新它所以任何时刻中断都能原路找回进度。想从头再来删掉progress.txt即可。想跳过某个爬不动的视频把video_count加一干净利落。同样的省心逻辑还体现在错误处理上网络抖动、页面加载超时程序会自动重试实在爬不了的视频会被记进video_errorlist.txt你事后扫一眼就知道哪个视频掉了队。开爬前 60 秒检查清单别等跑起来才发现少了什么开爬前扫一遍这张清单Python 3 已安装依赖库已pip installvideo_list.txt里每行是一个完整的 B 站视频 URL网络稳定首次运行建议人在电脑前方便扫码想从头爬确认没有残留的progress.txt如果之前登录过但 cookies 失效删掉cookies.pkl重新登录全部打勾就可以放心让程序跑一整晚了。参数拧两下热门视频也稳默认参数适合大多数场景但碰到 10 万 评论的爆款视频页面会因为加载数据过多而内存崩溃。这时你需要动两个旋钮MAX_SCROLL_COUNT 45 # 默认45次滚动约能加载920条一级评论可调小 max_sub_pages 150 # 二级评论最多翻150页设 None 表示不限制滚动次数越少页面越轻越不容易崩二级评论页数设个上限同样是为了省内存。嫌请求太密集、怕被平台限流加一行随机延时import random time.sleep(random.uniform(1, 5)) # 每次等待1~5秒随机分散请求节奏把参数调成适合自己视频的量级爬取过程就从碰运气变成了可预期——这也是这个工具和一次性脚本最大的区别。拿到 CSV 之后这张表怎么读程序跑完同级目录下会出现以视频 ID 命名的 CSV 文件每一行是一条评论字段结构如下编号该评论在整个评论流中的位置隶属关系一级评论 / 二级评论层级一目了然被评论者昵称、被评论者ID一级评论显示up主二级评论显示被回复的那位用户昵称、用户ID评论者本人信息评论内容、发布时间、点赞数分析最常用的三个字段截图里每一行都带着完整归属信息哪条是楼中楼、回复的是谁、多少赞、什么时候发的——这份结构化数据可以直接喂给 pandas 做情感分析、词频统计或社群网络研究不需要再手工整理。翻车现场急救箱用的时候难免遇到几个小状况提前给你备好解药CSV 用 Excel 打开是乱码文件是 UTF-8 编码Excel 默认没认出来。改用记事本打开或走数据 → 从文本/CSV 导入并手动选择 UTF-8即可正常显示。单元格显示$NAME?报错这是 Excel 把以-开头的昵称当成了公式例如-Ghauster。不是数据坏了换个导入方式或直接用代码读取就好。爬到的评论数比页面标称的少正常。B站评论数存在虚标部分评论可能被隐藏或屏蔽。判断标准很简单你手动把网页滚到底看到的最后几条评论和 CSV 末尾对得上就是完整爬全了。报 Permission denied多半是 CSV 或 progress.txt 被其他程序占用比如你正开着 Excel 看它。关掉占用文件或换管理员身份运行即可解决。程序长时间没动静大概率是访问太频繁被平台冷处理了。重启程序即可断点续爬若频繁出现就按前面说的把延时拉长。你的第一份完整评论数据集现在就能开始从手工翻页到全自动爬取从残缺数据到层级完整的 CSV差的只是一个对的工具。BilibiliCommentScraper 的价值不在于代码多炫而在于它把完整、断点、批量、省心这四个词落到了实处让每一个想认真做数据分析的人都能用十分钟搭好自己的数据管道。想立刻上手克隆下来跑一遍就知道git clone https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper.git cd BilibiliCommentScraper pip install selenium beautifulsoup4 webdriver-manager把你想分析的视频链接写进video_list.txt运行python Bilicomment.py剩下的交给它。如果你在爬取中发现新的坑、或者有更好的参数方案也欢迎把经验带回项目——这类工具的价值正是在使用者的反馈中一点点长起来的。数据驱动的时代先拿到完整数据的人赢在起跑线上。【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/14 2:30:19

LLM时代技术写作指南:人机协同工作流与实战避坑

最近在技术社区和开发者圈子里,一个讨论越来越热:在大型语言模型(LLM)能力日新月异的今天,人类的写作是否已经过时了?作为一名长期与代码、文档和技术博客打交道的开发者,我对此深有感触。从代码…

2026/8/14 2:30:19

从Prompt Engineering到Harness架构:构建可维护的AI应用工程化实践

最近在跟几个大厂 AI 团队的朋友交流,发现一个很有意思的现象:大家聊起 Prompt Engineering(提示工程)时,都从最初的狂热转向了冷静。很多人花大量时间研究“魔法咒语”,试图用一个完美的 Prompt 解决所有问…

2026/8/14 2:30:19

小微企业智能财务与库存管理系统实战解析

1. 小微企业财务与库存管理痛点解析小微企业主们每天最头疼的两件事:钱和货。前者关系到企业命脉,后者决定经营效率。我接触过上百家小微企业的账目和库存系统,发现他们普遍面临三个核心痛点:第一是手工做账效率低下。许多小微企业…

2026/8/15 0:14:01

13-三端并行开发规范:后端SaaS、安卓工控、小程序协同开发模型

13-三端并行开发规范:后端SaaS、安卓工控、小程序协同开发模型 为什么需要三端并行? 先说个真实的坑。我们做无人售货柜项目那会儿,后端、安卓、小程序三端各干各的,后端写完接口才丢个文档给前端,安卓那边硬件调了半天…

2026/8/15 0:14:01

Deepseek Harness系统对群星系统的启示

现在deepseek发布了deepseek harness,从中我们能得到什么灵感呢?DeepSeek Harness 昨晚刚发布,今天凌晨就开源了,来得正好。我已经研究了它的架构,对群星系统来说,可借鉴的点非常多。DeepSeek Harness 能给…

2026/8/15 0:14:01

论文查AI率免费的离线批量实现方案

上周帮实验室师妹处理硕论盲审前的AI率自检,前前后后折腾了三天,踩了一堆所谓免费工具的坑,最后干脆自己撸了一套本地跑的脚本,总算把整个论文查AI率免费的流程跑通了。最开始我图省事,随便搜了几个打着免费旗号的在线…

2026/8/15 0:14:01

AI 搜索引用率追踪机制解析:从数据采集到可见性验证的技术方案

文章目录 背景与问题定义 AI 搜索引擎引用机制的原理拆解 人工监测的技术实现:可复现的数据采集方案 付费工具的覆盖度验证与局限性分析 90 天数据实验的设计与执行 踩坑记录与最佳实践 总结 1. 背景与问题定义 AI 搜索引擎的引用机制与传统搜索存在根本性差异。百度有站长平…

2026/8/15 0:09:01

蓝速科技智慧讲台多系统兼容方案与场景落地指南

在推进智慧教室改造和现代化会议空间升级的过程中,很多项目负责人都面临着一个共同的难题:如何在满足国产化信创要求的同时,又不破坏原有的教学习惯和办公生态?传统的多媒体讲台往往系统固化,一旦涉及操作系统更换&…

2026/8/14 4:27:24

如何快速生成中国车牌图片:Python开源工具完整指南

如何快速生成中国车牌图片:Python开源工具完整指南 【免费下载链接】chinese_license_plate_generator 中国车牌生成器 项目地址: https://gitcode.com/gh_mirrors/ch/chinese_license_plate_generator 中国车牌生成器是一个基于Python的开源项目&#xff0c…

2026/8/14 4:27:24

当 LLM 遇见大文档:主流开源项目如何处理上下文超限

从 Agentic Loop 到 Repo Map,七种策略与六类陷阱引言:128K vs 10MB 的硬冲突 2026 年的 LLM 上下文窗口已达到 128K ~ 1M token(≈ 0.5MB ~ 4MB 文本),但 LLM 想要处理的真实数据规模远远超过这个量级:真实…

2026/8/15 0:04:00

AI 电动婴儿车智能功率 辅助控制、电源管理的完整选型方案

2026年随着 AI 技术在电动孕婴童用品中的深度渗透(如智能避障、自适应速度控制、能量回收),电动婴儿车对功率器件提出更高要求:高效率、小型化、低功耗、高可靠性。微碧半导体(VBsemi)基于 Trench 及 SGT 工…

2026/8/15 0:04:00

论文AIGC检测不达标完整教程!低门槛用5款工具逐步复检!

论文提交前自己先查一遍AI率,是2026年毕业生的常规动作。学校要求论文AI率低于30%,乃至于20%才能答辩… 很多同学发现一个尴尬的事情:同一篇论文,知网查出来AI率35%,维普查可能是48%,大雅、朱雀又是另外的数…

2026/8/14 4:27:24

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/14 4:27:24

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/14 4:27:24

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…