Pytho爬虫项目实战:采集B站《全职高手》近20万条评论数据

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限时加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情

我们都知道,B站有很多号称“镇站之宝”的视频,拥有着数量极其恐怖的评论和弹幕。所以这次我们的目标就是,爬取B站视频的评论数据,分析其为何会深受大家喜爱。

很多人学习python,不知道从何学起。
很多人学习python,掌握了基本语法过后,不知道在哪里寻找案例上手。
很多已经做案例的人,却不知道如何去学习更加高深的知识。
那么针对这三类人,我给大家提供一个好的学习平台,免费领取视频教程,电子书籍,以及课程的源代码!??¤
QQ群:623406465

首先去调研一下,B站评论数量最多的视频是哪一个。。。好在已经有大佬已经统计过了,我们来看一哈!

嗯?《全职高手》,有点意思,第一集和最后一集分别占据了评论数量排行榜的第二名和第一名,远超了其他很多很火的番。那好,就拿它下手吧,看看它到底强在哪儿。

废话不多说,先去B站看看这部神剧到底有多好看 

额,需要开通大会员才能观看。。。

好吧,不看就不看,不过好在虽然视频看不了,评论却是可以看的。

感受到它的恐怖了吗?63w6条的评论!9千多页!果然是不同凡响啊。

接下来,我们就开始编写爬虫,爬取这些数据吧。

 


使用爬虫爬取网页一般分为四个阶段:分析目标网页,获取网页内容,提取关键信息,输出保存。

1. 分析目标网页

  • 首先观察评论区结构,发现评论区为鼠标点击翻页形式,共 9399 页,每一页有 20 条评论,每条评论中包含 用户名、评论内容、评论楼层、时间日期、点赞数等信息展示。

  • 接着我们按 F12 召唤出开发者工具,切换到Network。然后用鼠标点击评论翻页,观察这个过程有什么变化,并以此来制定我们的爬取策略。
  • 我们不难发现,整个过程中 URL 不变,说明评论区翻页不是通过 URL 控制。而在每翻一页的时候,网页会向服务器发出这样的请求(请看 Request URL)。

  • 点击 Preview 栏,可以切换到预览页面,也就是说,可以看到这个请求返回的结果是什么。下面是该请求返回的 json 文件,包含了在 replies 里包含了本页的评论数据。在这个 json 文件里,我们可以发现,这里面包含了太多的信息,除了网页上展示的信息,还有很多没展示出来的信息也有,简直是挖到宝了。不过,我们这里用不到,通通忽略掉,只挑我们关注的部分就好了。

爬虫实战 - 如何爬取B视频评论 步骤 (本次爬虫仅以一个视频为示例:链接) 查找评论请求api 解析URL 去掉第一个和最后一个参数可得评论URL,即:https://api.bilibili.com/x/v2/reply?jsonp=jsonp&pn=1&type=1&oid=585286365&sort=2 【其中pn是页码;sort控制排序顺序,1按时间排序,2按热度排序;oid代码视频编号】 - 开始敲代码 import requests header = {"User-Agent": "M 阅读详情

相关推荐

BiliBili系列(二):个人历史数据爬取与分析

本人的项目,未参考任何博文

爱猫的小学森 4491

Python B评论采集工具

B 评论采集小工具。主要功能是抓取指定视频的评论数据。 本工具解决了 Wbi 签名的时效性问题,支持自动获取密钥,保证采集稳定。操作上只需提供 BV 号和 Cookie 即可。

Pytho爬虫 获取数据以及存储数据

Python 获取数据

Shinersmile的博客 966

爬取B评论2019.5.28)

看到B一个up主使用人工统计楼层,然后excel抽奖,感觉太费劲了,帮他写了个小脚本,代码没亮点,只实现了最基本的爬用户id和抽奖功能,没有做模块化处理,也没有加入多线程提高速度,后续慢慢学习继续丰富 1、原始版本(2019.5.28) #!/usr/bin/env python # coding: utf-8 import requests import json import random...

wwyy2018的博客 3971

爬虫之牛刀小试(五):爬取B的用户评论

接着我们的目标要获取多个网址(类似于https://api.bilibili.com/x/v2/reply/wbi/main?使用selenium来模仿人的动作,获取多个网址,关键是B需要登陆就很难受,不知道为什么Cookie用不了,只好手动操作一下了。此次共读取了20X10共计200条评论,每一个网址有20评论,需要花费大约30s左右,共计爬十个。小小地出手一下,这次使用selenium来自动化进行爬取,虽然速度很慢,但是还可以接受。找到你想要的值,对了,时间记得要转化一下,不然会出错!

m0_68926749的博客 4779

python3网络爬虫--爬取b视频评论用户信息(附源码)

马保国老师在b挺火的,关于他的视频播放量很高,b视频评论区都是人才说话好听,写个爬虫爬取一下b评论区用户信息和评论内容。 一.准备工作 1.工具 (1)Chrome 谷歌浏览器 安装地址:https://www.google.cn/chrome/ (插件:json-handle 下载地址:http://jsonhandle.sinaapp.com/,json-handle安装方法: https://blog.csdn.net/xb12369/article/details/79002208 用于分

懷淰メ的博客 1万+

python爬虫的应用-python网络爬虫应用实战

原标题:python网络爬虫应用实战Python这门编程语言包罗万象,可以说掌握了python,除了一些特殊环境和高度的性能要求,你可以用它做任何事。Python作为一门脚本语言,它灵活、易用、易学、适用场景多,实现程序快捷便利,早已经成为程序员们的一门编程利器。从小到服务器运维的脚本,到大型软件开发,使用python都能够很灵活的快速实现。python不但可以快速实现大型的web应用程序,在网络...

weixin_39702714的博客 225

pytho网络爬虫之歌曲爬取

怀着对网络爬虫的好奇,在暑假自学了python的一些基本知识,之后便开始了pyton网络爬虫的学习,兴趣是最好的老师,但是每一次成功的跑起来的喜悦之情也是令人舒服的,为了让我们枯燥的学习变的不那么枯燥。今天就分享写自己写的一个小的程序,那就是利用pyton网络爬虫获取歌曲并且保存,当然对于图片、视频等同样适用。共勉。 首先,选取网址。 我的选择是:http://www.333ttt.com/ ...

tomcat我们走 1435

(十七)python网络爬虫实战:A股企业公开年报数据的获取与解析,分词和词频统计

本节主要是介绍在实际的爬虫项目中,使用redis进行数据的缓存,实现并发爬取,同时基于实际的例子,介绍了如何进行爬取分析,如何下载和解析PDF格式的数据,如何进行文本数据的分词和词频统计等。

c1007857613的专栏 4701

爬虫实战项目合集

转载自Hank WechatSogou 微信公众号爬虫。基于搜狗微信搜索的微信公众号爬虫接口,可以扩展成基于搜狗搜索的爬虫,返回结果是列表,每一项均是公众号具体信息字典。 DouBanSpider 豆瓣读书爬虫。可以爬下豆瓣读书标签下的所有图书,按评分排名依次存储,存储到Excel中,可方便大家筛选搜罗,比如筛选评价人数>1000的高分书籍;可依据不同的主题存储到Excel不同的Sheet ,采用User Agent伪装为浏览器进行爬取,并加入随机延时来更好的模仿浏览器行为,避免爬虫被封。 zhihu

热衷开源的Boy 814

python网络爬虫应用_python Cmd实例之网络爬虫应用

python Cmd实例之网络爬虫应用标签(空格分隔): python Cmd 爬虫废话少说,直接上代码# encoding=utf-8import osimport multiprocessingfrom cmd import Cmdimport commandsfrom mycrawler.dbUtil import DbUtilimport signal# 下载监控def run_downl...

weixin_39607798的博客 206

pytho爬虫程序注意事项

python爬虫程序需要注意两件事儿,使用headers和代理。 headers可以将程序伪装成浏览器,应对网的反爬虫 程序 代理有两点好处:1、让服务器以为不是同一个客户端在请求;2防止我们的真实地址被泄露,防止被追究。 见一个小例子: import requests # 代理 proxies = {"http": "http://120.77.201.46:80"} # 请求头...

qq_15054345的博客 303

pytho爬虫基础:day1

URL:对网络资源地址的描述,俗称网址(参数部分从?开始,每一个参数key=value的形 式,参数与参数用&隔开)HTTPS协议:HTTP的安全版,即http中加入了ssl层,其传输的内容都是经过ssl加密的。get :从服务器上获取资源,get请求是默认的请求方式,get传参是拼接在url后面。2.聚焦网络爬虫:针对特定网页的爬虫。post传输是封装在请求体中,是不可见的。3.增量式网络爬虫:只更新改变的地方,而未改变的地方则不更新,1.通用网络爬虫:搜索引擎的爬虫

weixin_45906368的博客 567

Python爬虫实战系列4:天眼查公司工商信息采集

分析请求时多注意cookie信息,分析cookie是后端生成还是前端js生成如遇需要携带cookie请求时,可以采用创建一个session来请求本文章代码只做学习交流使用,作者不负责任何由此引起的任何法律责任。由于信息安全问题,这里不放源码。

人生不易,请勿焦虑。 7810

pytho网络爬虫

# encoding:utf8 from urllib import request from bs4 import BeautifulSoup import pymysql import time #下载器 def htmlDownload(url): req = request.Request(url); #返回文件类型的对象 req.add_header('User-A...

runner668的博客 592

微软架构师全新出版《Python3网络爬虫开发实战》第二版,Python爬虫入门教程

随便打开知乎一个关于爬虫问题,仔细观察发现,现在懂爬虫、学习爬虫的人越来越多。 为什么Python爬虫这么受欢迎呢? 一方面,互联网可以获取的数据越来越多,另一方面,像 Python 这样的编程语言提供越来越多的优秀工具,让爬虫变得简单、容易上手。 利用爬虫我们可以获取大量的价值数据,比如: 知乎:爬取优质答案,为你筛选出各话题下最优质的内容。 淘宝:抓取商品、评论及销量数据,对各种商品及用户的消费场景进行分析。 安居客:抓取房产买卖及租售信息,分析房价变化趋势、做不同区域的房价分析。 … 爬虫是入门

Python_0011的博客 1334

python如何爬虫eps数据_python爬虫如何采集知乎信息汇总?

在没有学习python之前,对于数据的提取只局限于复制、粘贴之后的保存,一步步的人工操作还是很慢的。现在的小编已经能够写代码去从网页上获取自己想要的内容了,学习成果方面还是有显著的变化。不知道小伙伴们是不是都会呢?本篇小编就以知乎的数据采集为例,让大家也练练手。打开知乎首页-->登陆-->搜索到一个大V,用谷歌浏览器分析点击关注了哪些人后的请求,通过分析:查找他关注的人的请求链接:通过观察尝试分析...

weixin_39617497的博客 231

基于Python爬虫的淘宝商品销售量分析和可视化系统实现

基于Python爬虫的淘宝商品销售量分析和可视化系统实现 1. 背景介绍 1.1 电子商务数据分析的重要性 在当今时代,电子商务已经成为了一个不可忽视的巨大市场。随着互联网的快速发展,越来越多的人选择在线购

AI架构师小马 790

Pytho爬虫之初职HTML页面②

Pytho爬虫之初职HTML页面

学历是帮一个人争取机会 | 能力是帮一个人把握机会 381
上一篇: 反反爬虫技术提升,Python爬虫遇到验证码的解决思路
下一篇: Python骚操作,Gitbook +Typora打造一个属于自己的电子书网站
Python_sn
博客等级 码龄6年 316粉丝 290原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值