使用python爬取B站千万级数据

脚本专栏 2026/7/14 佚名

3 2 1

Python（发音：英["" src="/UploadFiles/2021-04-08/201806080836221.jpg">

粉丝独白

说起热门的B站相信很多喜欢玩动漫的，看最有创意的Up主的同学一定非常熟悉。我突发奇想学Python这么久了，为啥不用Python爬取B站中我关注的人，已经关注的人他们关注的人，看看全站里面热门的UP主都是是哪些。

要点：

- 爬取10万用户数据

- 数据存储

- 数据词云分析

1.准备阶段

写代码前先构思思路：既然我要爬取用户关注的用户，那我需要存储用户之间的关系，确定谁是主用户，谁是follower。

存储关系使用数据库最方便，也有利于后期的数据分析，我选择sqlite数据库，因为Python自带sqlite，sqlite在Python中使用起来也非常方便。

数据库中需要2个表，一个表存储用户的相互关注信息，另一个表存储用户的基本信息，在B站的用户体系中，一个用户的mid号是唯一的。

然后我还需要一个列表来存储所以已经爬取的用户，防止重复爬取，毕竟用户之间相互关注的现象也是存在的，列表中存用户的mid号就可以了。

2.新建数据库

先写建数据库的代码，数据库中放一个用户表，一个关系表：

3.爬取前5页的用户数据

我需要找到B站用户的关注列表的json接口，很快就找到了，地址是：

https://api.bilibili.com/x/relation/followings"" src="/UploadFiles/2021-04-08/201806080836223.jpg">

整个爬取页面的思路比较简单，首先设置header,用requests库进行API请求，获得关注的用户数据列表。

我们爬取前5页，每一页的数据进行简单的处理，然后转为字典数据进行获取mid,uname,sign3个维度的数据，最后save()函数存入db.

4.存入数据库

我们数据集里面一共有2个表，一个用户列表，用来存储所以的用户信息，一个是用户之间的关注信息。

5.探秘是热门UP主

打算利用已经爬取到本地的数据进行词云的生成，来看一下这10万用户中共同的关注的哪些UP主出现的次数最多。

代码的思路主要是从数据库中获取用户的名字，重复的次数越多说明越多的用户关注，然后我使用fate的一张图片作为词云的mask图片，最后生成词云图片。

最后一起来看一下词云图

可以看出蕾丝，暴走漫画，木鱼水心，参透之C君，papi酱等B站大UP主都是热门关注。

Python可以做什么？

web开发和爬虫是比较适合零基础的

自动化运维运维开发和自动化测试是适合已经在做运维和测试的人员

大数据数据分析这方面是很需要专业的专业性相对而言比较强

科学计算一般都是科研人员在用

机器学习和人工智能首先学历要求高其次高数要求高难度很大

python爬取网页数据,python爬取数据,python爬取B站数据

标签：

python爬取网页数据,python爬取数据,python爬取B站数据

免责声明：本站文章均来自网站采集或用户投稿，网站不提供任何软件下载或自行开发的软件！如有用户或公司发现本站内容信息存在侵权行为，请邮件告知！ 858582#qq.com

评论“使用python爬取B站千万级数据”

使用python爬取B站千万级数据

暂无“使用python爬取B站千万级数据”评论...

www.imxmx.com 杰晶网络

8,675无损音乐

1,324高清电影

213破解软件

120,141站长资源

最新文章

群星《奔赴！万人现场第2期》[FLAC/分轨][5

2026/7/14

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》

2026/7/14

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》

2026/7/14

【古典音乐】詹姆斯·高威《季节》1993[WAV+

2026/7/14

贝拉芳蒂《卡里普索之王》SACD[WAV+CUE]

2026/7/14

一句话新闻

一口气升级7个大模型SaaS应用，百度智能云：突出一个“开箱即用” - 2026/7/14

这一波大模型产业落地浪潮里，不少企业其实处在 “干瞪眼“的状态。

一种情况是，很多大模型产品看得见却摸不着，在台上一个个遥遥领先——今天Sora技精四座，明天英伟达的机器人又赢得满堂彩，可是到了台下一问：啥时候能用上啊？答曰：遥遥无期。

另一种情况是，企业想用上大模型，却又难免瞻前顾后——既要考虑场景融合，又得兼顾安全性，还要考虑打通现有系统，再加上各种部署成本和繁琐的采购流程……最后只能拂袖：罢了，再等等吧。

使用python爬取B站千万级数据

粉丝独白

1.准备阶段

2.新建数据库

3.爬取前5页的用户数据

4.存入数据库

5.探秘是热门UP主

Python可以做什么？

python爬取网页数据,python爬取数据,python爬取B站数据

pandas带有重复索引操作方法

pandas表连接索引上的合并方法

评论“使用python爬取B站千万级数据”

稳了！魔兽国服回归的3条重磅消息！官宣时间再确认！

更新动态

友情链接

使用python爬取B站千万级数据

粉丝独白

1.准备阶段

2.新建数据库

3.爬取前5页的用户数据

4.存入数据库

5.探秘是热门UP主

Python可以做什么？

python爬取网页数据,python爬取数据,python爬取B站数据

pandas带有重复索引操作方法

pandas表连接 索引上的合并方法

评论“使用python爬取B站千万级数据”

稳了！魔兽国服回归的3条重磅消息！官宣时间再确认！

更新动态

友情链接

pandas表连接索引上的合并方法