当前位置：首页 > 编程笔记 >

Python爬虫 bilibili视频弹幕提取过程详解

柯琛

2023-03-14

本文向大家介绍Python爬虫 bilibili视频弹幕提取过程详解，包括了Python爬虫 bilibili视频弹幕提取过程详解的使用技巧和注意事项，需要的朋友参考一下

两个重要点

1.获取弹幕的url是以 .xml 结尾

2.弹幕url的所需参数在视频url响应的 javascript 中

先看代码

import requests
from lxml import etree
import re
# 使用手机UA
headers = {
  "User-Agent": "Mozilla/5.0 (iPhone; CPU iPhone OS 11_0 like Mac OS X) AppleWebKit/604.1.38 (KHTML, like Gecko) Version/11.0 Mobile/15A372 Safari/604.1"
}
# 视频url
video_url = "https://m.bilibili.com/video/av37834086.html"
html = requests.get(url=video_url, headers=headers).content.decode('utf-8')
# 获取弹幕url的参数
cid = re.findall(r"comment: '//comment.bilibili.com/' \+ (.*?) \+ '.xml',", html)
url = "https://comment.bilibili.com/" + cid[0] + ".xml"
print(url)
response = requests.get(url, headers=headers)
html = response.content
xml = etree.HTML(html)
# 提取数据
str_list = xml.xpath("//d/text()")
# 写入文件
with open('bibi_xuxubaobao.txt', 'w', encoding='utf-8') as f:
  for line in str_list:
    f.write(line)
    f.write('\n')

先找到弹幕的url，以.xml结尾，所以先找到这串数字所在的位置，并获取这串数字发起第二次请求

而这串数字就在第一次请求的响应的JavaScript中，可以通过 re 正则表达式进行提取

接下来的工作就是获取弹幕url返回的所有弹幕数据，然后对响应进行数据处理。

代码示例中使用的是 lxml 进行获取。接着就是保存到个人本地文件中了

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持小牛知识库。

类似资料：

python爬虫线程池案例详解(梨视频短视频爬取)

本文向大家介绍python爬虫线程池案例详解(梨视频短视频爬取)，包括了python爬虫线程池案例详解(梨视频短视频爬取)的使用技巧和注意事项，需要的朋友参考一下 python爬虫-梨视频短视频爬取(线程池) 示例代码知识点扩展： Python爬虫下载视频（梨视频）梨视频示例：Ctrl+Alt+L格式化代码到此这篇关于python爬虫线程池案例详解(梨视频短视频爬取)的文章就介绍到这了,更多
Python爬虫爬取博客实现可视化过程解析

本文向大家介绍Python爬虫爬取博客实现可视化过程解析，包括了Python爬虫爬取博客实现可视化过程解析的使用技巧和注意事项，需要的朋友参考一下源码：爬虫不是重点，只是拿来爬阅读数量，pyecharts是重点这次爬的是我自己的博客，一共10页，每页10片文章，正好写了100篇博客 pyecharts安装： pip install wheelpip install pyecharts==0.
python爬虫（入门教程、视频教程）原创

本文向大家介绍python爬虫（入门教程、视频教程）原创，包括了python爬虫（入门教程、视频教程）原创的使用技巧和注意事项，需要的朋友参考一下 python的版本经过了python2.x和python3.x等版本，无论哪种版本，关于python爬虫相关的知识是融会贯通的，呐喊教程关于爬虫这个方便整理过很多有价值的教程，小编通过本文章给大家做一个关于python爬虫相关知识的总结，以下就是全
获取视频弹幕信息

通过该接口可以获取一个用户一个视频的弹幕信息, 地址为： https://spark.bokecc.com/api/video/barrage 需要传递以下参数：参数说明 userid 用户 id，不可为空 videoid 查询的videoid, 不可为空 starttime 开始时间,可选(yyyy-MM-dd HH:mm:ss) endtime 结束时间,可选(yyyy-MM-dd HH:
基于python爬取梨视频实现过程解析

本文向大家介绍基于python爬取梨视频实现过程解析，包括了基于python爬取梨视频实现过程解析的使用技巧和注意事项，需要的朋友参考一下目标网址：梨视频然后我们找到科技这一页：https://www.pearvideo.com/category_8。其实你要哪一页都行，你喜欢就行。嘿嘿… 这是动态网站，所以咱们直奔network 然后去到XHR：找规律，这个应该不难，我就直接贴网址上来咯，
Python爬虫爬取新闻资讯案例详解

本文向大家介绍Python爬虫爬取新闻资讯案例详解，包括了Python爬虫爬取新闻资讯案例详解的使用技巧和注意事项，需要的朋友参考一下前言本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理。一个简单的Python资讯采集案例，列表页到详情页，到数据保存，保存为txt文档，网站网页结构算是比较规整，简单清晰明了，资讯新闻内容的采

相关阅读

Python爬虫爬取新闻资讯案例详解 Python爬取视频(其实是一篇福利)过程解析 bilibili弹幕转ass程序制作思路及过程 Java爬虫抓取视频网站下载链接 python爬虫中多线程的使用详解

相关文章

网络爬虫是什么 Python爬取全国火锅店并可视化展示 [实例]爬虫下载小说实战-Swing实现简单爬虫 Python爬虫实战：王者荣耀全套皮肤采集

相关问答

如何用FFMPEG从多个视频中提取视频？javascript - bilibili的视频播放如何实现？YT API - 为YouTube视频提取不同的“视频长度”从mpeg视频中提取文件从提取的url流YouTube视频

相关工具

神箭手云爬虫百度云分享爬虫要视频 Bilibili-plus bilibili-user

相关文档

Python 原生爬虫教程 Python 爬虫学习系列教程爬虫课件 WebMagic 爬虫框架中文文档 Python OpenCV 图像和视频分析