欢迎您访问程序员文章站本站旨在为大家提供分享程序员计算机编程知识!
您现在的位置是: 首页  >  IT编程

Python爬虫实战案例之爬取喜马拉雅音频数据详解

程序员文章站 2022-08-18 16:10:33
前言喜马拉雅是专业的音频分享平台,汇集了有声小说,有声读物,有声书,fm电台,儿童睡前故事,相声小品,鬼故事等数亿条音频,我最喜欢听民间故事和德云社相声集,你呢?今天带大家爬取喜马拉雅音频数据,一起期...

前言

喜马拉雅是专业的音频分享平台,汇集了有声小说,有声读物,有声书,fm电台,儿童睡前故事,相声小品,鬼故事等数亿条音频,我最喜欢听民间故事和德云社相声集,你呢?

今天带大家爬取喜马拉雅音频数据,一起期待吧!!

这个案例的视频地址在这里

https://v.douyu.com/show/a2jemjj3e3mmnxml

项目目标

爬取喜马拉雅音频数据

受害者地址

Python爬虫实战案例之爬取喜马拉雅音频数据详解

本文知识点:

1、系统分析网页性质

2、多层数据解析

3、海量音频数据保存

环境:

1.确定数据所在的链接地址(url)
2.通过代码发送url地址的请求
3.解析数据(要的, 筛选不要的)
4.数据持久化(保存)

案例思路:

1. 在静态数据中获取音频的id值

2. 发送指定id值json数据请求(src)

3. 从json数据中解析音频所对应的url地址 开始写代码

先导入所需的模块

1.确定数据所在的链接地址(url) 逆向分析 网页性质(静态网页/动态网页)

打开开发者工具,播放一个音频,在madie里面可以找到一个数据包

Python爬虫实战案例之爬取喜马拉雅音频数据详解

复制url,搜索

Python爬虫实战案例之爬取喜马拉雅音频数据详解

找到id值

Python爬虫实战案例之爬取喜马拉雅音频数据详解

继续搜索,找到请求头参数

Python爬虫实战案例之爬取喜马拉雅音频数据详解

2.通过代码发送url地址的请求

3.解析数据(要的, 筛选不要的) 解析音频的 id值

4.数据持久化(保存)

最后还要处理文件名非法字符

完整代码

运行代码,效果如下图

Python爬虫实战案例之爬取喜马拉雅音频数据详解

到此这篇关于python爬虫实战案例之取喜马拉雅音频数据详解的文章就介绍到这了,更多相关python爬取喜马拉雅音频数据内容请搜索以前的文章或继续浏览下面的相关文章希望大家以后多多支持!