Python爬虫实战案例之爬取喜马拉雅音频数据详解
程序员文章站
2022-04-10 13:49:10
前言喜马拉雅是专业的音频分享平台,汇集了有声小说,有声读物,有声书,fm电台,儿童睡前故事,相声小品,鬼故事等数亿条音频,我最喜欢听民间故事和德云社相声集,你呢?今天带大家爬取喜马拉雅音频数据,一起期...
前言
喜马拉雅是专业的音频分享平台,汇集了有声小说,有声读物,有声书,fm电台,儿童睡前故事,相声小品,鬼故事等数亿条音频,我最喜欢听民间故事和德云社相声集,你呢?
今天带大家爬取喜马拉雅音频数据,一起期待吧!!
这个案例的视频地址在这里
https://v.douyu.com/show/a2jemjj3e3mmnxml
项目目标
爬取喜马拉雅音频数据
受害者地址
本文知识点:
1、系统分析网页性质
2、多层数据解析
3、海量音频数据保存
环境:
1.确定数据所在的链接地址(url)
2.通过代码发送url地址的请求
3.解析数据(要的, 筛选不要的)
4.数据持久化(保存)
案例思路:
1. 在静态数据中获取音频的id值
2. 发送指定id值json数据请求(src)
3. 从json数据中解析音频所对应的url地址 开始写代码
先导入所需的模块
1.确定数据所在的链接地址(url) 逆向分析 网页性质(静态网页/动态网页)
打开开发者工具,播放一个音频,在madie里面可以找到一个数据包
复制url,搜索
找到id值
继续搜索,找到请求头参数
2.通过代码发送url地址的请求
3.解析数据(要的, 筛选不要的) 解析音频的 id值
4.数据持久化(保存)
最后还要处理文件名非法字符
完整代码
运行代码,效果如下图
到此这篇关于python爬虫实战案例之取喜马拉雅音频数据详解的文章就介绍到这了,更多相关python爬取喜马拉雅音频数据内容请搜索以前的文章或继续浏览下面的相关文章希望大家以后多多支持!