利用python如何爬取js里面的内容

程序员文章站 2022-04-03 21:18:23

...

本篇文章给大家分享的内容是3利用python如何爬取js里面的内容，有着一定的参考价值，有需要的朋友可以参考一下

一、在编写爬虫软件获取所需内容时可能会碰到所需要的内容是由javascript添加上去的在获取的时候为空比如我们在获取新浪新闻的评论数时使用普通的方法就无法获取

利用python如何爬取js里面的内容

普通获取代码示例：

import requests
from bs4 import BeautifulSoup

res = requests.get('http://news.sina.com.cn/c/nd/2017-06-12/doc-ifyfzhac1650783.shtml')
res.encoding = 'utf-8'
soup = BeautifulSoup(res.text,'html.parser')
#取评论数
commentCount = soup.select_one('#commentCount1')
print(commentCount.text)

此时所获取的结果为空这是由于内容是存储在js文件中

因此我们需要取寻找存储评论内容的js 经过查找我们发现其存储在改js里

利用python如何爬取js里面的内容

将相应内容放入json数据查看器中我们发现评论总数和评论内容都在该js文件中一json格式存放

利用python如何爬取js里面的内容

在消息头中我们可以看的该js文件的访问路径及请求方式

利用python如何爬取js里面的内容

代码示例

import json
comments = requests.get('http://comment5.news.sina.com.cn/page/info?version=1&format=js&channel=gn&newsid=comos-fyfzhac1650783')
comments.encoding = 'utf-8'
print(comments)
jd = json.loads(comments.text.strip('var data=')) #移除改var data=将其变为json数据
print(jd['result']['count']['total'])

注释：这里解释下为何需要移除 var data= 因为在获取时字符串前缀是包含var data=的其不符合json数据格式因此转化时需将其从请求内容中移除

利用python如何爬取js里面的内容

取评论总数时为何使用jd['result']['count']['total']

利用python如何爬取js里面的内容

以上就是利用python如何爬取js里面的内容的详细内容，更多请关注其它相关文章！

上一篇： mysql处理大量数据时的优化查询速度的方法详解

下一篇：推荐10个mysql主从架构

利用python如何爬取js里面的内容

普通获取代码示例：

如何利用python爬虫爬取爱奇艺VIP电影？

Python如何利用正则表达式爬取网页信息及图片

如何利用python爬虫爬取爱奇艺VIP电影？

python3如何利用requests模块实现爬取页面内容的实例详解

python3如何利用requests模块实现爬取页面内容的实例详解