用Python爬取2022春节档电影信息

程序员文章站 2022-03-04 12:15:33

目录前提条件相关介绍实验环境具体步骤目标网站分析网站代码实现输出结果总结前提条件熟悉html基础语句熟悉xpath基础语句相关介绍python是一种跨平台的计算机程序设计语言。是一个高层次的结合了解释...

前提条件

熟悉html基础语句

熟悉xpath基础语句

实验环境

python 3.x （面向对象的高级语言）

resquest 2.14.2 （python第三方库）

pandas 1.1.0（python第三方库）

time （python标准库）

lxml（python第三方库）

具体步骤

目标网站

https://movie.douban.com/cinema/later/shenzhen/

用Python爬取2022春节档电影信息

分析网站

按f12打开浏览器操作台

用Python爬取2022春节档电影信息

按ctrl+shift+c快捷键

用Python爬取2022春节档电影信息

按ctrl+f快捷键，控制台出现搜索框

用Python爬取2022春节档电影信息

复制xpath

xpath为//*[@id=“showing-soon”]/div[1]/div/h3/a

用Python爬取2022春节档电影信息

粘贴到搜索框，验证xpath

用Python爬取2022春节档电影信息

查看html，寻找共性

用Python爬取2022春节档电影信息

发现目标元素都在一个div框里，修改xpath

xpath修改为//*[@id=“showing-soon”]/div/div/h3/a

用Python爬取2022春节档电影信息

其余目标元素，以此类推

用Python爬取2022春节档电影信息

最后，用pandas保存为csv文件

# 利用pandas保存文件
df = pd.dataframe()
df['上映日期'] =  ondate
df['片名'] =  name
df['类型'] =  movie_class
df['制片国家/地区'] = area
df['想看人数'] = num
df['超链接'] = href

用Python爬取2022春节档电影信息

代码实现

# -*- coding: utf-8 -*-
"""
created on tue jan 25 10:07:11 2022
@author: tfx
"""
import time
import requests # 请求库
import pandas as pd
from lxml import etree# 提取信息库
# 日期
today = time.strftime('%y{y}%m{m}%d{d}',time.localtime()).format(y='年',m='月',d='日')
# 网址
url = 'https://movie.douban.com/cinema/later/shenzhen/'
# 请求头
headers = {
        'user-agent': 'mozilla/5.0 (windows nt 10.0; win64; x64) applewebkit/537.36 (khtml, like gecko) chrome/80.0.3987.163 safari/537.36'
        }
# 发送请求
response = requests.get(url=url,headers=headers)
# 数据解析,xpath可以用浏览器检查元素获得
html = etree.html(response.text) #类型变换
# 电影详细超链接
href = html.xpath('//*[@id="showing-soon"]/div/div/h3/a/@href')
# 上映日期
ondate =  html.xpath('//*[@id="showing-soon"]/div/div/ul/li[1]/text()')
# 片名
name = html.xpath('//*[@id="showing-soon"]/div/div/h3/a/text()')
# 类型
movie_class = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[2]/text()')
# 制片国家 / 地区
area = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[3]/text()')
# 想看人数
num = html.xpath('//*[@id="showing-soon"]/div/div/ul/li[4]/span/text()')
# 利用pandas保存文件
df = pd.dataframe()
df['上映日期'] =  ondate
df['片名'] =  name
df['类型'] =  movie_class
df['制片国家/地区'] = area
df['想看人数'] = num
df['超链接'] = href
df.to_csv('2022春节档电影_'+today+'.csv',mode='w',index=none,encoding='gbk')
print('保存完成!')

输出结果

用Python爬取2022春节档电影信息

总结

到此这篇关于用python爬取2022春节档电影信息的文章就介绍到这了,更多相关python春节档电影信息内容请搜索以前的文章或继续浏览下面的相关文章希望大家以后多多支持！

用Python爬取2022春节档电影信息

目录

前提条件

相关介绍

实验环境

具体步骤

目标网站

分析网站

代码实现

输出结果

总结

python使用requests模块实现爬取电影天堂最新电影信息

Python爬虫实战用 BeautifulSoup 爬取电影网站信息

Python | 用Python爬取LOL所有的英雄信息以及英雄皮肤

一个简单的python爬虫程序爬取豆瓣热度Top100以内的电影信息

Python 豆瓣电影Top250信息的爬取

用Python爬虫实现爬取豆瓣电影Top250

python实现天猫页面打开，用for循环爬取书名信息，并存储信息。

python利用requests模块，实现爬取电影天堂最新电影信息。

用python爬取猫眼电影，简单网站的多重思路

Python爬虫入门 | 爬取豆瓣电影信息

用Python爬取2022春节档电影信息

目录

前提条件

相关介绍

实验环境

具体步骤

目标网站

分析网站

代码实现

输出结果

总结

python使用requests模块实现爬取电影天堂最新电影信息

Python爬虫实战用 BeautifulSoup 爬取电影网站信息

Python | 用Python爬取LOL所有的英雄信息以及英雄皮肤

一个简单的python爬虫程序 爬取豆瓣热度Top100以内的电影信息

Python 豆瓣电影Top250信息的爬取

用Python爬虫实现爬取豆瓣电影Top250

python实现天猫页面打开，用for循环爬取书名信息，并存储信息。

python利用requests模块，实现爬取电影天堂最新电影信息。

用python爬取猫眼电影，简单网站的多重思路

Python爬虫入门 | 爬取豆瓣电影信息

一个简单的python爬虫程序爬取豆瓣热度Top100以内的电影信息