欢迎您访问程序员文章站本站旨在为大家提供分享程序员计算机编程知识!
您现在的位置是: 首页

Python爬虫入门<二>—模拟浏览器

程序员文章站 2022-05-18 21:37:29
...

模拟浏览器

标签: python爬虫 模拟浏览器


1.为什么要模拟浏览器

其实,我们访问一一些需要登录的网站的时候,我们的到的请求是由浏览器发出来的,所以我们做爬虫的时候,需要模拟浏览器的环境,从而的到响应。

2需要的工具

其实,在做爬虫的时候,我们需要工具去进行抓包,这里我用的谷歌浏览器自带的抓包工具,大家也可以用fidder,当然还有很多人喜欢用火狐(据说好用)
我就用谷歌浏览器了(嘻嘻)
那我们就用豆瓣来模拟(都喜欢用豆瓣)
Python爬虫入门<二>—模拟浏览器

3编写代码访问

import urllib.request

def savefile(data):
    path = "C:\\Users\\Administrator\\Desktop\\爬虫豆瓣.txt"
    f = open(path ,'wb+')
    f.write(data)
    f.close()

url = "https://www.douban.com/"
headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/60.0.3112.101 Safari/537.36'}
request = urllib.request.Request(url=url,headers=headers)
response = urllib.request.urlopen(url)
data = response.read()
savefile(data)

Python爬虫入门<二>—模拟浏览器

HTTP文件详解