Python爬虫UA伪装爬取的实例讲解

程序员文章站 2023-03-12 16:20:36

在使用python爬取网站信息时，查看爬取完后的数据发现，数据并没有被爬取下来，这是因为网站中有ua这种请求载体的身份标识，如果不是基于某一款浏览器爬取则是不正常的请求，所以会爬取失败。本文介绍pyt...

在使用python爬取网站信息时，查看爬取完后的数据发现，数据并没有被爬取下来，这是因为网站中有ua这种请求载体的身份标识，如果不是基于某一款浏览器爬取则是不正常的请求，所以会爬取失败。本文介绍python爬虫采用ua伪装爬取实例。

一、python爬取失败原因如下：

ua检测是门户网站的服务器会检测对应请求的载体身份标识，如果检测到请求的载体身份标识为某一款浏览器，说明该请求是一个正常的请求。如果检测到请求的载体身份标识不是基于某一款浏览器的。则表示该请求为不正常的请求，则服务器端就很有可能会拒绝该次请求。

二、解决方法：采用ua伪装

让爬虫对应的请求载体身份标识伪装成某一款浏览器，这里采用的伪装成chrome浏览器。

采用ua伪装爬取实例

import requests
if __name__=="__main__":
  headers={
    "user-agent":"mozilla/5.0(windows nt 10.0;win64;x64) applewebkit / 537.36(khtml, likegecko) 
    chrome / 88.0.4324.150 safari / 537.36"
  }
  url="https://www.sogou.com/web"
  queryword=input("输出关键字")
  param={
    "query":queryword
  }
  res=requests.get(url=url,params=param,headers=headers)
  res.encoding="utf-8"
  page_text=res.text
  filename=queryword+".html"
  with open(filename,"w",encoding="utf-8") as fs:
    fs.write(page_text)
  print(page_text+"爬取结束")

知识点扩展：

采用ua伪装：让爬虫对应的请求载体身份标识伪装成某一款浏览器，这里采用的伪装成chrome浏览器

代码如下：

import requests
#ua:user—agent(请求载体的身份标识)
# ua检测：门户网站的服务器会检测对应请求的载体身份标识，如果检测到请求的载体身份标识为某一款浏览器，说明该请求是一个正常的请求。
# 如果检测到请求的载体身份标识不是基于某一款浏览器的。则表示该请求为不正常的请求，则服务器端就很有可能会拒绝该次请求
if __name__=="__main__":
  headers={
    "user-agent":"mozilla/5.0(windows nt 10.0;win64;x64) applewebkit / 537.36(khtml, likegecko) chrome / 88.0.4324.150 safari / 537.36"
  }
  url="https://www.sogou.com/web"
  queryword=input("输出关键字")
  param={
    "query":queryword
  }
  res=requests.get(url=url,params=param,headers=headers)
  res.encoding="utf-8"
  page_text=res.text
  filename=queryword+".html"
  with open(filename,"w",encoding="utf-8") as fs:
    fs.write(page_text)
  print(page_text+"爬取结束")

到此这篇关于python爬虫ua伪装爬取的实例讲解的文章就介绍到这了,更多相关python爬虫如何ua伪装爬取内容请搜索以前的文章或继续浏览下面的相关文章希望大家以后多多支持！

Python爬虫UA伪装爬取的实例讲解

Python爬虫实现爬取百度百科词条功能实例

2019基于python的网络爬虫系列，爬取糗事百科

Python实现爬取百度贴吧帖子所有楼层图片的爬虫示例

Python网络爬虫开发从环境搭建到实例爬取网页

Python简单爬虫导出CSV文件的实例讲解

Python实现的爬取小说爬虫功能示例

python requests爬取高德地图数据的实例

以视频爬取实例讲解Python爬虫神器Beautiful Soup用法

python爬虫教程之爬取百度贴吧并下载的示例

Python爬虫使用selenium爬取qq群的成员信息（全自动实现自动登陆）