python爬虫要学什么

程序员文章站 2022-03-19 15:17:15

...

爬虫，被称为网络机器人，在FOAF社区中间，更经常的称为网页追逐者，是一种按照一定的规则，自动地抓取万维网信息的程序或者脚本，主要用于搜索引擎,它将一个网站的所有内容与链接进行阅读，并建立相关的全文索引到数据库中，然后跳到另一个网站。传统爬虫从一个或若干初始网页的URL开始，获得初始网页上的URL，再不断从当前页面上抽取新的URL放入队列，直到满足系统的一定停止条件。

python爬虫要学什么

学习之前的准备

1、一颗热爱学习

2、不屈不挠的心一台有键盘的电脑（什么系统都行。我用的os x，所以例子会以这个为准）

3、html相关的一些前段知识。不需要精通，能懂一点就够！Python的基础语法知识。

具体的学习路线

总体分为三个大方面：

1、简单的定向脚本爬虫（request --- bs4 --- re）

2、大型框架式爬虫（Scrapy框架为主）

3、浏览器模拟爬虫（Mechanize模拟和 Selenium 模拟）

具体步骤：

1、Beautiful Soup

requests库的安装与使用，安装beautiful soup 爬虫环境，beautiful soup 的解析器，re库正则表达式的使用，bs4 爬虫实践。获取百度贴吧的内容bs4 爬虫实践，获取双色球中奖信息bs4 爬虫实践，获取起点小说信息bs4 爬虫实践，获取电影信息bs4 爬虫实践。获取悦音台榜单

2、Scrapy 爬虫框架

安装Scrapy，Scrapy中的选择器 Xpath和CSSScrapy 爬虫实践，今日影视Scrapy 爬虫实践，天气预报Scrapy 爬虫实践，获取代理Scrapy 爬虫实践，糗事百科Scrapy 爬虫实践，爬虫相关攻防（代理池相关）

3、浏览器模拟爬虫

Mechanize模块的安装与使用，利用Mechanize获取乐音台公告，Selenium模块的安装与使用，浏览器的选择 PhantomJS，Selenium & PhantomJS 实践，获取代理；Selenium & PhantomJS 实践，漫画爬虫。

以上就是python爬虫要学什么的详细内容，更多请关注其它相关文章！

python爬虫要学什么

小白学 Python 爬虫：自动化测试框架 Selenium 从入门到实战

Python 爬虫 + 人脸检测会产生什么样的化学反应？简直不可思议！

《趣谈 Linux 操作系统》学习笔记(一)：为什么要学 Linux 及学习路径

Python 之父撰文回忆：为什么要创造 pgen 解析器？

自学Python要多久？Python学到什么程度可以找到好工作

为什么要学软文营销？

新手学Python有什么好方法和建议? 10年经验分享

月薪2万的爬虫工程师，Python需要学到什么程度？

小白学 Python 爬虫：Selenium 获取某大型电商网站商品信息

自学Python要学多久可以学会?