Python爬虫练习：爬取赶集网数据信息

程序员文章站 2024-01-20 20:48:28

...

本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理。

以下文章来源于云+社区，作者 py3study

转载地址

https://blog.csdn.net/fei347795790?t=1

Python爬虫练习：爬取赶集网数据信息

一.创建项目

scrapy startproject putu

二.创建spider文件

scrapy genspider patubole patubole.com

三.利用chrome浏览器分析出房价和标题的两个字段的xpath表达式，开始编写patubole.py文件。网络的爬取是通过这个文件进行的

以下代码是最终的代码

所建的patubole.py文件必须实现name,parse函数，start_url这三个属性

Python爬虫练习：爬取赶集网数据信息

四.将爬取的数据保存到数据库sufang中。

（1）在pycharm中新建数据库

Python爬虫练习：爬取赶集网数据信息

完成后会出现

Python爬虫练习：爬取赶集网数据信息

（2）将数据存放在新建的数据库zufang的数据表sufang中

数据的爬取是由patubole.py实现的，数据的存储是由pipelines.py实现的，pipelines.py又是有items.py提供数据的支持

所以编写items.py

Python爬虫练习：爬取赶集网数据信息

此时就要回过头来修改刚开始为了测试编写的patubole.py 文件

代码如下

Python爬虫练习：爬取赶集网数据信息

3）在settings.py中进行PatuPipeline文件配置

ITEM_PIPELINES = {

'patu.pipelines.PatuPipeline': 300,

}

（5）pipelines.py文件代码，实现存储数据到数据库中

其中包含SQL的相关知识

Python爬虫练习：爬取赶集网数据信息

最终结果

Python爬虫练习：爬取赶集网数据信息

其中main.py文件是为了调试方便而添加的，可以不用，直接用相关命令启动爬虫

Python爬虫练习：爬取赶集网数据信息

相关标签：爬虫数据库 python mysql

上一篇：深入理解数据库索引采用B树和B+树的原因

下一篇： Qt之QWebView

Python爬虫练习：爬取赶集网数据信息

一.创建项目

二.创建spider文件

三.利用chrome浏览器分析出房价和标题的两个字段的xpath表达式，开始编写patubole.py文件。网络的爬取是通过这个文件进行的

四.将爬取的数据保存到数据库sufang中。

Python爬虫练习：爬取赶集网数据信息

Python爬虫之自动爬取某车之家各车销售数据

通俗易懂的分析如何用Python实现一只小爬虫，爬取拉勾网的职位信息

神箭手云爬虫-爬取携程【国际】航班/机票信息-利用python解析返回的json文件将信息存储进Mysql数据库

python爬虫爬取json数据

Python爬虫-爬取数据-urllib库

Python爬虫爬取淘宝，京东商品信息

Python爬虫爬取疫情数据并可视化展示

python3爬虫-通过selenium登陆拉钩，爬取职位信息

Python爬虫实战之爬取某宝男装信息