python爬虫（爬取段子）

程序员文章站 2022-06-28 11:11:13

python爬取段子爬取某个网页的段子第一步不管三七二十一我们先导入模块第二步获取网站的内容第三步找到段子所在的位置第四部保存文件 ......

python爬取段子

爬取某个网页的段子

第一步

不管三七二十一我们先导入模块

#http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc  段子所在的网址
import re 
import  requests   #如果没这模块运行cmd pip  install requests

第二步

获取网站的内容

#http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc  段子所在的网址
import re 
import  requests   #如果没这模块运行cmd pip  install requests
 
response = requests.get(http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc)
data = response.text

第三步

找到段子所在的位置

#http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc  段子所在的网址
import re 
import  requests   #如果没这模块运行cmd pip  install requests
 
response = requests.get('http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc')   #这个编辑器的长度关系没法放一行
data = response.text
#按f12选择自己想要的内容所在的位置copy出来
new_list = re.findall('<span class="bjh-p">(.*?)</span></p><p>',data ) # (.*?)是我们要的内容

第四部

保存文件

#http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc  段子所在的网址
import re 
import  requests   #如果没这模块运行cmd pip  install requests
 
response = requests.get('http://baijiahao.baidu.com/s?id=1598724756013298998&wfr=spider&for=pc')   #这个编辑器的长度关系没法放一行
data = response.text
#按f12选择自己想要的内容所在的位置copy出来
new_list = re.findall('<span class="bjh-p">(.*?)</span></p><p>',data ) # (.*?)是我们要的内容

for a in new_list:
    with open(r'd:\图片\段子.txt', 'a') as fw:
        fw.write(a)
        fw.flush()

上一篇： VIVO 手机重力传感器踩坑记录

下一篇：曹操本想放过吕布，如果再来一次吕布还会背叛曹操吗？

python爬虫（爬取段子）

python爬取段子

爬取某个网页的段子

第一步

第二步

第三步

第四部

python scrapy框架爬取80s保存mysql

python使用requests模块实现爬取电影天堂最新电影信息

Python实现的爬取小说爬虫功能示例

python爬取英语学习资料并发送邮件

爬虫入门之爬取策略 XPath与bs4实现(五)

Python使用Scrapy爬取妹子图

python requests爬取高德地图数据的实例

Python爬虫爬取智联招聘（进阶版）

用.NET Core写爬虫爬取电影天堂

利用Python写一个爬妹子的爬虫