基于Python实现的百度贴吧网络爬虫实例

程序员文章站 2022-05-20 08:54:36

...

本文实例讲述了基于Python实现的百度贴吧网络爬虫。分享给大家供大家参考。具体如下：

完整实例代码点击此处本站下载。

项目内容：

用Python写的百度贴吧的网络爬虫。

使用方法：

新建一个BugBaidu.py文件，然后将代码复制到里面后，双击运行。

程序功能：

将贴吧中楼主发布的内容打包txt存储到本地。

原理解释：

首先，先浏览一下某一条贴吧，点击只看楼主并点击第二页之后url发生了一点变化，变成了：
http://tieba.baidu.com/p/2296712428?see_lz=1&pn=1

可以看出来，see_lz=1是只看楼主，pn=1是对应的页码，记住这一点为以后的编写做准备。
这就是我们需要利用的url。
接下来就是查看页面源码。
首先把题目抠出来存储文件的时候会用到。
可以看到百度使用gbk编码，标题使用h1标记：

复制代码代码如下:

【原创】时尚首席（关于时尚，名利，事业，爱情，励志）

同样，正文部分用div和class综合标记，接下来要做的只是用正则表达式来匹配即可。

运行截图：

基于Python实现的百度贴吧网络爬虫实例

生成的txt文件：

基于Python实现的百度贴吧网络爬虫实例

# -*- coding: utf-8 -*- 
#--------------------------------------- 
#  程序：百度贴吧爬虫 
#  版本：0.5 
#  作者：why 
#  日期：2013-05-16 
#  语言：Python 2.7 
#  操作：输入网址后自动只看楼主并保存到本地文件 
#  功能：将楼主发布的内容打包txt存储到本地。 
#--------------------------------------- 
import string 
import urllib2 
import re 
#----------- 处理页面上的各种标签 ----------- 
class HTML_Tool: 
  # 用非 贪婪模式 匹配 \t 或者 \n 或者 空格 或者 超链接 或者 图片 
  BgnCharToNoneRex = re.compile("(\t|\n| ||)") 
  # 用非 贪婪模式 匹配 任意标签 
  EndCharToNoneRex = re.compile("<.>") 
  # 用非 贪婪模式 匹配 任意标签 
  BgnPartRex = re.compile("
") 
  CharToNewLineRex = re.compile("(
||||)") 
  CharToNextTabRex = re.compile("") 
  # 将一些html的符号实体转变为原始符号 
  replaceTab = [("",">"),("&","&"),("&","\""),(" "," ")] 
  def Replace_Char(self,x): 
    x = self.BgnCharToNoneRex.sub("",x) 
    x = self.BgnPartRex.sub("\n  ",x) 
    x = self.CharToNewLineRex.sub("\n",x) 
    x = self.CharToNextTabRex.sub("\t",x) 
    x = self.EndCharToNoneRex.sub("",x) 
    for t in self.replaceTab:  
      x = x.replace(t[0],t[1])  
    return x  
class Baidu_Spider: 
  # 申明相关的属性 
  def __init__(self,url):  
    self.myUrl = url + '?see_lz=1' 
    self.datas = [] 
    self.myTool = HTML_Tool() 
    print u'已经启动百度贴吧爬虫，咔嚓咔嚓' 
  # 初始化加载页面并将其转码储存 
  def baidu_tieba(self): 
    # 读取页面的原始信息并将其从gbk转码 
    myPage = urllib2.urlopen(self.myUrl).read().decode("gbk") 
    # 计算楼主发布内容一共有多少页 
    endPage = self.page_counter(myPage) 
    # 获取该帖的标题 
    title = self.find_title(myPage) 
    print u'文章名称：' + title 
    # 获取最终的数据 
    self.save_data(self.myUrl,title,endPage) 
  #用来计算一共有多少页 
  def page_counter(self,myPage): 
    # 匹配 "共有12页" 来获取一共有多少页 
    myMatch = re.search(r'class="red">(\d+?)', myPage, re.S) 
    if myMatch:  
      endPage = int(myMatch.group(1)) 
      print u'爬虫报告：发现楼主共有%d页的原创内容' % endPage 
    else: 
      endPage = 0 
      print u'爬虫报告：无法计算楼主发布内容有多少页！' 
    return endPage 
  # 用来寻找该帖的标题 
  def find_title(self,myPage): 
    # 匹配 xxxxxxxxxx 找出标题 
    myMatch = re.search(r'(.*?)', myPage, re.S) 
    title = u'暂无标题' 
    if myMatch: 
      title = myMatch.group(1) 
    else: 
      print u'爬虫报告：无法加载文章标题！' 
    # 文件名不能包含以下字符： \ / ： * ? "  | 
    title = title.replace('\\','').replace('/','').replace(':','').replace('*','').replace('?','').replace('"','').replace('>','').replace('(.*?)',myPage,re.S) 
    for item in myItems: 
      data = self.myTool.Replace_Char(item.replace("\n","").encode('gbk')) 
      self.datas.append(data+'\n') 
 
#-------- 程序入口处 ------------------ 
print u"""#--------------------------------------- 
#  程序：百度贴吧爬虫 
#  版本：0.5 
#  作者：why 
#  日期：2013-05-16 
#  语言：Python 2.7 
#  操作：输入网址后自动只看楼主并保存到本地文件 
#  功能：将楼主发布的内容打包txt存储到本地。 
#--------------------------------------- 
""" 
# 以某小说贴吧为例子 
# bdurl = 'http://tieba.baidu.com/p/2296712428?see_lz=1&pn=1' 
print u'请输入贴吧的地址最后的数字串：' 
bdurl = 'http://tieba.baidu.com/p/' + str(raw_input(u'http://tieba.baidu.com/p/'))  
#调用 
mySpider = Baidu_Spider(bdurl) 
mySpider.baidu_tieba()

希望本文所述对大家的Python程序设计有所帮助。
声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn核实处理。
相关文章
相关视频



一文了解Python中如何使用query()进行优...


python fabric实现远程操作和部署示例


python抓取网页中的图片示例


简单谈谈Python中的闭包


基于Python实现的百度贴吧网络爬虫实例




Python 简介


Python 环境搭建


Python 中文编码


Python 基础语法


Python 变量类型




网友评论
文明上网理性发言，请遵守 新闻评论服务协议
我要评论











专题推荐


独孤九贱-php全栈开发教程全栈  170W+
主讲：Peter-Zhu  轻松幽默、简短易学，非常适合PHP学习入门


玉女心经-web前端开发教程入门  80W+
主讲：灭绝师太  由浅入深、明快简洁，非常适合前端学习入门


天龙八部-实战开发教程实战  120W+
主讲：西门大官人 思路清晰、严谨规范，适合有一定web编程基础学习





作者信息




认证0级讲师



发布技术文章


最新文章
热门排行




一文了解Python中如何使用query()进行优雅的查询
python基本运算符号有哪些
在python中导入哪个库可以进行大数据分析
浅谈浮点数运算为什么会产生误差
pandas怎么读取excel文件
一文了解大文件排序/外存排序问题
python如何读取txt文件内容
python的缩进规则是什么



python是什么意思
大数据专业学习什么内容
python如何处理excel数据
py文件怎么打开？
python里面def是什么意思
pycharm怎么安装
python怎么换行输出
python中eval是什么意思？





推荐视频教程

javascript初级视频教程


jquery 基础视频教程




视频教程分类

php视频教程
html视频教程
css视频教程
JS视频教程
jQuery视频教程
mysql视频教程
Linux视频教程
Python视频教程






网站首页 
PHP视频
PHP实战
PHP代码
PHP手册
词条
手记
编程词典
php培训

：公益在线php培训，帮助PHP学习者快速成长！
Copyright 2014-2021 https://www.php.cn/ All Rights Reserved | 苏ICP备2020058653号-1关于我们免责申明赞助与捐赠广告合作