欢迎您访问程序员文章站本站旨在为大家提供分享程序员计算机编程知识!
您现在的位置是: 首页

Heritrix3.0教程(二) 下载安装与运行

程序员文章站 2022-04-29 16:23:43
...

 

        本博客属原创文章,转载请注明出处: http://guoyunsky.iteye.com/blog/1744454

        本人新浪微博:http://weibo.com/guoyunwb

       Heritrix3.0.0在2009年底发布,但资料甚少.我这里就先抛砖引用,以前也分析过Heritrix1.4.3,但只是源码,不系统.这里就系统的介绍Heritrix的使用,源码分析和借鉴.先介绍Heritrix的下载与使用吧.

1.下载,下载地址:http://sourceforge.net/projects/archive-crawler/files/heritrix3/.下载后的截图为Heritrix3.0教程(二) 下载安装与运行
            
    
    博客分类: 搜索引擎-爬虫-Heritrix  

这里大家可以看下README.TXT文件.这里面有对Heritrix基本的介绍.

     2.下面开始使用Heritrix3.0.0

进入CMD(开始->运行),进入Heritrix3.0.0所在目录,我这里是D:/heritrix/heritrix3.0.0/bin,这里大家截图也可以看到.输入以下命令:heritrix -a admin:admin,这里会跳出一个cmd,截图如下:Heritrix3.0教程(二) 下载安装与运行
            
    
    博客分类: 搜索引擎-爬虫-Heritrix  

就表示你已经启动Heririx成功,然后在浏览器里输入,https://localhost:8443(注意,是https,不是http).由于Heritrix3.0.0已通过https登录,用户名跟密码就是以上输入的admin:admin.所以不同于早期版本,我这里用的是火狐浏览器,界面可能如下

Heritrix3.0教程(二) 下载安装与运行
            
    
    博客分类: 搜索引擎-爬虫-Heritrix  

ie等可能不一样.然后点击我已充分了解可能的风险,点添加例外,再输入用户名跟密码,也就是刚才的admin,admin后,便可以进入Heritrix3.0.0 web界面了.大概如下:Heritrix3.0教程(二) 下载安装与运行
            
    
    博客分类: 搜索引擎-爬虫-Heritrix  

出现以上界面,就表示你可以使用Heritrix去抓取数据了,但这里还需配置Job,也就是抓取任务.

这里先大概介绍下界面:

  1. Memory 表示内存使用情况
  2. Jobs Directory:表示抓取job目录,默认是Heritrix_home/jobs
  3. rescan按钮表示扫描jobs目录,目录有改动,也就是抓取任务有增加或者删除,这里则都会显示
  4. create按钮表示创建一个Job
  5. add按钮表示添加一个已经存在的job,这里是输入这个job所在的路径

     好了,这里基本上可以下载并使用Heririx了.下一篇则介绍如何配置CrawlJob,也就是抓取任务去抓取数据.

 

更多技术文章、感悟、分享、勾搭,请用微信扫描:

Heritrix3.0教程(二) 下载安装与运行
            
    
    博客分类: 搜索引擎-爬虫-Heritrix