PHP采摘利器：Snoopy 试用心得

程序员文章站 2024-01-28 19:25:10

...

PHP采集利器：Snoopy 试用心得

　Snoopy是一个php类，用来模拟浏览器的功能，可以获取网页内容，发送表单。Snoopy正确运行需要你的服务器的PHP版本在4以上，并且支持PCRE（Perl Compatible Regular Expressions），基本的LAMP服务都支持。

一、Snoopy的一些特点:

　　1.抓取网页的内容 fetch

　　2.抓取网页的文本内容 (去除HTML标签) fetchtext

　　3.抓取网页的链接，表单 fetchlinks fetchform

　　4.支持代理主机

　　5.支持基本的用户名/密码验证

　　6.支持设置user_agent, referer(来路), cookies和header content(头文件)

　　7.支持浏览器重定向，并能控制重定向深度

　　8.能把网页中的链接扩展成高质量的url(默认)

　　9.提交数据并且获取返回值

　　10.支持跟踪HTML框架

　　11.支持重定向的时候传递cookies，要求php4以上就可以了，由于本身是php一个类，无需扩支持，服务器不支持curl时候的最好选择。

二、类方法:

fetch($URI)
———–

　　这是为了抓取网页的内容而使用的方法。$URI参数是被抓取网页的URL地址。抓取的结果被存储在 $this->results 中。如果你正在抓取的是一个框架，Snoopy将会将每个框架追踪后存入数组中，然后存入 $this->results。

fetchtext($URI)
—————

　　本方法类似于fetch()，唯一不同的就是本方法会去除HTML标签和其他的无关数据，只返回网页中的文字内容。

fetchform($URI)
—————

　　本方法类似于fetch()，唯一不同的就是本方法会去除HTML标签和其他的无关数据，只返回网页中表单内容(form)。

fetchlinks($URI)
—————-

　　本方法类似于fetch()，唯一不同的就是本方法会去除HTML标签和其他的无关数据，只返回网页中链接(link)。
默认情况下，相对链接将自动补全，转换成完整的URL。

submit($URI,$formvars)
———————-

　　本方法向$URL指定的链接地址发送确认表单。$formvars是一个存储表单参数的数组。

submittext($URI,$formvars)
————————–

　　本方法类似于submit()，唯一不同的就是本方法会去除HTML标签和其他的无关数据，只返回登陆后网页中的文字内容。

submitlinks($URI)
—————-

　　本方法类似于submit()，唯一不同的就是本方法会去除HTML标签和其他的无关数据，只返回网页中链接(link)。
默认情况下，相对链接将自动补全，转换成完整的URL。

三、类属性: (缺省值在括号里)

$host 连接的主机
$port 连接的端口
$proxy_host 使用的代理主机，如果有的话
$proxy_port 使用的代理主机端口，如果有的话
$agent 用户代理伪装 (Snoopy v0.1)
$referer 来路信息，如果有的话
$cookies cookies，如果有的话
$rawheaders 其他的头信息, 如果有的话
$maxredirs 最大重定向次数， 0=不允许 (5)
$offsiteok whether or not to allow redirects off-site. (true)
$expandlinks 是否将链接都补全为完整地址 (true)
$user 认证用户名, 如果有的话
$pass 认证用户名, 如果有的话
$accept http 接受类型 (image/gif, image/x-xbitmap, image/jpeg, image/pjpeg, */*)
$error 哪里报错, 如果有的话
$response_code 从服务器返回的响应代码
$headers 从服务器返回的头信息
$maxlength 最长返回数据长度
$read_timeout 读取操作超时 (requires PHP 4 Beta 4+)
设置为0为没有超时
$timed_out 如果一次读取操作超时了，本属性返回 true (requires PHP 4 Beta 4+)
$maxframes 允许追踪的框架最大数量
$status 抓取的http的状态
$temp_dir 网页服务器能够写入的临时文件目录 (/tmp)
$curl_path cURL binary 的目录, 如果没有cURL binary就设置为 false

四、以下是demo

include "Snoopy.class.php";  $snoopy = new Snoopy; $snoopy->proxy_host = "www.baidu.com";  $snoopy->proxy_port = "8080"; $snoopy->agent = "(compatible; MSIE 4.01; MSN 2.5; AOL 4.0; Windows 98)";  $snoopy->referer = "http://www.baidu.com/"; $snoopy->cookies["SessionID"] = 238472834723489l;  $snoopy->cookies["favoriteColor"] = "RED"; $snoopy->rawheaders["Pragma"] = "no-cache"; $snoopy->maxredirs = 2;  $snoopy->offsiteok = false;  $snoopy->expandlinks = false; $snoopy->user = "joe";  $snoopy->pass = "bloe"; if($snoopy->fetchtext("http://www.baidu.com"))  {        echo " ".htmlspecialchars($snoopy->results)." 
\n"; 
  } 
  else 
      echo "error fetching document: ".$snoopy->error."\n";snoopy采集phpchina示例 submit($submit_url,$submit_vars); if ($snoopy->results) {     //获取连接地址     $snoopy->fetchlinks("http://www.phpchina.com/bbs");     $url=array();     $url=$snoopy->results;     //print_r($url);     foreach ($url as $key=>$value)     {         //匹配http://www.phpchina.com/bbs/forumdisplay.php?fid=156&sid=VfcqTR地址即论坛板块地址         if (!preg_match("/^(http:\/\/www\.phpchina\.com\/bbs\/forumdisplay\.php\?fid=)[0-9]*&sid=[a-zA-Z]{6}/i",$value))         {             unset($url[$key]);         }     }     //print_r($url);     //获取到板块数组$url，循环访问，此处获取第一个模块第一页的数据     $i=0;     foreach ($url as $key=>$value)     {         if ($i>=1)         {             //测试限制             break;         }         else         {             //访问该模块，提取帖子的连接地址，正式访问里需要提取帖子分页的数据，然后根据分页数据提取帖子数据             $snoopy=new Snoopy();             $snoopy->fetchlinks($value);             $tie=array();             $tie[$i]=$snoopy->results;             //print_r($tie);             //转换数组             foreach ($tie[$i] as $key=>$value)             {                 //匹配http://www.phpchina.com/bbs/viewthread.php?tid=68127& extra=page%3D1&page=1&sid=iBLZfK                 if (!preg_match("/^(http:\/\/www\.phpchina\.com\/bbs\/viewthread\.php\?tid=)[0-9]*&extra=page\%3D1&page=[0-9]*&sid=[a-zA-Z]{6}/i",$value))                 {                     unset($tie[$i][$key]);                 }             }             //print_r($tie[$i]);             //归类数组，将同一个帖子不同页面的内容放一个数组里             $left='';//连接左边公用地址             $j=0;             $page=array();             foreach ($tie[$i] as $key=>$value)             {                 $left=substr($value,0,52);                 $m=0;                 foreach ($tie[$i] as $pkey=>$pvalue)                 {                     //重组数组                     if (substr($pvalue,0,52)==$left)                     {                         $page[$j][$m]=$pvalue;                         $m++;                     }                 }                 $j++;             }             //去除重复项开始             //$page=array_unique($page);只能用于一维数组             $paget[0]=$page[0];             $nums=count($page);             for ($n=1;$n $value)             {                 //外围循环，针对一个帖子                 if (is_array($value))                 {                     foreach ($value as $k1=>$v1)                     {                         //页内循环，针对一个帖子的N页                         $snoopy=new Snoopy();                         $snoopy->fetch($v1);                         $temp=$snoopy->results;                         //读取标题                         if (!preg_match_all("/ (.*) /i",$temp,$tt))                         {                             echo "no title";                             exit;                         }                         else                         {                             $title[$u]=$tt[1][1];                         }                         unset($tt);                         //读取内容                         if (!preg_match_all("/ (.*) /i",$temp,$tt))                         {                             print_r($tt);                             echo "no content1";                             exit;                         }                         else                         {                             foreach ($tt[1] as $c=>$c2)                             {                                 $content[$u].=$c2;                             }                         }                     }                 }                 else                 {                     //直接取页内容                     $snoopy=new Snoopy();                     $snoopy->fetch($value);                     $temp=$snoopy->results;                     //读取标题                     if (!preg_match_all("/ (.*) /i",$temp,$tt))                     {                         echo "no title";                         exit;                     }                     else                     {                         $title[$u]=$tt[1][1];                     }                     unset($tt);                     //读取内容                     if (!preg_match_all("/ (.*) /i",$temp,$tt))                     {                         echo "no content2";                         exit;                     }                     else                     {                         foreach ($tt[1] as $c=>$c2)                         {                             $content[$u].=$c2;                         }                     }                 }                 $u++;             }             print_r($content);         }         $i++;     } } else {     echo "login failed";     exit; } ?>??

声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn核实处理。

相关文章
相关视频



关于中英数字混的字串符分割问题_PHP教程


PHP＋TEXT留言本(三)_PHP教程


应用PHP标签模板实现什么任务_PHP教程


php入门教程 精简版_PHP教程


PHP采摘利器：Snoopy 试用心得




HTML基础教程之<strong>和<em>


HTML基础教程之<span>标签


HTML基础教程之<meta>标签


HTML <div> 和<span>


JavaScript数组对象属性length和二维数组





网友评论
文明上网理性发言，请遵守 新闻评论服务协议
我要评论











专题推荐


独孤九贱-php全栈开发教程全栈  170W+
主讲：Peter-Zhu  轻松幽默、简短易学，非常适合PHP学习入门


玉女心经-web前端开发教程入门  80W+
主讲：灭绝师太  由浅入深、明快简洁，非常适合前端学习入门


天龙八部-实战开发教程实战  120W+
主讲：西门大官人 思路清晰、严谨规范，适合有一定web编程基础学习







作者信息




认证0级讲师



发布技术文章


最新文章
热门排行




PHP 安装配置教程大全（最新）
教你使用PHP数据库迁移工具“Phinx”
一文详解Windows和Linux环境下怎么安装配置PHP
详解win10下PHP的安装配置（以php5.6为例）
【DTM】PHP协程客户端v0.1 beta版本发布啦！
【吐血整理】28个关于PHP核心技术的面试题，助力跳槽！
php Swoole实现毫秒定时计划任务（详解）
用PHP将女友照片转成可爱的动漫头像！



循环大量数据导致内存超出，不增加内存如何解决该问题
VPN是什么
最全最详细的PHP面试题(带有答案)
PHP四大主流框架的优缺点总结
PHP快速搭建一个简单的QQ机器人
API常用签名验证方法(PHP实现)
PHP常用日期时间操作合集
Mac电脑设置hosts的方法（图文步骤）





推荐视频教程

javascript初级视频教程


jquery 基础视频教程




视频教程分类

php视频教程
html视频教程
css视频教程
JS视频教程
jQuery视频教程
mysql视频教程
Linux视频教程
Python视频教程