apache禁止搜索引擎收录、网络爬虫采集的配置方法

程序员文章站 2023-10-28 14:47:46

apache中禁止网络爬虫，之前设置了很多次的，但总是不起作用，原来是是写错了，不能写到dirctory中，要写到location中复制代码代码如下:

apache中禁止网络爬虫，之前设置了很多次的，但总是不起作用，原来是是写错了，不能写到dirctory中，要写到location中

<location />

setenvifnocase user-agent "spider" bad_bot

browsermatchnocase bingbot bad_bot

browsermatchnocase googlebot bad_bot

order deny,allow

#下面是禁止soso的爬虫

deny from 124.115.4. 124.115.0. 64.69.34.135 216.240.136.125 218.15.197.69 155.69.160.99 58.60.13. 121.14.96. 58.60.14. 58.61.164. 202.108.7.209

deny from env=bad_bot

</location>

这是禁止了所有包含spider字符的爬虫。
如果要针对性的禁止爬虫，改成精确匹配的爬虫字符串，如果bingbot、googlebot等等

上一篇： jQuery选择器源码解读（二）：select方法

下一篇： jQuery使用hide方法隐藏元素自身用法实例教程

apache禁止搜索引擎收录、网络爬虫采集的配置方法

apache禁止搜索引擎收录、网络爬虫采集的配置方法

防止网页被搜索引擎爬虫和网页采集器收录的方法汇总

防止网页被搜索引擎爬虫和网页采集器收录的方法汇总