欢迎您访问程序员文章站本站旨在为大家提供分享程序员计算机编程知识!
您现在的位置是: 首页  >  网络运营

搜索引擎喜欢UTF-8编码robots.txt

程序员文章站 2023-11-11 17:51:46
所以请问,你网站根目录下的robots.txt文件是UTF-8编码吗?如果不是,建议你修改为该编码。 Google Groups成员指出包括Google在内的大部分常用搜索引擎更宠爱UTF-8编... 09-04-02...

所以请问,你网站根目录下的robots.txt文件是utf-8编码吗?如果不是,建议你修改为该编码。

google groups成员指出包括google在内的大部分常用搜索引擎更宠爱utf-8编码的robots.txt文件。

相关文章:有道关于robots.txt的解释

robots.txt这个文件相信大家都不模式吧,是搜索引擎中访问网站的时候要查看的第一个文件。robots.txt文件告诉蜘蛛程序在服务器上什么文件是可以被查看的。

当一个搜索蜘蛛访问一个站点时,它会首先检查该站点根目录下是否存在robots.txt,如果存在,搜索机器人就会按照该文件中的内容来确定访问的范围;如果该文件不存在,所有的搜索蜘蛛将能够访问网站上所有没有被口令保护的页面。

robots.txt必须放置在一个站点的根目录下,而且文件名必须全部小写。

语法:最简单的 robots.txt 文件使用两条规则:

• user-agent: 适用下列规则的漫游器
• disallow: 要拦截的网页

robots.txt是一种存放于网站根目录下的ascii编码的文本文件,robots.txt的文件名应统一为小写,即robots.txt。

robots.txt协议并不是一个规范,而只是约定俗成的,所以并不能保证网站的隐私。注意robots.txt是用字符串比较来确定是否获取url,所以目录末尾有和没有斜杠“/”这两种表示是不同的url,也不能用”disallow: .gif”这样的通配符。

因为robots.txt是一个纯文本文件,所以很多站长在设置网站的这个文件时,随便把系统中过的文本编辑器拿来就写了,然后上传到自己的网站根目录,以为这样就万事大吉了,其实,你只做了一半因为你的马虎。

已经被无数站长证实的事实是:搜索引擎更喜欢utf-8编码的robots.txt文件。google groups成员phil payne也是为此做出声明说:在常用的html文件编码类型中,google和其他的搜索引擎都更偏爱utf-8编码的robots.txt文件。甚至有的文件编码形式都已经被google直接忽略掉了。

所以请问,你网站根目录下的robots.txt文件是utf-8编码吗?如果不是,建议你修改为该编码。