google groups成员指出包括google在内的大部分常用搜索引擎更宠爱utf-8编码的robots.txt文件。
相关文章:有道关于robots.txt的解释
robots.txt这个文件相信大家都不模式吧,是搜索引擎中访问网站的时候要查看的第一个文件。robots.txt文件告诉蜘蛛程序在服务器上什么文件是可以被查看的。
当一个搜索蜘蛛访问一个站点时,它会首先检查该站点根目录下是否存在robots.txt,如果存在,搜索机器人就会按照该文件中的内容来确定访问的范围;如果该文件不存在,所有的搜索蜘蛛将能够访问网站上所有没有被口令保护的页面。
robots.txt必须放置在一个站点的根目录下,而且文件名必须全部小写。
语法:最简单的 robots.txt 文件使用两条规则:
• user-agent: 适用下列规则的漫游器
• disallow: 要拦截的网页
robots.txt是一种存放于网站根目录下的ascii编码的文本文件,robots.txt的文件名应统一为小写,即robots.txt。
robots.txt协议并不是一个规范,而只是约定俗成的,所以并不能保证网站的隐私。注意robots.txt是用字符串比较来确定是否获取url,所以目录末尾有和没有斜杠“/”这两种表示是不同的url,也不能用”disallow: .gif”这样的通配符。
因为robots.txt是一个纯文本文件,所以很多站长在设置网站的这个文件时,随便把系统中过的文本编辑器拿来就写了,然后上传到自己的网站根目录,以为这样就万事大吉了,其实,你只做了一半因为你的马虎。
已经被无数站长证实的事实是:搜索引擎更喜欢utf-8编码的robots.txt文件。google groups成员phil payne也是为此做出声明说:在常用的html文件编码类型中,google和其他的搜索引擎都更偏爱utf-8编码的robots.txt文件。甚至有的文件编码形式都已经被google直接忽略掉了。
所以请问,你网站根目录下的robots.txt文件是utf-8编码吗?如果不是,建议你修改为该编码。
新闻热点
疑难解答