WordPress站点之Robots.txt的优化及写法

2024-09-07 00:52:47

字体：大中小

来源：转载

供稿：网友

Robots协议（也称为爬虫协议、机器人协议等）的全称是“网络爬虫排除标准”（Robots Exclusion Protocol），网站通过Robots协议告诉搜索引擎哪些页面可以抓取，哪些页面不能抓取。

搜索引擎机器人访问网站时，首先会寻找站点根目录有没有 robots.txt文件，如果有这个文件就根据文件的内容确定收录范围，如果没有就按默认访问以及收录所有页面。另外，当搜索蜘蛛发现不存在robots.txt文件时，会产生一个404错误日志在服务器上，从而增加服务器的负担，因此为站点添加一个robots.txt文件还是很重要的。

知道Robots协议的作用后，下面具体说一下WordPress站点如何编写robots.txt文件。

WordPress站点默认在浏览器中输入：http://你的域名/robots.txt，会显示如下内容：

User-agent: *

Disallow: /wp-admin/

Disallow: /wp-includes/

这是由WordPress自动生成的，意思是告诉搜索引擎不要抓取后台程序文件。

但这是远远不够的，比较完整的WordPress站点robots.txt文件内容如下：

User-agent: *

Disallow: /wp-admin/

Disallow: /wp-content/

Disallow: /wp-includes/

Disallow: page/

Disallow: /tagtrackback

Disallow: /feed

Disallow: ?s=*/

Disallow: /attachment/