首页 > SEO建站资讯 > SEO建站技巧 > 【robots.txt】文件的具体写法和作用

【robots.txt】文件的具体写法和作用

时间：2020-12-24,10:58:22 编辑：台州SEO 文章来源：通盛网络人气：3428 次

　　一般来说，学做SEO优化，对于robots.txt文件还是需要了解的，这个文件在某些特殊的地方会发挥非常重要的作用，今天台州网络公司的SEO顾问就来和朋友说说robots.txt文件的具体写法和相对应的作用，内容如下：

　　robots.txt文件的具体写法和作用

　　禁止搜索引擎收录的方法

　　一.什么是robots.txt文件?

　　台州网络公司小编告诉您搜索引擎通过一种程序robot(又称spider)，自动访问互联网上的网页并获取网页信息。

　　您可以在您的网站中创建一个纯文本文件robots.txt，在这个文件中声明该网站中不想被robot访问的部分，这样，该网站的部分或全部内容就可以不被搜索引擎收录了，或者指定搜索引擎只收录指定的内容。

　　二. robots.txt文件放在哪里?

　　台州网络公司小编告诉您robots.txt文件应该放在网站根目录下。举例来说，当robots访问一个网站(比如http://www.abc.com)时，首先会检查该网站中是否存在http://www.abc.com/robots.txt这个文件，如果机器人找到这个文件，它就会根据这个文件的内容，来确定它访问权限的范围。

　　网站 URL 相应的 robots.txt的 URL

　　http://www.w3.org/ http://www.w3.org/robots.txt

　　http://www.w3.org:80/ http://www.w3.org:80/robots.txt

　　http://www.w3.org:1234/ http://www.w3.org:1234/robots.txt

　　http://w3.org/ http://w3.org/robots.txt

　　三. robots.txt文件的格式

　　"robots.txt"文件包含一条或更多的记录，这些记录通过空行分开(以CR,CR/NL, or NL作为结束符)，每一条记录的格式如下所示：

　　":"。

　　在该文件中可以使用#进行注解，具体使用方法和UNIX中的惯例一样。该文件中的记录通常以一行或多行User-agent开始，后面加上若干Disallow行,详细情况如下：

　　User-agent:

　　该项的值用于描述搜索引擎robot的名字，在"robots.txt"文件中，如果有多条User-agent记录说明有多个robot会受到该协议的限制，对该文件来说，至少要有一条User-agent记录。如果该项的值设为*，则该协议对任何机器人均有效，在"robots.txt"文件中，"User-agent：*"这样的记录只能有一条。

　　Disallow :

　　该项的值用于描述不希望被访问到的一个URL，这个URL可以是一条完整的路径，也可以是部分的，任何以Disallow 开头的URL均不会被robot访问到。例如"Disallow: /help"对/help.html 和/help/index.html都不允许搜索引擎访问，而"Disallow: /help/"则允许robot访问/help.html，而不能访问/help/index.html。

　　任何一条Disallow记录为空，说明该网站的所有部分都允许被访问，在"/robots.txt"文件中，至少要有一条Disallow记录。如果"/robots.txt"是一个空文件，则对于所有的搜索引擎robot，该网站都是开放的。

　　四. robots.txt文件用法举例

　　例1. 禁止所有搜索引擎访问网站的任何部分

　　下载该robots.txt文件 User-agent: *

　　Disallow: /

　　例2. 允许所有的robot访问

　　(或者也可以建一个空文件 "/robots.txt" file)

　　User-agent: *

　　Disallow:

　　例3. 禁止某个搜索引擎的访问

　　User-agent: BadBot

　　Disallow: /

　　例4. 允许某个搜索引擎的访问 User-agent: baiduspider

　　Disallow:

　　User-agent: *

　　Disallow: /

　　例5. 一个简单例子

　　在这个例子中，该网站有三个目录对搜索引擎的访问做了限制，即搜索引擎不会访问这三个目录。

　　需要注意的是对每一个目录必须分开声明，而不要写成 "Disallow: /cgi-bin/ /tmp/"。

　　User-agent:后的* 具有特殊的含义，代表"any robot"，所以在该文件中不能有"Disallow: /tmp/*" or "Disallow: *.gif"这样的记录出现.

　　User-agent: *

　　Disallow: /cgi-bin/

　　Disallow: /tmp/

　　Disallow: /~joe/

　　五. robots.txt文件参考资料

　　robots.txt文件的更具体设置,请参看以下资料：

　　· Web Server Administrator's Guide to the Robots Exclusion Protocol

　　· HTML Author's Guide to the Robots Exclusion Protocol

　　· The original 1994 protocol description, as currently deployed

　　· The revised Internet-Draft specification, which is not yet completed or implemented

　　说明

　　本站采取了一些简单的防盗设置,如果您对本站的文章感兴趣,请联系:youwen@gmail.com

　　在你的主页中为Web Robot设计路标

　　Internet越来越酷，WWW的知名度如日中天。在Internet上发布公司信息、进行电子商务已经从时髦演化成时尚。作为一个Web Master，你可能对HTML、Javascript、Java、 ActiveX了如指掌，但你是否知道什么是Web Robot?你是否知道Web Robot和你所设计的主页有什么关系?

　　Internet上的流浪汉--- Web Robot

　　有时你会莫名其妙地发现你的主页的内容在一个搜索引擎中被索引，即使你从未与他们有过任何联系。其实这正是Web Robot的功劳。Web Robot其实是一些程序，它可以穿越大量Internet网址的超文本结构，递归地检索网络站点所有的内容。这些程序有时被叫 “蜘蛛(Spider)” ， “网上流浪汉(Web Wanderer)”，“网络蠕虫(web worms)”或Web crawler。一些Internet网上知名的搜索引擎站点(Search Engines)都有专门的Web Robot程序来完成信息的采集，例如Lycos，Webcrawler，Altavista等，以及中文搜索引擎站点例如北极星，网易，GOYOYO等。

　　Web Robot就象一个不速之客，不管你是否在意，它都会忠于自己主人的职责，任劳任怨、不知疲倦地奔波于万维网的空间，当然也会光临你的主页，检索主页内容并生成它所需要的记录格式。或许有的主页内容你乐于世人皆知，但有的内容你却不愿被洞察、索引。难道你就只能任其“横行”于自己主页空间，能否指挥和控制Web Robot的行踪呢?答案当然是肯定的。只要你阅读了本篇的下文，就可以象一个交通警察一样，布置下一个个路标，告诉Web Robot应该怎么去检索你的主页，哪些可以检索，哪些不可以访问。

　　其实Web Robot能听懂你的话

　　不要以为Web Robot是毫无组织，毫无管束地乱跑。很多Web Robot软件给网络站点的管理员或网页内容制作者提供了两种方法来限制Web Robot的行踪：

　　1、Robots Exclusion Protocol 协议

　　网络站点的管理员可以在站点上建立一个专门格式的文件，来指出站点上的哪一部分可以被robot访问, 这个文件放在站点的根目录下，即robots.txt." target="_blank">http://.../robots.txt.

　　2、Robots META tag

　　一个网页作者可以使用专门的HTML META tag ，来指出某一个网页是否可以被索引、分析或链接。

　　这些方法适合于大多数的Web Robot，至于是否在软件中实施了这些方法，还依赖于 Robot的开发者，并非可以保证对任何Robot都灵验。如果你迫切需要保护自己内容，则应考虑采用诸如增加密码等其他保护方法。

　　使用Robots Exclusion Protocol协议

　　当Robot访问一个 Web 站点时，比如http://www.seotz.net/，它先去检查文件robots.txt" target="_blank">http://www.seotz.net/robots.txt。如果这个文件存在，它便会按照这样的记录格式去分析：

　　User-agent: *

　　Disallow: /cgi-bin/

　　Disallow: /tmp/

　　Disallow: /~joe/

　　以确定它是否应该检索站点的文件。这些记录是专门给Web Robot看的，一般的浏览者大概永远不会看到这个文件，所以千万不要异想天开地在里面加入形似类的HTML语句或是“How do you do? where are you from?”之类假情假意的问候语。

　　在一个站点上只能有一个 "/robots.txt" 文件，而且文件名的每个字母要求全部是小写。在Robot的记录格式中每一个单独的"Disallow"行表示你不希望Robot访问的URL，每个URL必须单独占一行，不能出现 "Disallow: /cgi-bin/ /tmp/"这样的病句。同时在一个记录中不能出现空行，这是因为空行是多个记录分割的标志。

　　User-agent行指出的是Robot或其他代理的名称。在User-agent行，'*' 表示一个特殊的含义---所有的robot。

　　下面是几个robot.txt的例子：

　　在整个服务器上拒绝所有的robots：

　　User-agent: *

　　Disallow: /

　　允许所有的robots访问整个站点：

　　User-agent: *

　　Disallow:

　　或者产生一个空的 "/robots.txt" 文件。

　　服务器的部分内容允许所有的robot访问

　　User-agent: *

　　Disallow: /cgi-bin/

　　Disallow: /tmp/

　　Disallow: /private/

　　拒绝某一个专门的robot：

　　User-agent: BadBot

　　Disallow: /

　　只允许某一个robot光顾：

　　User-agent: WebCrawler

　　Disallow:

　　User-agent: *

　　Disallow: /

　　最后我们给出 http://www.w3.org/站点上的robots.txt：

　　# For use by search.w3.org

　　User-agent: W3Crobot/1

　　Disallow:

　　User-agent: *

　　Disallow: /Member/ # This is restricted to W3C Members only

　　Disallow: /member/ # This is restricted to W3C Members only

　　Disallow: /team/ # This is restricted to W3C Team only

　　Disallow: /TandS/Member # This is restricted to W3C Members only

　　Disallow: /TandS/Team # This is restricted to W3C Team only

　　Disallow: /Project

　　Disallow: /Systems

　　Disallow: /Web

　　Disallow: /Team

　　使用Robots META tag方式

　　Robots META tag 允许HTML网页作者指出某一页是否可以被索引，或是否可以用来查找更多的链接文件。目前只有部分robot实施了这一功能。

　　Robots META tag的格式为：

　　象其他的META tag一样，它应该放在HTML文件的HEAD区：

　　...

　　Robots META tag指令使用逗号隔开，可以使用的指令包括 [NO]INDEX 和[NO]FOLLOW。INDEX 指令指出一个索引性robot是否可以对本页进行索引;FOLLOW 指令指出robot是否可以跟踪本页的链接。缺省的情况是INDEX和FOLLOW。例如：

　　最后台州网络公司小编总结一下：一个好的SEOer、一个好的Web 站点管理员应该将robot的管理考虑在内，使robot为自己的主页服务，同时又不损害自己网页的安全。今天有关robots.txt文件的内容就到此为止，希望对朋友们有所帮助。

　　总结：以上就是关于《【robots.txt】文件的具体写法和作用》的全部内容，希望对大家有所帮助。想了解更多有网站优化、搜索引擎排名、网站建设、网页设计的相关内容，请收藏本站及时关注本站更新。通盛网络官方网址：www.seotz.net
「网站优化」电话：13357671511
（备注：出于传播知识、信息的目的，本站部分文章、图片来源于网络，如有侵权请第一时间告知，小编核实后会立刻删除，不接受、不回复任何形式的恶意索赔。）

头条文章

如何优化网站单页呢？
　　php入门到就业线上直播课：进入学习　　Apipost ···
【椒江网络公司】浅谈：电子商务网站建设的几个技巧和要点
　　电子商务网站其实就是我们常说的电商网站。我们从百度搜索可···
电子商务网站建设的基本方案【黄岩SEO】
　　今天，【黄岩SEO】讲述一下电子商务网站的一个基本的建设···
椒江SEO为您分析：家电网站建设的风格与前台展现
　　大家都知道，网站前台和网站后台通常是相对于动态网站而言，···
企业网络推广如何快速获取核心关键词？
我相信每一个SEO人都会为更新企业网站的内容而头疼。每天添加···

【robots.txt】 文件的具体写法和作用

通盛网络

【robots.txt】文件的具体写法和作用