怎么让搜索引擎搜索不到

themass 2006-04-15 05:05:43

怎么让搜索引擎搜索不到,用户有一些敏感信息希望不被搜索引擎搜索到怎么做

...全文

163 7 打赏收藏转发到动态举报

写回复

用AI写文章

7 条回复

切换为时间正序

请发表友善的回复…

发表回复

niewenmin 2006-05-11

打赏
举报

bingdian37 2006-04-15

打赏
举报

登陆限制

BlueDestiny 2006-04-15

打赏
举报

李睿_Lee 2006-04-15

打赏
举报

另外，在IIS的日志里可以看到有哪些蜘蛛来过。

李睿_Lee 2006-04-15

打赏
举报

当Robot访问一个Web站点时，比如http://www.some.com/，它先去检查文件http://www.some.com/robots.txt。如果这个文件存在，它便会按照这样的记录格式去分析：　　User-agent: *Disallow: /cgi-bin/Disallow: /tmp/Disallow: /~joe/以确定它是否应该检索站点的文件。这些记录是专门给Web Robot看的，一般的浏览者大概永远不会看到这个文件。
　　在一个站点上只能有一个“/robots.txt”文件，而且文件名的每个字母要求全部是小写。在Robot的记录格式中每一个单独的“Disallow” 行表示你不希望Robot访问的URL，每个URL必须单独占一行，不能出现“Disallow: /cgi-bin/ /tmp/”这样的病句。同时在一个记录中不能出现空行，这是因为空行是多个记录分割的标志。
　　User-agent行指出的是Robot或其他代理的名称。在User-agent行，'*' 表示所有的Robot。
　　下面是几个robot.txt的例子：
　　在整个服务器上拒绝所有的robots：User-agent: *Disallow: /
　　允许所有的robots访问整个站点：User-agent: *Disallow: ；或者产生一个空的“/robots.txt”文件
　　服务器的部分内容允许所有的robot访问User-agent: *Disallow: /cgi-bin/Disallow: /tmp/Disallow: /private/
　　拒绝某一个专门的robot：User-agent: BadBotDisallow: /
　　只允许某一个Robot光顾：User-agent: WebCrawlerDisallow:User-agent: *Disallow: /
　　最后我们给出 http://www.w3.org/站点上的robots.txt：

　　# For use by search.w3.org
　　User-agent: W3Crobot/1
　　Disallow:
　　User-agent: *
　　Disallow: /Member/ # This is restricted to W3C Members only
　　Disallow: /member/ # This is restricted to W3C Members only
　　Disallow: /team/ # This is restricted to W3C Team only
　　Disallow: /TandS/Member # This is restricted to W3C Members only
　　Disallow: /TandS/Team # This is restricted to W3C Team only
　　Disallow: /Project
　　Disallow: /Systems
　　Disallow: /Web
　　Disallow: /Team
　　Robots META tag的格式为：
　　〈META NAME="ROBOTS" CONTENT="NOINDEX, NOFOLLOW"〉
　　像其他的META tag一样，它应该放在HTML文件的HEAD区：
　　〈html〉
　　〈head〉
　　〈meta name="robots" content="noindex,nofollow"〉
　　〈meta name="description" content="This page ...."〉
　　〈title〉...〈/title〉
　　〈/head〉
　　〈body〉
　　...

　　Robots META tag指令用逗号隔开，可以使用的指令包括[NO]INDEX和[NO] FOLLOW。INDEX指令指出一个索引性Robot是否可以对本页进行索引，FOLLOW指令指出Robot是否可以跟踪本页的链接。缺省的情况是INDEX和FOLLOW。例如：

　　〈meta name="robots" content="index,follow"〉
　　〈meta name="robots" content="noindex,follow"〉
　　〈meta name="robots" content="index,nofollow"〉
　　〈meta name="robots" content="noindex,nofollow"〉
　　在制作和维护Web时，应当考虑对Web Robot程序的管理。

当然，如果蜘蛛的设计者不遵循标准，以上方法就无法阻止了。

李睿_Lee 2006-04-15