您的位置：首页 > 运维架构 > 网站架构

网站下的robots

2015-08-20 10:54 471 查看

面试某软，被面试官问道：你做爬虫，知不知道很多网站下都有个robots文件？

    答曰：不知。

    于是面试官给我演示了一遍~

    遂卒。首战惨败。

    下来查了维基百科，基本了解robots。https://zh.wikipedia.org/wiki/Robots.txt

    比如必应搜索www.bing.com的根目录下有这么一个文件：http://www.bing.com/robots.txt，其内容如下：

User-agent: msnbot-media
Disallow: /
Allow: /shopping/$
Allow: /shopping$
Allow: /th?

User-agent: Twitterbot
Disallow:

User-agent: *
Disallow: /account/
Disallow: /bfp/search
Disallow: /bing-site-safety
Disallow: /blogs/search/
Disallow: /entities/search
Disallow: /fd/
Disallow: /history
Disallow: /hotels/search
...

这个文件的作用是，告诉搜索引擎该域名下那些文件能够爬取，哪些不行。

    下面摘自维基百科：



robots.txt（统一小写）是一种存放于网站根目录下的ASCII编码的文本文件，它通常告诉网络搜索引擎的漫游器（又称网络蜘蛛），此网站中的哪些内容是不应被搜索引擎的漫游器获取的，哪些是可以被漫游器获取的。因为一些系统中的URL是大小写敏感的，所以robots.txt的文件名应统一为小写。robots.txt应放置于网站的根目录下。如果想单独定义搜索引擎的漫游器访问子目录时的行为，那么可以将自定的设置合并到根目录下的robots.txt，或者使用robots元数据（Metadata，又称元数据）。

robots.txt协议并不是一个规范，而只是约定俗成的，所以并不能保证网站的隐私。注意robots.txt是用字符串比较来确定是否获取URL，所以目录末尾有与没有斜杠“／”表示的是不同的URL。robots.txt允许使用类似"Disallow:
*.gif"这样的通配符

转载请注明：康瑞部落 » 网站下的robots

内容来自用户分享和网络整理，不保证内容的准确性，如有侵权内容，可联系管理员处理

标签： 爬虫面试

相关文章推荐

新的分享

章节导航