您的位置:首页 > 理论基础 > 计算机网络

Heritrix源码分析(十) Heritrix中的Http Status Code(Http状态码)(转)

2013-07-18 15:41 316 查看
本博客属原创文章,欢迎转载!转载请务必注明出处:http://guoyunsky.iteye.com/blog/649737

本博客已迁移到本人独立博客: http://www.yun5u.com/

欢迎加入Heritrix群(QQ):109148319,10447185, Lucene/Solr群(QQ) : 118972724

以前在做Web开发的时候就接触过一些HttpStatus Code,比如404,500.后来接触Heritrix之后才知道HttpStatus Code竟然有如此之多。不一样的HttpStatus Code就代表不一样的Http状态,简单的如成功、失败、重定向等。Heritrix自己也根据自己的需求增加了一些,同时由于Heritrix通过HttpClient去获取网络资源,其中一部分HttpStatus Code也来源于HttpClient,接下来我会逐个介绍。

有兴趣的朋友可以看下源代码中各个HttpStatus Code的不同应用场合和作用,可以说贯穿了真个抓取,设计得相当灵活。如只想大致了解下,可以参考org.archive.crawler.datamodel.FetchStatusCodes,里面有不同的HttpStatus Code以及英文注释。

序号Heritrix属性Heritrix属性值说明
1S_UNATTEMPTED0初始状态
2S_DNS_SUCCESS1DNS获取成功
3S_DOMAIN_UNRESOLVABLE-1DNS获取失败,该状态的URL会继续被抓取
4S_CONNECT_FAILED-2连接HTTP失败,该状态的URL会继续被抓取
5S_CONNECT_LOST-3连接HTTP掉线,该状态的URL会继续被抓取
6S_TIMEOUT-4连接HTTP超时,该状态的URL会继续被抓取
6S_RUNTIME_EXCEPTION-5运行意外,该状态的URL会记录在runtime-errors.log日志中
7S_DOMAIN_PREREQUISITE_FAILURE-6运行先决条件(也就是DNS)失败
8S_UNFETCHABLE_URI-7非法的URL,URL不符合规则。Heritrix也自定义了规则去限制URL
9S_TOO_MANY_RETRIES-8多次尝试都是失败,Heritrix可以让未成功的URL尝试多次
10S_DEFERRED-50该URL准备先获取先决条件URL(也就是DNS)
11S_UNQUEUEABLE-60没有通过调度器(Frontier)
12S_ROBOTS_PREREQUISITE_FAILURE-61获取DNS失败,被爬虫协议(robots.txt)拒绝
13S_OTHER_PREREQUISITE_FAILURE-62获取DNS失败的其他原因
14S_PREREQUISITE_UNSCHEDULABLE_FAILURE-63获取DNS失败,该Host不在范围中(也就是用户定义的Url抓取范围)
15S_GETBYNAME_SUCCESS1001通过URL获取IP成功
16S_SERIOUS_ERROR-3000严重错误,比如内存溢出
17S_DEEMED_CHAFF-4000完全无用,可忽视的URL
18S_TOO_MANY_EMBED_HOPS-4001超出层数限制,也就是抓取深度,这里是抽取出来的连接
19S_TOO_MANY_EMBED_HOPS-4002超出层数限制,也就是抓取深度,这里是嵌套的连接
20S_OUT_OF_SCOPE-5000URL超出范围
21S_BLOCKED_BY_USER-5001被用户拒绝,heritrix可以配置很多规则(Rule)去过滤一部分Url
22S_BLOCKED_BY_CUSTOM_PROCESSOR-5002在预处理模块被阻止
23S_BLOCKED_BY_QUOTA-5003超过抓取成本,Heritrix可以配置抓取一个URL的成本
24S_BLOCKED_BY_RUNTIME_LIMIT-5004超过抓取时间,Heritrix可以配置抓取一个URL的用时
25S_DELETED_BY_USER-6000被用户删除
26S_PROCESSING_THREAD_KILLED7000heritrix可以多线程抓取,用户可以删除线程,当前状态就表示运行该URL的线程被删除
27S_ROBOTS_PRECLUDED-9998被爬虫协议(robots.txt)拒绝
28
29
内容来自用户分享和网络整理,不保证内容的准确性,如有侵权内容,可联系管理员处理 点击这里给我发消息
标签: