您的位置：首页 > 其它

Nutch 一般工作流程

2014-04-09 17:26 148 查看

sequence of batch operations

1. inject -> populates CrawlDB from seed list

2. Generate -> Selets URLS to fetch in segment

3. Fetch -> Fetches URLs from segment

4. Parse -> Parses content(text + metadata)

5. UpdateDB -> Updates CroawlDB(new URLs, new status...)

6. InvertLinks -> Build Webgraph

7. SOLR Index -> Send docs to SOLR

8. SOLR Dedup -> Remove duplicate docs based on signature

Repeat steps 2 to 8

Or use the all-in-one crawl script

内容来自用户分享和网络整理，不保证内容的准确性，如有侵权内容，可联系管理员处理

标签：

相关文章推荐

nutch的基本工作流程理解
Nutch爬虫工作流程及文件格式详细分析
Nutch工作流程-说明性文档
爬虫调研II：Nutch的工作流程和扩展性
使用Git工作的一般流程
爬虫调研II：Nutch的工作流程和扩展性
Nutch爬虫工作流程及文件格式详细分析
Nutch工作流程
分析Nutch的工作流程
Nutch爬虫工作流程及文件格式详细分析
Nutch爬虫工作流程及文件格式详细分析
使用Git工作的一般流程
[网摘]Nutch的工作流程
nutch的基本工作流程理解
Git工作的一般流程
Git工作的一般流程
转：cygwin简单应用及Nutch之Crawler工作流程
机器学习入门报告之解决问题一般工作流程
Nutch工作流程
Nutch1.7学习笔记2：基本工作流程分析

新的分享

一次教科书级别的Redis高可用架构设计实践 - Redis
曾光：北京这次的毒株不像国内流行类型
从PRD文档到产品上线，有哪些问题需要解决？
vue3自定义指令的使用
Oracle SQL性能优化最常用的40条建议 - ORACLE
程序员翻车常见反应，你中枪了吗？ - 职场生涯
新鲜开源：基于Prometheus的企业监控平台设计与实现 - 运维
嵌入式软件开发之程序架构设计-任务调度
【Java面试】请简单说一下你对受检异常和非受检异常的理解
奇安信更新招股书：第一季亏损过5亿，齐向东持股38%
艾瑞咨询：2020年中国后智能厨房案例研究报告
艾瑞咨询：2020年中国人工智能+物流发展研究报告

章节导航