Nutch1.7的deploy模式在伪分布式环境上报错
2014-02-13 17:35
106 查看
1.操作系统CentOS 6.5 x64
2.Hadoop平台为Cloudera CDH5 beta2,hadoop-2.2.0
3.开始操作:
Nutch1.7已经编译成功,把seed.txt上传到HDFS的urls目录中,目标目录crawl不存在;
在runtime/deploy下执行
hadoop jar apache-nutch-1.7.job org.apache.nutch.crawl.Crawl urls -dir crawl -depth 1 -topN 5
正常情况会在crawl目录下生成抓取数据,但是此时会报错:
Exception in thread "main" java.lang.IllegalArgumentException: Wrong FS: hdfs://localhost/work/nutch/crawl/crawldb/918962832, expected: file:///
at org.apache.hadoop.fs.FileSystem.checkPath(FileSystem.java:644)
at org.apache.hadoop.fs.RawLocalFileSystem.pathToFile(RawLocalFileSystem.java:79)
at org.apache.hadoop.fs.RawLocalFileSystem.deprecatedGetFileStatus(RawLocalFileSystem.java:506)
at org.apache.hadoop.fs.RawLocalFileSystem.getFileLinkStatusInternal(RawLocalFileSystem.java:722)
at org.apache.hadoop.fs.RawLocalFileSystem.getFileStatus(RawLocalFileSystem.java:501)
at org.apache.hadoop.fs.FileSystem.isDirectory(FileSystem.java:1412)
at org.apache.hadoop.fs.ChecksumFileSystem.rename(ChecksumFileSystem.java:496)
at org.apache.nutch.crawl.CrawlDb.install(CrawlDb.java:159)
at org.apache.nutch.crawl.Injector.inject(Injector.java:297)
at org.apache.nutch.crawl.Crawl.run(Crawl.java:132)
at org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:70)
at org.apache.nutch.crawl.Crawl.main(Crawl.java:55)
at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)
at sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:57)
at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)
at java.lang.reflect.Method.invoke(Method.java:606)
at org.apache.hadoop.util.RunJar.main(RunJar.java:212)
已知HDFS没有任何问题,自己编写的MR程序也可以运行,在第二个cloudera CDH4平台上也会报这个错
还未找到解决方案...
2.Hadoop平台为Cloudera CDH5 beta2,hadoop-2.2.0
3.开始操作:
Nutch1.7已经编译成功,把seed.txt上传到HDFS的urls目录中,目标目录crawl不存在;
在runtime/deploy下执行
hadoop jar apache-nutch-1.7.job org.apache.nutch.crawl.Crawl urls -dir crawl -depth 1 -topN 5
正常情况会在crawl目录下生成抓取数据,但是此时会报错:
Exception in thread "main" java.lang.IllegalArgumentException: Wrong FS: hdfs://localhost/work/nutch/crawl/crawldb/918962832, expected: file:///
at org.apache.hadoop.fs.FileSystem.checkPath(FileSystem.java:644)
at org.apache.hadoop.fs.RawLocalFileSystem.pathToFile(RawLocalFileSystem.java:79)
at org.apache.hadoop.fs.RawLocalFileSystem.deprecatedGetFileStatus(RawLocalFileSystem.java:506)
at org.apache.hadoop.fs.RawLocalFileSystem.getFileLinkStatusInternal(RawLocalFileSystem.java:722)
at org.apache.hadoop.fs.RawLocalFileSystem.getFileStatus(RawLocalFileSystem.java:501)
at org.apache.hadoop.fs.FileSystem.isDirectory(FileSystem.java:1412)
at org.apache.hadoop.fs.ChecksumFileSystem.rename(ChecksumFileSystem.java:496)
at org.apache.nutch.crawl.CrawlDb.install(CrawlDb.java:159)
at org.apache.nutch.crawl.Injector.inject(Injector.java:297)
at org.apache.nutch.crawl.Crawl.run(Crawl.java:132)
at org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:70)
at org.apache.nutch.crawl.Crawl.main(Crawl.java:55)
at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)
at sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:57)
at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)
at java.lang.reflect.Method.invoke(Method.java:606)
at org.apache.hadoop.util.RunJar.main(RunJar.java:212)
已知HDFS没有任何问题,自己编写的MR程序也可以运行,在第二个cloudera CDH4平台上也会报这个错
还未找到解决方案...
相关文章推荐
- centos下搭建单机和伪分布式hadoop环境-(2)下载安装所需软件+测试hadoop的单机模式
- 《设计模式--基于C#的工程化实现及扩展》 Security Design Pattern 系列 1 公钥体系与分布式环境要求
- centos下搭建单机和伪分布式hadoop环境-(3)配置hadoop的伪分布式模式
- 完全分布式模式的Hadoop环境搭建
- Hadoop集群完全分布式模式环境部署
- Hadoop集群完全分布式模式环境部署
- Hadoop分布式模式环境搭建
- 使用docker搭建hadoop环境,并配置伪分布式模式
- Hadoop 2.6.0 伪分布式模式环境搭建
- HBase单机模式与分布式环境搭建
- Hadoop集群完全分布式模式环境部署
- MAC下Hadoop环境配置(模拟分布式模式)
- Spark Standalone模式伪分布式环境搭建
- 攻城狮在路上(陆)-- hadoop分布式环境搭建(HA模式)
- hadoop初识之三:搭建hadoop环境(配置HDFS,Yarn及mapreduce 运行在yarn)上及三种运行模式(本地模式,伪分布式和分布式介)
- 《设计模式--基于C#的工程化实现及扩展》补充 Security Design Pattern 系列 1 公钥体系与分布式环境要求
- Linux环境Hadoop2.8.0搭建(单机模式-伪分布式模式)
- 《设计模式--基于C#的工程化实现及扩展》补充 Security Design Pattern 系列 1 公钥体系与分布式环境要求
- windows eclipse hadoop 集群开发环境搭建(分布式模式)
- Hadoop群集环境搭建-- 伪分布式模式