您的位置:首页 > 运维架构

sqoop导入数据至hive

2016-07-13 17:21 295 查看
使用sqoop导入数据至hive常用语句

    直接导入hive表

     sqoop import --connect jdbc:postgresql://ip/db_name--username user_name  --table table_name  --hive-import -m 5

    内部执行实际分三部,1.将数据导入hdfs(可在hdfs上找到相应目录),2.创建hive表名相同的表,3,将hdfs上数据传入hive表中

    sqoop根据postgresql表创建hive表

    sqoop create-hive-table --connect jdbc:postgresql://ip/db_name --username user_name  --table table_name  --hive-table hive_table_name( --hive-partition-key partition_name若需要分区则加入分区名称)

    导入hive已经创建好的表中

    sqoop import --connect jdbc:postgresql://ip/db_name --username user_name  --table table_name  --hive-import -m 5 --hive-table hive_table_name  (--hive-partition-key partition_name --hive-partition-value partititon_value);

    使用query导入hive表

    sqoop import --connect jdbc:postgresql://ip/db_name --username user_name  --query "select ,* from retail_tb_order where \$CONDITIONS"  --hive-import -m 5 --hive-table hive_table_name  (--hive-partition-key partition_name --hive-partition-value partititon_value);

    注意:$CONDITIONS条件必须有,query子句若用双引号,则$CONDITIONS需要使用\转义,若使用单引号,则不需要转义。

遇到问题

    若需要在导入hive数据表的前提下,再添加在原有关系型数据库中没有的一列数据如何解决。

    首先,我们想到的是添加一个partition可很方便的添加“一列”数据,partition的使用很类似普通一列,常用的sql执行是没有问题的。

    其次,想到在query的sql中添加一个常量或者一个变量,例如:”select 'hello',* from retail_tb_order where \$CONDITIONS“,执行后会报异常

    12/08/28 14:41:31 INFO tool.CodeGenTool: Beginning code generation

    12/08/28 14:41:31 INFO manager.SqlManager: Executing SQL statement: select 'hello',* from retail_tb_order where  (1 = 0)

    12/08/28 14:41:32 INFO manager.SqlManager: Executing SQL statement: select 'hello',* from retail_tb_order where  (1 = 0)

    12/08/28 14:41:32 ERROR orm.ClassWriter: Cannot resolve SQL type 1111

    12/08/28 14:41:32 ERROR orm.ClassWriter: Cannot resolve SQL type 1111

    12/08/28 14:41:32 ERROR orm.ClassWriter: No Java type for SQL type 1111 for column _column_

    12/08/28 14:41:32 ERROR orm.ClassWriter: No Java type for SQL type 1111 for column _column_

    12/08/28 14:41:32 ERROR orm.ClassWriter: No Java type for SQL type 1111 for column _column_

    12/08/28 14:41:32 ERROR orm.ClassWriter: No Java type for SQL type 1111 for column _column_

    12/08/28 14:41:32 ERROR orm.ClassWriter: No Java type for SQL type 1111 for column _column_

    12/08/28 14:41:32 ERROR orm.ClassWriter: No Java type for SQL type 1111 for column _column_

    12/08/28 14:41:32 ERROR sqoop.Sqoop: Got exception running Sqoop: java.lang.NullPointerException

    java.lang.NullPointerException

        at org.apache.sqoop.orm.ClassWriter.parseNullVal(ClassWriter.java:900)

        at org.apache.sqoop.orm.ClassWriter.parseColumn(ClassWriter.java:925)

        at org.apache.sqoop.orm.ClassWriter.generateParser(ClassWriter.java:999)

        at org.apache.sqoop.orm.ClassWriter.generateClassForColumns(ClassWriter.java:1314)

        at org.apache.sqoop.orm.ClassWriter.generate(ClassWriter.java:1138)

        at org.apache.sqoop.tool.CodeGenTool.generateORM(CodeGenTool.java:82)

        at org.apache.sqoop.tool.ImportTool.importTable(ImportTool.java:367)

        at org.apache.sqoop.tool.ImportTool.run(ImportTool.java:453)

        at org.apache.sqoop.Sqoop.run(Sqoop.java:145)

        at org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:65)

        at org.apache.sqoop.Sqoop.runSqoop(Sqoop.java:181)

        at org.apache.sqoop.Sqoop.runTool(Sqoop.java:220)

        at org.apache.sqoop.Sqoop.runTool(Sqoop.java:229)

        at org.apache.sqoop.Sqoop.main(Sqoop.java:238)

        at com.cloudera.sqoop.Sqoop.main(Sqoop.java:57)

    该问题出现原因是sqoop ClassWriter类会在postgresql表中解析sql中的所有列,当解析常量'hello'时,数据库没有该列也就找不到相应的数据类型。

    若要解决该问题应该需修改ClassWriter源码。

若有解决的q我
内容来自用户分享和网络整理,不保证内容的准确性,如有侵权内容,可联系管理员处理 点击这里给我发消息
标签: