sqoop数据导入到Hdfs 或者hive

用java代码调用shell脚本执行sqoop将hive表中数据导出到mysql

http://www.cnblogs.com/xuyou551/p/7999773.html

用sqoop将mysql的数据导入到hive表中

https://www.cnblogs.com/xuyou551/p/7998846.html

1：先将mysql一张表的数据用sqoop导入到hdfs中

准备一张表

需求将 bbs_product 表中的前100条数据导导出来只要id brand_id和 name 这3个字段

数据存在 hdfs 目录 /user/xuyou/sqoop/imp_bbs_product_sannpy_ 下

bin/sqoop import 
--connect jdbc:mysql://172.16.71.27:3306/babasport 
--username root 
--password root 
--query 'select id, brand_id,name from bbs_product where $CONDITIONS LIMIT 100' 
--target-dir /user/xuyou/sqoop/imp_bbs_product_sannpy_ 
--delete-target-dir 
--num-mappers 1 
--compress 
--compression-codec org.apache.hadoop.io.compress.SnappyCodec 
--fields-terminated-by '	'

ps：如果导出的数据库是mysql 则可以添加一个属性 --direct

 1 bin/sqoop import 
 2 --connect jdbc:mysql://172.16.71.27:3306/babasport 
 3 --username root 
 4 --password root 
 5 --query 'select id, brand_id,name from bbs_product  where $CONDITIONS LIMIT 100' 
 6 --target-dir /user/xuyou/sqoop/imp_bbs_product_sannpy_ 
 7 --delete-target-dir 
 8 --num-mappers 1 
 9 --compress 
10 --compression-codec org.apache.hadoop.io.compress.SnappyCodec 
11 --direct 
12 --fields-terminated-by '	'

加了 direct 属性在导出mysql数据库表中的数据会快一点执行的是mysq自带的导出功能

第一次执行所需要的时间

第二次执行所需要的时间（加了direct属性）

执行成功

2：启动hive 在hive中创建一张表

1 drop table if exists default.hive_bbs_product_snappy ;
2 create table default.hive_bbs_product_snappy(
3 　id int,
4 　brand_id int,
5   name string
6 )
7 ROW FORMAT DELIMITED FIELDS TERMINATED BY '	' ;

3：将hdfs中的数据导入到hive中

1 load data inpath '/user/xuyou/sqoop/imp_bbs_product_sannpy_' into table default.hive_bbs_product_snappy ;

4：查询 hive_bbs_product_snappy 表

1 select * from hive_bbs_product_snappy;

此时hdfs 中原数据没有了

然后进入hive的hdfs存储位置发现

注意：sqoop 提供了直接将mysql数据导入 hive的功能底层步骤就是以上步骤

创建一个文件 touch test.sql 编辑文件 vi test.sql

1 use default;
2 drop table if exists default.hive_bbs_product_snappy ;
3 create table default.hive_bbs_product_snappy(
4 id int,
5 brand_id int,
6 name string
7 )
8 ROW FORMAT DELIMITED FIELDS TERMINATED BY '	' ;

在启动hive的时候执行 sql脚本

bin/hive -f /opt/cdh-5.3.6/sqoop-1.4.5-cdh5.3.6/test.sql

执行sqoop直接导入hive的功能

 1 bin/sqoop import 
 2 --connect jdbc:mysql://172.16.71.27:3306/babasport 
 3 --username root 
 4 --password root 
 5 --table bbs_product 
 6 --fields-terminated-by '	' 
 7 --delete-target-dir 
 8 --num-mappers 1 
 9 --hive-import 
10 --hive-database default 
11 --hive-table hive_bbs_product_snappy

看日志输出可以看出在执行map任务之后又执行了load data

查询 hive 数据

相关阅读:
Python基础-time and datetime
Python基础-包
Python基础-常用模块
第四十七天Python学习记录
第四十四天Python学习记录
如何教你在NIPS会议上批量下载历年的pdf文档（另附04~14年NIPS论文下载链接）
如何用pdfbox-app-1.8.10.jar批处理将pdf文档转换成text文档
如何在Win10下设置图片的浏览方式为windows照片查看器
如何不通过系统升级来安装window10正式版？(特别针对Xp用户)
Mysql统计信息处理及binlog解释

原文地址：https://www.cnblogs.com/chengjun/p/8998414.html