sqoop是一款在hadoop和關(guān)系數(shù)據(jù)庫服務(wù)器之間傳送數(shù)據(jù)的工具。
導(dǎo)入:mysql,oracle導(dǎo)入數(shù)據(jù)到hadoop的hdfs、hive、hbase等數(shù)據(jù)存儲系統(tǒng)。
導(dǎo)出:從hadoop的文件系統(tǒng)導(dǎo)出數(shù)據(jù)到關(guān)系數(shù)據(jù)庫。
工作機制:將導(dǎo)入導(dǎo)出命令翻譯成mapreduce程序來實現(xiàn)。對inputformat和outputformat的定制。
- 安裝
tar -zxvf sqoop-1.4.6.bin__hadoop-2.0.4-alpha.tar.gz
mv sqoop-1.4.6.bin__hadoop-2.0.4-alpha sqoop
cd conf
mv sqoop-env-template.sh sqoop-env.sh
export HADOOP_COMMON_HOME=/home/hadoop/apps/hadoop-2.6.4(which hadoop)
export HADOOP_MAPRED_HOME=/home/hadoop/apps/hadoop-2.6.4
export HIVE_HOME=/home/hadoop/apps/hive
加入mysql的jdbc驅(qū)動包
cp /home/hadoop/apps/hive/lib/mysql-connector-java-5.1.34_1.jar ./lib/(當(dāng)前目錄下的lib)
bin/sqoop help
- 從mysql數(shù)據(jù)庫服務(wù)器中表導(dǎo)入hdfs
$bin/sqoop import \
--connect jdbc:mysql://mini1:3306/test \
--username root \
--password root \
--table emp \
--m 1 (用幾個mapreduce跑)
默認(rèn)導(dǎo)到
$ $HADOOP_HOME/bin/hadoop fs -cat /user/hadoop/emp/part-m-00000
要導(dǎo)到指定位置加參數(shù):
--target-dir <new or exist directory in HDFS>
檢查導(dǎo)入:
$HADOOP_HOME/bin/hadoop fs -cat /queryresult/part-m-*
遠(yuǎn)程登錄mysql:mysql -h mini1 -uroot -proot
注意hosts的配置,必須每臺機器都配上,因為maptask(yarnchild)在不同的機器上,如果沒配好不能解析主機名。
- 導(dǎo)入關(guān)系表到hive
bin/sqoop import --connect jdbc:mysql://hdp-node-01:3306/test --username root --password root --table emp --hive-import --m 1
- 導(dǎo)入表數(shù)據(jù)子集
bin/sqoop import \
--connect jdbc:mysql://hdp-node-01:3306/test \
--username root \
--password root \
--where "city ='sec-bad'" \
--target-dir /wherequery \
--table emp_add --m 1
按需導(dǎo)入:
bin/sqoop import \
--connect jdbc:mysql://hdp-node-01:3306/test \
--username root \
--password root \
--target-dir /wherequery2 \
--query 'select id,name,deg from emp WHERE id>1207 and $CONDITIONS' \
--split-by id \
--fields-terminated-by '\t' \
--m 1
檢查:
$HADOOP_HOME/bin/hadoop fs -cat /wherequery/part-m-*
- 增量導(dǎo)入
bin/sqoop import \
--connect jdbc:mysql://hdp-node-01:3306/test \
--username root \
--password root \
--table emp --m 1 \
--incremental append \
--check-column id \
--last-value 1208
- 導(dǎo)出
1.建表
mysql> USE db;
mysql> CREATE TABLE employee (
id INT NOT NULL PRIMARY KEY,
name VARCHAR(20),
deg VARCHAR(20),
salary INT,
dept VARCHAR(10));
2.導(dǎo)出命令
bin/sqoop export \
--connect jdbc:mysql://hdp-node-01:3306/test \
--username root \
--password root \
--table employee \
--export-dir /user/hadoop/emp/
驗證:
mysql>select * from employee;
在實際應(yīng)用中把這些命令寫入shell腳本,通過azkaban這些作業(yè)調(diào)度工具來調(diào)度。