《大數據平臺部署與應用》 項目實施課件 項目6 部署與應用Sqoop_第1頁
《大數據平臺部署與應用》 項目實施課件 項目6 部署與應用Sqoop_第2頁
《大數據平臺部署與應用》 項目實施課件 項目6 部署與應用Sqoop_第3頁
《大數據平臺部署與應用》 項目實施課件 項目6 部署與應用Sqoop_第4頁
《大數據平臺部署與應用》 項目實施課件 項目6 部署與應用Sqoop_第5頁
已閱讀5頁,還剩28頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

部署Sqoop任務描述在使用Sqoop遷移中國工業產品產量數據之前,要先在平臺中部署Sqoop,在本任務中,小數將基于項目2中部署的Hadoop集群,在master虛擬機上部署Sqoop。任務環境已部署完全分布式Hadoop集群的CentOS7操作系統的虛擬機(主節點)。任務描述與任務環境目錄1解壓Sqoop下載Sqoop2修改Sqoop名稱3從Sqoop官網下載Sqoop安裝包“sqoop-1.4.7.bin__hadoop-2.6.0.tar.gz”。使用Xftp8遠程傳輸工具將Sqoop安裝包傳輸至master虛擬機/opt/software目錄下。下載Sqoop目錄1解壓Sqoop下載Sqoop2修改Sqoop名稱3在master虛擬機解壓安裝包sqoop-1.4.7.bin__hadoop-2.6.0.tar.gz至/opt/module目錄下。解壓操作完成后查看解壓目錄,結果中能夠看到“sqoop-1.4.7.bin__hadoop-2.6.0”,說明文件已解壓成功。解壓Sqoop目錄1解壓Sqoop下載Sqoop2修改Sqoop名稱3修改sqoop-1.4.7.bin__hadoop-2.6.0的名稱為sqoop-1.4.7。修改Sqoop名稱目錄4查看Sqoop版本修改配置文件5去除警告信息6執行“vim/etc/profile”命令進入文件中配置環境變量,在文件末尾添加Sqoop環境變量并保存退出。執行“source/etc/profile”命令使環境變量立即生效。修改配置文件進入Sqoop安裝目錄下的conf目錄中,復制sqoop-env-template.sh文件并重命名。執行“vimsqoop-env.sh”命令修改sqoop-env.sh文件內容:修改HADOOP_COMMON_HOME以設置Hadoop路徑修改HADOOP_MAPRED_HOME以設置hadoop-*-core.jar路徑在配置文件中HADOOP_COMMON_HOME和HADOOP_MAPRED_HOME是必須配置的,其他配置(如Hive和HBase等路徑)可以待后續需要時再進行添加。修改配置文件目錄4查看Sqoop版本修改配置文件5去除警告信息6查看Sqoop版本,若出現如下內容,則說明Sqoop部署成功。查看Sqoop版本在查看Sqoop版本時返回的日志信息中包含了多個警告信息,這些警告的出現是由于在當前Hadoop集群環境中,未在配置文件或環境變量中指定如HBase和Accumulo等路徑。由于這些警告信息不影響Sqoop的正常部署,因此可以不用對這些警告信息進行特別的處理或干預。目錄4查看Sqoop版本修改配置文件5去除警告信息6Sqoop在啟動時會去檢查配置文件和環境變量中是否有配置相關組件路徑,如果想去除這些警告,可以通過修改$SQOOP_HOME/bin/configure-sqoop文件。在文件中,對警告信息(HBase、HCatalog、Accumulo等路徑)進行注釋處理。去除警告信息再次查看Sqoop版本,可以發現警告已經去除成功。去除警告信息使用Sqoop實現中國工業產品產量數據遷移任務描述在部署好Sqoop之后,小需要配合數據遷移工程師,將散落在各個系統中的歷史工業產品產量數據遷移至大數據平臺,其中就包含在MySQL中的數據。在本任務中,小數將對大數據平臺進行測試,將MySQL數據庫中的中國工業產品產量數據遷移至HDFS上,并進行簡單的數據查詢操作。任務環境已部署完全分布式Hadoop集群的3臺CentOS7操作系統的虛擬機,且主節點已部署MySQL和Sqoop。任務描述與任務環境中國工業產量數據來源于國家統計局統計的1998-2022年的工業產量數據,該數據集包括指標、年份、產量3個特征,部分中國工業產量數據如下。數據示例指標年份產量筆記本計算機產量(萬臺)202222717.83鋼材產量(萬噸)2022134033.48集成電路產量(萬塊)202232418500轎車產量(萬輛)20221044.95水泥產量(萬噸)2022212927.18原鹽產量(萬噸)20225359.88中成藥產量(萬噸)2022244.66重軌產量(萬噸)2022355.49目錄1使用Sqoop遷移MySQL表數據至HDFS在MySQL中創建數據表2中國工業產品產量數據是存儲在某大型制造企業的系統數據庫里,此處模擬存儲在MySQL數據庫中。在MySQL中創建表的實現流程如下。在MySQL中創建數據表在MySQL中創建數據庫,數據庫名為sqoop_data,并查看所有數據庫。創建數據庫在準備創建數據表時,可以選擇不預先創建數據庫,而是直接在默認數據庫中建立數據表。這種方法雖然可行,但從數據管理的角度來看,它并非最佳方案。不創建獨立數據庫而直接在默認數據庫中構建數據表,可能會導致數據組織不夠清晰,從而在未來的數據維護、更新和檢索過程中帶來不便。因此,為了確保數據結構的合理性和管理的便捷性,建議在創建數據表之前先定義并創建相應的數據庫。使用“usesqoop_data;”命令切換到創建的數據庫sqoop_data。切換數據庫創建數據表industrail_product_output,表字段包括“指標”“年份”和“產量”3列。創建MySQL表在MySQL中,若表名或字段名涉及關鍵字、中文、特殊字符或標點符號時,通常會使用反引號將其括起來,確保能夠正常識別。查看表的字段及特征構成。創建MySQL表先將數據“1998-2022年中國工業產品產量.csv”上傳至master虛擬機/opt/data目錄下。通過load命令將數據導入創建好的表中導入數據至MySQL表中在將本地數據導入至MySQL中的數據表之前,應確保啟用了客戶端和服務器中的“local_infile”功能。啟動客戶端“local_infile”功能方法為在登錄MySQL時加上“--local_infile”參數,如“mysql-uroot-p123456--local_infile”;啟動服務器中的“local_infile”功能方法為進入MySQL后執行“setgloballocal_infile=ON;”命令。查看industrail_product_output表中的前10行數據。驗證數據是否導入成功目錄1使用Sqoop遷移MySQL表數據至HDFS在MySQL中創建數據表2啟動Hadoop集群,之后通過import命令把MySQL中的表數據導入到HDFS中。使用Sqoop遷移MySQL表數據至HDFS在Linux操作系統中,若需要將一段長代碼進行換行處理以提升可讀性或便于管理,可以在代碼行的末尾添加反斜杠符號“\”,這樣系統會認為命令尚未結束,從而允許將代碼延續到下一行。這種做法在處理復雜或長度超過終端窗口寬度的命令時尤為有用,通過恰當的換行,可以更有效地輸入、查看和編輯代碼,進而提高工作效率和代碼維護的便捷性。import命令參數說明。使用Sqoop遷移MySQL表數據至HDFS參數參數解釋參數--connect連接關系型數據庫的URL數據庫主機地址為master,端口號為3306,數據庫名稱為sqoop_data--driver指定JDBC驅動類的名稱com.mysql.cj.jdbc.Driver--username連接數據庫的用戶名root--password連接數據庫的密碼123456--table指定要導入的表industrail_product_output--target-dir指定數據將要存儲的目標目錄保存到HDF的/production_data/mysql_data--num-mappers指定并行度,即同時運行的Ma

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論