《數據倉庫與數據挖掘》課件 第2章 分布式數據倉庫_第1頁
《數據倉庫與數據挖掘》課件 第2章 分布式數據倉庫_第2頁
《數據倉庫與數據挖掘》課件 第2章 分布式數據倉庫_第3頁
《數據倉庫與數據挖掘》課件 第2章 分布式數據倉庫_第4頁
《數據倉庫與數據挖掘》課件 第2章 分布式數據倉庫_第5頁
已閱讀5頁,還剩15頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

第2章

分布式數據倉庫目錄2.1什么是Hive

2.2Hive用在哪里

2.3Hive與傳統數據倉庫的比較

2.4Hive的優缺點2.5Hive的功能與架構2.6Hive運行流程2.7Hive數據存儲模型2.8課后習題1.1

什么是Hive2.1什么是HiveHive是一個建立在Hadoop文件系統上的數據倉庫基礎架構,它提供了一系列工具,能夠對存儲在HDFS(Hadoop分布式文件系統)中的數據進行數據提取、轉換和加載(ETL),允許熟悉SQL的用戶查詢數據,同時也允許熟悉MapReduce的開發者開發mapper和reducer來處理復雜的分析工作。特性:(1)靈活方便的ETL(2)支持Tez、Spark等多種計算引擎(3)可直接訪問HDFS文件以及HBase(4)易用易編程2.2Hive用在哪里2.2Hive用在哪里Hive的最佳使用場合是大數據集的批處理作業,例如,網絡日志分析或者不同行業中的用戶行為分析、風險管理等多個方面。2.3Hive與傳統數據倉庫的比較1.2數據倉庫與傳統數據庫區別:1.2數據倉庫與傳統數據庫區別:2.4Hive的優缺點2.4Hive的優缺點Hive使用集群模式和超時重傳機制實現了高可靠和高容錯。2.4Hive的優缺點

但是,Hive本身也有一些缺點:(1)延遲高,因為MR本身延遲就高(2)不支持物化視圖(就是不能在試圖上進行增刪改,僅支持普通的查詢視圖)(3)不適用OLTP(4)只支持函數,不支持存儲過程2.5Hive的功能與架構2.5Hive的功能與架構Hive的功能結構:2.6Hive運行流程2.6Hive運行流程Hive的運行流程是一個復雜但高度優化的過程,它主要依賴于Hadoop的MapReduce框架或其他執行引擎(如Tez、Spark)來處理大規模數據,下圖給出了一個基本的工作流程:2.7Hive數據存儲模型2.7Hive數據存儲模型Hive的數據存儲模型是建立在Hadoop文件系統之上的,它提供了靈活的數據存儲方式,以支持大規模數據的存儲和分析。數據庫表表傾斜數據分區分區桶桶桶桶正常數據2.8

課后習題2.8課后習題1.請簡述Hive的基本概念及其在大數據處理中的作用。2.Hive的運行流程包括哪些主要階段?每個階段的主要任務是什么?3.請解釋Hive的三種部署方式:內嵌模式、本地模式和遠程模式,并說明它們的主要區別。4.簡述Hive數據存儲模型的主要組成部

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論