版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領
文檔簡介
第八章基于支持向量機的路面狀況分類目
錄支持向量機算法定義支持向量機算法原理圖像及其特征010203支持向量機算法定義01支持向量機算法定義支持向量機(supportvectormachine,SVM)算法是一種監督學習算法,用來進行分類或者回歸,在深度學習被提出之前,一直是公認的、最優秀的分類算法,直至現在,支持向量機算法的使用率仍居高不下。支持向量機算法是由超平面定義的一種二分類模型,即能夠將不同類別的樣本在樣本空間分隔的超平面。(給定標記好的訓練數據,SVM算法輸出一個最佳分隔超平面,用來對新樣本進行分類)01支持向量機算法定義01圖中可以看出,分別使用了最近鄰KNN、決策樹、隨機森林和支持向量機SVM四種分類算法進行分類的效果,其中SVM的分類效果一直是比較好的。支持向量機算法定義01例:中國有南北方之稱,科學家根據各地的年降雨、溫度等因素,進行一系列的推算,最終決定以“秦嶺-淮河”為中國南北邊界線,從此人們就能根據“秦嶺-淮河”知道是南、是北了。各種氣候因素相當于SVM的訓練數據“秦嶺-淮河”這條最佳的南北分界線,相當于SVM算法找到的最佳分類超平面支持向量機算法原理02支持向量機算法原理支持向量機算法既可以用于分類任務中,也可以用于回歸任務中,其基本原理是將數據映射到高維空間中,找到一個超平面,使得不同類別的數據被分隔開來,同時最大化所有數據點到超平面的距離,這些離超平面最近的數據點被稱為支持向量。02支持向量機算法原理支持向量機算法的最終目的是用訓練數據集的間隔最大化找到一個最優分離超平面02超平面假設有5個男生和5個女生的身高、體重數據,將它們繪制成散點圖將已知的點劃分為圓形和“十”字形兩個部分,其中相接的部分直線就是支持向量機算法中的超平面。支持向量機算法原理支持向量機算法的最終目的是用訓練數據集的間隔最大化找到一個最優分離超平面02超平面加入頭發長度的數據時,輸入數據變成了三維此時需要一個二維平面,才能把數據分成兩個部分。當我們的數據點集為N維的時(意味著有N個特征),需要一個N-1維的平面才可以把數據分成兩個部分。支持向量機算法原理在使用支持向量機算法進行分類或者回歸的過程中,超平面的選擇可以有多個02超平面的選擇隨意畫出三條可以正確劃分男性和女性數據的直線,這些直線都是可以作為超平面的,因此超平面不是唯一的。支持向量機算法原理在使用支持向量機算法進行分類或者回歸的過程中,超平面的選擇可以有多個02超平面的選擇最佳的超平面選擇:在固定超平面的方向(圖中為直線的斜率)且不會錯誤分類樣本的時候移動超平面(圖中為上下移動直線),此時會在超平面的兩側找到兩個極限位置(越過該位置就會分錯數據),如圖所示,在兩條虛線中心(到兩虛線的距離相同)的實線就為該方向的最佳分類超平面。其中兩條虛線的垂直距離就是這個超平面的最大分類間距(margin)。支持向量機算法原理實際生活中,我們碰到的數據集大多是線性不可分的,需要對數據進行轉換。事實上,低維平面內不可分的數據放在一個高維空間中就有可能變得可分。理論上任意的數據樣本都能夠找到一個合適的映射,使得這些在低維空間不能劃分的樣本到高維空間中之后能夠線性可分,而這個映射就是核函數。02核函數圖像及其特征03圖像及其特征圖像是指由像素組成的二維或三維數據,可以是數字圖像、模擬圖像或計算機生成的圖像。數字圖像是一種特殊的圖像,它是由數字表示的圖像,通常以像素矩陣的形式存儲在計算機中。03圖像及其特征數字圖像由二維元素組成,每一個元素具有一個特定的位置和幅值,這些元素就稱為像素。像素(pixel)是picture和element這兩個字母的縮寫,是用來計算數字圖像的一種單位,是組成數字圖像的最小單位,比如對一幅標有1024像素×768像素的圖像而言,這幅圖像的長邊有1024個像素,寬邊有768個像素,1024×768=786432,即這是一幅具有近80萬像素的圖像。03數字圖像圖像及其特征在日常生活中,我們通常看到的彩色圖像中的每一個像素都是用三個字節來表示的,其中每個字節對應著R(紅色)、G(綠色)、B(藍色)分量的亮度。灰度圖像則是將亮度值量化為0~255共256個級別,每個像素是只有一個采樣顏色的圖像;0表示純黑色,255表示純白色,中間的數字從小到大表示由黑到白的過渡色。灰度化處理就是將一幅彩色的圖像轉化為灰度圖像的過程。03灰度圖像圖像及其特征在機器學習中,通常會對圖像進行處理并提取相應的特征之后再輸入模型中,這樣不僅能夠減少運算量,也可以達到提高模型性能的目的。常見的圖像特征:顏色特征、形狀特征和紋理特征等。圖像特征的提取方法:常用的紋理特征提取方法——灰度共生矩陣。03圖像特征提取方法圖像及其特征灰度共生矩陣(gray-levelco-occurrencematrix,GLCM)是一種基于灰度圖像的特征提取方法,其基本思想是統計圖像中像素灰度值之間的空間關系。通過計算灰度共生矩陣中的特征參數,如對比度、相關性、能量、熵、逆差矩等,可以有效地描述圖像的紋理信息。03圖像特征提取方法常用的特征參數二階矩對比度相關性熵逆差矩圖像及其特征03圖像特征提取方法二階矩二階矩也被稱為能量(energy),表示的是灰度共生矩陣中所有元素的平方和。其反映了圖像灰度分布的均勻程度和紋理粗細度。二階矩越大,表示圖像的紋理越粗糙,越復雜;二階矩越小,表示圖像的紋理越細。對比度對比度(contrast)反映了圖像的清晰度和紋理溝紋深淺的程度。紋理的溝紋深,其對比度大,效果清晰;反之,對比度小,則溝紋淺,效果模糊。圖像及其特征03圖像特征提取方法相關性相關性(correlation)表示灰度共生矩陣中像素之間的線性相關程度。相關性越大,表示圖像的紋理越趨向于線性。熵熵(entropy)表示灰度共生矩陣中像素對的不確定性程度。熵越大,表示圖像的紋理越復雜,紋理不均勻;熵越小,表示圖像的紋理越簡單,紋理比較均勻。逆差矩逆差矩(inversedifferencemoment)反映了圖像紋理局部特征變化的情況。當逆差矩越大,表示圖像的紋理越均勻;反之,逆差矩越小,表示圖像紋理越不均勻。感謝觀看!第九章基于樸素貝葉斯算法的店鋪評論分類目
錄樸素貝葉斯算法概述樸素貝葉斯算法原理文本分類數據預處理流程010203樸素貝葉斯算法概述01樸素貝葉斯算法概述樸素貝葉斯算法(naivebayesmodel)是一種基于貝葉斯定理與特征條件獨立假設的分類方法。它在假設數據特征之間相互獨立的條件下,使用已知的數據概率來對未知的數據進行分類。01以水果分類為例,假設一個水果的顏色、形狀、和大小三個特征分別是紅色、圓形、直徑4cm。當我們使用樸素貝葉斯算法判斷該水果是不是蘋果時,首先會假設這三個特征互相獨立、沒有依賴關系,然后再計算該水果是不是蘋果的概率。樸素貝葉斯算法原理02樸素貝葉斯算法原理貝葉斯定理是18世紀英國數學家托馬斯·貝葉斯(ThomasBayes)提出的重要概率論理論。貝葉斯定理的公式如下:02貝葉斯定理P(B|A)表示在已知特征A的情況下,事件B發生的概率,也稱為后驗概率;P(B|A)表示在已知事件B發生的情況下,特征A出現的概率,也稱為似然度;P(B)表示事件B的先驗概率,指在考慮特征A之前,事件B發生的概率;P(A)表示特征A的先驗概率,指在考慮事件B之前,特征A出現的概率。樸素貝葉斯算法原理例:已知某工廠生產次品的概率為10%,同時該工廠停電的概率為1%,停電時生產次品的概率為90%,那么當該工廠生產了次品的時候,停電的概率有多大?02貝葉斯定理在該例中,首先定義事件的概率,即設P(次品)表示生產次品的概率,即P(次品)=10%;設P(停電)表示工廠停電的概率,即P(停電)=1%;P(次品|停電)表示停電時生產次品的概率,即P(次品|停電)=90%;而該工廠生產次品時,停電的概率用P(停電|次品)表示,通過貝葉斯公式計算,停電的概率為:樸素貝葉斯算法原理在許多情況下,特征與特征之間可能存在關聯性,例如通過溫度、濕度、氣壓等特征判斷是否是晴天,如果溫度高,濕度就可能小,他們之間是存在關聯性的。在這種多特征、多類別的場景下,如果直接從有限的樣本中估計類別的概率往往會比較困難。02樸素貝葉斯算法原理樸素貝葉斯算法采用了“特征條件獨立性假設”,即假設樣本中的各個特征之間都是相互獨立的、互不關聯的,忽略特征之間的關聯性,使計算概率的過程更加簡單。樸素貝葉斯算法還需要估計先驗概率和條件概率,并利用貝葉斯定理計算后驗概率,樸素貝葉斯算法通常表現出很好的分類效果。樸素貝葉斯算法原理例:樸素貝葉斯算法實現文本分類(判斷是否為籃球運動)表中文本特征是文字形式的,計算機很難進行計算,通常會通過一些文本預處理的方式將文本特征轉成向量形式。如詞頻特征矩陣將文本特征中重復的詞去掉得到詞頻列表如[突破,扣籃,罰球,唱歌,跳舞],接著再轉為詞頻特征02樸素貝葉斯算法原理文本特征類別突破;扣籃True罰球;扣籃True唱歌;跳舞False樸素貝葉斯算法原理如果現在有[突破,罰球]這兩個特征,那么使用樸素貝葉斯算法去判斷該數據是否是籃球運動時,會得出以下公式。02樸素貝葉斯算法原理屬于籃球運動的概率為不屬于籃球運動的概率為所以最后將擁有[突破,罰球]特征的文本分為屬于籃球運動這一類型。文本分類數據預處理流程03文本分類數據預處理流程文本分類數據預處理是文本分類中比較重要且關鍵的過程,文本分類數據預處理的好壞直接影響著分類的效果。文本分類數據預處理可以幫助我們從原始文本分類數據中提取有用信息并去除無用信息,而不同的任務常常需要使用不同的預處理步驟和方法,來對文本分類數據進行預處理,為后續模型訓練和分析打下基礎。03常見的文本分類數據預處理步驟:文本分類數據預處理流程03常見的文本分類數據預處理步驟:01分詞將文本拆分成一個個單獨的單詞或詞組,以方便后續處理02去除停用詞將一些常見的,但是對分析用處不大的、無意義的字詞或者標點符號從文本中去除03文本特征提取從文本中提取有用的信息并將其作為模型的輸入特征04文本向量化將文本轉換為向量形式文本分類數據預處理流程分詞是實現文本分類的第一個步驟,指將一段文本按照一定的規則或算法進行切分,切分成一個個具有實際含義的詞匯單位。在英文中,單詞之間以空格作為自然分界符;而在漢語中,詞沒有一個形式上的分界符。也就是說,相比于英文,中文沒有詞與詞之間的分界符(如空格)。因此分詞是處理中文文本的首要步驟。03分詞文本分類數據預處理流程對于中文進行分詞可以使用jieba庫。jieba分詞庫是一個優秀的Python第三方中文分詞庫,常常用于對中文文本進行分詞。jieba分詞庫的分詞原理是利用中文詞庫來確定漢字之間的關聯概率,并將概率大的漢字組成詞組,形成最終的分詞結果。jieba分詞庫支持3種分詞模式:精確模式、全模式、搜索引擎模式。03分詞文本分類數據預處理流程03分詞分詞模式簡介特點切分結果精確模式對語句進行最精確的切分不存在冗余數據,能夠完整地把文本按照中文詞庫的標準完成拆分,比較適合文本分析全模式將語句中所有可能是詞的詞語都切分出來分詞速度很快,但是會存在冗余數據搜索引擎模式在精確模式的基礎上,對長詞再次進行切分提高召回率,適合用于搜索引擎分詞例:“冰墩墩是2022年北京冬季奧運會的吉祥物”文本分類數據預處理流程停用詞是指在文本分析中被忽略的一些常見詞語,例如“的”“了”“是”等。這些詞在文本中出現的頻率非常高,但通常不攜帶太多的語義信息,因此這些詞在文本分類中通常可以被忽略。忽略這些詞可以減少文本數據量,提高文本處理效率,同時可以避免這些無意義的詞對文本分類的影響。03去除停用詞文本分類數據預處理流程停用詞通常包括語氣助詞、連詞、代詞、介詞、冠詞、副詞等一些無實際意義的詞語。在文本分類中,常常使用停用詞表來忽略這些詞語。停用詞表可以是自己預定義的,也可以是根據具體的文本數據集來自動生成的。目前常用的中文停用詞表:03去除停用詞百度停用詞表哈工大停用詞表中文停用詞表文本分類數據預處理流程文本特征是指用于描述文本的屬性或特性,可以用于文本分類、情感分析、實體識別等任務。常見的文本特征提取包括詞頻(TF)、TF-IDF值等。詞頻特征是一種比較簡單文本特征,它指的是文本中每個詞出現的次數。因為每個文本一般都是由單詞所組成的,而每個單詞出現的次數在一定程度上又可以從側面反映該文章的內容。例:love這個詞出現的比較多,則可以猜測很大可能屬于情感類的文章。在處理文本類的信息時,詞頻特征是非常重要的信息之一。03文本特征提取文本分類數據預處理流程詞頻特征簡單易于理解,能夠從宏觀角度捕獲文本信息,但是詞頻特征往往會受到停止詞匯的影響(即停用詞),例如“的”“,”等,他們出現次數往往較多,容易影響文本的分析效果,所以在處理文本類型的數據時常常包含去停用詞這一部分操作。03文本特征提取文本分類數據預處理流程原因:計算機系統內部以二進制來表示、存儲和處理數據信息,即0、1兩種運算數字。在自然界中,能夠獲取到信息非常豐富、種類非常多,例如數值、字符、圖像、音頻等,而數值型的數據很容易夠轉成二進制的表示形式,但像字符類型(文本)的這種數據,計算機很難對其進行運算、存儲等。解決辦法:需要將詞匯轉化為計算機可識別的數值形式,即文本向量化。03文本向量化感謝觀看!第十章基于多層感知機的相冊分類目
錄感知機算法多層感知機算法圖像增廣010203感知機算法01感知機算法感知機算法最早是由美國學者FrankRosenblatt受到生物神經細胞的啟發于1957年提出的一種機器學習模型,它是一種二分類的線性分類模型,是神經網絡和支持向量機的基礎。感知機算法只有一個輸入層xi和一個輸出層y,它的學習能力非常有限,只能處理線性問題,很難解決復雜的非線性問題。01感知機算法感知機算法是一種最簡單的前饋神經網絡,其結構與生物的神經細胞結構類似。感知機算法是一個單個神經元的生物神經網絡,它的輸入可以有多個,并且每一個輸入都會有一個權重,通過讓輸入xi與權重wi相乘進行加權,然后進行求和得出一個值,如果這個值大于閾值θ,則輸出y=1;如果小于這個閾值則輸出y=0,其中0和1分別表示類別。01多層感知機算法02多層感知機算法多層感知機(multiLayerperceptron,MLP)算法是一種前饋神經網絡,是由感知機模型推廣而來。多層感知機算法是指由多個感知機組成的多層次的人工神經網絡。它克服了感知機不能對線性不可分數據進行識別的弱點。02組成:多層感知機算法通常由一個輸入層、多個隱藏層和一個輸出層組成,是神經網絡中的一種。規則:每一個圓圈表示一個神經元的節點,每一層神經元只接受來自前一層神經元的輸入(前一層可能是輸入層也可能是隱藏層),后面的層對前面層沒有信號反饋。輸入模式經過各層的順序傳播,最后在輸出層上得到輸出。圖像增廣03圖像增廣圖像增廣也可以稱為數據增強,是一種通過讓有限的數據產生更多的等價數據來人工擴展訓練數據集的技術,通常用在圖像數據的處理上。在數據集不足的情況下,對訓練圖像進行一系列的隨機變化之后,生成相似但不同的訓練樣本,從而擴大訓練集的規模。應用圖像增廣的原因除了數據量少之外,還可以隨機改變訓練樣本以減少模型對某些屬性的依賴,從而提高模型的泛化能力。03圖像增廣的概念圖像增廣圖像增廣的方法相當于在數據集上增加視角、位置方面的偏差,進而增強模型在這些方面的魯棒性,從而提高測試精度。03圖像增廣的常用方法圖像增廣的常用方法:圖像縮放圖像平移圖像旋轉圖像翻轉圖像增廣圖像縮放是對數字圖像的尺寸進行調整的過程,可以理解為對圖像進行拉伸或壓縮的操作。這是一種非平凡的過程,需要在處理效率以及結果的平滑度和清晰度上做一個權衡。當圖像的尺寸縮小后,它的平滑度將會增強。03圖像增廣的常用方法圖像增廣圖像平移是將一幅圖像中的所有像素點都按照給定的偏移量在水平方向(沿x軸方向)或垂直方向(沿y軸方向)移動,也就是說將圖像所有的像素坐標,分別加上指定的水平偏移量和垂直偏移量,是圖像幾何變換中較為簡單的一種變換。03圖像增廣的常用方法圖像增廣圖像旋轉是指圖像以某一點為中心旋轉一定的角度,形成一幅新的圖像的過程。圖像的旋轉變換一般以圖像中心為旋轉中心,圖像旋轉后不會變形,但其垂直對稱軸和水平對稱軸都會發生改變,其大小也一般會發生改變。03圖像增廣的常用方法圖像增廣圖像翻轉包括水平翻轉、垂直翻轉和水平垂直翻轉3種類型,在圖像翻轉過程中,翻轉只改變圖像的方向,并不改變圖像的大小,并且不是任意改變方向。03圖像增廣的常用方法垂直翻轉是指以圖像的垂直中軸線為坐標旋轉180°,翻轉之后原圖像的左半部分變到右邊,右半部分變到左邊水平翻轉是指以圖像的平行中軸線為坐標旋轉180°,翻轉之后將原圖像的上半部分變到下邊,下半部分變到上邊水平垂直翻轉是指水平翻轉和垂直翻轉同時進行的操作感謝觀看!第十一章智慧電商:基于多模型融合實現商品銷量預測目
錄Stacking算法概述Stacking算法流程GBDT算法概述GBDT算法原理01020304Stacking算法概述01Stacking算法概述集成學習是一種結合多個模型的預測結果,以得到比任何一個模型都更優、效果更好的預測結果的方法,作為集成學習三大類中的Stacking算法,通常基于多個不同的基學習器進行集成,因此又被稱為異質集成方法。Stacking算法被廣泛應用于各種領域,如金融、醫療、推薦系統等。在這些領域,Stacking算法已經成為一個強有力的工具,能夠提高預測準確性和穩定性。01Stacking算法概述Stacking算法是由Wolpert于1992年提出的一種分層模型的集成框架。其基本思想是先使用第一層初級學習器在原始數據上進行訓練,接著根據每個初級學習器的輸出結果來創建一個新的數據集,最后將新的數據集輸入元學習器中進行訓練,并將其輸出作為集成學習后的最終預測結果。01Stacking算法流程02Stacking算法流程對于一個問題來說,通常可以采用不同類型的學習器,如線性回歸、邏輯回歸、支持向量機等算法構建的學習器,來解決學習問題。這些學習器通常能夠學習到問題的一部分,但并不能學習到問題全部。Stacking集成方法的思想可以概括為:如果某個初級學習器錯誤地學習了特征空間的某個區域,那么元學習器通過結合其他初級學習器的學習行為,可以適當糾正這種錯誤。02Stacking算法流程Stacking集成方法的基本算法流程:02假設原始數據集D={(x1,y1),(x2,y2),…,(xn,yn)},將原始數據集D分為原始訓練集Dtrain和原始測試集Dtest兩部分,其中原始訓練集Dtrain用于訓練初級學習器,原始測試集Dtest用于測試元學習器。(1)選擇并構建多個初級學習器,例如構建邏輯回歸、支持向量機、KNN學習器等。(2)對于初級學習器1,利用K折交叉驗證的方法,在K-1折上訓練初級學習器,并在第K折上進行驗證,最終得到K個預測結果,將其組合為集合P1,作為初級學習器1的最終預測結果。(3)Stacking算法流程Stacking集成方法的基本算法流程:02對于初級學習器{2,3,…,m},重復步驟(2)的操作,得到預測結果集合P2,…,Pm。(4)將m個初級學習器的預測結果拼接為新數據集P={P1,P2,…,Pm},作為元學習器的訓練集數據并進行訓練,從而得到Stacking的最終模型。(5)最后將測試集Dtest輸入Stacking模型中進行測試與評估。(6)Stacking算法流程02(1)集成強學習器的優勢,以達到較高的分類準確率;(2)不需要太多的參數調整和特征篩選工作;(3)利于工程實踐、數學理論知識較少、容易理解、模型可擴展性高、對訓練數據利用更充分。優點(1)需要構建多個初級學習器模型,計算量往往較大、模型容易過擬合;(2)類似黑箱模型的特性,模型的可解釋性較弱。缺點GBDT算法概述03GBDT算法概述GBDT算法是gradientboostingdecisiontree(梯度提升決策樹)的縮寫,最早由Friedman于2001年提出,屬于有監督學習中的一種算法。GBDT算法是一種迭代的決策樹算法,是集成學習中Boosting方法的成員之一。03GBDT算法概述Boosting方法在訓練基學習器時采用的是串行的方式,其基本思路是將基學習器進行層層疊加,其中每一層基學習器在訓練的時候,會對前一層基學習器分錯的樣本,根據其學習誤差調整訓練集的權重,給予更高的權重,最后根據各層學習器結果的加權得到最終模型。03GBDT算法原理04GBDT算法原理GBDT算法是一種不斷進行迭代的決策樹算法,既可以用于解決分類問題也可以用于解決回歸問題,采用決策樹作為基學習器。GBDT算法的主要流程:04初始化第一個基學習器,該基學習器是一個只有根節點的決策樹建立M個基學習器,計算出損失函數的負梯度在當前模型的值,將它們作為殘差的估計創建一顆回歸樹CART來擬合這個殘差在擬合后的樹的葉子節點找到一個盡可能的減小損失的值并更新學習器GBDT算法原理例:假設有一組數據集為編號、年齡、體重、身高4列。其中,年齡、體重作為特征(輸入變量),身高作為目標變量特征,即需要預測的值。04編號年齡/歲體重/kg身高/m15201.127301.3321701.7430601.852565?GBDT算法原理GBDT算法步驟:04(1)初始化損失函數式子如下。其中,式子中的yi為目標變量。損失函數選擇為平方損失函數,然后直接對式子進行求導并另導數等于零,求c的值,即c的值為編號1~編號4的身高均值。身高初始化學習器的結果如下。GBDT算法原理GBDT算法步驟:04(2)建立M顆分類回歸樹,m=1,2,3,…,M,進行迭代訓練。a.計算負梯度,由于選擇的損失函數為平方損失函數,所以負梯度就是殘差,其式子如下:編號年齡/歲體重/kg身高/m1520-0.3752730-0.175321700.225430600.3251520-0.375表格為使用身高-初始化學習器的結果c得出的結果構成新的數據集GBDT算法原理GBDT算法步驟:04(2)建立M顆分類回歸樹,m=1,2,3,…,M,進行迭代訓練。b.對于i=1,2,3,…,N利用CART擬合數據(xi,rm,i),得到第m棵回歸樹,其對應的葉子節點區域為Rm,j,其中j=1,2,3,…,Jm,且Jm為第m棵回歸樹葉子節點的個數。c.對于Jm個葉子節點區域,j=1,2,3,…,Jm,計算出最佳擬合值。GBDT算法原理GBDT算法步驟:04(2)建立M顆分類回歸樹,m=1,2,3,…,M,進行迭代訓練。d.更新學習器Fm(x)。(3)得到強學習器FM(x)的表達式為感謝觀看!第十二章智慧風控:基于多模型融合實現電信客戶流失預警目
錄XGBoost算法概述XGBoost算法原理XGBoost算法的優缺點010203XGBoost算法概述01XGBoost算法概述XGBoost(extremegradientboosting,XGBoost)算法又叫極度梯度提升樹,是集成學習中Boosting算法中的一種實現方式。該算法是基于GBDT算法的一種高效實現,能夠在大規模數據集上運行,并具有很強的泛化能力。XGBoost算法被廣泛應用于數據挖掘、自然語言處理、計算機視覺和推薦系統等領域,成為許多數據科學家和機器學習工程師的首選算法之一。01XGBoost算法概述XGBoost算法由華盛頓大學的陳天奇博士提出,最開始是分布式機器學習研究社區小組的研究項目之一,后來在希格斯機器學習挑戰賽(HiggsBosonMachineLearningChallenge,一個由Kaggle組織舉辦的機器學習競賽)中大放異彩,被業界所熟知并廣泛使用。在工業界,目前,一些主流的互聯網公司如騰訊、阿里巴巴等都已將XGBoost算法應用到其業務中;在各種數據科學競賽中,XGBoost算法也成為參賽選手的首選模型之一,幫助了許多競賽者在賽場上取得優異的成績。01XGBoost算法原理02XGBoost算法原理XGBoost算法是一個開源框架,是在GBDT算法的基礎上對Boosting算法進行的改進。在GBDT算法中,模型學習的是損失函數的梯度;在XGBoost算法中,模型學習的則是損失函數的二階泰勒展開的差值;XGBoost算法在代價函數里加入了正則項,用于控制模型的復雜度,這樣在保證高精度的同時又保證了極快的速度。02XGBoost算法原理XGBoost算法的核心思想:02通過不斷添加決策樹,不斷進行特征分裂來生長一棵樹,每次添加一棵決策樹,其實是學習一個新函數,去擬合上次預測的殘差。當訓練完成得到k棵決策樹后,要預測一個樣本的分數,就是根據該樣本的特征,在每棵樹中會落到對應的一個葉子節點,每個葉子節點就對應一個分數。最后將每棵樹對應的分數進行相加,從而得到該樣本的預測值。123XGBoost算法原理XGBoost模型訓練的主要流程:確定模型形式、設定目標函數、模型優化。02(1)首先是確定模型形式。假設有一個n條樣本、m個特征的原始數據集D={(x1,y1),(x2,
y2),…,(xi,yi)},其中,xi為第i個特征向量,yi為第i個樣本的真實值;而XGBoost模型是由多個
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
- 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
- 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
- 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 6.2 民主政治不斷發展教學設計2026-2027學年統編版道德與法治九年級上冊
- 法醫DNA練習題及答案呈現
- 農行財務工作總結
- 青島崗位轉正考試題目及解答
- iwe材料試題及答案
- oracle試題以及答案otg
- 應用翻譯試題及答案
- 2025屆下花園區數學四年級第二學期期中檢測試題含解析
- 2025-2026學年黟縣數學四年級第二學期期中達標檢測試題(含答案)
- 2026年度車險試題及詳細答案
- 夜間施工方案及安全措施
- 退伍留疆考試題庫及答案
- 2025至2030全球及中國鋰離子電池保護集成電路行業發展趨勢分析與未來投資戰略咨詢研究報告
- 政法維穩工作課件
- 園區車輛安全管理培訓課件
- 《農業技術推廣》課件
- 啤酒市場營銷策略考核試卷
- 安全環保主管競聘
- 檢測合同三方協議
- 小兒隱匿性陰莖手術
- 《稻草人》閱讀指導課件
評論
0/150
提交評論