Py數據基礎及實戰 11_第1頁
Py數據基礎及實戰 11_第2頁
Py數據基礎及實戰 11_第3頁
Py數據基礎及實戰 11_第4頁
Py數據基礎及實戰 11_第5頁
已閱讀5頁,還剩70頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

數據預處理數據清洗數據變換數據合并自動化預處理數據清洗數據清洗主要是刪除原始數據集中的重復數據,平滑噪聲數據,篩選掉與分析主題無關的數據,處理重復值、缺失值和異常值等。重復值處理缺失值處理異常值處理重復值處理1.記錄重復記錄重復是指數據中某條記錄的一個或多個屬性的值完全相同。在某企業的母嬰用品發貨記錄表中,包括母嬰用品名稱、品牌名稱兩個屬性。為查看所有品牌名稱,可利用列表(list)去重可以利用集合(set)的特性(元素唯一)去重得到的結果是:去重前的品牌總數為697,去重后的品牌總數為14。代碼冗長數據的排列順序發生改變?記錄重復pandas庫提供了一個名為drop_duplicates()的去重方法,此方法只對DataFrame或Series類型的數據有效。drop_duplicates()方法的基本使用格式如下。pandas.DataFrame.drop_duplicates(subset=None,*,keep=‘first’,inplace=False,ignore_index=False)參數名稱參數說明subset接收字符串或序列。表示進行去重的列。默認值為Nonekeep接收特定字符串。表示存在重復值時保留第幾個數據。first:保留第一個。last:保留最后一個。false:只要重復都不保留。默認值為firstinplace接收bool類型的值。表示是否在原表上進行操作。默認值為False記錄重復利用drop_duplicates()方法對母嬰用品發貨記錄表中的品牌名稱進行去重操作。利用drop_duplicates()方法去重利用drop_duplicates()方法對多列去重創建數組對象2.屬性內容重復屬性內容重復是指數據中存在兩個或多個屬性,它們的名稱不同,但數據完全相同。當需要去除連續型重復屬性時,可以利用屬性間的相似度,去除兩個相似度為1的屬性的其中一個。在pandas庫中計算相似度的方法有corr()方法,該方法支持pearson、spearman和kendall這3種計算相似度的方法,可以通過method參數調節,默認值為pearson。屬性內容重復利用kendall法求出母嬰用品發貨記錄表中“倉庫標簽”屬性和“品牌標簽”屬性的相似度矩陣,得到的相似度矩陣如下。通過相似度矩陣去重存在一個弊端,該方法只能對數值型重復屬性去重,類別型屬性之間無法通過計算相關系數來衡量相似度,因此無法根據相似度矩陣對其進行去重處理。

倉庫標簽品牌標簽倉庫標簽1.000000-0.003389品牌標簽-0.0033891.000000屬性內容重復使用pandas庫的DataFrame.equals()方法進行屬性去重。DataFrame.equals()方法的基本使用格式如下。pandas.DataFrame.equals(other)DataFrame.equals()方法常用的參數及其說明如下。參數名稱參數說明other接收Series或DataFrame。表示要與第一個內容進行比較的另一個Series或DataFrame。無默認值屬性內容重復使用DataFrame.equals()方法進行屬性去重,得到的前兩行兩列的屬性矩陣如下。再通過遍歷的方式篩選出完全重復的屬性。得到的結果是:需要刪除的列是[],刪除多余列后data的屬性數目為5。

母嬰用品名稱品牌名稱母嬰用品名稱TrueFalse品牌名稱FalseTrue缺失值處理1.拉格朗日插值法拉格朗日插值法的基本實現步驟如下。確定原始數據中的因變量和自變量。取缺失值前后各k個數據,將剔除缺失值后的2k個數據組成一組,再將剩下的數據依次排序,并基于拉格朗日插值多項式,對全部缺失值依次進行插補。缺失值處理2.牛頓插值法牛頓插值法的基本實現步驟如下。計算差商。計算牛頓插值多項式。利用所得多項式計算所需插入缺失部分的值。牛頓插值法也是多項式插值,但采用了另一種構造插值多項式的方法,與拉格朗日插值法相比,牛頓插值法具有承襲性和易于變動節點的特點。從本質上來說,兩者給出的結果是一樣的,只不過表示的形式不同。因此,在Python的SciPy庫中,只提供了拉格朗日插值法的函數,而如果要使用牛頓插值法,則需要自行編寫函數。牛頓插值法以某便利店一段時間的銷售額數據為例,數據示例如下表。根據拉格朗日插值法,使用缺失值前后各5個未缺失的數據對2025年5月5日的數據進行插補。插值后的結果如下。時間2025/05/012025/05/022025/05/032025/05/042025/05/052025/05/06銷售額(元)732135716501980

1170時間2025/05/072025/05/082025/05/092025/05/102025/05/112025/05/12銷售額(元)6006871570165021191383時間原始值插值2025/05/05

1806.928571異常值處理異常值是指樣本中的個別數值明顯偏離其余的觀測值。不加處理地將異常值包括進數據的計算分析過程中,會對結果產生不良影響。在數據預處理時,是否剔除異常值需視具體情況而定,因為有些異常值可能蘊含著有用的信息。異常值處理方法方法描述刪除含有異常值的記錄直接將含有異常值的記錄刪除視為缺失值將異常值視為缺失值,利用處理缺失值的方法進行處理平均值修正用前后兩個觀測值的平均值修正該異常值不處理直接在含有異常值的數據集上進行分析建模數據清洗數據變換數據合并自動化預處理數據變換數據變換主要是對數據進行函數變換、標準化、離散化和屬性構造等處理。將數據轉換成“適當的”形式,以滿足分析任務及算法的需要。簡單函數變換簡單函數變換是指對原始數據進行某些數學函數變換。平方開方取對數差分運算……簡單的函數變換常用于將不具有正態分布的數據變換成具有正態分布的數據,在時間序列分析中,有時簡單的對數變換或差分運算即可將非平穩序列轉換成平穩序列。數據標準化1.最小-最大標準化最小-最大標準化也稱離差標準化,是對原始數據的線性變換,將數值映射到[0,1]區間內,其計算公式如下。其中,max為樣本數據的最大值,min為樣本數據的最小值,max-min為極差。最小-最大標準化保留了原來數據中存在的關系,是消除量綱和數據取值范圍差異的簡單方法。這種處理方法的缺點是若數值集中某個數值很大,則規范化后大部分值會接近于0,并且將會相差不大。若遇到超過目前屬性[min,max]取值范圍的時候,會引起系統出錯,需要重新確定min和max。數據標準化2.零-均值標準化零-均值標準化也稱標準差標準化,經過處理的數據的均值為0,標準差為1,其計算公式如下。其中為原始數據的均值,為原始數據的標準差,零-均值標準化是當前用得較多的數據標準化方法。數據標準化3.小數定標標準化通過移動屬性值的小數位數,將屬性值映射到[–1,1]區間內,移動的小數位數取決于屬性值絕對值的最大值。小數定標標準化的轉化公式如下。數據標準化以某網店店主記錄的商品銷售數據為例,其數據集含有7個記錄、4個屬性,數據示例如下。對商品銷售數據中每一個屬性的取值分別用最小-最大標準化、零-均值標準化、小數定標標準化進行標準化操作。ColumnIndex0123065–52032128341122322–321–2325278–457–468–128335643269520244187–42763222515111532472–232161436013353211數據標準化得到的最小-最大標準化后的表如下。ColumnIndex012300.0687020.0000000.6784180.93190010.5038170.7511150.1263970.00000020.1679390.0562000.0000000.18822330.0000000.8492421.0000000.78558541.0000000.0829620.9458300.82659050.4198470.9384480.8082550.00072360.6641221.0000000.6904561.000000數據標準化得到的零-均值標準化后的表如下。ColumnIndex01230–0.937925–1.1540950.1821310.88635710.2810720.495732–1.226644–1.1858262–0.659908–1.030652–1.549214–0.7672923–1.1303980.7112671.0028200.56100941.671156–0.9718690.8645760.65218750.0458270.9072090.513479–1.18421960.7301761.0424080.2128521.037784數據標準化得到的小數定標標準化后的表如下。ColumnIndex012300.065–0.5200.3210.283410.1220.322–0.321–0.232520.078–0.457–0.468–0.128330.0560.4320.6950.202440.187–0.4270.6320.225150.1110.5320.472–0.232160.1430.6010.3350.3211數據離散化1.離散化的過程連續屬性的離散化就是在數據的取值范圍內設定若干個離散的劃分點,將取值范圍劃分為一些離散化的區間,最后用不同的符號或整數值代表落在每個子區間中的數據值。數據離散化涉及兩個子任務確定類別數將連續屬性值映射到這些類別中數據離散化2.常用的離散化方法等寬法:等寬法將屬性的值域分成具有相同寬度的區間,區間的個數由數據本身的特點決定或由用戶指定,類似于制作頻率分布表。等頻法:等頻法將相同數量的記錄放進每個區間。(一維)聚類(一維)聚類的方法包括兩個步驟,首先將連續屬性的值用聚類算法進行聚類,然后再對聚類得到的簇進行處理,合并到一個簇的連續屬性值做同一標記。聚類分析的離散化方法也需要用戶指定簇的個數,從而決定產生的區間數。數據離散化以某餐館員工的年齡數據為例,分別使用上述3種離散化方法對員工年齡數據進行屬性離散化的對比,數據示例如下。員工姓名葉亦凱張建濤莫子建易子歆郭仁澤唐莉年齡273325203546數據離散化分別用等寬法(左圖)、等頻法(中間圖)和(一維)聚類(右圖)對數據進行離散化的結果。獨熱編碼在處理數據時,經常會遇到類型數據,如性別分為男、女,手機運營商分為移動、聯通和電信。在這種情況下,通常會選擇將類型數據轉化為數值并代入模型,如0、1或–1、0、1,這些數值往往會被默認為連續型數值進行處理,然而這樣會影響模型的效果。獨熱編碼獨熱編碼即One-Hot編碼,又稱一位有效編碼,是處理類型數據較好的方法,主要使用N位狀態寄存器來對N個狀態進行編碼,每個狀態都有它獨立的寄存器位,并且在任意時候都只有一個編碼位有效。對于一個屬性,如果它有m個有限的可能取值,那么經過獨熱編碼后,就變成了m個二元屬性,并且這些屬性之間是互斥的,每一次都只有一個被激活,這時原來的數據經過獨熱編碼后會變成稀疏矩陣。性別男和女經過獨熱編碼后可以表示為10和01。獨熱編碼獨熱編碼的優點將離散型屬性的取值擴展到歐氏空間,離散型屬性的某個取值就對應歐氏空間的某個點。對離散型屬性使用獨熱編碼,可以讓屬性之間的距離計算更為合理。獨熱編碼在Python中,可以使用scikit-learn庫中preprocessing模塊的OneHotEncoder函數進行獨熱編碼,OneHotEncoder函數的基本使用格式如下。classsklearn.preprocessing.OneHotEncoder(*,categories='auto',drop=None,sparse_output=True,dtype=<class'numpy.float64'>,handle_unknown='error',min_frequency=None,max_categories=None,feature_name_combiner='concat’)獨熱編碼OneHotEncoder函數常用的部分參數及其說明。參數名稱參數說明categories接收array-like類型的值或auto。表示從訓練數據自動確定類別。默認值為autodrop接收first、if_binary或array-like。表示是否刪除“冗余列”以避免多重共線性。默認值為Nonesparse_output接收bool類型的值。表示返回稀疏矩陣還是數組。默認值為Truedtype接收字符串。表示期望的輸出類型。默認值為np.float64handle_unknown接收error、ignore或infrequent_if_exist。表示遇到訓練時未見過的類別如何處理:error:報錯;ignore:輸出全0列。默認值為None獨熱編碼采用OneHotEncoder函數進行獨熱編碼。數據清洗數據變換數據合并自動化預處理數據合并數據合并作為數據預處理中的重要組成部分。多表合并分組聚合多表合并是指通過堆疊合并、主鍵合并、重疊合并等多種合并方式,將關聯的數據信息合并在一張表中。根據某個或某幾個屬性對數據集進行分組,并對各組應用一個函數,無論是使用聚合函數還是使用轉換函數,都是數據分析的常用操作。多表合并1.堆疊合并數據堆疊就是簡單地將兩張表拼在一起,也被稱作軸向連接、綁定或連接。根據連接軸的方向,堆疊可分為橫向堆疊和縱向堆疊。堆疊合并數據橫向堆疊橫向堆疊即將兩張或多張表在x軸方向上拼接在一起,可以使用pandas庫的concat函數完成。concat函數的基本使用格式如下。pandas.concat(objs,*,axis=0,join='outer',ignore_index=False,keys=None,levels=None,names=None,verify_integrity=False,sort=False,copy=True)堆疊合并數據concat函數常用的部分參數及其說明。參數名稱參數說明objs接收多個Series、DataFrame的組合。表示參與連接的pandas對象的列表的組合。無默認值axis接收0或1。表示連接的軸。默認值為0join接收inner或outer。表示其他軸上的索引是按交集(inner)還是并集(outer)進行合并。默認值為outerignore_index接收bool類型的值。表示是否不保留連接軸上的索引,并產生一組新索引range(total_length)。默認值為Falsekeys接收序列。表示與連接對象有關的值,用于形成連接軸上的層次化索引。默認值為Nonelevels接收包含多個序列的列表。表示在指定keys參數后,指定用作層次化索引各級別上的索引。默認值為Nonenames接收列表。表示在設置了keys和levels參數后,用于創建分層級別的名稱。默認值為Noneverify_integrity接收bool類型的值。檢查新連接的軸是否包含重復項。如果發現重復項,那么將會引發異常。默認值為False堆疊合并數據當axis=1的時候,concat函數進行行對齊操作,將不同列名稱的兩張或多張表合并。當兩張表索引不完全一樣時,可以使用join參數選擇是內連接還是外連接。在內連接的情況下,僅僅返回索引重疊部分的數據。在外連接的情況下,則返回索引并集部分的數據,不足的地方則使用缺失值填補。堆疊合并數據某餐館有2025年8月28日和2025年8月29日一部分菜品的詳情數據,基于這份數據對索引完全相同的兩張表進行橫向堆疊,橫向堆疊前后的表大小如下。數據行數列數df1表325df2表324外連接橫向堆疊后的表329內連接橫向堆疊后的表329堆疊合并數據縱向堆疊縱向堆疊是將兩張或多張表在y軸方向上進行拼接。concat函數和append()方法都可以實現縱向堆疊。使用concat函數時,在默認情況下(即axis=0),concat進行列對齊操作,將不同行索引的兩張或多張表縱向合并。在兩張表的列名并不完全相同的情況下,可以使用join參數:取值為inner時,返回的僅僅是列名的交集所代表的列。取值為outer時,返回的是列名的并集所代表的列(右圖)。堆疊合并數據將索引不相同的表的縱向堆疊,縱向堆疊前后的表大小如下。數據行數列數df3表109df4表229內連接縱向堆疊后的表3218外連接縱向堆疊后的表018多表合并2.主鍵合并數據主鍵合并,即通過一個或多個鍵將兩個數據集的行連接起來,類似于SQL中的join。針對兩張包含不同屬性的表,將其根據某幾個屬性一一對應拼接起來,結果集的列數為兩個原數據集的列數和減去連接鍵的數量。主鍵合并數據pandas庫中的merge函數和join()方法都可以實現主鍵合并,但兩者的實現方式并不相同。merge函數的基本使用格式如下。pandas.merge(left,right,how='inner',on=None,left_on=None,right_on=None,left_index=False,right_index=False,sort=False,suffixes=('_x','_y'),copy=True,indicator=False,validate=None)主鍵合并數據merge函數常用的部分參數及其說明。參數名稱參數說明left接收DataFrame。表示要添加的新數據1。無默認值right接收DataFrame或Series。表示要添加的新數據2。無默認值how接收inner、outer、left或right。表示數據的連接方式。默認值為inneron接收字符串或序列。表示兩個數據合并的主鍵(必須一致)。默認值為Noneleft_on接收字符串或序列。表示left參數接收數據用于合并的主鍵。默認值為Noneright_on接收字符串或序列。表示right參數接收數據用于合并的主鍵。默認值為Noneleft_index接收bool類型的值。表示是否將left參數接收數據的index作為連接主鍵。默認值為Falseright_index接收bool類型的值。表示是否將right參數接收數據的index作為連接主鍵。默認值為Falsesort接收bool類型的值。表示是否根據連接鍵對合并后的數據進行排序。默認值為Falsesuffixes接收元組。表示當left和right參數接收數據列名相同時,為列名添加后綴。默認值為('_x','_y')主鍵合并數據以菜品詳情表和菜品信息表為例,使用merge函數對數據進行合并,合并前后的表大小如下表。數據行數列數meal(菜品詳情)表329info(菜品信息)表1612主鍵合并后的表2721主鍵合并數據join()方法也可以實現部分主鍵合并的功能。但是使用join()方法時,兩個主鍵的名字必須相同。join()方法的基本使用格式如下。pandas.DataFrame.join(other,on=None,how='left',lsuffix='',rsuffix='',sort=False,validate=None)主鍵合并數據join()方法常用的參數及其說明。參數名稱參數說明other接收DataFrame、Series或包含了多個DataFrame的列表。表示參與連接的其他DataFrame。無默認值on接收列名或包含列名的列表或元組。表示用于連接的列名。默認值為Nonehow接收特定字符串。取值為inner時代表內連接;取值為outer時代表外連接;取值為left時代表左連接;取值為right時代表右連接。默認值為leftlsuffix接收字符串。表示用于追加到左側重疊列名的尾綴。無默認值rsuffix接收字符串。表示用于追加到右側重疊列名的尾綴。無默認值sort接收bool類型的值。表示是否根據連接鍵對合并后的數據進行排序。默認值為False主鍵合并數據以菜品詳情表和菜品信息表為例,使用join()方法對數據進行主鍵合并,主鍵合并前后的表大小如下表。數據行數列數meal(菜品詳情)表329info(菜品信息)表1612主鍵合并表3221多表合并3.重疊合并數據重疊合并在其他工具或語言中并不常見,但是pandas庫的開發者希望pandas能夠解決幾乎所有的數據分析問題,因此提供了combine_first()方法來對數據進行重疊合并。重疊合并數據combine_first()方法的基本使用格式如下。pandas.DataFbine_first(other)combine_first()方法常用的參數及其說明。參數名稱參數說明other接收DataFrame。表示參與重疊合并的另一個DataFrame。無默認值重疊合并數據新建兩個DataFrame來進行重疊合并。IndexIDSystemCPU01win7i512win10i523NaNi534win10i745win10i756win7i567win10i578win7i789win8i3IndexIDSystemCPU01win7i512win10i523NaNNaN34win10i745NaNNaN56NaNNaN67win10i578win7i789win8i3IndexIDSystemCPU01win7i312NaNNaN23NaNi534NaNNaN45win10i756win7i567NaNNaN78NaNNaN89NaNNaN分組聚合pandas庫提供了一個靈活高效的groupby()方法,配合agg()方法、transform()方法或apply()方法,能夠實現分組聚合的操作。分組聚合的原理示例(右圖)。分組聚合1.使用groupby()方法拆分數據groupby()方法提供的是分組聚合步驟中的拆分功能,它能夠根據索引或屬性對數據進行分組,其基本使用格式如下。pandas.DataFrame.groupby(by=None,axis=0,level=None,as_index=True,sort=True,group_keys=_NoDefault.no_default,squeeze=_NoDefault.no_default,observed=False,dropna=True)[source]使用groupby()方法拆分數據groupby()方法常用的參數及其說明。參數名稱參數說明by接收列表、字符串、mapping或function。用于確定進行分組的依據。如果傳入的是一個函數,那么對索引進行計算并分組;如果傳入的是一個字典或Series,那么將字典或Series的值作為分組依據;如果傳入的是一個NumPy數組,那么將數組的元素作為分組依據;如果傳入的是字符串或字符串列表,那么將這些字符串所代表的屬性作為分組依據。默認值為Noneaxis接收int類型的值。表示操作的軸,默認對y軸進行操作,即默認值為0level接收int類型的值或索引名。表示標簽所在級別。默認值為Noneas_index接收bool類型的值。表示聚合后的聚合標簽是否以DataFrame索引形式輸出。默認值為Truesort接收bool類型的值。表示是否對分組依據、分組標簽進行排序。默認值為Truegroup_keys接收bool類型的值。表示是否顯示分組標簽的名稱squeeze接收bool類型的值。表示是否在允許的情況下對返回數據進行降維。默認值為False使用groupby()方法拆分數據以菜品詳情表為例,根據訂單編號對數據進行分組。分組后的結果并不能直接查看,而是被存在內存中,輸出的是內存地址。GroupBy對象常用的描述性統計方法及其說明。方法名稱說明方法名稱說明count計算分組的數目,包括缺失值cumcount對每個分組中的組員進行標記,標號為0~(n-1),n為組員個數head返回每組的前n個值size返回每組的大小max返回每組的最大值min返回每組的最小值mean返回每組的均值std返回每組的標準差median返回每組的中位數sum返回每組的和使用groupby()方法拆分數據基于某餐館的菜品詳情表,求分組后前5組每組的均值(左表)、標準差(中間表)、大小(右表)的結果。order_idcounts(菜品銷量)amounts(菜品售價)1761.527.51791.067.01804.04.02363.035.03221.089.0order_idcounts(菜品銷量)amounts(菜品售價)1760.70710728.9913781790.00000059.396970180NaNNaN236NaNNaN322NaNNaNorder_id大小17621792180123613221分組聚合2.使用agg()方法聚合數據agg()方法和aggregate()方法都支持對每個分組應用某函數,包括Python內置函數或自定義函數。agg()方法能夠對DataFrame對象進行操作是從pandas0.20開始的,在之前的版本中,agg()方法并無此功能。使用agg()方法聚合數據針對DataFrame的agg()方法與aggregate()方法的基本使用格式如下。pandas.DataFrame.agg(func=None,axis=0,*args,**kwargs)pandas.DataFrame.aggregate(func=None,axis=0,*args,**kwargs)agg()方法和aggregate()方法常用的參數及其說明。參數名稱參數說明func接收列表、字典或函數。表示應用于每行或每列的函數。無默認值為Noneaxis接收0或1。代表操作的軸。默認值為0使用agg()方法聚合數據以菜品詳情表為例,對當前數據使用agg()方法一次性求出所有菜品銷量和菜品售價的總和與均值。得到菜品銷量與菜品售價的總和與均值如下。以菜品詳情表為例,僅計算表中菜品銷量的總和與菜品售價的均值,此時需要使用字典的方式,將兩個屬性名分別作為字典的鍵,然后將NumPy庫的求和與求均值的函數分別作為字典的值。

得到的結果是:菜品銷量的總和為44,菜品售價的均值為48.84375屬性summeancounts(菜品銷量)44.0001.375amounts(菜品售價)1563.0000048.84375使用agg()方法聚合數據以菜品詳情表為例,使用agg()方法求不同屬性的不同數目統計量,如代碼421所示。得到菜品銷量總和與菜品售價的總和與均值如下。以菜品詳情表為例,可在agg()方法中通過傳入用戶自定義的函數來求菜品銷量兩倍總和。得到菜品銷量兩倍總和為88。屬性meansumcounts(菜品銷量)NaN44.0amounts(菜品售價)48.843751563.00000使用agg()方法聚合數據以菜品詳情表為例,可在agg()方法中,對數據使用含NumPy庫中的函數的自定義函數來求菜品銷量、菜品售價的兩倍總和。index(索引)序號counts(菜品銷量)0212223242數據counts(菜品銷量)amounts(菜品售價)菜品詳情表883126菜品詳情表的菜品銷量、菜品售價兩倍總和菜品詳情表前5行的菜品銷量兩倍總和使用agg()方法聚合數據以菜品詳情表為例,使用agg()方法也能夠實現對每一個屬性的每一組數據使用相同的函數。菜品詳情表分組后前3組每組的均值(左表)、標準差(右表)。以菜品詳情表為例,對分組后的菜品詳情表求取每組菜品銷量總數和菜品售價均值,得到前3組菜品銷量總數和菜品售價均值如下。order_idcounts(菜品銷量)amounts(菜品售價)1761.527.51791.067.01804.07.0order_idcounts(菜品銷量)amounts(菜品售價)1760.70710728.9913781790.00000059.396970180NaNNaNorder_idcounts(菜品銷量)amounts(菜品售價)176327.5179267.018047.0分組聚合3.使用apply()方法聚合數據apply()方法類似于agg()方法,能夠將函數應用于每一列。apply()方法傳入的函數只能夠作用于整個DataFrame或Series,而無法像agg()方法那樣能夠對不同的屬性應用不同的函數來獲取不同的結果。使用apply()方法聚合數據apply()方法的基本使用格式如下。pandas.DataFrame.apply(func,axis=0,raw=False,result_type=None,args=(),**kwargs)apply()方法常用的參數及其說明。參數名稱參數說明func接收函數。表示應用于每行或每列的函數。無默認值axis接收0或1。表示操作的軸。默認值為0raw接收bool類型的值。表示是否直接將ndarray對象傳遞給函數。默認值為Falseresult_type可選expand、reduce、broadcast、None。當axis=1時,expand:類似列表的結果將被轉換為列。reduce:如果可能,返回一個序列,而不是展開類似列表的結果。broadcast:結果將被廣播到DataFrame的原始形狀,原始索引和列將被保留。。默認值為None使用apply()方法聚合數據

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論