管理統計SPASS第11章主成分分析與因子分析_第1頁
管理統計SPASS第11章主成分分析與因子分析_第2頁
管理統計SPASS第11章主成分分析與因子分析_第3頁
管理統計SPASS第11章主成分分析與因子分析_第4頁
管理統計SPASS第11章主成分分析與因子分析_第5頁
已閱讀5頁,還剩65頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

第11章主成分分析與因子分析

在實際問題中,我們設計調查表,收集到大量指標(變量)數據,但這些指標間通常不是相互獨立,而是相關的。此時,為了簡化問題,我們就可以運用主成分分析法,在眾多的指標中找出少數幾個綜合性指標,來反映原來指標所反映的主要信息(即,絕大部分的方差),實現簡化問題的目的。例如,企業的利潤、成本、市場占有率等是明顯相關的;某地區的企業數、GDP、物流量、信息量等也是明顯相關的;一組青年中人的年齡、身高、肺活量等指標之間,通常也存在著相關性。對這些相關性較強的指標,可通過主成分分析法實現復雜問題的簡單化。一、主成分分析基本概念

主成分(Principalcomponents)分析是把給定的一組變量,通過線性變換,轉化為一組不相關的變量。在這種變量的轉化過程中,變量的總方差(的方差之和)保持不變。同時,使具有最大方差,稱為第一主成分;具有次大方差,稱為第二主成分。依次類推,原來有k個變量,就可以轉換出k個主成分。但在實際應用中,為了簡化問題,通常不是找出k個主成分,而是找出q(q<k)個主成分就夠了,只要這q個主成分反映出原來k個變量的絕大部分的方差就行。

調查n個個體(樣本)在k個指標下的數值(或者用

k個指標來評價n個對象),就可得到數據矩陣:

統計描述現在的目的是要求解出,使得即簡記為向量Y滿足如下條件:指標

之間不相關。方差盡可能大,即對n

個對象的分辨率盡可能強,信息損失盡可能的少。主成分分析小結:(1)從相關的多個指標中,求出相互獨立的多個指標。(2)的方差信息不損失,盡可能等同于的方差。

X

與Y

的轉換關系為:幾何解釋

在下圖的坐標中,散點大致為橢圓狀。經過線性變換可以得到新的坐標。在橢圓的長軸上,反映出了散點在這個方向的最大方差。在橢圓的短軸上,反映出了散點在這個方向的方差。主成分的計算流程步驟一:對矩陣而言(它是k階的實對稱矩陣),首先找到它的k個實特征根。步驟二:相應的k個長度為1的、相互正交的特征向量,

即特征向量矩陣為式中,,。

主成分的計算流程步驟三:按如下方法得到主成分:式中,。是相互正交的綜合變量。將k個主成分放到一起可得矩陣表達式:主成分的計算流程主成分更為明晰的表達式:

主成分的計算流程結語:若從中只取q個,就能使則,就是體現了原來多指標下數據主要信息的少數幾個綜合性指標,就是我們要找的主成分。主成分分析實例例1:全國經濟發展基本情況的指標主要有八項:GDP、居民消費水平、固定資產投資、職工平均工資、貨物周轉量、居民消費價格指數、商品零售價格指數、工業總產值,現收集有全國30個省市自治區的相關指標(見例),請用主成分分析方法選出適當的指標項。二、因子分析

方法概述

人們在研究實際問題時,往往希望盡可能多的收集相關變量,以期望對問題有比較全面、完整的把握和認識。為解決這些問題,最簡單和最直接的解決方案是減少變量數目,但這必然又會導致信息丟失或不完整等問題。為此,人們希望探索一種有效的解決方法,它既能減少參與數據分析的變量個數,同時也不會造成統計信息的大量浪費和丟失。因子分析就是在盡可能不損失信息或者少損失信息的情況下,將多個變量減少為少數幾個因子的方法。這幾個因子可以高度概括大量數據中的信息,這樣,既減少了變量個數,又同樣能再現變量之間的內在聯系。

二、因子分析因子分析方法是利用各變量間存在一定的相關關系,用較少的綜合指標分別綜合存在于各變量中的相關關系,而綜合指標之間彼此不相關,即各指標代表的信息不重疊。代表各類信息的綜合指標就稱為因子變量或公因子。這種方法能以較少的因子變量和最小的信息損失來解釋變量之間的結構。因子分析概述因子變量的特點:(1)因子變量的數量遠少于原有變量的數量,對因子變量的分析可以減少分析中的計算工作量。(2)因子變量并不是原有變量簡單的取舍,而是對原始變量的重新組構,他們能夠反映原始眾多變量的絕大部分信息,不會產生重要信息的丟失。(3)因子變量之間沒有線性相關關系,對因子變量的分析就能避開原始變量的共線性問題,使研究工作更加簡便。(4)因子變量具有命名解釋性。因子變量的命名解釋性可以理解為某個因子變量是對某些原始變量的總和,它能夠反映這些原始變量的絕大部分信息。因此我們可以對因子變量根據專業知識和其所反映的獨特含義給予命名。因子分析概述因子分析的主要應用有兩方面:一是尋求基本結構,簡化觀測系統,將具有錯綜復雜關系的變量綜合為少數幾個因子(不可觀測的,相互獨立的隨機變量),以再現因子與原始變量之間的內在聯系;二是用于分類,對p個變量或n個樣本進行分類。因子分析概述因子分析根據研究對象可以分為R型和Q型因子分析:R型因子分析研究變量之間的相關關系,通過對變量的相關陣或協差陣內部結構的研究,找出控制所有變量的幾個公共因子,用以對變量或樣本進行分類。Q型因子分析研究樣本之間的相關關系,通過對樣本的相似矩陣內部結構的研究找出控制所有樣本的幾個主因子。這兩種因子分析的處理方法一樣,只是出發點不同。R型從變量的相關陣出發,Q型從樣本相似陣出發。因子分析實例為了了解青年對婚姻家庭的態度,隨機訪問了100人,詢問了30個問題,把這些問題歸結于不可測的因子變量,即對外型的重視、對孩子的教育觀點、對家庭的重視、對金錢的重視等其它方面,因子分析的目的就是要建立一個模型,用這些不可測的、所有原始變量共有的因子變量和一些每個原始變量所特有的特殊因子來描述可測的原始變量,進而分析和解釋青年人對婚姻家庭的態度。因子模型描述如下:因子分析模型因子分析模型那么因子分析模型可以構造成:因子分析模型則稱上式為因子模型,它的矩陣形式為:其中矩陣是待估系數矩陣,稱為因子載荷矩陣,系數a11稱為變量X1在因子F1上的載荷。稱F1,F2,…,Fm為的公共因子,它一般對X每一個分量Xi都有作用;稱為的X1特殊因子,它起著殘差的作用,只對X1起作用因子分析模型因子模型的四個關鍵性假設:因子分析的基本步驟因子分析的標準分析步驟為:(1)根據具體問題,判斷待分析的原始若干變量是否適合作因子分析,并采用某些檢驗方法來判斷數據是否符合分析要求。(2)選擇提取公因子的方法,并按一定標準確定提取的公因子數目。(3)考察公因子的可解釋性,并在必要時進行因子旋轉,以尋求最佳的解釋方式。(4)計算出因子得分等中間指標進一步分析使用。1.判斷原始變量是否適合進行因子分析因子分析有一個默認的前提條件,就是原始各變量間必須有較強的相關性,否則根本無法從中綜合出能反映原始變量結構的因子變量,這就是因子分析最為嚴格的前提要求,所以一般在進行具體的因子分析前,需先對原始變量進行相關分析。最簡單的方法是計算變量之間的相關系數矩陣并進行統計檢驗。如果相關系數矩陣中的大部分相關系數都小于0.3且未通過統計檢驗,那么,這些變量就不適合作因子分析。除此之外,SPSS還提供了幾種幫助判斷變量是否適合作因子分析的統計檢驗方法:1.判斷原始變量是否適合進行因子分析(1)巴特利特球度檢驗(Bartletttestofsphericity)巴特利特球度檢驗原假設H0是:相關陣是單位陣,即各變量各自獨立。巴特利特球度檢驗的統計量根據相關系數矩陣的行列式計算得到。如果該統計量值比較大,且其對應的相伴概率值小于用戶心中的顯著性水平,則應拒絕H0

,認為相關系數矩陣不太可能是單位陣,適合作因子分析;相反,如果該統計量值比較小,且其對應的相伴概率值大于用戶心中的顯著性水平,則不能拒絕H0

,可以認為相關系數矩陣可能是單位陣,不適合作因子分析。1.判斷原始變量是否適合進行因子分析(2)反映象相關矩陣(Anti-imagecorrelationmatrix)檢驗反映象相關矩陣檢驗是將偏相關系數矩陣的每個元素取反,得到反映象相關陣。如果變量之間確實存在較強的相互重疊傳遞影響,由于計算偏相關系數時是在控制其它變量對兩變量影響的條件下計算出來的凈相關系數,因此如果變量中確實能夠提取出公共因子,那么偏相關系數必然很小,則反映象相關矩陣中的有些元素的絕對值比較大,則說明這些變量可能不適合作因子分析。1.判斷原始變量是否適合進行因子分析(3)KMO(Kaiser-Meyer-Olkin)檢驗KMO統計量是比較各變量間簡單相關系數和偏相關系數的大小。可見,KMO統計量的取值在0和1之間,KMO統計量越接近1,則越適合作因子分析,KMO越小,則越不適合作因子分析。一般認為,KMO值大于0.9就非常適合,0.7以上效果一般;0.6則不太適合,0.5以下不適合。2.提取公因子和確定公因子數目因子分析有許多提取公因子的方法,如主成分分析法,最大似然法,α因子提取法等,其中應用最廣泛的是主成分分析法。主成份分析法的目的是從原始的多個變量取若干線性組合,使得能盡可能多地保留原始變量中的信息。主成分分析法是通過坐標變換手段,將原始變量轉換到新變量,是一個正交變換(坐標變換)。2.提取公因子和確定公因子數目該方程組要求:考慮它的線性變換:設有

是一個p維隨機變量2.提取公因子和確定公因子數目2.提取公因子和確定公因子數目分別將如上確定的成為原始數據的第一、第二、……第p主成分。在實際應用中,我們往往只需要能反映原始數據絕大部分信息的少數幾個主成分即可,因此一般選取前面幾個方差最大的主成分。2.提取公因子和確定公因子數目基于上述基本原理,現將主成分模型的系數求解步驟歸納如下:(1)將原有變量數據進行標準化處理。(2)計算變量的簡單相關系數矩陣。(3)求解協方差陣的特征根,并將特征值從大到小排序并重新編碼:2.提取公因子和確定公因子數目(4)按預先規定所取的P個公因子的累計方差貢獻率達到的百分比m%2.提取公因子和確定公因子數目(6)寫出因子負荷陣2.提取公因子和確定公因子數目選定提取因子方法的同時,還需確定所需提取的公因子的數目。其實在確定公因子數量的問題上,并無統一的原則來遵循,也無統一的標準來確定所應該有的公因子數目,一般來說,主要通過以下幾個方面來確定公因子數量。2.提取公因子和確定公因子數目(1)根據特征根來確定。特征根在某種程度上可以被看成是表示公因子影響力度大小的指標,如果特征根小于1,說明該公因子的解釋力度還不如直接引入一個原變量的平均解釋力度大。因此在SPSS中默認用特征根大于1作為納入標準。2.提取公因子和確定公因子數目(2)根據公因子的累積方差貢獻率來確定。其實公因子的累積方差貢獻率也就是前面在主成分分析中講到的主成分的累積貢獻率。一般來說,提取公因子的方差累積貢獻率達到85%-90%以上就比較滿意了,可以此決定需要提取多少個公因子。2.提取公因子和確定公因子數目大量的實踐表明,根據方差累積貢獻率確定公因子數往往較多,而用特征根來確定又往往偏低,許多時候應當將兩者結合起來,以綜合確定合適的數量。其實在因子分析中,提取公因子數量的原則重點在于提取出的公因子的可解釋性上,如果有實際意義,即使貢獻率較小,也可以考慮保留。而如果特征根大于1,但是找不到合理的解釋,則也可考慮將該公因子去除。3.公因子的命名解釋某個原始變量xi同時與幾個公因子都有比較大的相關關系,即xi的信息要由若干個公因子共同解釋;同時,雖然一個公因子能夠解釋許多原始變量的信息,但它都只是解釋每一個原始變量的一部分信息,而不是任何一個變量的典型代表。這樣在按照默認的分解方式,各因子可能難以找到所代表的實際意義3.公因子的命名解釋因子模型的一個特點:因子載荷陣不唯一,則可以利用這一特點對因子載荷矩陣進行適當的旋轉,使公因子載荷系數向更大(向1)或更小(向0)方向變化,使得對公因子的命名和解釋變得更加容易,但保持因子載荷矩陣A各行的元素的平方和即變量X的共同度不變。實現以上目的是通過因子軸的旋轉進行變換的。3.公因子的命名解釋設從公因子F旋轉到公因子G,則模型變為:是旋轉后的因子模型,其中b11仍稱為因子載荷。由旋轉前后的模型比較可以看出旋轉并不會影響公因子的提取過程和結果,只會改變原始變量的信息量在不同因子上的分布,即改變因子載荷陣。3.公因子的命名解釋常用的旋轉方法可分為正交和斜交兩大類。在因子旋轉過程中如果因子軸仍相互正交,則稱為正交旋轉。如果因子軸之間不是相互正交的,則是斜交旋轉。進行正交變換可以保證變換后各因子仍正交,這是比較理想的情況。3.公因子的命名解釋常用的是方差最大化正交旋轉(Varimax),它旋轉的原則是各因子仍保持直角正交,但使得因子間方差的差異達到最大,即使得在每個因子具有較高載荷的變量個數最小化。這種方法一般能簡化對因子的解釋。3.公因子的命名解釋但如果正交變換后對公因子仍然不易解釋,也可以進行斜交旋轉,或許可以得到比較容易解釋的結果。斜交旋轉最常用的是傾斜旋轉(Promax),這種方法是在方差最大化正交旋轉的基礎上進行斜交旋轉,計算速度較快,旋轉后允許因子間存在相關(交角非直角)。3.公因子的命名解釋在對因子矩陣進行旋轉以后,就必須給不同的因子進行命名。因子命名有一些原則:(1)因子分析的命名必須簡明、用盡量少的詞(2~3個)去解釋因子。(2)必須要注重不同因子荷載高的變量之間的相似性(3)可以根據因子中包含什么樣的變量來給因子命名。4.計算因子得分在因子分析中,還可以將公因子表示為原始變量的線性組合,這樣就可以從原始變量的觀測值估計各個公因子的值,求出的此值就是因子得分。4.計算因子得分由此可以得到以下模型:稱為因子得分模型,每一個式子都是因子得分函數。由它可計算出每個樣本的因子得分。SPSS在因子分析中的應用

3、基本步驟總結(1)確認待分析的原變量是否適合作因子分析因子分析的主要任務是將原有變量的信息重疊部分提取和綜合成因子,進而最終實現減少變量個數的目的。故它要求原始變量之間應存在較強的相關關系。進行因子分析前,通常可以采取計算相關系數矩陣、巴特利特球度檢驗和KMO檢驗等方法來檢驗候選數據是否適合采用因子分析。(2)構造因子變量將原有變量綜合成少數幾個因子是因子分析的核心內容。它的關鍵是根據樣本數據求解因子載荷陣。因子載荷陣的求解方法有基于主成分模型的主成分分析法、基于因子分析模型的主軸因子法、極大似然法等。SPSS在因子分析中的應用

(3)利用旋轉方法使因子變量更具有可解釋性將原有變量綜合為少數幾個因子后,如果因子的實際含義不清,則不利于后續分析。為解決這個問題,可通過因子旋轉的方式使一個變量只在盡可能少的因子上有比較高的載荷,這樣使提取出的因子具有更好的解釋性。(4)計算因子變量得分實際中,當因子確定以后,便可計算各因子在每個樣本上的具體數值,這些數值稱為因子得分。于是,在以后的分析中就可以利用因子得分對樣本進行分類或評價等研究,進而實現了降維和簡化問題的目標。SPSS在因子分析中的應用

根據上述步驟,可以得到進行因子分析的詳細計算過程如下:①將原始數據標準化,以消除變量間在數量級和量綱上的不同。②求標準化數據的相關矩陣。③求相關矩陣的特征值和特征向量。④計算方差貢獻率與累積方差貢獻率。⑤確定因子:設F1,F2,…,Fp為p個因子,其中前m個因子包含的數據信息總量(即其累積貢獻率)不低于85%時,可取前m個因子來反映原評價指標。⑥因子旋轉:若所得的m個因子無法確定或其實際意義不是很明顯,這時需將因子進行旋轉以獲得較為明顯的實際含義。⑦用原指標的線性組合來求各因子得分。⑧綜合得分:通常以各因子的方差貢獻率為權,由各因子的線性組合得到綜合評價指標函數。SPSS在因子分析中的應用實例分析:居民消費結構的變動1.實例內容消費結構是指在消費過程中各項消費支出占居民總支出的比重。它是反映居民生活消費水平、生活質量變化狀況以及內在過程合理化程度的重要標志。而消費結構的變動不僅是消費領域的重要問題,而且也關系到整個國民經濟的發展。因為合理的消費結構及消費結構的升級和優化不僅反映了消費的層次和質量的提高,而且也為建立合理的產業結構和產品結構提供了重要的依據。表11-2是某市居民生活費支出費用,具體分為食品、衣著、家庭設備用品及服務、醫療保健、交通通訊、文教娛樂及服務、居住和雜項商品與服務等8個部分。請利用因子分析探討該市居民消費結構,為產業政策的制定和宏觀經濟的調控提供參考。SPSS在因子分析中的應用2.實例操作

數據文件11-1.sav是某市居民在食品、衣著、醫療保健等八個方面的消費數據,這些指標之間存在著不同強弱的相關性。如果單獨分析這些指標,無法能夠分析居民消費結構的特點。因此,可以考慮采用因子分析,將這八個指標綜合為少數幾個因子,通過這些公共因子來反映居民消費結構的變動情況。SPSS在因子分析中的應用3.實例結果及分析(1)描述性統計表下表顯示了食品、衣著等這八個消費支出指標的描述統計量,例如均值、標準差等。這為后續的因子分析提供了一個直觀的分析結果。可以看到,食品支出消費所占的比重最大,其均值等于39.4750%,其次是文化娛樂服務支出消費和交通通信支出消費。所有的消費支出中,醫療保健消費支出占的比重最低。SPSS在因子分析中的應用SPSS在因子分析中的應用(2)因子分析共同度

下表是因子分析的共同度,顯示了所有變量的共同度數據。第一列是因子分析初始解下的變量共同度。它表明,對原有八個變量如果采用主成分分析法提取所有八個特征根,那么原有變量的所有方差都可被解釋,變量的共同度均為1(原有變量標準化后的方差為1)。事實上,因子個數小于原有變量的個數才是因子分析的目的,所以不可能提取全部特征根。于是,第二列列出了按指定提取條件(這里為特征根大于1)提取特征根時的共同度。可以看到,所有變量的絕大部分信息(全部都大于83%)可被因子解釋,這些變量信息丟失較少。因此本次因子提取的總體效果理想。SPSS在因子分析中的應用SPSS在因子分析中的應用(3)因子分析的總方差解釋接著Spss軟件計算得到相關系數矩陣的特征值、方差貢獻率及累計方差貢獻率結果如下表所示。在下頁表中,第一列是因子編號,以后三列組成一組,組中數據項的含義依次是特征根、方差貢獻率和累計貢獻率。第一組數據項(第二至第四列)描述了初始因子解的情況。可以看到,第一個因子的特征根值為4.316,解釋了原有8個變量總方差的53.947%。前三個因子的累計方差貢獻率為94.196%,并且只有它們的取值大于1。說明前3個公因子基本包含了全部變量的主要信息,因此選前3個因子為主因子即可。同時,ExtractionSumsofSquaredLoadings和RotationSumsofSquaredLoadings部分列出了因子提取后和旋轉后的因子方差解釋情況。從表中看到,它們都支持選擇3個公共因子。SPSS在因子分析中的應用因子分析的總方差解釋SPSS在因子分析中的應用(4)因子碎石圖下圖為因子分析的碎石圖。橫坐標為因子數目,縱坐標為特征根。可以看到,第一個因子的特征值很高,對解釋原有變量的貢獻最大;第三個以后的因子特征根都較小,取值都小于1,說明它們對解釋原有變量的貢獻很小,稱為可被忽略的“高山腳下的碎石”,因此提取前三個因子是合適的。SPSS在因子分析中的應用SPSS在因子分析中的應用(5)旋轉前的因子載荷矩陣下表中顯示了因子載荷矩陣,它是因子分析的核心內容。通過載荷系數大小可以分析不同公共因子所反映的主要指標的區別。從結果看,大部分因子解釋性較好,但是仍有少部分指標解釋能力較差,例如“食品”指標在三個因子的載荷系數區別不大。因此接著采用因子旋轉方法使得因子載荷系數向0或1兩極分化,使大的載荷更大,小的載荷更小。這樣結果更具可解釋性。SPSS在因子分析中的應用旋轉前的因子載荷矩陣SPSS在因子分析中的應用(6)旋轉后的因子載荷矩陣下表中顯示了實施因子旋轉后的載荷矩陣。可以看到,第一主因子在“交通和通信”和“醫療保健”等五個指標上具有較大的載荷系數,第二主因子在“居住”和“衣著”指標上系數較大,而第三主因子在“雜項商品與服務”上的系數最大。此時,各個因子的含義更加突出。SPSS在因子分析中的應用實施因子旋轉后

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論