版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領
文檔簡介
/納入協變量信息的多級計分認知診斷模型【摘要】在多級計分協變量認知診斷框架下,提出了一種可同時納入連續協變量信息和多類別協變量信息的多級計分認知診斷模型GPDM-C,實現了其DINA形態的GPDINA-C的MCMC參數估計。模擬研究的結果顯示,GPDINA-C擁有較好的屬性/模式判準精度和參數估計能力,相較于未納入協變量信息的GPDINA,GPDINA-C有更好的模型表現,在參數估計精度上有較大優勢。實證研究的結果同樣表明,GPDINA-C相比于未納入協變量信息的多級計分認知診斷模型,能更好擬合實證數據,估計得到的協變量影響參數能客觀反映真實情況。 1引言 在心理和教育學研究中,除了感興趣的變量外,研究人員同時還會收集許多協變量信息,通常包括性別、年齡、地域、家庭社會經濟地位等。Li,Hong和Macready(2015)認為協變量信息與我們所關注的建模變量具有重要關系。這些協變量信息常作為調節因子調節自變量對因變量的影響,或是作為控制變量加以控制,許多心理學研究均涉及協變量信息。例如,張莉、薛香娟和趙景欣(2019)以家庭社會經濟地位作為協變量控制,構建縱向中介模型,發現農村留守兒童先前的學業成績能預測隨后的歧視知覺,但先前的歧視知覺不能預測隨后的學業成績,并且農村留守兒童的抑郁在學業成績和歧視知覺之間起縱向中介作用。王玲曉、張麗婭和常淑敏(2019)在控制性別、年級和家庭社會經濟地位后,發現母親拒絕對兒童的同伴拒絕有顯著正向預測作用,家庭環境紛雜度調節了母親拒絕與同伴拒絕之間的關系,兒童外化問題行為在家庭環境紛雜度對母親拒絕和同伴拒絕關系的調節效應中起完全中介作用。在項目反應理論(itemresponsetheory,IRT)中,考慮了協變量的影響后,可以對個體能力的估計和題目參數的估計起到積極作用。研究者們提出了一些納入協變量信息的項目反應模型,例如,Li等(2015)比較了多種包含協變量信息的混合Rasch模型(mixtureraschmodel,MRM),發現在MRM中納入二分類協變量時,被試能力估計精度有所提高,在納入連續協變量時,被試能力和項目參數的估計都有所提高。Kahraman(2014)使用解釋性IRT模型對計算機模擬病例考試(computer-basedcasesimulationtest,CCS)考生作答數據進行分析,分別以性別、反應時、項目順序、選擇題得分作為協變量納入解釋性IRT模型中,發現這些協變量信息均能提高模型對數據的擬合度。上述研究均表明,當納入協變量信息后,模型參數的估計精度將得到提升,更擬合實證數據。 然而,在認知診斷評估(cognitivediagnosticassessment,CDA)相關的研究中,少有研究者考慮了協變量信息的作用。CDA是結合認知心理學和心理測量學優勢而開發的新一代測驗理論(陳秋梅,張敏強,2010;郭磊,張金明,宋乃慶,2019),可用于評估個體知識掌握結構和加工技能(Leighton&Gierl,2007),向學生和老師提供個性化指導和反饋(Rupp,Templin&Henson,2010),受到國內外研究者的廣泛關注。認知診斷模型(cognitivediagnosticmodels,CDMs)作為CDA的關鍵,可以實現對個體知識狀態的估計,正確選擇CDM可以有效提高參數估計精度。絕大多數CDMs開發關注如何更好利用個體作答信息和題目信息提升個體知識狀態的估計精度,例如為了更加擬合不同題目的屬性連接形式而開發的不同屬性連接規則的約束模型(DINA,Junker&Sijtsma,2001;DINO,Templin&Henson,2006;LLM,Maris,1999),以及包含多數約束模型的飽和模型(GDM,vonDavier,2005;LCDM,Henson,Templin,&Willse,2009;G-DINA,delaTorre,2011),能夠處理多級計分測驗數據的多級計分模型(seq-GDINA,Ma&delaTorre,2016;GPDM,Chen&delaTorre,2018;GPCDM,高旭亮,汪大勛,王芳,蔡艷,涂東波,2019),能夠處理屬性包含多水平信息的多分屬性模型(pGDINA,Chen&delaTorre,2013)。但這些CDMs都忽略了協變量信息的重要作用。 在認知診斷框架下納入協變量信息不僅可以在宏觀層面更好估計個體能力值,還能在微觀層面對個體的知識狀態實現更精準的分類。研究能夠有效提升分類算法精度的模型具有重要意義,因此,很有必要開發可處理協變量信息的CDMs。當前,僅有個別研究探討了協變量信息在CDMs中的作用。Ayers,Rabe-Hesketh和Nugent(2013)以DINA模型為基礎,利用logistic回歸表征了協變量信息對屬性掌握概率的影響,構建模型如下:為考生i在屬性k上的掌握概率,分別為考生的性別信息(二分協變量)和前測成績(連續協變量),是協變量對掌握概率的影響大小,是屬性k的難度參數。之后,Park和Lee(2014)提出的協變量DINA模型(thecovariateextensionoftheDINAmodel)使用協變量信息分別對考生屬性掌握概率和題目正確作答概率進行表征,其思路與Ayers等(2013)研究相似。Park,Xing和Lee(2017)構建的解釋性認知診斷模型(explanatoryCDM)以IRT模型估計得到的能力參數作為潛在變量,與觀測變量共同作為協變量表征了屬性掌握概率和題目正確作答概率。上述研究結果表明,在加入協變量信息時,提高了個體的屬性/模式判準率,以及題目參數的估計精度。 但這些研究存在以下不足,缺乏更廣泛的普適性:(1)從大型測驗(PISA,TIMSS,高考)到小型測驗(班級測驗),這些測驗中存在大量多級計分題目(Chen&delaTorre,2018;Ma&delaTorre,2016),多級計分題目比二級計分題目能夠提供更多信息,而目前的模型均基于二級計分DINA模型開發,不能在多級計分測驗中處理協變量信息。(2)這些研究中包含的類別協變量僅為二分變量(如性別),不能處理諸如班級、年級、家庭社會經濟地位等多類別協變量信息。因此,本研究旨在開發同時可以處理不同類型協變量的多級計分CDM,以推動CDA在處理協變量信息層面的研究。 2協變量多級計分認知診斷模型的構建 2.1基礎模型的選擇 對多級計分CDMs進行協變量拓廣涉及對多級計分CDMs的選擇。目前多級計分CDMs包括基于等級反應模型(gradedresponsemodel)開發的P-DINA(polytomousDINA,涂冬波,蔡艷,戴海琦,丁樹良,2010)和GPDM(generalpolytomousdiagnosismodel,Chen&delaTorre,2018),基于連續比率模型(continuationratiomodel)開發的序列GDINA模型(sequentialGDINA,Ma&delaTorre,2016)以及基于分布評分模型(partial-creditmodel)開發的GPCDM(generalpartialcreditdiagnosticmodel,高旭亮等,2019)等。本研究選擇GPDM作為協變量拓廣的基礎模型,其原因在于:相比于將題目參數設置在累計概率的P-DINA,GPDM將題目參數設置在條件概率上,這種表示方式更直接(Chen&delaTorre,2018),因為條件概率可以直接表示被試i在題目j上得分等級為c的概率,而累計概率表示得分從0至c的概率和,需要通過計算得到對應每個等級的概率值。GPDM、序列GDINA、GPDCDM的加工函數都是GDINA,但僅有GPDM滿足GDINA的單調性假設,即掌握更多所需屬性的考生不會降低正確作答的可能性(Chen&delaTorre,2018;Hong,Chang&Tsai,2016)。同時,GPDM的Q矩陣界定在題目水平上,而序列GDINA與GPCDM均將Q矩陣定義在類別上,得分步驟順序要求嚴格,并且每個類別要求明確地與特定屬性相關聯,類別Q矩陣不總是適用在現實情境中(Chen&delaTorre,2018)。 2.2GPDM-C的測量模型 2.3GPDM-C的結構模型 利用logistic回歸用連續協變量信息和分類協變量信息表征屬性掌握概率,并將二分類協變量拓展為多類別協變量,表示為: 2.4縮減模型GPDINA-C與參數估計 由于GPDM本質是基于GDINA的多級計分拓廣,所以GPDM-C也可以約束為各種簡約模型以滿足不同研究和現實情景的需求。本文基于模型簡約性、更易使大眾理解的考慮,通過對GPDMC約束,采用更易理解的題目猜測參數和失誤參數,提供一種DINA形式的縮減協變量多級計分模型GPDINA-C,并采用MCMC算法基于R與JAGS軟件,對GPDINA-C模型進行參數估計,GPDINA-C的JAGS代碼見附錄。GPDINA-C的表達式為: 3研究1:模擬研究 3.1研究目的 本研究有兩個目的:(1)驗證MCMC參數估計方法是否能精準估計GPDINA-C的模型參數,即模型的可識別性,以及在多級計分情景下的屬性/模式判準率。(2)展示當數據存在協變量影響,而錯誤使用未能處理協變量信息的診斷模型時,會給參數估計結果帶來的影響。 3.2研究設計 3.3結果 3.3.1GPDINA-C平均屬性判準率和模式判準率 如表3所示,當題目質量為高或中等時以及測驗長度較長時,GPDINA-C有著較好的屬性判準率和模式判準率。納入協變量信息的GPDINAC在高質量題目條件下,AACCR和PCCR在20題時的范圍分別在0.961~0.970和0.844~0.871,當測驗長度增加到40題時,AACCR和PCCR的范圍分別提升至0.989~0.992和0.947~0.963;題目質量為中等時,AACCR和PCCR在20題時的范圍分別在0.896~0.934和0.622~0.740,當測驗長度增加到40題時,AACCR和PCCR的范圍分別提升至0.0.952~0.961和0.813~0.841;題目質量為低時,AACCR和PCCR在20題時的范圍分別在0.812~0.887和0.382~0.590,當測驗長度增加到40題時,AACCR和PCCR的范圍分別提升至0.873~0.923和0.552~0.708。題目質量和測驗長度大幅度影響了模型的判準率。在相同題目質量情況下,協變量影響越大,模型的判準精度越高。例如,在測驗長度均為20題、題目質量均為中等時,在低協變量影響下的AACCR為0.896,PCCR為0.622,中等協變量影響下的AACCR為0.909,PCCR為0.658,高協變量影響下的AACCR為0.934,PCCR為0.740。 在所有實驗條件下,相比于未納入協變量信息的GPDINA,GPDINA-C的平均屬性判準率和模式判準率都更高,尤其是在題目質量中等或者較差的情況下,該結果表明,當數據受到了協變量影響后,使用未能處理協變量信息的GPDINA模型,將會對被試的知識狀態估計精度帶來惡化影響。協變量效應也影響了GPDINA-C相較于GPDINA的屬性/模式判準精度的提升程度。具體而言,當協變量的影響越大時,GPDINA-C對GPDINA的屬性/模式判準精度的提升越大。例如,在測驗長度為20題、題目質量均為中等時,在低協變量影響下,AACCR提升了0.07%,PCCR提升了3.7%,在中等協變量影響下,AACCR提升了1.6%,PCCR提升了7.2%,在高協變量影響下,AACCR提升了2.9%,PCCR提升了11.6%;在題目質量均為低時,在低協變量影響下,AACCR提升了2.8%,PCCR提升了13.4%,在中等協變量影響下,AACCR提升了5.8%,PCCR提升了24.0%,在高協變量影響下,AACCR提升了8.0%,PCCR提升了27.4%。以上表明,在有協變量影響的測驗中,GPDINA-C能夠得到較高的屬性/模式判準精度,參數估計方法有效。 3.3.2GPDINA-C模型題目參數估計精度 如表4所示,GPDINA-C在各實驗條件下的題目參數估計精度均較好,bias范圍為-0.0017~0.0011,RMSE范圍為0.0119~0.0262。在絕大多數情況下,GPDINA-C的題目參數估計精度優于GPDINA,bias更接近0,RMSE更小,說明在有協變量影響的情景下,使用未能處理協變量信息的GPDINA模型,將會降低對題目參數估計的精度,這與前人在IRT領域的研究結果保持一致。當題目質量提高、協變量影響變大或題目長度增加時,GPDINA-C題目參數的估計精度會更好。 3.3.3GPDINA-C模型結構參數估計精度 如表5所示,GPDINA-C在各實驗條件下的結構參數估計精度良好。連續協變量影響參數(β)的bias范圍為-0.058~0.045,RMSE范圍為0.016~0.068;分類協變量影響參數(γ)的bias范圍為-0,086~0.088,RMSE范圍為0.053~0.135;屬性難度參數(δ)的bias范圍為-0.060~0.077,RMSE范圍為0.043~0.231。協變量參數(β、γ)的估計精度與題目質量和協變量大小有關,當題目質量越好或協變量影響越小時,協變量參數的估計精度越好。屬性難度參數(δ)的估計精度與題目質量和協變量大小有關,當題目質量越好或協變量影響越大時,協變量參數的估計精度越好。 4研究2:實證研究 4.1研究目的 比較GPDINA-C與GPDINA在真實測驗中的模型表現,驗證納入協變量信息的多級計分認知診斷模型在實際應用中的優勢和適用性。 4.2實證數據 選擇國際數學與科學趨勢研究(TrendsinInternationalMathematicsandScienceStudy,TIMSS)2007年四年級數學評估測驗考生的數據,共有1760名考生,包含10道二級計分題目和2道三級計分題目(第3和第10題)。考察了8個屬性,測驗Q矩陣由Lee,Park和Taylan(2011)所界定,如表6所示。 Park和Lee(2014)指出,數學和科學具有結構和功能上的關系,數學可以作為科學中的工具,科學也可以進一步刺激數學的發現(Li,Shavelson,Kupermintz,&Ruiz-Primo,2002),因此,科學成績可以作為數學成績的預測變量。在本測驗中,考生的數學成績和科學成績存在顯著正相關(r=0.83,p<0.001),所以本研究選擇考生在科學評估測驗的標準化成績作為連續協變量信息用于預測考生的屬性掌握程度。分類協變量是考生所在地區,共五組,這些地區的考生成績有顯著的差異(F(4,1757)=63.64,p<0.001,=0.13),這種地區的成績差異也能作為被試屬性掌握的預測工具。其中,270名考生來自中國香港地區(四年級數學評估測驗成績排名第一),294名考生來自中國臺灣地區(排名第三),320名考生來自日本(排名第五),312名考生來自英國(排名第九),564名考生來自美國(排名第十三),美國作為基準組別。 4.3結果 4.3.1模型擬合比較 在貝葉斯方法下評價模型數據擬合的指標為偏差信息準則DIC(devianceinformationcriterion),該指標可由JAGS軟件直接計算得出,公式如下: DIC的大小可以判斷模型擬合的相對優劣,值越小說明模型對數據更擬合。分析得到,未納入協變量信息的GPDINA的DIC值為32809.2,納入協變量信息的GPDINA-C的DIC值為31518.7,說明納入協變量信息的多級計分模型對這批真實數據的擬合表現更優。 4.3.2GPDINA-C的協變量參數 GPDINA-C的協變量影響參數β和γ的大小分別反映了連續協變量(科學成績)與分組協變量(考生所在地區)對考生屬性掌握程度的貢獻。結果表明,科學成績對考生屬性掌握的影響大小β=2.16(SD=0.11),p<0.001,說明科學成績可以顯著正向預測考生的數學能力掌握程度;表7展示了分組協變量(即地區)對考生屬性掌握的影響,即γ參數,以及各地區考生在這12題的平均得分。地區對考生屬性掌握的影響與各地區的測驗均值有顯著正相關(r=0.97,p=0.006),表明GPDINA-C能很好估計分類協變量的取值,GPDINA-C能很好地擬合實際情況中分類協變量對屬性掌握的影響作用。以上結果均表明納入協變量信息的GPDINA-C可以提供GPDINA所不能提供的協變量影響參數信息,并且GPDINA-C能很好估計協變量影響大小,其估計值可以作為協變量影響考生屬性掌握的評價指標。 4.3.3考生知識狀態 GPDINA-C從28=256種知識狀態中識別出1760名考生各自所屬的知識狀態。圖6展示了考生數最多的前十類知識狀態,屬于這十類知識狀態的考生占總考生數的95.5%。 圖6考生各知識狀態占總考生比例(前十類) 5討論 5.1不足與展望 盡管本研究開發了能夠處理多種協變量信息的GPDM-C模型,并給出其簡約模型GPDINA-C的參數估計的MCMC算法,但仍有一些值得完善和思考的研究方向。 (1)在實證研究中,何時需要考慮協變量的信息,本研究給出如下建議:若協變量與測驗所考察能力或屬性有顯著的相關關系,此時可以將該協變量信息納入認知診斷模型中,在控制協變量信息的基礎上,提高認知診斷模型的估計精度;若協變量與屬性之間不存在相關關系,可以不納入協變量,這也是結構方程模型,縱向數據分析,項目反應理論等研究中的常見做法。此外,也可從模型與數據擬合指標的角度去判斷協變量信息是否應納入,若納入協變量信息后模型擬合指標變小,則說明納入協變量信息后,模型更加擬合該批數據,理應納入協變量信息,獲得更精確的估計結果;反之則可以不納入協變量。考慮到文章篇幅和研究的聚焦性,本研究未以GPDINA作為真模型進行探討,未來可嘗試模型的交叉比較。 (2)GPDM-C是對以等級計分思想為基礎的GPDM進行的開發,而目前存在如基于連續比率模型(continuationratiomodel)的seq-GDINA,基于分布評分模型(partial-creditmodel)的GPDCDM等其他多級計分思想的模型,它們的計分邏輯不同,未來可基于不同計分邏輯探討納入協變量的影響。 (3)本研究在模擬和實證研究中約束了模型中的協變量影響參數(β,γ)在屬性水平上相等,即協變量在所有屬性上有相同的作用,這更適用于屬性粒度較小的測驗,例如同一個協變量對小屬性加法和減法的掌握程度的影響相似,而可能不適用于屬性粒度較大的測驗;同一個協變量對大屬性數學和語文的掌握程度的影響差異很大。未來研究中可以放松該限制,考察協變量在各屬性上的不同影響。 (4)本研究涉及的協變量僅為一種連續協變量信息和一種類別協變量信息的影響,而在現實測驗情境下,研究者收集了大量協變量信息,未來可以探討納入更多協變量信息時模型的表現,以及加入協變量交互作用時模型的表現。 (5)GPDM-C設定的協變量影響在屬性水平,即協變量影響屬性掌握程
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
- 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
- 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
- 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 2026年第一學期高中語文教學工作總結
- 節日消防安全知識要點
- 健康宣教計劃
- 乳品加工工安全綜合模擬考核試卷含答案
- 安全提升心得體會講解
- 拖拉機制造工創新應用模擬考核試卷含答案
- 膜劑工誠信品質強化考核試卷含答案
- 硅樹脂生產工安全意識強化水平考核試卷含答案
- 供料破碎工安全培訓知識考核試卷含答案
- 森林園林康養師競賽能力考核試卷含答案
- 2026年重慶市“五方面人員”選拔鄉鎮領導班子考試歷年參考題庫(含完整答案)
- 家政保姆入戶服務標準化禮儀規范
- 2026秋新教科版科學五年級上冊教學課件:第四單元 第5課 巖石的類別與變化 有2個微課視頻
- 2026年浙江基層法律服務工作者執業核準考試試題及答案
- 2026年幼兒園課程故事培訓會
- GJB827B--2020軍事設施建設費用定額
- DL∕T 5776-2018 水平定向鉆敷設電力管線技術規定
- 全過程工程咨詢服務標準
- DZ∕T 0070-2016 時間域激發極化法技術規程(正式版)
- 市政工程監理實施細則(完整版)
- OEE培訓教材合集課件
評論
0/150
提交評論