版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領
文檔簡介
數據挖掘與商務智能范勤勤物流研究中心目錄第一章聯系方式辦公地點:科研樓429BEmail:forever123fan@163.com考核方式閉卷考試(70%)+考勤(30%)課時安排總學時36,起止1-9周目錄第一章內容安排第一章緒論第二章挖掘頻繁模式、關聯和相關性第三章分類:基本概念第四章分類:高級方法第五章聚類分析:基本概念和方法第六章離群點檢測第七章認識數據第八章數據預處理目錄第一章參考書JiaweiHan,MichelineKamber,JianPei(著).范明,孟小峰.(譯)
數據挖掘:概念與技術,機械工業出版社,2012.MargaretH.Dunham.數據挖掘教程.清華大學出版社.2003(英文)U.M.Fayyad,G.Piatetsky-Shapiro,P.Smyth,andR.Uthurusamy.AdvancesinKnowledgeDiscoveryandDataMining.AAAI/MITPress,1996.史忠植.知識發現.清華大學出版社,2002.陳文偉,黃金才.數據倉庫與數據挖掘.人民郵電出版社,20041234567第一章緒論為什么進行數據挖掘?什么是數據挖掘?可以挖掘什么類型的數據?可以挖掘什么類型的模式?使用什么技術?面向什么類型的應用?數據挖掘的主要問題?目錄第一章為什么進行數據挖掘?數據挖掘的發展動力數據爆炸問題自動數據收集工具和成熟的數據庫技術使得大量的數據被收集,存儲在數據庫、數據倉庫或其他信息庫中以待分析Business:Web,e-commerce,transactions,stocks,…Science:Remotesensing,bioinformatics,scientificsimulation,…Societyandeveryone:News,YouKu,wechat,QQ,….7數據挖掘的發展動力8巨量數據的例子Europe‘sVeryLongBaselineInterferometry(VLBI,特長基線干涉儀):16個天文望遠鏡,每個望遠鏡每秒產生1個G的天文觀測數據。電信公司數據:每天有幾十億的電話。銀行數據:交易記錄。百度:每天處理的數據量將近100個PB,1PB=100萬個G,相當于5000個國家圖書館的信息量總和。航運:一艘營運中的船舶,24小時內通常會生成高達2GB的數據信息,這包括天氣、發動機、航行位置、速度、燃油消耗等。數據挖掘的發展動力-社會需求9我們擁有豐富的數據,但卻缺乏知識人們渴望通過對這些龐大的數據分析得到更多的有助于決策的信息。雖然,目前的數據庫系統可以高效率地實現數據的錄入、查詢、統計等功能,但由于數據量龐大以及數據庫系統中分析方法的嚴重缺乏,使得它無法發現數據中隱藏的相互聯系,更無法根據當前的數據去預測未來的發展趨勢。因此,出現了所謂“數據多,知識少”的現象,造成了嚴重的資源浪費。數據挖掘的發展動力數據挖掘從大量數據中尋找其規律的技術,是統計學、數據庫技術和人工智能技術的綜合解決方法數據倉庫技術和數據挖掘技術數據倉庫(DataWarehouse)和在線分析處理(OLAP)10社會信息化后,社會的運轉是軟件的運轉社會信息化后,社會的歷史是數據的歷史
數據管理系統
數據收集和數據庫創建數據庫技術的演化文件系統1960s和以前層次數據庫和網狀數據庫1970s關系數據模型,關系數據庫管理系統(RDBMS)的實現1980s早期各種高級數據庫系統(擴展的關系數據庫、面向對象數據庫等等)面向應用的數據庫系統(空間數據庫、時序數據庫、多媒體數據庫等等)1980s晚期數據挖掘、數據倉庫、多媒體數據庫和網絡數據庫1990s流數據管理和挖掘基于各種應用的數據挖掘XML數據庫和整合的信息系統2000s11什么是數據挖掘?概述數據挖掘(從數據中發現知識)從大量的數據中挖掘哪些令人感興趣的(易被理解、新穎的、潛在有用的、非平凡的)模式或知識挖掘的不僅僅是數據(所以“數據挖掘”并非一個精確的用詞)數據挖掘大部分的價值在于利用數據挖掘技術改善預測模型數據挖掘的替換詞數據庫中的知識挖掘(KDD)知識提煉數據/模式分析數據考古數據捕撈、信息收獲等等13數據挖掘:數據庫中的知識挖掘(KDD)數據挖掘——知識挖掘的核心數據清理數據集成數據庫數據倉庫Knowledge任務相關數據選擇數據挖掘模式評估14KDD的步驟KDD過程數據清理:(消除噪聲和刪除不一致的數據。占全過程60%的工作量)數據集成(多種數據源可以組合在一起)數據選擇(從數據庫中提取與分析任務相關的數據)數據變換(數據變換或統一成適合挖掘的形式)數據挖掘(核心步驟,使用智能方法提取數據模式)模式評估(根據某種興趣度度量,識別提供知識的真正有趣的模式)知識表示(使用可視化和知識表示技術,向用戶提供挖掘的知識)15典型數據挖掘系統的體系結構數據倉庫數據清洗過濾數據庫數據庫或數據倉庫服務器數據挖掘引擎模式評估圖形用戶界面知識庫數據集成16數據挖掘系統的特征17數據的特征算法的特征知識系統的特征數據挖掘系統的特征——數據特征18大容量POS數據(某個超市每天要處理高達2000萬筆交易)衛星圖像(NASA的地球觀測衛星以每小時50GB的速度發回數據)互聯網數據含噪音(不完全、不正確)異質數據(多種數據類型混合的數據源,來自互聯網的數據是典型的例子)數據挖掘系統的特征——算法特征19構成數據挖掘算法的三要素模式記述語言:反映了算法可以發現什么樣的知識模式評價:反映了什么樣的模式可以稱為知識模式探索:包括針對某一特定模式對參數空間的探索和對模式空間的探索主要方法分類聚類相關規則回歸其他數據挖掘系統的特征——知識系統特征20知識發現系統需要一個前處理過程知識發現系統是一個自動/半自動過程知識發現系統只能發現特定模式的知識規則分類關聯并非所有的東西都是數據挖掘基于數據倉庫的OLAP系統OLAP系統專注于數據的匯總,而數據挖掘系統可以對數據進行多種復雜的處理信息系統專注于數據的查詢處理機器學習系統,數據統計分析系統這些系統所處理的數據容量往往很有限相比于上述系統,數據挖掘系統關注更廣的范圍,是一個多學科的融合21可以挖掘什么類型的數據?數據類型數據庫數據事務數據數據倉庫其他類型的數據空間數據庫時間數據庫和時間序列數據庫流數據多媒體數據庫面向對象數據庫和對象-關系數據庫異種數據庫和歷史(legacy)數據庫文本數據庫和萬維網(WWW)23數據庫數據數據庫數據24數據庫系統:由一組內部相關的數據和一組管理和存取數據的軟件程序組成關系數據庫是表的匯集,每個表都被賦予一個唯一的名字。例子:商店、學校當數據挖掘用于關系數據庫時,可以進一步搜索趨勢或數據模式。分析顧客數據:新顧客的信用風險檢測偏差:哪些商品的銷售出人預料數據倉庫數據倉庫25數據倉庫(數據立方體):是一個從多個數據源收集的信息存儲庫,存放在一致的模式下,并且通常駐留在單個站點上。例子:沃爾瑪,銀行事務數據事務數據26事務數據庫的每個記錄代表一個事務:如顧客的一個購物,一個航班訂票事務標識號(trans_ID)商品ID的列表T0011,5,8,9,12T0021,8,14……數據挖掘技術的應用通過頻繁項集來挖掘促銷策略:如一起銷售商品的集合空間數據庫空間數據庫空間數據庫是指在關系型數據庫(DBMS)內部對地理信息進行物理存儲。空間數據庫中存儲的海量數據包括對象的空間拓撲特征、非空間屬性特征以及對象在時間上的狀態變化數據挖掘技術的應用通過空間分類和空間趨勢分析,引入機器學習算法,對有用模式進行智能檢索常見的空間數據庫數據類型地理信息系統(GIS)遙感圖像數據醫學圖像數據27時間數據庫和時序數據庫時間數據庫和時序數據庫時間數據庫和時序數據庫都存放與時間有關的數據。時間數據庫通常存放包含時間相關屬性的數據。時序數據庫存放隨時間變化的值序列例子:股票市場的價格、環境溫度、銀行交易等對時間數據庫和時序數據庫的數據挖掘對時間數據庫和時序數據庫的數據挖掘,可以通過研究事物發生發展的過程,有助于揭示事物發展的本質規律,可以發現數據對象的演變特征或對象變化趨勢28流數據特點與傳統的數據庫技術中的靜態數據不同,流數據是連續的、有序的、變化的、快速的、大量的數據輸入的數據與傳統數據庫技術相比,流數據在存儲、查詢、訪問、實時性的要求等方面都有很大區別主要應用場合網絡監控傳感器網絡航空航天流媒體…等等29多媒體數據庫多媒體數據庫多媒體數據庫實現用計算機管理龐大復雜的多媒體數據,主要包括圖形(graphics)、圖象(image)、聲音(audio)、視頻(video)等等,現代數據庫技術一般將這些多媒體數據以二進制大對象的形式進行存儲對于多媒體數據庫的數據挖掘對于多媒體數據庫的數據挖掘,需要將存儲和檢索技術相結合。目前的主要方法包括構造多媒體數據立方體、多媒體數據庫的多特征提取和基于相似性的模式匹配30面向對象數據庫和對象-關系數據庫面向對象數據庫面向對象數據庫是面向對象技術和數據庫技術結合的產物,該技術對數據以對象的形式進行存儲,并在這個基礎上實現了傳統數據庫的功能,包括持久性、并發控制、可恢復性、一致性和查詢數據庫的能力等數據挖掘面向對象數據庫和對象-關系數據庫中的數據挖掘會涉及一些新的技術,比如處理復雜對象結構、復雜數據類型、類和子類層次結構、構造繼承以及方法和過程等等。對象-關系數據庫對象-關系數據庫基于對象-關系模型構造,該模型通過處理復雜對象的豐富數據類型和對象定位等功能,擴充關系模型31異構數據庫和歷史(legacy)數據庫歷史數據庫是一系列的異構數據庫系統的集合,包括不同種類的數據庫系統,像關系數據庫、網絡數據庫、文件系統等等對于異構數據庫系統,實現數據共享應當達到兩點一是實現數據庫轉換;二是實現數據的透明訪問。有效利用歷史數據庫的關鍵在于實現不同數據庫之間的數據信息資源、硬件設備資源和人力資源的合并和共享WEBSERVICE技術的出現有利于歷史數據庫數據的重新利用32文本數據庫和萬維網(WWW)文本數據庫存儲的是對對象的文字性描述萬維網(WWW)可以被看成最大的文本數據庫文本數據庫的分類無結構類型(大部分的文本資料和網頁)半結構類型(XML數據)結構類型(圖書館數據)數據挖掘內容內容檢索WEB訪問模式檢索33數據挖掘應用——市場分析和管理數據從那里來?信用卡交易、會員卡、商家的優惠卷、消費者投訴電話、公眾生活方式研究交叉市場分析貨物銷售之間的相互聯系和相關性,以及基于這種聯系上的預測目標市場構建一系列的“客戶群模型”,這些顧客具有相同特征:興趣愛好、收入水平、消費習慣,等等確定顧客的購買模式34數據挖掘應用——市場分析和管理顧客分析哪類顧客購買哪種商品(聚類分析或分類預測)提供概要信息多維度的綜合報告統計概要信息(數據的集中趨勢和變化)客戶需求分析確定適合不同顧客的最佳商品預測何種因素能夠吸引新顧客35數據挖掘應用——公司分析和風險管理財務計劃現金流轉分析和預測交叉區域分析和時間序列分析(財務資金比率,趨勢分析等等)競爭對競爭者和市場趨勢的監控將顧客按等級分組和基于等級的定價過程將定價策略應用于競爭更激烈的市場中資源計劃總結和比較資源和花費36數據挖掘應用——欺詐行為檢測和異常模式的發現方法對欺騙行為進行聚類和建模,并進行孤立點分析應用(衛生保健、零售業、信用卡服務、電信等)汽車保險:檢測交通事故獲取保險賠償的人群洗錢:發現可疑的貨幣交易行為醫療保險:職業病人,醫生以及相關數據分析;不必要的或相關的測試電信:電話呼叫欺騙行為;電話呼叫模型(呼叫目的地、持續時間、日或周呼叫次數。分析該模型發現與期待標準的偏差)零售產業:分析師估計有38%的零售額下降是由于雇員的不誠實行為造成的反恐怖主義37數據挖掘應用領域舉例38例子1:信貸決策(inthe1980s,AmericanExpress)已知:申請人金融和個人信息調查表問題:是否批準貸款簡單的統計方法可以決定90%的案例“臨界線案例”要由信貸員做出決定50%準予貸款的“臨界線案例”未按期還款.解決方案:拒絕所有“臨界線案例”?No!臨界線案例是最活躍的,重要的客戶數據挖掘應用領域舉例39例子1:信貸決策(inthe1980s,AmericanExpress)1000“臨界線案例”的訓練集20個屬性:年齡為當前老板工作的年限在當前居住地居住的年限擁有銀行帳戶的年限所持有的其他信用卡,…學習到的規則:正確率為70%信貸員決策的正確率為50%規則可以用來向客戶解釋決策背后的原因數據挖掘應用領域舉例40例子2:購物籃分析關聯分析技術被用來發現在交易傾向同時被購買的商品(用來分析收銀數據)啤酒+尿布擺在一起促銷數據挖掘應用領域舉例41例子3:超市預知高中生懷孕一家門店被客戶投訴將嬰兒產品優惠券寄給他的女兒客戶道歉數據挖掘應用領域舉例42例子4:圖像處理學習到的規則:正確率為70%已知:沿海水域的雷達衛星圖像問題:檢測出是否有浮油Noteasy:看上去的深色區域可能是由天氣因素造成的。(如大風)需要接受過培訓的人員到圖片所示區域實地考察:昂貴的過程數據挖掘應用領域舉例43例子4:圖像處理從標準化圖像提取黑色區域屬性:區域規模形狀、面積亮度邊角的銳利度和鋸齒形狀附近的其他區域背景信息解決問題受到如下限制:訓練數據很少:原油泄漏事件是很少發生的不均衡數據:絕大多數的深色區域不是浮油造成的數據挖掘應用領域舉例44例子5:預測奧斯卡關2013年,微軟紐約研究院的經濟學家DAVID利用大數據成功預測24個奧斯卡獎項中的19個。2014年,DAVID成功預測24個獎項中的21個。
可以挖掘什么類型的模式?概述一般功能描述性的數據挖掘-描述數據的一般性質,了解數據中潛在的規律預測性的數據挖掘-對數據進行推斷,做預測常用的數據挖掘功能通常,用戶并不知道在數據中能挖掘出什么東西,對此我們會在數據挖掘中應用一些常用的數據挖掘功能,挖掘出一些常用的模式,包括:類/概念描述:特性化和區分挖掘頻繁模式、關聯和相關性用于預測分析的分類與回歸聚類分析離群點分析46類/概念描述:特性化和區分StatusBirth_countryAge_rangeGpaCountGraduateCanada25-30Good90UndergraduateCanada25-30Good210概念描述為數據的特征化和比較產生描述(當所描述的概念所指的是一類對象時,也稱為類描述)數據區分:提供兩個或多個數據集的比較描述。例:數據特征化:提供給定數據集的簡潔匯總。例:對AllElectronic公司的“大客戶”(年消費額$1000以上)的特征化描述:40-50歲,有固定職業,信譽良好,等等47挖掘頻繁模式、關聯和相關性頻繁模式在數據中頻繁出現的模式,包括頻繁項集、頻繁子序列和頻繁子結構示例關聯規則挖掘從事務數據庫,關系數據庫和其他信息存儲中的大量數據的項集之間發現有趣的、頻繁出現的模式、關聯和相關性廣泛的用于購物籃或事務數據分析48用于預測分析的分類與回歸概念描述根據訓練數據集和類標號屬性,構建模型來分類現有數據,并用來分類新數據(分類),用來預測類型標志未知的對象類(預測)分類規則。IFage=“<=30”ANDstudent=“no”THENbuys_computer=“no”IFage=“<=30”ANDstudent=“yes”THENbuys_computer=“yes”IFage=“31…40”THENbuys_computer=“yes”IFage=“>40”ANDcredit_rating=“excellent”THENbuys_computer=“yes”IFage=“>40”ANDcredit_rating=“fair”THENbuys_computer=“no”其他比如:按氣候將國家分類,按汽油消耗定額將汽車分類導出模型的表示:決策樹、分類規則、神經網絡可以用來預報某些未知的或丟失的數字值49聚類分析聚類分析將物理或抽象對象的集合分組成為由類似的對象組成的多個類的過程最大化類內的相似性和最小化類間的相似性應用對WEB日志的數據進行聚類,以發現相同的用戶訪問模式50離群點分析離群點分析離群點:一些與數據的一般行為或模型不一致的數據通常離群點被作為“噪音”或異常被丟棄,但在欺騙檢測中卻可以通過對罕見事件進行離群點分析而得到結論應用信用卡欺詐檢測移動電話欺詐檢測客戶劃分醫療分析(異常)51所有模式都是有趣的嗎?結論數據挖掘可能產生數以千計的模式或規則,但并不是所有的模式或規則都是令人感興趣的模式興趣度的客觀和主觀度量客觀度量:基于所發現模式的結構和關于它們的統計,比如:支持度、置信度等等主觀度量:基于用戶對數據的判斷。比如:出乎意料的、新穎的、可行動的等等模式興趣度的度量一個模式是有趣的,如果(1)它易于被人理解;(2)在某種程度上,對于新的或測試數據是有效的;(3)具有潛在效用;(4)新穎的;(5)符合用戶確信的某種假設52使用什么技術?數據挖掘:多個學科的融合統計學數據庫系統數據倉庫信息檢索機器學習數據挖掘應用模式識別可視化算法高性能計算54統計學
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
- 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
- 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
- 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 2026新風鳴公司面試題及答案
- 2026信念責任面試題及答案
- 2026煙草審計面試題目及答案
- 2026醫學營養面試題庫及答案
- 2026英文互聯網面試題及答案
- 2026中國新材料產業技術創新與產業化應用前景分析
- 2026城鎮管理面試題目及答案
- (2026年)醫院現代財務管理制度
- 2026人工智能行業發展現狀需求分析投資策略規劃研究深度分析報告
- 思想政治教師述職報告(3篇)
- 傷損鋼軌管理辦法
- 商務會見活動方案
- 2025數據處理與保密協議合同書
- 中外運2025校招在線筆試題目及答案
- 兒童彈性髓內釘課件
- 2025年家庭醫生簽約服務職業技能競賽-全科醫師試題
- DBJ-T45-180-2024 《電動自行車停放充電場所建設技術標準》
- DB52T 986-2015 地理標志產品 凱里紅酸湯
- 廣州市從化區紀委監委公開招考8名合同制紀檢監察輔助人員(高頻重點提升專題訓練)共500題附帶答案詳解
- DB3210T 1178-2024林權地籍調查技術規程
- 兒童吞咽障礙的康復護理
評論
0/150
提交評論