廣西梧州市2026年公務(wù)員:公安AI大數(shù)據(jù)專業(yè)科目考試題庫(kù)-考前沖刺_第1頁(yè)
廣西梧州市2026年公務(wù)員:公安AI大數(shù)據(jù)專業(yè)科目考試題庫(kù)-考前沖刺_第2頁(yè)
廣西梧州市2026年公務(wù)員:公安AI大數(shù)據(jù)專業(yè)科目考試題庫(kù)-考前沖刺_第3頁(yè)
廣西梧州市2026年公務(wù)員:公安AI大數(shù)據(jù)專業(yè)科目考試題庫(kù)-考前沖刺_第4頁(yè)
廣西梧州市2026年公務(wù)員:公安AI大數(shù)據(jù)專業(yè)科目考試題庫(kù)-考前沖刺_第5頁(yè)
已閱讀5頁(yè),還剩38頁(yè)未讀 繼續(xù)免費(fèi)閱讀

下載本文檔

版權(quán)說(shuō)明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)

文檔簡(jiǎn)介

廣西梧州市2026年公務(wù)員:公安AI大數(shù)據(jù)專業(yè)科目考試題庫(kù)--考前沖刺第一部分:?jiǎn)雾?xiàng)選擇題(共30題,每題1.5分,共45分)1.在公安大數(shù)據(jù)處理架構(gòu)中,用于處理海量歷史數(shù)據(jù)離線分析,且對(duì)吞吐量要求高而對(duì)實(shí)時(shí)性要求相對(duì)較低的計(jì)算模式是()。A.流計(jì)算B.批處理C.交互式查詢D.內(nèi)存計(jì)算2.Hadoop生態(tài)系統(tǒng)中,負(fù)責(zé)分布式文件存儲(chǔ),且具有高容錯(cuò)性、高吞吐量特點(diǎn)的組件是()。A.MapReduceB.HBaseC.HDFSD.Hive3.在機(jī)器學(xué)習(xí)算法中,主要用于將高維數(shù)據(jù)映射到低維空間,同時(shí)盡可能保留數(shù)據(jù)局部結(jié)構(gòu)的算法是()。A.K-Means聚類B.t-SNEC.邏輯回歸D.決策樹(shù)4.公安視頻圖像結(jié)構(gòu)化描述中,通常不包括以下哪類信息?()A.人像特征B.車輛特征C.人體特征D.視頻的音頻比特率5.某市公安局在研判嫌疑人軌跡時(shí),通過(guò)分析多源異構(gòu)數(shù)據(jù)(如卡口、WIFI探針、銀行交易)來(lái)構(gòu)建人物關(guān)系網(wǎng)。這種最適合采用的大數(shù)據(jù)技術(shù)是()。A.關(guān)系型數(shù)據(jù)庫(kù)索引優(yōu)化B.知識(shí)圖譜C.簡(jiǎn)單的文本搜索D.數(shù)據(jù)倉(cāng)庫(kù)OLAP6.Python語(yǔ)言中,用于科學(xué)計(jì)算和數(shù)組操作,且是Pandas和NumPy基礎(chǔ)的核心庫(kù)是()。A.NumPyB.RequestsC.Scikit-learnD.Matplotlib7.關(guān)于深度學(xué)習(xí)中的卷積神經(jīng)網(wǎng)絡(luò)(CNN),以下描述錯(cuò)誤的是()。A.卷積層主要用于提取特征B.池化層主要用于降維和減少參數(shù)C.全連接層通常用于輸出最終分類結(jié)果D.CNN只能處理圖像數(shù)據(jù),無(wú)法處理文本數(shù)據(jù)8.在數(shù)據(jù)清洗階段,若發(fā)現(xiàn)某記錄中“年齡”字段為“-5”,這屬于哪種數(shù)據(jù)質(zhì)量問(wèn)題?()A.缺失值B.重復(fù)值C.異常值D.不一致值9.《數(shù)據(jù)安全法》規(guī)定,國(guó)家建立數(shù)據(jù)分類分級(jí)保護(hù)制度,對(duì)數(shù)據(jù)實(shí)行()。A.統(tǒng)一管理,分類保護(hù)B.自主保護(hù),分類監(jiān)管C.分類分級(jí),分類分級(jí)保護(hù)D.集中存儲(chǔ),分級(jí)使用10.下列哪項(xiàng)技術(shù)不屬于“NoSQL”數(shù)據(jù)庫(kù)的范疇?()A.Redis(鍵值存儲(chǔ))B.MongoDB(文檔存儲(chǔ))C.Neo4j(圖形存儲(chǔ))D.MySQL(關(guān)系型存儲(chǔ))11.在公安情報(bào)分析中,通過(guò)分析歷史犯罪數(shù)據(jù)的時(shí)間序列特征,預(yù)測(cè)未來(lái)某一區(qū)域發(fā)案概率的趨勢(shì),這屬于典型的()應(yīng)用。A.關(guān)聯(lián)分析B.聚類分析C.回歸分析與時(shí)間序列預(yù)測(cè)D.異常檢測(cè)12.歐幾里得距離常用于衡量?jī)蓚€(gè)數(shù)據(jù)點(diǎn)之間的相似度,對(duì)于二維平面上兩點(diǎn)A(,)A.|B.C.(D.m13.在網(wǎng)絡(luò)爬蟲(chóng)技術(shù)中,robots.txt協(xié)議的作用是()。A.加密網(wǎng)頁(yè)數(shù)據(jù)B.告訴爬蟲(chóng)哪些頁(yè)面可以抓取,哪些不可以C.加速網(wǎng)頁(yè)加載速度D.防止SQL注入攻擊14.針對(duì)非結(jié)構(gòu)化文本數(shù)據(jù)(如警情記錄、微博評(píng)論),提取關(guān)鍵詞和情感傾向通常采用的自然語(yǔ)言處理(NLP)技術(shù)是()。A.TF-IDF與情感詞典匹配B.圖像邊緣檢測(cè)C.聲紋識(shí)別D.視頻流轉(zhuǎn)碼15.以下關(guān)于云計(jì)算服務(wù)模式的描述,對(duì)應(yīng)“PaaS(平臺(tái)即服務(wù))”的是()。A.提供虛擬機(jī)、存儲(chǔ)空間等硬件資源B.提供開(kāi)發(fā)語(yǔ)言、庫(kù)、數(shù)據(jù)庫(kù)管理系統(tǒng)等開(kāi)發(fā)平臺(tái)C.提供可直接使用的軟件應(yīng)用(如郵箱、OA)D.提供網(wǎng)絡(luò)寬帶接入服務(wù)16.在公安大數(shù)據(jù)實(shí)戰(zhàn)中,將不同業(yè)務(wù)系統(tǒng)(如110接處警、旅業(yè)系統(tǒng)、戶政系統(tǒng))的數(shù)據(jù)進(jìn)行關(guān)聯(lián),打破信息壁壘的過(guò)程被稱為()。A.數(shù)據(jù)可視化B.數(shù)據(jù)融合與共享C.數(shù)據(jù)加密D.數(shù)據(jù)備份17.決策樹(shù)算法中,用于選擇最優(yōu)劃分特征的指標(biāo)通常是信息增益或()。A.均方誤差B.基尼系數(shù)C.梯度下降D.正則化參數(shù)18.某模型在犯罪嫌疑人識(shí)別任務(wù)中,召回率很高但精確率很低,這意味著()。A.抓到的嫌疑人大多是真正的罪犯,但漏掉了很多罪犯B.抓到的嫌疑人很少是真正的罪犯,但幾乎沒(méi)漏掉罪犯C.模型表現(xiàn)非常完美D.模型完全沒(méi)有分類能力19.在梧州市智慧警務(wù)建設(shè)中,利用AI技術(shù)對(duì)西江流域重點(diǎn)監(jiān)控視頻進(jìn)行水上違法行為識(shí)別,主要依賴于計(jì)算機(jī)視覺(jué)中的()技術(shù)。A.目標(biāo)檢測(cè)與行為分析B.人臉識(shí)別C.語(yǔ)音識(shí)別D.OCR文字識(shí)別20.ApacheSpark相比MapReduce,其主要性能優(yōu)勢(shì)在于()。A.基于磁盤的計(jì)算B.基于內(nèi)存的迭代計(jì)算C.只能處理流數(shù)據(jù)D.不支持Scala語(yǔ)言21.數(shù)據(jù)庫(kù)中,事務(wù)具有ACID特性,其中“I”代表的是()。A.原子性B.一致性C.隔離性D.持久性22.在進(jìn)行大規(guī)模圖計(jì)算(如社交網(wǎng)絡(luò)關(guān)系分析)時(shí),常用的分布式計(jì)算框架是()。A.PregelB.HadoopC.TensorFlowD.Flask23.關(guān)于人工智能倫理與隱私保護(hù),在進(jìn)行公共場(chǎng)所安防監(jiān)控?cái)?shù)據(jù)分析時(shí),必須遵循的原則不包括()。A.最小夠用原則B.知情同意原則(在特定法律允許范圍內(nèi)可豁免)C.數(shù)據(jù)隨意公開(kāi)原則D.目的限定原則24.反向傳播算法(BP算法)主要用于訓(xùn)練()。A.K-Means模型B.神經(jīng)網(wǎng)絡(luò)C.支持向量機(jī)(SVM)D.樸素貝葉斯25.下列哪種情況適合使用“左連接(LEFTJOIN)”?A.查詢兩個(gè)表中完全匹配的數(shù)據(jù)B.查詢左表所有數(shù)據(jù),以及右表中匹配的數(shù)據(jù),無(wú)匹配顯示NULLC.查詢右表所有數(shù)據(jù),以及左表中匹配的數(shù)據(jù)D.生成笛卡爾積26.在評(píng)價(jià)分類模型時(shí),若類別極度不平衡(如嫌疑人極少,普通人極多),下列指標(biāo)相對(duì)最可靠的是()。A.準(zhǔn)確率B.F1-ScoreC.錯(cuò)誤率D.訓(xùn)練時(shí)間27.Python中,Pandas庫(kù)的核心數(shù)據(jù)結(jié)構(gòu)是()。A.List和DictB.Series和DataFrameC.Set和TupleD.Array和Matrix28.公安大數(shù)據(jù)平臺(tái)中,用于采集各警種業(yè)務(wù)系統(tǒng)日志數(shù)據(jù)的組件通常被設(shè)計(jì)為()。A.批處理作業(yè)B.ETL工具C.即時(shí)消息隊(duì)列D.手動(dòng)錄入界面29.某算法在訓(xùn)練集上表現(xiàn)極佳,但在測(cè)試集上表現(xiàn)很差,這種現(xiàn)象被稱為()。A.欠擬合B.過(guò)擬合C.梯度消失D.梯度爆炸30.在基于位置的警務(wù)服務(wù)(LBS)中,計(jì)算手機(jī)信令數(shù)據(jù)與基站距離時(shí),若基站位置坐標(biāo)為(,,),手機(jī)位置為(A.dB.dC.dD.d第二部分:多項(xiàng)選擇題(共15題,每題2分,共30分。多選、錯(cuò)選不得分,少選得0.5分)31.公安大數(shù)據(jù)具有“4V”特征,主要包括()。A.Volume(大量)B.Velocity(高速)C.Variety(多樣)D.Value(低價(jià)值密度)E.Virtual(虛擬)32.以下屬于深度學(xué)習(xí)常用框架的有()。A.TensorFlowB.PyTorchC.KerasD.CaffeE.MySQL33.在數(shù)據(jù)預(yù)處理階段,針對(duì)缺失值的處理方法常見(jiàn)的有()。A.刪除缺失記錄B.均值/中位數(shù)填充C.插值法填充D.使用固定常數(shù)填充E.忽略缺失值直接計(jì)算34.下列關(guān)于關(guān)系型數(shù)據(jù)庫(kù)和非關(guān)系型數(shù)據(jù)庫(kù)的說(shuō)法,正確的有()。A.關(guān)系型數(shù)據(jù)庫(kù)遵循ACID原則,適合事務(wù)處理B.非關(guān)系型數(shù)據(jù)庫(kù)模式靈活,易于水平擴(kuò)展C.Redis屬于非關(guān)系型數(shù)據(jù)庫(kù)中的鍵值存儲(chǔ)D.Oracle屬于非關(guān)系型數(shù)據(jù)庫(kù)E.非關(guān)系型數(shù)據(jù)庫(kù)不支持SQL查詢35.公安視頻圖像信息庫(kù)建設(shè)涉及的關(guān)鍵技術(shù)包括()。A.視頻結(jié)構(gòu)化B.人臉識(shí)別C.車牌識(shí)別D.Re-ID(行人重識(shí)別)E.視頻壓縮存儲(chǔ)36.關(guān)于Python中的Pandas庫(kù),下列說(shuō)法正確的是()。A.DataFrame可以看作是一個(gè)表格型的數(shù)據(jù)結(jié)構(gòu)B.read_csv()函數(shù)常用于讀取CSV文件C.drop_duplicates()方法用于刪除重復(fù)行D.它不能處理時(shí)間序列數(shù)據(jù)E.groupby()操作類似于SQL中的GROUPBY37.人工智能在公安領(lǐng)域的典型應(yīng)用場(chǎng)景包括()。A.智慧交通信號(hào)控制B.犯罪熱點(diǎn)地圖繪制C.電信詐騙智能預(yù)警D.涉毒線索挖掘E.監(jiān)獄在押人員行為分析38.在構(gòu)建預(yù)測(cè)模型時(shí),通常將數(shù)據(jù)集劃分為訓(xùn)練集和測(cè)試集,劃分的目的在于()。A.加快計(jì)算速度B.評(píng)估模型的泛化能力C.防止過(guò)擬合D.減少數(shù)據(jù)存儲(chǔ)空間E.增加數(shù)據(jù)量39.下列屬于《個(gè)人信息保護(hù)法》中規(guī)定的敏感個(gè)人信息的有()。A.生物識(shí)別信息B.宗教信仰C.特定身份D.醫(yī)療健康E.行程軌跡40.機(jī)器學(xué)習(xí)中的正則化技術(shù)(如L1、L2正則化)主要作用是()。A.防止過(guò)擬合B.加快模型收斂速度C.提高模型在訓(xùn)練集上的準(zhǔn)確率D.降低模型復(fù)雜度E.增加模型參數(shù)數(shù)量41.Hadoop生態(tài)系統(tǒng)中的核心組件包括()。A.HDFS(分布式文件系統(tǒng))B.YARN(資源調(diào)度器)C.MapReduce(分布式計(jì)算框架)D.HBase(分布式列式數(shù)據(jù)庫(kù))E.Linux操作系統(tǒng)42.在進(jìn)行網(wǎng)絡(luò)輿情分析時(shí),常用的文本挖掘技術(shù)有()。A.分詞B.命名實(shí)體識(shí)別(NER)C.主題模型(LDA)D.情感分析E.圖像分割43.以下關(guān)于k-近鄰算法(KNN)的描述,正確的有()。A.是一種惰性學(xué)習(xí)算法B.訓(xùn)練階段計(jì)算量較大,預(yù)測(cè)階段較快C.需要選擇合適的k值D.對(duì)數(shù)據(jù)的縮放敏感E.既可以用于分類也可以用于回歸44.公安數(shù)據(jù)治理的主要任務(wù)包括()。A.數(shù)據(jù)標(biāo)準(zhǔn)管理B.數(shù)據(jù)質(zhì)量管理C.數(shù)據(jù)安全管理D.數(shù)據(jù)生命周期管理E.數(shù)據(jù)資產(chǎn)化45.關(guān)于梯度下降算法,下列描述正確的有()。A.是一種迭代優(yōu)化算法B.目標(biāo)是最小化損失函數(shù)C.學(xué)習(xí)率過(guò)大可能導(dǎo)致不收斂D.學(xué)習(xí)率過(guò)小會(huì)導(dǎo)致收斂速度過(guò)慢E.只能用于凸函數(shù)優(yōu)化第三部分:判斷題(共20題,每題0.5分,共10分。對(duì)的選“A”,錯(cuò)的選“B”)46.大數(shù)據(jù)技術(shù)就是為了處理GB級(jí)別以上的數(shù)據(jù)而產(chǎn)生的,KB級(jí)別的數(shù)據(jù)不需要大數(shù)據(jù)技術(shù)。47.深度學(xué)習(xí)中的“梯度消失”問(wèn)題通常可以通過(guò)引入ReLU激活函數(shù)來(lái)部分緩解。48.在關(guān)系型數(shù)據(jù)庫(kù)中,外鍵用于建立和加強(qiáng)兩個(gè)表數(shù)據(jù)之間的鏈接。49.公安情報(bào)分析中,所有的關(guān)聯(lián)規(guī)則挖掘結(jié)果都具有實(shí)際應(yīng)用價(jià)值。50.NumPy數(shù)組中的所有元素必須是相同類型的。51.OCR(光學(xué)字符識(shí)別)技術(shù)可以將圖片中的文字轉(zhuǎn)換為可編輯的文本,在證件識(shí)別中應(yīng)用廣泛。52.云計(jì)算的三種服務(wù)模式IaaS、PaaS、SaaS中,SaaS提供給用戶的能力是使用云服務(wù)商運(yùn)行的應(yīng)用程序。53.樸素貝葉斯分類器假設(shè)特征之間是相互獨(dú)立的,這在現(xiàn)實(shí)世界中往往很難滿足。54.公安機(jī)關(guān)查詢公民個(gè)人信息時(shí),不需要經(jīng)過(guò)嚴(yán)格的審批和授權(quán)流程。55.數(shù)據(jù)倉(cāng)庫(kù)主要用于事務(wù)處理(OLTP),而數(shù)據(jù)庫(kù)主要用于分析處理(OLAP)。56.支持向量機(jī)(SVM)在處理非線性可分問(wèn)題時(shí),可以通過(guò)核技巧將數(shù)據(jù)映射到高維空間。57.Pandas中的merge函數(shù)默認(rèn)是按照索引進(jìn)行合并的。58.所有的機(jī)器學(xué)習(xí)模型在訓(xùn)練之前都需要對(duì)特征進(jìn)行歸一化或標(biāo)準(zhǔn)化處理。59.在圖結(jié)構(gòu)中,度是指與該節(jié)點(diǎn)相連的邊的數(shù)量。60.AUC(AreaUnderCurve)值越接近0.5,說(shuō)明分類器的性能越好。61.Python是一門解釋型語(yǔ)言,因此它的執(zhí)行速度通常比C語(yǔ)言慢。62.涉及國(guó)家秘密的信息系統(tǒng)不得直接或間接與國(guó)際互聯(lián)網(wǎng)或者其他公共信息網(wǎng)絡(luò)連接。63.聚類分析是一種無(wú)監(jiān)督學(xué)習(xí)算法,它不需要訓(xùn)練標(biāo)簽。64.在Spark中,RDD(彈性分布式數(shù)據(jù)集)一旦創(chuàng)建就不能被修改,是只讀的。65.計(jì)算機(jī)視覺(jué)技術(shù)在安防領(lǐng)域的應(yīng)用完全取代了人工巡邏,不再需要民警參與。第四部分:填空題(共10題,每題1分,共10分)66.在Python中,用于導(dǎo)入Pandas庫(kù)并簡(jiǎn)寫(xiě)為pd的語(yǔ)句是`importpandas____________`。67.機(jī)器學(xué)習(xí)中,用于衡量模型預(yù)測(cè)值與真實(shí)值之間差異的函數(shù),通常被稱為_(kāi)_____函數(shù),常見(jiàn)的有均方誤差(MSE)和交叉熵?fù)p失。68.數(shù)據(jù)清洗中,重復(fù)值去重可以使用Pandas庫(kù)中的`______()`方法。69.在二分類問(wèn)題中,如果預(yù)測(cè)為正例但實(shí)際為負(fù)例,這種情況被稱為_(kāi)_____。70.SQL語(yǔ)句中,用于從數(shù)據(jù)庫(kù)表中查詢數(shù)據(jù)的命令是`______`。71.協(xié)同過(guò)濾算法常用于推薦系統(tǒng),它主要分為基于用戶的協(xié)同過(guò)濾和基于______的協(xié)同過(guò)濾。72.在神經(jīng)網(wǎng)絡(luò)中,常用的非線性激活函數(shù)除了Sigmoid和Tanh外,還有目前在深度學(xué)習(xí)中最主流的______。73.公安大數(shù)據(jù)平臺(tái)的數(shù)據(jù)源通常包括結(jié)構(gòu)化數(shù)據(jù)、半結(jié)構(gòu)化數(shù)據(jù)和______數(shù)據(jù)。74.在進(jìn)行數(shù)據(jù)分析時(shí),若數(shù)據(jù)呈現(xiàn)右偏分布(長(zhǎng)尾在右),描述數(shù)據(jù)集中趨勢(shì)時(shí),______往往比平均值更具代表性。75.f(x)第五部分:簡(jiǎn)答題(共4題,每題5分,共20分)76.簡(jiǎn)述過(guò)擬合產(chǎn)生的原因及其常見(jiàn)的解決方法。77.請(qǐng)列舉出至少五種在公安大數(shù)據(jù)分析中常用的數(shù)據(jù)可視化圖表類型,并簡(jiǎn)述其適用場(chǎng)景。78.簡(jiǎn)述HDFS(HadoopDistributedFileSystem)的主要設(shè)計(jì)特點(diǎn)及其在存儲(chǔ)海量公安視頻監(jiān)控?cái)?shù)據(jù)時(shí)的優(yōu)勢(shì)。79.在處理涉及公民個(gè)人隱私的公安數(shù)據(jù)時(shí),數(shù)據(jù)脫敏(DataMasking)是常用的保護(hù)手段。請(qǐng)簡(jiǎn)述數(shù)據(jù)脫敏的主要方法。第六部分:綜合應(yīng)用題(共3題,共35分)80.(10分)某市公安局正在建設(shè)一套“重點(diǎn)人員異常行為預(yù)警系統(tǒng)”。系統(tǒng)采集了包括人員的住宿記錄(HDFS文件A)、出行記錄(HBase表B)、消費(fèi)記錄(MySQL表C)以及互聯(lián)網(wǎng)上網(wǎng)記錄(Elasticsearch索引D)?,F(xiàn)在需要編寫(xiě)一個(gè)數(shù)據(jù)處理流程,將這四部分?jǐn)?shù)據(jù)進(jìn)行關(guān)聯(lián),分析出“跨區(qū)域頻繁活動(dòng)且資金流異常”的嫌疑人員列表。(1)請(qǐng)從技術(shù)架構(gòu)角度,描述該數(shù)據(jù)融合處理流程應(yīng)包含哪些關(guān)鍵步驟?(如:數(shù)據(jù)抽取、清洗、轉(zhuǎn)換等,請(qǐng)?jiān)敿?xì)展開(kāi))(2)針對(duì)“跨區(qū)域頻繁活動(dòng)”這一指標(biāo),如果使用Python代碼進(jìn)行邏輯判斷,假設(shè)已知某人員一周內(nèi)的所有位置打卡記錄列表`locations=['A區(qū)','B區(qū)','A區(qū)','C區(qū)','A區(qū)']`,請(qǐng)編寫(xiě)一段Python代碼片段,計(jì)算該人員出現(xiàn)的不同區(qū)域數(shù)量(即活動(dòng)范圍)。81.(12分)在視頻偵查實(shí)戰(zhàn)中,人臉識(shí)別技術(shù)至關(guān)重要。(1)請(qǐng)簡(jiǎn)述基于深度學(xué)習(xí)的人臉識(shí)別流程,包括人臉檢測(cè)、人臉對(duì)齊、特征提取和特征比對(duì)四個(gè)階段的主要工作。(2)在評(píng)價(jià)人臉識(shí)別算法性能時(shí),ROC曲線和AUC值是重要指標(biāo)。請(qǐng)解釋什么是ROC曲線?AUC值等于1、0.5分別代表什么含義?(3)某算法在特定測(cè)試集上的混淆矩陣如下:預(yù)測(cè)正例(嫌疑人)預(yù)測(cè)負(fù)例(普通人)真實(shí)正例(嫌疑人)9010真實(shí)負(fù)例(普通人)30870請(qǐng)計(jì)算該算法的準(zhǔn)確率、精確率和召回率。82.(13分)某市發(fā)生連環(huán)盜竊案,警方收集了大量案發(fā)地周邊的WIFI探針MAC地址數(shù)據(jù)和手機(jī)信令數(shù)據(jù)?,F(xiàn)欲利用聚類算法發(fā)現(xiàn)可能的作案團(tuán)伙或高危人員聚集點(diǎn)。(1)若選擇K-Means算法進(jìn)行聚類,請(qǐng)簡(jiǎn)述該算法的基本原理。(2)在使用K-Means之前,為什么通常需要對(duì)數(shù)據(jù)進(jìn)行標(biāo)準(zhǔn)化處理?(3)已知平面坐標(biāo)系中有三個(gè)點(diǎn):(1,1),(1.5,2(公式提示:歐氏距離d((4)除了K-Means,請(qǐng)列舉出另外兩種聚類算法名稱。答案及詳細(xì)解析第一部分:?jiǎn)雾?xiàng)選擇題1.B解析:批處理主要用于處理大規(guī)模的歷史靜態(tài)數(shù)據(jù),對(duì)實(shí)時(shí)性要求低,注重吞吐量。流計(jì)算用于實(shí)時(shí)數(shù)據(jù)。2.C解析:HDFS(HadoopDistributedFileSystem)是Hadoop的分布式文件存儲(chǔ)組件。3.B解析:t-SNE(t-DistributedStochasticNeighborEmbedding)是一種流行的數(shù)據(jù)可視化降維技術(shù),擅長(zhǎng)保留局部結(jié)構(gòu)。K-Means是聚類,邏輯回歸是分類,決策樹(shù)是分類/回歸。4.D解析:視頻結(jié)構(gòu)化主要提取視頻內(nèi)容中的語(yǔ)義信息,如人、車、物的特征。音頻比特率是文件編碼屬性,不屬于結(jié)構(gòu)化語(yǔ)義內(nèi)容。5.B解析:知識(shí)圖譜技術(shù)最適合用于構(gòu)建實(shí)體(人、地、事、物)之間的關(guān)系網(wǎng)絡(luò)。6.A解析:NumPy是Python科學(xué)計(jì)算基礎(chǔ)庫(kù),提供數(shù)組支持。Pandas基于NumPy。7.D解析:CNN雖然主要用于圖像,但通過(guò)一維卷積(1D-CNN)也可以處理文本和時(shí)間序列數(shù)據(jù)。8.C解析:年齡為負(fù)數(shù)明顯不符合現(xiàn)實(shí)邏輯,屬于異常值。9.C解析:根據(jù)《數(shù)據(jù)安全法》,國(guó)家建立數(shù)據(jù)分類分級(jí)保護(hù)制度,對(duì)數(shù)據(jù)實(shí)行分類分級(jí)保護(hù)。10.D解析:MySQL是關(guān)系型數(shù)據(jù)庫(kù)(RDBMS),其他三個(gè)都屬于NoSQL范疇。11.C解析:預(yù)測(cè)未來(lái)趨勢(shì)屬于回歸分析和時(shí)間序列預(yù)測(cè)的范疇。12.B解析:歐幾里得距離即兩點(diǎn)間的直線距離,公式為。13.B解析:robots.txt是站點(diǎn)與爬蟲(chóng)間的協(xié)議,規(guī)定抓取范圍。14.A解析:TF-IDF用于提取關(guān)鍵詞,情感詞典用于情感傾向分析,均屬于文本處理。其他選項(xiàng)涉及音視頻和圖像。15.B解析:PaaS(PlatformasaService)提供平臺(tái)環(huán)境,如語(yǔ)言、庫(kù)、數(shù)據(jù)庫(kù)管理系統(tǒng)。A是IaaS,C是SaaS。16.B解析:打破信息壁壘,整合多源數(shù)據(jù)的過(guò)程即數(shù)據(jù)融合與共享。17.B解析:ID3使用信息增益,C4.5使用信息增益率,CART使用基尼系數(shù)。基尼系數(shù)常用于衡量不純度。18.B解析:召回率高意味著查全率高(漏抓少),精確率低意味著查準(zhǔn)率低(誤抓多)。19.A解析:水上違法行為識(shí)別屬于對(duì)視頻中物體和動(dòng)作的分析,即目標(biāo)檢測(cè)與行為分析。20.B解析:Spark基于內(nèi)存計(jì)算,迭代速度快,相比MapReduce(基于磁盤)有巨大性能優(yōu)勢(shì)。21.C解析:ACID分別代表原子性、一致性、隔離性、持久性。I是Isolation(隔離性)。22.A解析:Pregel是Google提出的圖計(jì)算框架,Hadoop是批處理,TensorFlow是深度學(xué)習(xí),F(xiàn)lask是Web框架。23.C解析:數(shù)據(jù)隨意公開(kāi)違反了數(shù)據(jù)安全和隱私保護(hù)原則。24.B解析:反向傳播(BP)是訓(xùn)練神經(jīng)網(wǎng)絡(luò)最常用的算法。25.B解析:LEFTJOIN以左表為主,保留左表所有數(shù)據(jù)。26.B解析:在類別不平衡時(shí),準(zhǔn)確率容易產(chǎn)生誤導(dǎo)(全猜多數(shù)類準(zhǔn)確率也很高),F(xiàn)1-Score綜合考慮了精確率和召回率。27.B解析:Pandas核心數(shù)據(jù)結(jié)構(gòu)是Series(一維)和DataFrame(二維)。28.B解析:ETL(Extract,Transform,Load)工具用于數(shù)據(jù)的抽取、轉(zhuǎn)換和加載。29.B解析:訓(xùn)練集表現(xiàn)好、測(cè)試集表現(xiàn)差是典型的過(guò)擬合現(xiàn)象。欠擬合是訓(xùn)練集和測(cè)試集都差。30.C解析:三維空間歐氏距離公式。第二部分:多項(xiàng)選擇題31.ABCD解析:大數(shù)據(jù)4V特征:Volume,Velocity,Variety,Value。Virtual不是標(biāo)準(zhǔn)特征。32.ABCD解析:TensorFlow,PyTorch,Keras,Caffe都是深度學(xué)習(xí)框架。MySQL是數(shù)據(jù)庫(kù)。33.ABCD解析:刪除、填充(均值、中位數(shù)、常數(shù)、插值)都是常見(jiàn)處理方法。34.ABC解析:關(guān)系型數(shù)據(jù)庫(kù)(如Oracle)支持ACID;NoSQL靈活、易擴(kuò)展;Redis是NoSQL。D、E錯(cuò)誤,NoSQL也有類SQL接口或特定查詢語(yǔ)言。35.ABCDE解析:視頻結(jié)構(gòu)化、人臉識(shí)別、車牌識(shí)別、Re-ID、存儲(chǔ)壓縮都是公安視頻庫(kù)的關(guān)鍵技術(shù)。36.ABCE解析:Pandas非常適合處理時(shí)間序列數(shù)據(jù),D錯(cuò)誤。37.ABCDE解析:五項(xiàng)均為AI在公安領(lǐng)域的典型實(shí)戰(zhàn)應(yīng)用。38.BC解析:劃分?jǐn)?shù)據(jù)集是為了評(píng)估泛化能力和防止過(guò)擬合。不是為了加快計(jì)算或減少存儲(chǔ)。39.ABCDE解析:《個(gè)人信息保護(hù)法》規(guī)定,生物識(shí)別、宗教信仰、特定身份、醫(yī)療健康、行蹤軌跡等都屬于敏感個(gè)人信息。40.AD解析:正則化主要為了防止過(guò)擬合和降低模型復(fù)雜度,通常以犧牲一點(diǎn)訓(xùn)練集準(zhǔn)確率為代價(jià)。41.ABC解析:HDFS,YARN,MapReduce是Hadoop的“三駕馬車”。HBase是子項(xiàng)目,Linux是操作系統(tǒng)。42.ABCD解析:分詞、NER、LDA、情感分析均為文本挖掘技術(shù)。圖像分割屬于計(jì)算機(jī)視覺(jué)。43.ACDE解析:KNN是惰性學(xué)習(xí),訓(xùn)練快(幾乎不計(jì)算),預(yù)測(cè)慢(需計(jì)算距離)。B錯(cuò)誤。44.ABCDE解析:標(biāo)準(zhǔn)、質(zhì)量、安全、生命周期、資產(chǎn)化均為數(shù)據(jù)治理的任務(wù)。45.ACD解析:梯度下降用于最小化損失函數(shù),學(xué)習(xí)率大小影響收斂,既可優(yōu)化凸也可優(yōu)化非凸(雖可能陷入局部最優(yōu))。46.B解析:大數(shù)據(jù)不僅指數(shù)據(jù)量大,還包含處理復(fù)雜度和速度等,且小數(shù)據(jù)若處理邏輯復(fù)雜也可能用到相關(guān)思想,但本質(zhì)上大數(shù)據(jù)技術(shù)是為了處理超出單機(jī)能力的數(shù)據(jù),GB級(jí)數(shù)據(jù)單機(jī)即可處理,不需要Hadoop/Spark等集群技術(shù)。此題定義較為嚴(yán)格,通常認(rèn)為大數(shù)據(jù)是指TB/PB級(jí)以上或復(fù)雜度高。47.A解析:ReLU函數(shù)在正區(qū)間的導(dǎo)數(shù)恒為1,能有效緩解深層網(wǎng)絡(luò)中的梯度消失問(wèn)題。48.A解析:外鍵正是用于維護(hù)表之間引用完整性的機(jī)制。49.B解析:關(guān)聯(lián)規(guī)則挖掘會(huì)產(chǎn)生大量規(guī)則,其中很多可能是無(wú)意義或偶然的(如“啤酒和尿布”在某些數(shù)據(jù)集可能只是巧合),需要通過(guò)支持度、置信度和業(yè)務(wù)邏輯篩選。50.A解析:NumPy數(shù)組為了高性能計(jì)算,要求數(shù)據(jù)類型一致。51.A解析:OCR是文字識(shí)別技術(shù),廣泛應(yīng)用于證件、車牌識(shí)別等。52.A解析:SaaS即軟件即服務(wù),用戶直接使用軟件。53.A解析:樸素貝葉斯的“樸素”假設(shè)就是特征獨(dú)立。54.B解析:公安機(jī)關(guān)查詢公民個(gè)人信息必須嚴(yán)格依照法律法規(guī),經(jīng)過(guò)內(nèi)部審批和授權(quán),嚴(yán)禁非法查詢。55.B解析:恰好相反。數(shù)據(jù)倉(cāng)庫(kù)用于分析(OLAP),數(shù)據(jù)庫(kù)用于事務(wù)處理(OLTP)。56.A解析:核技巧是SVM處理非線性問(wèn)題的核心方法。57.B解析:merge默認(rèn)根據(jù)列名(或on指定的列)進(jìn)行合并,不是索引。想用索引合并需設(shè)置left_index=True等。58.B解析:不是所有模型都需要,例如基于樹(shù)的模型(決策樹(shù)、隨機(jī)森林)對(duì)特征縮放不敏感。59.A解析:圖的度是指節(jié)點(diǎn)連接的邊數(shù)。60.B解析:AUC越接近1越好,0.5相當(dāng)于隨機(jī)猜測(cè)。61.A解析:Python是解釋型,運(yùn)行效率通常低于編譯型語(yǔ)言如C/C++。62.A解析:涉密網(wǎng)必須與互聯(lián)網(wǎng)物理隔離。63.A解析:聚類是無(wú)監(jiān)督學(xué)習(xí),沒(méi)有標(biāo)簽。64.A解析:RDD(ResilientDistributedDataset)是只讀的,轉(zhuǎn)換操作會(huì)生成新的RDD。65.B解析:AI是輔助手段,不能完全替代人工決策和巡邏,存在誤判且需要最終確認(rèn)。第四部分:填空題66.aspd67.損失68.drop_duplicates69.假陽(yáng)性或假正例70.SELECT71.物品72.ReLU(RectifiedLinearUnit)73.非結(jié)構(gòu)化74.中位數(shù)75.Sigmoid或激活第五部分:簡(jiǎn)答題76.答案:(1)原因:模型過(guò)于復(fù)雜(參數(shù)過(guò)多)、訓(xùn)練數(shù)據(jù)太少、數(shù)據(jù)噪聲干擾、訓(xùn)練時(shí)間過(guò)長(zhǎng)。(2)解決方法:數(shù)據(jù)層面:增加訓(xùn)練數(shù)據(jù)量、使用數(shù)據(jù)增強(qiáng)。模型層面:簡(jiǎn)化模型結(jié)構(gòu)(減少層數(shù)或神經(jīng)元)、使用正則化(L1/L2正則化)。訓(xùn)練策略:早停法、Dropout(隨機(jī)失活)。集成方法:Bagging(如隨機(jī)森林)。77.答案:(1)折線圖:用于展示數(shù)據(jù)隨時(shí)間變化的趨勢(shì)(如某轄區(qū)月發(fā)案量趨勢(shì))。(2)柱狀圖:用于比較不同類別之間的數(shù)值大?。ㄈ绺鞣志制瓢笖?shù)量對(duì)比)。(3)餅圖/環(huán)形圖:用于展示各部分占總體的比例(如各類犯罪案件占比)。(4)散點(diǎn)圖:用于展示兩個(gè)變量之間的相關(guān)性(如氣溫與盜竊案數(shù)量的關(guān)系)。(5)熱力圖:用于展示地理空間上的密度或矩陣中的相關(guān)性(如犯罪熱點(diǎn)分布圖)。(6)箱線圖:用于展示數(shù)據(jù)的分布情況及異常值(如人員活動(dòng)半徑分布)。78.答案:HDFS主要設(shè)計(jì)特點(diǎn):(1)高容錯(cuò)性:數(shù)據(jù)通過(guò)副本機(jī)制(默認(rèn)3副本)存儲(chǔ),某個(gè)節(jié)點(diǎn)故障時(shí)數(shù)據(jù)不會(huì)丟失。(2)高吞吐量:采用流式數(shù)據(jù)訪問(wèn)模式,適合批量處理,優(yōu)化了數(shù)據(jù)的讀取速度。(3)適合大規(guī)模數(shù)據(jù)集:?jiǎn)蝹€(gè)文件可達(dá)TB、PB級(jí)別,支持millionsoffiles。(4)廉價(jià)硬件:構(gòu)建在普通的PC服務(wù)器上,成本低。在存儲(chǔ)公安視頻監(jiān)控?cái)?shù)據(jù)時(shí)的優(yōu)勢(shì):視頻監(jiān)控?cái)?shù)據(jù)具有數(shù)據(jù)量巨大、寫(xiě)入后基本不修改、需長(zhǎng)期保存的特點(diǎn)。HDFS的大文件支持和高吞吐量非常適合順序?qū)懭牒妥x取視頻文件,其副本機(jī)制保證了重要監(jiān)控證據(jù)的安全性,且成本相比傳統(tǒng)SAN存儲(chǔ)低廉。79.答案:數(shù)據(jù)脫敏的主要方法包括:(1)替換:用虛構(gòu)但看起來(lái)真實(shí)的數(shù)據(jù)替換真實(shí)數(shù)據(jù)(如將姓名“張三”替換為“李四”)。(2)重排:打亂數(shù)據(jù)的順序(如身份證號(hào)打亂位置)。(3)加密:使用加密算法對(duì)數(shù)據(jù)進(jìn)行加密,只有擁有密鑰才能解密查看。(4)截?cái)?遮蔽:只顯示部分信息,其余用符號(hào)代替(如手機(jī)號(hào)138****1234)。(5)哈希:對(duì)數(shù)據(jù)進(jìn)行哈希運(yùn)算,通常用于不可逆的脫敏場(chǎng)景。第六部分:綜合應(yīng)用題80.答案:(1)關(guān)鍵步驟:數(shù)據(jù)抽?。簭腍DFS文件A讀取文本/日志,從HBase表B通過(guò)API讀取行鍵數(shù)據(jù),從MySQL表C通過(guò)JDBC/ODBC讀取結(jié)構(gòu)化數(shù)據(jù),從Elasticsearch索引D通過(guò)RestAPI讀取文檔數(shù)據(jù)。數(shù)據(jù)清洗:處理缺失值(如填補(bǔ)或剔除)、去除重復(fù)記錄、糾正異常數(shù)據(jù)(如時(shí)間格式不統(tǒng)一)。數(shù)據(jù)轉(zhuǎn)換/整合:統(tǒng)

溫馨提示

  • 1. 本站所有資源如無(wú)特殊說(shuō)明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁(yè)內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒(méi)有圖紙預(yù)覽就沒(méi)有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫(kù)網(wǎng)僅提供信息存儲(chǔ)空間,僅對(duì)用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
  • 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。

最新文檔

評(píng)論

0/150

提交評(píng)論