版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領
文檔簡介
(19)國家知識產權局(12)發明專利務所(普通合伙)44285GO6N3/0464(2023審查員張華晶裝置將無標注數據的第一圖像樣本切分為多個第一征識別模型中的編碼器和第二解碼器構建任務像樣本包含的詞片序列對任務處理模型進行訓練,得到0CR識別模型。本申請無需大量標注數將無標注數據的第一圖像樣本切分為多個第一圖像塊,并將無標注數據的第一圖像樣本切分為多個第一圖像塊,并從多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,得到遮擋圖像塊和未遮擋圖像塊型2將無標注數據的第一圖像樣本切分為多個第一圖像塊,并從所述多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,得到遮擋圖像塊和未遮擋圖像塊,其中,所述遮擋圖像塊的數量大于所述未遮擋圖像塊的數量;利用所述遮擋圖像塊和所述未遮擋圖像塊,以重構所述第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓練,得到預訓練特征識別模型;基于所述預訓練特征識別模型中的編碼器和第二解碼器構建任務處理模型;將有標注數據的第二圖像樣本切分為多個第二圖像塊;采用所述多個第二圖像塊和所述第二圖像樣本包含的詞片序列對所述任務處理模型進行訓練,得到的模型作為OCR識別模型;所述利用所述遮擋圖像塊和所述未遮擋圖像塊,以重構所述第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓練,得到預訓練特征識別模型,包括:將所述未遮擋圖像塊輸入到所述初始特征識別模型包含的編碼器中,得到所述未遮擋圖像塊的視覺語義信息;將所述未遮擋圖像塊的視覺語義信息和所述遮擋圖像塊輸入到所述初始特征識別模型包含的第一解碼器中,得到重構出的所述未遮擋圖像塊和所述遮擋圖像塊分別對應的預設特征;根據重構出的所述未遮擋圖像塊和所述遮擋圖像塊分別對應的預設特征,以及,從所述第一圖像樣本提取的預設特征,對所述初始特征識別模型的參數進行預訓練,得到所述預訓練特征識別模型。2.根據權利要求1所述的OCR識別模型訓練方法,其特征在于,所述預設特征包括以下3.根據權利要求1所述的OCR識別模型訓練方法,其特征在于,所述采用所述多個第二圖像塊和所述第二圖像樣本包含的詞片序列對任務處理模型進行訓練,得到的模型作為將所述多個第二圖像塊輸入到所述任務處理模型中,得到所述多個第二圖像塊對應的基于所述多個第二圖像塊對應的OCR識別結果和所述第二圖像樣本包含的詞片序列對所述任務處理模型的參數進行訓練,得到所述OCR識別模型。4.根據權利要求1所述的OCR識別模型訓練方法,其特征在于,圖像樣本的獲取方法,包獲取原始樣本;對所述原始樣本進行圖像轉換處理,得到處理后的原始樣本,其中,所述圖像轉換處理將所述原始樣本和所述處理后的原始樣本作為所述圖像樣本。獲取待識別圖像;將所述待識別圖像切分為多個待識別圖像塊;3將所述多個待識別圖像塊輸入所述OCR識別模型中,以得到所述OCR識別模型輸出的OCR識別結果,作為所述待識別圖像的OCR識別結果。構建模塊、第二切分模塊和第二訓練模塊;所述第一切分模塊,用于將無標注數據的第一圖像樣本切分為多個第一圖像塊,并從所述多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,得到遮擋圖像塊和未遮擋圖像塊,其中,所述遮擋圖像塊的數量大于所述未遮擋圖像塊的數量;所述第一訓練模塊,用于利用所述遮擋圖像塊和所述未遮擋圖像塊,以重構所述第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓練,得到預訓練特征識別模型;模型構建模塊,用于基于所述預訓練特征識別模型中的編碼器和第二解碼器構建任務處理模型;所述第二切分模塊,用于將有標注數據的第二圖像樣本切分為多個第二圖像塊;所述第二訓練模塊,用于采用所述多個第二圖像塊和所述第二圖像樣本包含的詞片序列對所述任務處理模型進行訓練,得到的模型作所述第一訓練模塊,具體用于:將所述未遮擋圖像塊輸入到所述初始特征識別模型包含的編碼器中,得到所述未遮擋圖像塊的視覺語義信息;將所述未遮擋圖像塊的視覺語義信息和所述遮擋圖像塊輸入到所述初始特征識別模型包含的第一解碼器中,得到重構出的所述未遮擋圖像塊和所述遮擋圖像塊分別對應的預設特征;根據重構出的所述未遮擋圖像塊和所述遮擋圖像塊分別對應的預設特征,以及,從所述第一圖像樣本提取的預設特征,對所述初始特征識別模型的參數進行預訓練,得到所述預訓練特征識別模型。所述獲取模塊,用于獲取待識別圖像;所述第三切分模塊,用于將所述待識別圖像切分為多個待識別圖像塊;所述識別模塊,用于將所述多個待識別圖像塊輸入所述OCR識別模型中,以得到所述所述處理器,用于執行所述程序,實現如權利要求1~4任一項所述的OCR識別模型訓練9.一種可讀存儲介質,其上存儲有計算機程序,其特征在于,所述計算機程序被處理器識別方法的各個步驟。4技術領域相關裝置。背景技術[0002]OCR(OpticalCharacterRecognition,光學字符識別)是利用光學技術和計算機技術把印在或寫在紙上的文字讀取出來,并轉換成一種計算機能夠接受、人又可以理解的格式,現在也包含自然場景的文字識別。[0003]目前主流的OCR識別模型主要采用CNN網絡作為骨干網絡,采用CTC作為解碼器,其中,在構建OCR識別模型時需要使用大量有標注數據的圖像樣本進行模型訓練。[0004]但是,標注數據需要耗費大量時間和資源,使得OCR識別模型的訓練效率大大降發明內容決現有技術OCR識別模型的訓練效率低且識別效果差的問題,其技術方案如下:[0007]將無標注數據的第一圖像樣本切分為多個第一圖像塊,并從多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,得到遮擋圖像塊和未遮擋圖像塊,其中,遮擋圖像塊的數量大于未遮擋圖像塊的數量;[0008]利用遮擋圖像塊和未遮擋圖像塊,以重構第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓練,得到預訓練特征識別模型;[0009]基于預訓練特征識別模型中的編碼器和第二解碼器構建任務處理模型;[0010]將有標注數據的第二圖像樣本切分為多個第二圖像塊;[0011]采用多個第二圖像塊和第二圖像樣本包含的詞片序列對任務處理模型進行訓練,得到的模型作為OCR識別模型。[0012]可選的,利用遮擋圖像塊和未遮擋圖像塊,以重構第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓練,得到預訓練[0013]將未遮擋圖像塊輸入到初始特征識別模型包含的編碼器中,得到未遮擋圖像塊的視覺語義信息;[0014]將未遮擋圖像塊的視覺語義信息和遮擋圖像塊輸入到初始特征識別模型包含的第一解碼器中,得到重構出的未遮擋圖像塊和遮擋圖像塊分別對應的預設特征;[0015]根據重構出的未遮擋圖像塊和遮擋圖像塊分別對應的預設特征,以及,從第一圖像樣本提取的預設特征,對初始特征識別模型的參數進行預訓練,得到預訓練特征識別模5[0016]可選的,預設特征包括以下特征中的一種或多種:方向梯度直方圖特征、卷積神經[0017]可選的,采用多個第二圖像塊和第二圖像樣本包含的詞片序列對任務處理模型進[0018]將多個第二圖像塊輸入到任務處理模型中,得到多個第二圖像塊對應的OCR識別結果;[0019]基于多個第二圖像塊對應的OCR識別結果和第二圖像樣本包含的詞片序列對任務[0022]對原始樣本進行圖像轉換處理,得到處理后的原始樣本,其中,圖像轉換處理包括以下處理中的一種或多種:隨機旋轉、高斯模糊、圖像膨脹、圖像腐蝕、下采樣和添加下劃[0023]將原始樣本和處理后的原始樣本作為圖像樣本。[0025]獲取待識別圖像;[0026]將待識別圖像切分為多個待識別圖像塊;[0027]將多個待識別圖像塊輸入OCR識別模型中,以得到OCR識別模型輸出的OCR識別結果,作為待識別圖像的OCR識別結果。第二切分模塊和第二訓練模塊;[0029]第一切分模塊,用于將無標注數據的第一圖像樣本切分為多個第一圖像塊,并從多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,得到遮擋圖像塊和未遮擋圖像塊,其中,遮擋圖像塊的數量大于未遮擋圖像塊的數量;[0030]第一訓練模塊,用于利用遮擋圖像塊和未遮擋圖像塊,以重構第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓練,得到預訓練特征識別模型;[0031]模型構建模塊,用于基于預訓練特征識別模型中的編碼器和第二解碼器構建任務處理模型;[0032]第二切分模塊,用于將有標注數據的第二圖像樣本切分為多個第二圖像塊;[0033]第二訓練模塊,用于采用多個第二圖像塊和第二圖像樣本包含的詞片序列對任務和識別模塊;[0036]第三切分模塊,用于將待識別圖像切分為多個待識別圖像塊;[0037]識別模塊,用于將多個待識別圖像塊輸入0CR識別模型中,以得到OCR識別模型輸6識別方法的各個步驟。[0041]一種可讀存儲介質,其上存儲有計算機程序,其特征在于,計算機程序被處理器執[0042]經由上述的技術方案可知,本申請提供的OCR識別模型訓練方法,首先將無標注數據的第一圖像樣本切分為多個第一圖像塊,并從多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,得到遮擋圖像塊和未遮擋圖像塊,然后利用遮擋圖像塊和未遮擋圖像塊,以重構第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓練,得到預訓練特征識別模型,接著基于預訓練特征識別模型中的編碼器和第二解碼器構建任務處理模型,之后將有標注數據的第二圖像樣本切分為多個第二圖像塊,最后采用多個第二圖像塊和第二圖像樣本包含的詞片序列對任務處理模型進行訓練,得到的模型作為OCR識別模型。本申請能夠基于大量無標注數據的第一圖像樣本對預先構建的初始特征識別模型進行訓練,以得到預訓練特征識別模型,基于該預訓練特征識別模型中的編碼器和第二解碼器即可構建任務處理模型,之后基于少量有標注數據的第二圖像樣本和第二圖像樣本包含的詞片序列訓練任務處理模型,即可得到具備更高識別能力的附圖說明[0043]為了更清楚地說明本申請實施例或現有技術中的技術方案,下面將對實施例或現有技術描述中所需要使用的附圖作簡單地介紹,顯而易見地,下面描述中的附圖僅僅是本申請的實施例,對于本領域普通技術人員來講,在不付出創造性勞動的前提下,還可以根據提供的附圖獲得其他的附圖。[0044]圖1為本申請實施例提供的OCR識別模型訓練方法的流程示意圖;[0045]圖2a為本申請實施例提供的圖像樣本的示意圖;[0046]圖2b為本申請實施例提供的遮擋圖像塊和未遮擋圖像塊的示意圖;[0047]圖3為本申請實施例提供的編碼器結構的示意圖;[0048]圖4為本申請實施例提供的解碼器結構的示意圖;[0049]圖5為本申請實施例提供的初始特征識別模型的訓練過程示意圖;[0050]圖6為本申請實施例提供的OCR識別方法的流程示意圖;[0051]圖7為本申請實施例提供的OCR識別模型的識別過程示意圖;[0052]圖8為本申請實施例提供的OCR識別模型訓練裝置的結構示意圖;[0053]圖9為本申請實施例提供的OCR識別裝置的結構示意圖;[0054]圖10為本申請實施例提供的OCR識別模型訓練設備的硬件結構框圖;[0055]圖11為本申請實施例提供的OCR識別設備的硬件結構框圖。具體實施方式[0056]下面將結合本申請實施例中的附圖,對本申請實施例中的技術方案進行清楚、完7整地描述,顯然,所描述的實施例僅僅是本申請一部分實施例,而不是全部的實施例。基于本申請中的實施例,本領域普通技術人員在沒有做出創造性勞動前提下所獲得的所有其他[0057]如背景技術中的介紹,現有的OCR識別模型主要采用CNN網絡作為骨干網絡,采用CTC作為解碼器,并且構建過程需要使用大量有標注數據的圖像樣本進行模型訓練。[0058]但是,標注數據需要耗費大量時間和資源,不能利用廉價易獲取的大規模的無標其易導致形近字錯誤識別,識別效果較差,往往需要配合額外的字符級別的語言模型或者形近詞典來進行后處理(例如糾錯等),以提高整體準確率;另外,因為光線變化或者物體遮述問題。為了使本領域技術人員更加理解本申請,接下來通過下述實施例對本申請提供的OCR識別模型訓練方法進行詳細介紹。[0060]請參閱圖1,示出了本申請實施例提供的OCR識別模型訓練方法的流程示意圖,該[0061]步驟S101、將無標注數據的第一圖像樣本切分為多個第一圖像塊,并從多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,得到遮擋圖像塊和未遮擋圖像塊。[0062]其中,遮擋圖像塊的數量大于未遮擋圖像塊的數量。[0063]本實施例可采用大量無標注數據的第一圖像樣本訓練初始的特征識別模型,其中,對于每個第一圖像樣本,本步驟可將該第一圖像樣本切分為多個固定大小的圖像塊patch,為了便于描述,本步驟將切分出的圖像塊定義為第一圖像塊。[0064]考慮到圖像具有局部相似性和平移不變性,具有很多冗余信息(即圖像的語義密度很低),如果僅遮擋很少比例的第一圖像塊,則在訓練初始特征識別模型時,特征識別模型很容易偷懶,簡單地從鄰居信息就可以腦補學習,最終導致學不到高層語義信息,基于此,需要從多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,并且使遮擋圖像塊的數量大于未遮擋圖像塊的數量,如此便可強迫特征識別模型學習最精煉的視覺語義信息。[0065]需要說明的是,本步驟隨機遮擋第一圖像塊時,是按照遮擋圖像塊的數量與未遮擋圖像塊的數量的比值為設定比值進行遮擋操作的;可選的,本步驟可在隨機遮擋時,使遮擋圖像塊的數量與未遮擋圖像塊的數量的比值為3比2,例如,以第一圖像樣本為圖2a所示的圖像樣本為例,隨機遮擋后的效果可參見圖2b所示。[0066]當然,本申請實施例中,遮擋圖像塊的數量與未遮擋圖像塊的數量的比值還可以為其他,例如,遮擋圖像塊的數量與未遮擋圖像塊的數量的比值為3比1,本申請對此不進行具體限定。[0067]步驟S102、利用遮擋圖像塊和未遮擋圖像塊,以重構第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓練,得到預訓練特征識別模型。[0068]在本實施例中,首先需要基于編碼器和第一解碼器構建初始特征識別模型。[0069]其中,編碼器用于提取輸入圖像的視覺語義信息,由于圖像的語義密度很低,采用合理的訓練方法對初始特征識別模型進行訓練,就可以使訓練出的編碼器(即預訓練特征8識別模型中的編碼器)能夠提取更精煉、更完備的視覺語義信息,圖像塊輸入編碼器進行訓練,使得預訓練特征識別模型中的編碼器提取的未遮擋圖像塊的視覺語義信息能夠表征第一圖像樣本的視覺語義信息。[0070]可選的,上述編碼器可采用transformer結構,該結構可參見圖3所示,即,編碼器由N個多頭注意力層(Multi-HeadAttention)和前饋神經網絡層(FeedForward)組成,這里,N的具體取值可以根據實際情況確定。[0071]上文中的第一解碼器用于基于未遮擋圖像塊的視覺語義信息和遮擋圖像塊,重構遮擋圖像塊和未遮擋圖像塊分別對應的預設特征。本實施例選擇基于第一解碼器重構預設特征而不是重構第一圖像樣本的像素,是因為像素中含有太多不重要的高頻細節,讓構建的特征識別模型去擬合這些高頻細節,容易造成過擬合,而預設特征具有穩定性,讓構建的特征識別模型去擬合預設特征,使得特征識別模型能夠學習到更好更多的高級語義信息,避免陷入噪聲細節中。[0072]可選的,第一解碼器也可采用transformer結構,該結構可參見圖4所示,即,第一解碼器由N個掩蔽多頭注意力層(MaskedMulti-HeadAttention)、多頭注意力層(Multi-HeadAttention)和前饋神經網絡層(FeedForward)組成。[0073]可選的,上述預設特征可以為方向梯度直方圖特征(即HOG特征),由于HOG特征可以基于第一圖像樣本快速、方便地計算出來,因此選擇HOG特征作為本實施例中的預設特神經網絡特征(即CNN特征)或者其他傳統特征,例如,局部二值模式(LocalBinaryfeaturetransform,尺度不變特征變換)特征等,本申請對此不進行限定。[0074]需要說明的是,鑒于現有技術已有類似的編碼器結構和解碼器結構,即本實施例的編碼器和第一解碼器中,部分層與現有技術相同,則為了提高特征識別模型的訓練效率,可在特征識別模型初始化階段,將現有技術已經訓練出的參數作為本實施例中的編碼器和第一解碼器部分層的初始參數,而對于另一部分現有技術不存在的層的初始參數需要進行隨機初始化。[0075]在構建完畢初始特征識別模型后,本步驟即可利用遮擋圖像塊和未遮擋圖像塊,以重構第一圖像樣本的預設特征為目標,對初始特征識別模型進行預訓練,得到預訓練特征識別模型。[0076]步驟S103、基于預訓練特征識別模型中的編碼器和第二解碼器構建任務處理模[0077]在上個步驟訓練得到預訓練特征識別模型后,本步驟可基于預訓練特征識別模型中的編碼器和第二解碼器構建任務處理模型。[0078]值得注意的是,在構建任務處理模型時,由于任務處理模型的輸入圖像塊的數量與預訓練特征識別模型的輸入圖像塊的數量可能不同,因此,圖3所示預訓練特征識別模型中的編碼器的“N”與任務處理模型中的編碼器的“N”可能不同。[0079]上述第二解碼器用于基于預訓練特征識別模型中的編碼器輸出的視覺語義信息,確定輸入至任務處理模型的圖像的OCR識別結果。9[0080]可選的,第二解碼器也可采用圖4所示的transformer結構,該具體結構可參見上述步驟S102中的介紹,在此不再贅述。[0081]步驟S104、將有標注數據的第二圖像樣本切分為多個第二圖像塊。[0082]本實施例可采用少量有標注數據的第二圖像樣本訓練任務處理模型,其中,對于每個第二圖像樣本,可將該第二圖像樣本切分為多個固定大小的圖像塊patch,為了與上述第一圖像塊進行區分,本步驟將切分出的圖像塊定義為第二圖像塊。[0083]值得注意的是,由于上述步驟S102已經訓練出能夠提取更精煉、更完備的視覺語義信息的編碼器,因此,本步驟只需要選取少于第一圖像樣本的數量的第二圖像樣本,基于少量的第二圖像樣本對應的第二圖像塊,對任務處理模型進行訓練,即可訓練出具備更高[0084]步驟S105、采用多個第二圖像塊和第二圖像樣本包含的詞片序列對任務處理模型進行訓練,得到的模型作為OCR識別模型。[0085]前述已經說明了,任務處理模型基于預訓練特征識別模型中的編碼器和第二解碼器構建得到。則本步驟中,任務處理模型中的編碼器用于獲得多個第二圖像塊的視覺語義信息,第二解碼器用于基于多個第二圖像塊的視覺語義信息,得到第二圖像樣本的OCR識別[0086]可選的,第二解碼器得到第二圖像樣本的OCR識別結果的過程可以包括:第二解碼器基于多個第二圖像塊的視覺語義信息,得到第二圖像樣本中的各詞片(wordpiece),然后基于得到的各詞片預測第二圖像樣本中的詞片序列,該詞片序列即為0CR識別結果。[0087]上述第二圖像樣本包含的詞片序列是指第二圖像樣本對應的標注數據,例如,若第二圖像樣本為圖2a所示,則該第二圖像樣本包含的詞片序列可以[0088]本申請提供的OCR識別模型訓練方法,首先將無標注數據的第一圖像樣本切分為多個第一圖像塊,并從多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,得到遮擋圖像塊和未遮擋圖像塊,然后利用遮擋圖像塊和未遮擋圖像塊,以重構第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓練,得到預訓練特征識別模型,接著基于預訓練特征識別模型中的編碼器和第二解碼器構建任務處理模型,之后將有標注數據的第二圖像樣本切分為多個第二圖像塊,最后采用多個第二圖像塊和第二圖像樣本包含的詞片序列對任務處理模型進行訓練,得到的模型作為0CR識別模型。本申請能夠基于大量無標注數據的第一圖像樣本對預先構建的初始特征識別模型進行訓練,以得到預訓練特征識別模型,基于該預訓練特征識別模型中的編碼器和第二解碼器即可構建任務處理模型,之后基于少量有標注數據的第二圖像樣本和第二圖像樣本包含的詞片序列訓練任務處理模型,即可得到具備更高識別能力的OCR識別模型,由于本申請的訓練過程無需大量標注數據,節省了人力資源,提高了OCR識別模型的訓練效率。[0089]此外,由于編碼器能夠提取多個第二子圖像更完備、更精煉的視覺語義信息,使得[0090]為了使本領域技術人員更加理解本申請實施例中初始的特征識別模型的訓練過本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預[0092]A1、將未遮擋圖像塊輸入到初始特征識別模型包含的編碼器中,得到未遮擋圖像塊的視覺語義信息。[0093]在本步驟中,為了避免引入過多遮擋掉的第一圖像塊輸入初始特征識別模型包含的編碼器,給初始特征識別模型包含的編碼器的訓練造成干擾,可以僅將未遮擋圖像塊輸入到初始特征識別模型包含的編碼器中,得到未遮擋圖像塊的視覺語義信息。[0094]參見圖5所示的初始特征識別模型的訓練過程示意圖,圖5中,初始特征識別模型基于編碼器Encoder和第一解碼器Decoder-1構建得到,本步驟可將圖2b所示的6個未遮擋圖像塊輸入到初始特征識別模型包含的編碼器(Encoder)中,以基于該6個未遮擋圖像塊對該初始特征識別模型包含的編碼器進行訓練。[0095]A2、將未遮擋圖像塊的視覺語義信息和遮擋圖像塊輸入到初始特征識別模型包含的第一解碼器中,得到未遮擋圖像塊和遮擋圖像塊分別對應的預設特征。[0096]仍參見圖5所示,本步驟可將未遮擋圖像塊的視覺語義信息和遮擋圖像塊按預設順序進行排列,然后再輸入到第一解碼器(Decoder-1)中,以利用第一解碼器重構未遮擋圖像塊和遮擋圖像塊分別對應的預設特征。[0097]A3、根據重構出的未遮擋圖像塊和遮擋圖像塊分別對應的預設特征,以及,從第一圖像樣本提取的預設特征,對初始特征識別模型的參數進行預訓練,得到預訓練特征識別模型。[0098]仍參見圖5所示,可將重構出的未遮擋圖像塊和遮擋圖像塊分別對應的預設特征按預設的順序進行組合,以重構出的得到第一樣本圖像的預設特征,然后本實施例可將重構出的第一樣本圖像的預設特征和從第一樣本圖像提取的預設特征(即該提取的預設特征別模型的參數進行調整和更新,以便經過多次訓練后得到最優參數,基于該最優參數即可得到預訓練特征識別模型。[0099]本實施例基于大量無標注數據的第一圖像樣本對初始特征識別模型進行訓練,在訓練時通過調節遮擋部分的比例,并采用能夠輸出預設特征的第一解碼器來幫助encoder提取精煉的視覺語義信息,從而使得訓練出的預訓練特征識別模型成為良好的特征提取器,并使得訓練出的編碼器能夠提取更精煉、更完備的視覺語義信息。[0100]采用這套框架,本申請能利用大量廉價易得的無標注數據,可以免去大批量標注[0101]為了使本領域技術人員更加理解本申請實施例中初始的OCR識別模型的訓練過程,以下的一個實施例,對“步驟S105、采用多個第二圖像塊和第二圖像樣本包含的詞片序列對任務處理模型進行訓練,得到的模型作為0CR識別模型”的過程進行說明。[0103]B1、將多個第二圖像塊輸入到任務處理模型中,得到多個第二圖像塊對應的OCR識別結果。[0104]具體來說,本步驟可將多個第二圖像塊輸入到任務處理模型包含的編碼器中,得到任務處理模型包含的編碼器輸出的多個第二圖像塊的視覺語義信息,然后將該多個第二圖像塊的視覺語義信息輸入到第二解碼器中,得到多個第二圖像塊對應的OCR識別結果,該11多個第二圖像塊對應的OCR識別結果即第二圖像樣本的OCR識別結果。[0105]在本步驟中,第二解碼器(參見圖7所示的Decoder-2)可在OCR識別時替代語言模[0106]這里,OCR識別結果是指對第二樣本圖像包含的詞片序列進行識別得到的結果。可選的,為了便于了解合適識別結束,OCR識別結果中,可在識別出的詞片序列后增加識別結[0107]B2、基于多個第二圖像塊對應的OCR識別結果和第二圖像樣本包含的詞片序列對[0108]與上個步驟對應,若OCR識別結果中包括識別結束符號,則本步驟在訓練模型時,“第二圖像樣本包含的詞片序列”之前需要添加識別開始符號,例如“[BOS]”。需要說明的[0109]可選的,本步驟可在訓練時,將第二圖像樣本包含的詞片序列輸入到第二解碼器,并使用交叉熵損失函數來監督第二解碼器的輸出,在任務處理模型預測時,第二解碼器從“[BOS]”符號開始迭代預測之后的詞片wordpiece,并把預測出的wordpiece作為下一次的輸入。[0110]本實施例基于少量有標注數據的第二圖像樣本和標注數據對任務處理模型進行訓練,由于該任務處理模型基于已經訓練好的預訓練特征識別模型中的編碼器構建得到,從而OCR識別模型中的第二解碼器能夠基于更完備的視覺語義信息進行OCR識別,因此,即使沒有額外的語言模型參與糾錯,OCR識別模型仍有很好的識別效果。[0111]需要說明的是,上述OCR識別模型可以很容易地擴展為多語言模型,只需要在第二解碼器端使用多語種預訓練模型即可;此外,在得到OCR識別模型后,如需擴展到其他場景下的OCR識別,例如打印體文本識別、手寫體文本識別調預訓練的OCR識別模型的參數并重新訓練,即可很快地收斂到需要的模型,訓練效率更[0112]本申請的一個實施例對圖像樣本的獲取方法進行介紹。[0113]可選的,圖像樣本的獲取方[0116]應當理解,只有基于各種各樣的圖像樣本對模型進行訓練,才可使訓練出的模型能夠適用更多場景。基于此,在獲得原始樣本后,本步驟需要使用數據增強技術,通過對原始樣本進行多種多樣的圖像轉換處理,得到處理后的原始樣本。[0117]可選的,圖像轉換處理包括以下處理中的一種或多種:隨機旋轉、高斯模糊、圖像膨脹、圖像腐蝕、下采樣和添加下劃線。本步驟可針對每個原始樣本,機會均等地隨機選取圖像轉換處理方法對原始樣本進行數據擴增。[0118]C3、將原始樣本和處理后的原始樣本作為圖像樣本。[0119]本步驟獲得圖像樣本可以作為第一圖像樣本,也可以在標注數據后作為第二圖像樣本,本申請對此不進行限定。[0120]綜上,本申請實施例通過對原始樣本進行圖像轉換處理,可以得到更多類型的第一圖像樣本和第二圖像樣本,基于該更多類型的第一圖像樣本和第二圖像樣本進行模型訓練,可以使得訓練出的模型更通用。[0121]本申請實施例還提供了一種應用于上述OCR識別模型的OCR識別方法,接下來通過下述實施例對本申請提供的OCR識別方法進行詳細介紹。[0122]請參閱圖6,示出了本申請實施例提供的OCR識別方法的流程示意圖,該OCR識別方法可以包括:[0124]步驟S602、將待識別圖像切分為多個待識別圖像塊。[0125]步驟S603、將多個待識別圖像塊輸入OCR識別模型中,以得到OCR識別模型輸出的[0126]具體參見圖7示出的OCR識別模型的識別過程示意圖,將多個待識別圖像塊輸入[0127]綜上,本申請實施例無需額外的語言模型進行后處理,也不需要繁瑣的預處理,僅基于OCR識別模型就能達到與當前主流OCR方法相當或更好的識別效果。[0128]本申請實施例還提供了一種OCR識別模型訓練裝置,下面對本申請實施例提供的OCR識別模型訓練裝置進行描述,下文描述的OCR識別模型訓練裝置與上文描述的OCR識別模型訓練方法可相互對應參照。[0129]請參閱圖8,示出了本申請實施例提供的OCR識別模型訓練裝置的結構示意圖,如圖8所示,該0CR識別模型訓練裝置可以包括:第一切分模塊801、第一訓練模塊802、模型構建模塊803、第二切分模塊804和第二訓練模塊805。[0130]第一切分模塊801,用于將無標注數據的第一圖像樣本切分為多個第一圖像塊,并從多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,得到遮擋圖像塊和未遮擋圖像[0131]第一訓練模塊802,用于利用遮擋圖像塊和未遮擋圖像塊,以重構第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓[0132]模型構建模塊803,用于基于預訓練特征識別模型中的編碼器和第二解碼器構建任務處理模型。[0133]第二切分模塊804,用于將有標注數據的第二圖像樣本切分為多個第二圖像塊。[0134]第二訓練模塊805,用于采用多個第二圖像塊和第二圖像樣本包含的詞片序列對[0135]本申請提供的OCR識別模型訓練裝置,首先將無標注數據的第一圖像樣本切分為多個第一圖像塊,并從多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,得到遮擋圖像塊和未遮擋圖像塊,然后利用遮擋圖像塊和未遮擋圖像塊,以重構第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓練,得到預訓練特征識別模型,接著基于預訓練特征識別模型中的編碼器和第二解碼器構建任務處理模型,之后將有標注數據的第二圖像樣本切分為多個第二圖像塊,最后采用多個第二圖像塊和第二圖像樣本包含的詞片序列對任務處理模型進行訓練,得到的模型作為0CR識別模型。本申請能夠基于大量無標注數據的第一圖像樣本對預先構建的初始特征識別模型進行訓練,以得到預訓練特征識別模型,基于該預訓練特征識別模型中的編碼器和第二解碼器即可構建任務處理模型,之后基于少量有標注數據的第二圖像樣本和第二圖像樣本包含的詞片序列訓練任務處理模型,即可得到具備更高識別能力的OCR識別模型,由于本申請的訓練過程無需大量標注數據,節省了人力資源,提高了OCR識別模型的訓練效率。[0136]在一種可能的實現方式中,上述第一訓練模塊802可以包括:第一輸入子模塊、第二輸入子模塊和第一訓練子模塊。[0137]其中,第一輸入子模塊,用于將未遮擋圖像塊輸入到初始特征識別模型包含的編碼器中,得到未遮擋圖像塊的視覺語義信息。[0138]第二輸入子模塊,用于將未遮擋圖像塊的視覺語義信息和遮擋圖像塊輸入到特征識別模型包含的第一解碼器中,得到未遮擋圖像塊和遮擋圖像塊分別對應的預設特征;[0139]第一訓練子模塊,用于根據重構出的未遮擋圖像塊和遮擋圖像塊分別對應的預設特征,以及,從所述第一圖像樣本提取的預設特征,對初始特征識別模型的參數進行訓練,得到預訓練特征識別模型。[0140]在一種可能的實現方式中,本申請實施例提供的OCR識別模型訓練裝置中,預設特征包括以下特征中的一種或多種:方向梯度直方圖特征、卷積神經網絡特征、局部二值模式[0141]在一種可能的實現方式中,上述第二訓練模塊805可以包括:第三輸入子模塊和第二訓練子模塊。[0142]其中,第三輸入子模塊,用于將多個第二圖像塊輸入到任務處理模型中,得到多個[0143]第二訓練子模塊,用于基于多個第二圖像塊對應的OCR識別結果和第二圖像樣本包含的詞片序列對任務處理模型的參數進行訓練,得到0CR識別模型。[0144]在一種可能的實現方式中,本申請實施例提供的OCR識別模型訓練裝置還可以包括圖像樣本獲取模塊。[0145]該圖像樣本獲取模塊,具體可以用于獲取原始樣本,對原始樣本進行圖像轉換處理,得到處理后的原始樣本,將原始樣本和處理后的原始樣本作為圖像樣本,其中,圖像轉添加下劃線。[0146]本申請實施例還提供了一種OCR識別裝置,下面對本申請實施例提供的OCR識別裝[0147]請參閱圖9,示出了本申請實施例提供的OCR識別裝置的結構示意圖,如圖9所示,[0148]獲取模塊901,用于獲取待識別圖像。[0149]第三切分模塊902,用于將待識別圖像切分為多個待識別圖像塊。[0150]識別模塊903,用于將多個待識別圖像塊輸入0CR識別模型中,以得到OCR識別模型[0151]本申請提供的OCR識別裝置,無需額外的語言模型進行后處理,也不需要繁瑣的預[0152]本申請實施例還提供了一種OCR識別模型訓練設備。可選的,圖10示出了OCR識別模型訓練設備的硬件結構框圖,參照圖10,該0CR識別模型訓練設備的硬件結構可以包括:至少一個處理器1001,至少一個通信接口1002,至少一個存儲器1003和至少一個通信總線[0153]在本申請實施例中,處理器1001、通信接口1002、存儲器1003、通信總線1004的數量為至少一個,且處理器1001、通信接口1002、存儲器1003通過通信總線1004完成相互間的[0154]處理器1001可能是一個中央處理器CPU,或者是特定集成電路ASIC(ApplicationSpecificIntegratedCircuit),或者是被配置成實施本發明實施例的一個或多個集成電[0155]存儲器1003可能包含高速RAM存儲器,也可能還包括非易失性存儲器(non-volatilememory)等,例如至少一個磁盤存儲器;[0156]其中,存儲器1003存儲有程序,處理器1001可調用存儲器1003存儲的程序,程序用[0157]將無標注數據的第一圖像樣本切分為多個第一圖像塊,并從多個第一圖像塊中隨機選取部分第一圖像塊進行遮擋,得到遮擋圖像塊和未遮擋圖像塊,其中,遮擋圖像塊的數量大于未遮擋圖像塊的數量;利用遮擋圖像塊和未遮擋圖像塊,以重構第一圖像樣本的預設特征為目標,對預先構建的包含編碼器和第一解碼器的初始特征識別模型進行預訓練,得到預訓練特征識別模型;基于預訓練特征識別模型中的編碼器和第二解碼器構建任務處理模型;[0158]將有標注數據的第二圖像樣本切分為多個第二圖像塊;[0159]采用多個第二圖像塊和第二圖像樣本包含的詞片序列對任務處理模型進行訓練,得到的模型作為OCR識別模型。[0160]可選的,程
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
- 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
- 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
- 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 2026年大學園藝學(食用菌栽培研究)試題及答案
- 2026年中職水路運輸安全管理(水路安全基礎)試題及答案
- 簡愛中考試題及參考答案
- 2026年大學學前教育(幼兒教育政策法規)試題及答案
- 主題咖啡廳設計
- 《動物藥學》-金膽片清膏的制備
- 《米其林小胎資料》課件
- 《高壓噴射注漿法》課件
- 《超級電容器》課件
- 2026-2027學年九年級英語上冊 Unit 3 單元測試卷(人教河北版)
- 農作物收割協議合同書
- 創新素養課題申報書
- 2025年教師招聘之《幼兒教師招聘》模擬題含答案詳解(完整版)
- 宮頸環扎護理查房課件
- 2026年高考英語專項復習:必背近10高考英語高頻詞匯表
- 糞污消納協議書
- 制造業產品質量保障體系及控制措施
- 數控機床裝調維修工綜合知識理論考試題庫
- 布魯菌病課件
- (正式版)QC∕T 1207-2024 燃料電池發動機用空氣壓縮機
- JT-T-216-2020客車空調系統技術條件
評論
0/150
提交評論