CN117764815B 模型訓練方法、視頻預測方法、裝置、設備及存儲介質 (上海人工智能創新中心)_第1頁
CN117764815B 模型訓練方法、視頻預測方法、裝置、設備及存儲介質 (上海人工智能創新中心)_第2頁
CN117764815B 模型訓練方法、視頻預測方法、裝置、設備及存儲介質 (上海人工智能創新中心)_第3頁
CN117764815B 模型訓練方法、視頻預測方法、裝置、設備及存儲介質 (上海人工智能創新中心)_第4頁
CN117764815B 模型訓練方法、視頻預測方法、裝置、設備及存儲介質 (上海人工智能創新中心)_第5頁
已閱讀5頁,還剩38頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

目標車輛采集到的初始視頻幀和/或初始視頻幀文;利用初始視頻幀和/或初始視頻幀對應的目型可以根據既有畫面和基于自然語言的控制文2利用目標車輛采集到的初始視頻幀和/或所述初始視頻幀的場景描述元數據,確定所利用所述初始視頻幀和/或所述初始視頻幀對應的目標車輛的軌跡數據,確定所述目將至少一個所述初始視頻幀的圖像編碼和對應的控制文本的文本編碼輸入Stable根據所述損失函數值確定中間模型,并利用注意力機制更新所述中利用多個所述初始視頻幀的圖像編碼和對應的控制文本的文本編碼訓練所述待訓練在所述中間模型中的Transformer模型的空間注意力模塊、交叉注意力模塊和前向反其中,所述預設時序推理模塊中包括因果時序注意力子模塊和解耦空間注意力子模塊,所述因果時序注意力子模塊用于基于注意力機制對所述Transformer模型的輸入量進2.根據權利要求1所述的方法,其特征在于,所述因果將多個所述初始視頻幀的圖像編碼和對應的控制文本的文本編碼輸入所述待訓練模通過所述待訓練模型對所述加噪視頻幀的圖像編碼進行降噪處理,得到降噪視頻幀,其中,所述利用多個所述初始視頻幀的圖像編碼和對應的控利用多個所述初始視頻幀的圖像編碼和對應的目標控制文本的文本編碼訓練所述待35.根據權利要求1所述的方法,其特征在于,所述視頻預后還包括預設多層神經網絡,所述預設多層神經網絡用于根據所述Transformer模型輸出將所述至少一個條件視頻幀的編碼和目標控制文本的編碼輸入預場景上下文確定模塊,用于利用目標車輛采集到的初始視頻幀和/或所述初始視頻幀車輛移動指令確定模塊,用于利用所述初始視頻幀和/或所述初始視頻幀對應的目標模型確定模塊,用于利用所述初始視頻幀和對應的控制文本訓練初損失函數值確定單元,用于將至少一個所述初始視頻幀的模型更新單元,用于根據所述損失函數值確定中間模型,并利用模型確定單元,用于利用多個所述初始視頻幀的圖像編碼和對應的控制所述利用注意力機制更新所述中間模型使之能夠處理時序信息,基于注意力機制對所述Transformer模型的輸入量進行加權處理,所述解耦空間注意力子模塊用于對所述因果時序注意力子模塊的輸出量的空間注意力進行解條件信息獲取模塊,用于獲取至少一個條件視頻幀、目預測視頻確定模塊,用于將所述至少一個條件視頻幀的編碼和目標4一所述的模型訓練方法得到,所述目標控制文本包括所述目標場景上下文和/或所述目標所述存儲器存儲有可被所述至少一個處理器執行的計算機程序,所述述至少一個處理器執行,以使所述至少一個處理器能夠執行權利要求1_5中任一項所述的5[0002]近些年,自動駕駛領域中的場景生成獲得了廣泛的研究關注。可以利用NeRF渲染視頻,神經場擴散模型NeuralField_LDM和條件生成模型BEVGen可以利用鳥瞰分割地[0006]利用目標車輛采集到的初始視頻幀和/或所述初始視頻幀的場景描述元數據,確[0007]利用所述初始視頻幀和/或所述初始視頻幀對應的目標車輛的軌跡數據,確定所所述目標場景上下文為所述條件視頻幀對應的當前場景的場[0011]將所述至少一個條件視頻幀的編碼和目標控制文本的編碼輸入預設視頻預測模[0013]場景上下文確定模塊,用于利用目標車輛采集到的初始視頻幀和/或所述初始視6[0014]車輛移動指令確定模塊,用于利用所述初始視頻幀和/或所述初始視頻幀對應的面所述的模型訓練方法得到,所述目標控制文本包括所述目標場景上下文和/或所述目標有計算機指令,計算機指令用于使處理器執行時實現上述第一方面的模型訓練方法,和/[0024]本發明提供的模型訓練方案,利用目標車輛采集到的初始視頻幀和/或所述初始用上述技術方案,利用初始視頻幀和/或初始視頻幀的數據,實現了對無標注大規模數據7員在沒有做出創造性勞動前提下所獲得的所有其他實施例,都應當屬于本發明保護的范的數據在適當情況下可以互換,以便這里描述的本發明的實施例能夠以除了在這里圖示或其它步驟或單元。[0042]圖1為本發明實施例一提供了一種模型訓練方法的流程圖,本實施例可適用于訓8[0044]S101、利用目標車輛采集到的初始視頻幀和/或所述初始視頻幀的場景描述元數語言模型如BLIP_2(圖生文模型)和根據視頻光流進行相機行為分類的模型分別自動生成述元數據的初始視頻幀,可以使用自然語言模型如GPT(GenerativePre_TrainedVQVAE的解碼器可以轉化為符合控制文本描述的[0049]本發明實施例提供的模型訓練方法,利用目標車輛采集到的初始視頻幀和/或所文本包括所述場景上下文和所述車輛移動指令,所述視頻預測模型用于輸出預測視頻幀。9[0051]具體的,可以對初始模型進行兩階段的訓練。圖3為一種第一階段模型訓練示意可以在中間模型中引入注意力機制處理時序信息,如在中間模型包含的Transformer模型制條件c以及當前的加噪步驟數t來預測加噪過程中,在原圖(即初始視頻幀)中加入的噪[0056]具體的,可以利用傅里葉編碼層將軌跡數據中的軌跡數值編碼為高維軌跡編多次訓練,最后得到的視頻預測模型可以根據給定的初始幀(初始視頻幀)和目標控制文[0058]圖4為本發明實施例二提供的一種模型訓練方法的流程圖,本發明實施例的技術力子模塊用于基于注意力機制對所述Transformer模型的輸入量進行加權處理,所述解耦[0064]S203、將至少一個初始視頻幀的圖像編碼和對應的目標文本編碼輸入Stable模塊,所述因果時序注意力子模塊用于基于注意力機制對所述Transformer模型的輸入量塊、交叉注意力模塊和前向反饋神經網絡之前均增加預設時序推理模塊(Temporal征輸入量視為T個特征(每個特征維度為H*W)進行處理。圖6為一種因果時序注意力子模塊的功能通過注意力機制實現,其可以將因果時序注意力W*T)和W個特征(每個特征維度為H*T)進行處待訓練模型的損失函數值Lva的確定方式可以為:述預設多層神經網絡用于根據所述Transformer模型輸出的特征圖生成所述預測視頻幀對型的預測效果與其他預測模型的效果對比如下表1效果評估對比表[0085]針對視頻預測模型中的時序推理模塊和長時序交互機制,可以在OpenDV_2K的評何重復的視頻。CLIPSIM指標為生成的預測幀與給定的初始幀對應特征的相似度平均值,CLIPSIM指標可以用于衡量生成的預測視頻與給定的初始幀的一致性。時序推理模塊和長時序交互機制的消融實驗的結果如下表2消融實驗[0089]為衡量視頻預測模型根據車輛軌跡生成的預測視頻與給可控性實驗結果信息表中記作ActionPredictionError(動作預測誤差)。根據車輛軌跡生成的預測視頻與給定的車輛軌跡的一致性的實驗結果信息如下表3可控性實驗結果信息[0093]為衡量視頻預測模型特征提取的有效性,可以利用端到端自動駕駛規劃模型在NuScenes數據集上的指標與本視頻預測模型進行對比,對比結果如表4特征提取有效性實[0096]其中,ST_P3*和UniAD*表示ST_P3和UniAD使用了環視的視頻預測模型中預設多層神經網絡輸出的預測軌跡與軌跡真值之間的歐氏距離。FDE使用七十分之一的待學習參數量,就可取得相對較好的效果,且只需要在NVIDIATesla[0099]圖8為本發明實施例三提供了一種視頻預測方法的流程圖,本實施例可適用于生[0102]在本實施例中,當前車輛的目標移動指令可以理解為當實施例技術方案通過將條件視頻幀的編碼和對應的包含實際需求的目標控制文本的編碼[0108]場景上下文確定模塊,用于利用目標車輛采集到的初始視頻幀和/或所述初始視[0109]車輛移動指令確定模塊,用于利用所述初始視頻幀和/或所述初始視頻幀對應的力子模塊用于基于注意力機制對所述Transformer模型的輸入量進行加權處理,所述解耦空間注意力子模塊用于對所述因果時序注意力子模塊的輸出量的空間注意力進果時序注意力子模塊和所述解耦空間注意力子模塊中最后的述預設多層神經網絡用于根據所述Transformer模型輸出的特征圖生成所述預測視頻幀對[0123]本發明實施例所提供的模型訓練裝置可執行本發明任意實施例所提供的模型訓所述的模型訓練方法得到,所述目標控制文本包括所述目標場景上下文和/或所述目標移[0129]本發明實施例所提供的視頻預測裝置可執行本發明任意實施例所提供的視頻預被至少一個處理器執行的計算機程序,處理器61可以根據存儲在只讀存儲器(ROM)62中的計算機程序或者從存儲單元68加載到隨機訪問存儲器(RAM)63中的計算機程序,來執行各如因特網的計算機網絡和/或各種電信網絡與其他設[0134]處理器61可以是各種具有處理和計算能力的通用和/或專用處理組件。處理器61機程序可在包括至少一個可編程處理器的可編程系統上執行和/或解釋,該可編程處理器[0137]用于實施本發明的方法的計算機程序可以采用一個或多個編程語言的任何組合機器上執行且部分地在遠程機器上執行或完全在遠程機器或服務[0138]上述提供的計算機設備可用于執行上述任意實施例提供的模型訓練方法和/或,[0141]利用目標車輛采集到的初始視頻幀和/或所述初始視頻幀的場景描述元數據,確[0142]利用所述初始視頻幀和/或所述初始視頻幀對應的目標車輛的軌跡數據,確定所[0145]獲取至少一個條件視頻幀,并利用條件視頻幀和/或所述條件視頻幀的場景描述[0146]利用所述條件視頻幀和/或所述條件視頻幀對應的當前車輛的軌跡數據,確定所[0147]將所述至少一個條件視頻幀的編碼和目標控制文本的編碼輸入預設視頻預測模[0149]上述提

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論