CN118229815B 視頻生成方法、深度學習模型的訓練方法、裝置、設備和存儲介質 (北京百度網訊科技有限公司)_第1頁
CN118229815B 視頻生成方法、深度學習模型的訓練方法、裝置、設備和存儲介質 (北京百度網訊科技有限公司)_第2頁
CN118229815B 視頻生成方法、深度學習模型的訓練方法、裝置、設備和存儲介質 (北京百度網訊科技有限公司)_第3頁
CN118229815B 視頻生成方法、深度學習模型的訓練方法、裝置、設備和存儲介質 (北京百度網訊科技有限公司)_第4頁
CN118229815B 視頻生成方法、深度學習模型的訓練方法、裝置、設備和存儲介質 (北京百度網訊科技有限公司)_第5頁
已閱讀5頁,還剩41頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

US2024087179A1,2024.03.14特征用于控制所生成的視頻中的目標對象的動2對所述關鍵點進行特征提取,得到所述動作序列的運動控制特征從包含所述目標對象的運動姿態信息的目標圖像中確定所述圖像特征和所述動作特從包含所述目標對象的運動描述信息的目標文本中確定所述3.根據權利要求1所述的方法,其中,所述初始噪聲的類型和時長與所述目標視頻一對所述運動控制特征進行空間跨注意力處理以及時序注意力處理,得基于所述圖像注意力特征、所述文本注意力特征和所述運動將所述樣本圖像序列中的起始樣本圖像、所述樣本動作序列中的根據所述樣本動作序列和所述輸出動作序列之間的差異,確定所述提取所述樣本圖像序列中每個樣本圖像中樣本對象的姿態信息,得到所述3所述輸出動作序列。使用動作序列生成模型,以樣本文本和樣本圖像序列為引導信號,生成樣確定所述樣本圖像序列的圖像序列特征,并對所述圖像序列將所述樣本圖像序列中的起始樣本圖像、所述樣本動作序列、根據所述樣本圖像序列和所述輸出圖像序列之間的差異,將所述文本特征輸入所述空間跨注意力子網絡和所述時序注意力子將所述運動控制特征輸入所述空間跨注意力子網絡和所述時序注4基于所述圖像注意力特征、文本注意力特征和所述運動控制注意動作序列生成模塊,用于以圖像和文本作為引導信號,使所述動作序列中每一幀動作包括表征所述目標對象的姿態的多運動控制特征確定模塊,用于對所述關鍵點進行特征提取,得到所文本特征確定單元,用于從包含所述目標對象的運動位置特征確定單元,用于確定用于指示所述動作序列中文本特征處理單元,用于對所述文本特征進行空間跨注意力處理以及時序注意力處運動控制特征處理單元,用于對所述運動控制特征進行空間跨注意視頻特征確定子單元,用于基于所述圖像注意力特征、所述文本注動作序列輸出模塊,用于將所述樣本圖像序列中的起始樣本圖像、5第二樣本確定模塊,用于使用動作序列生成模型,以樣本文加噪模塊,用于確定所述樣本圖像序列的圖像序列特運動控制特征確定單元,用于將所述樣本動作序列輸入所述運動控去噪單元,用于將所述運動控制特征、起始樣本圖像的圖像第二圖像特征確定單元,用于將所述起始樣本圖像輸入6文本注意力特征確定子單元,用于將所述文本特征輸入所運動控制注意力特征確定子單元,用于將所述運動控制特征輸入所述去噪子單元,用于基于所述圖像注意力特征、文本注意力特征和所述存儲器存儲有可被所述至少一個處理器執行的指令,所述指令被使所述計算機執行根據權利要求1至13中子設備其中至少之一上,所述計算機程序在被處理器執行時實現根據權利要求1至13中任78[0013]應當理解,本部分所描述的內容并非旨在標識本公開的實施例的關鍵或重要特[0015]圖1是根據本公開的一個實施例的可以應用視頻生成方法和深度學習模型的訓練[0025]圖11是根據本公開的一個實施例的視頻生成方法和深度學習模型的訓練方法中9[0033]圖1是根據本公開一個實施例的可以應用視頻生成方法和深度學習模型的訓練方[0036]本公開實施例所提供的視頻生成方法中的至少之一一般可以由終端設備101、[0037]本公開實施例所提供的深度學習模型的訓練方法一般可以由服務器105執行。相對象的動作序列。對象運動描述信息的動作序列。[0047]例如,運動控制特征用于控制所生成的視頻中的目標對象的動作與動作序列一作312包括表征目標對象姿態信息的多個關鍵點。文本313包括目標對象的運動描述信息,n[0077]動作序列501輸入運動控制網絡,得到運動控制特征。運動控制特征輸入去噪網絡,可以作用在去噪網絡中每個模塊中的空間跨注意力網絡5101和時序注意力網絡5102,態以及樣本對象運動描述信息的輸出動作序列。[0090]例如,深度學習模型輸出的輸出動作序列中的第一幀動作與起始樣本動作一樣本動作序列中的動作幀數與輸出動作序列中的動作幀[0097]文本編碼器和圖像編碼器可以是訓練好的CLIP網絡。動作序列生成網絡可以是生成的,也可以是通過提取樣本圖像序列中每個樣本圖像中樣本對象的姿態信息得到的。[0123]根據本公開的實施例,去噪網絡包括空間跨注意力子網絡和時序注意力子網[0131]運動控制特征確定模塊802用于確定動作序列的運動控制特征,運動控制特征用[0132]視頻生成模塊803用于基于圖像特征、文本特征以及運動控制特征,生成目標視[0134]圖像和動作特征確定單元用于從包含目標對象的運動姿態信息的目標圖像中確[0135]文本特征確定單元用于從包含目標對象的運動描述信息的目標文本中確定文本[0136]位置特征確定單元用于確定用于指示動作序列中的多個動作的位置順序的位置[0143]文本特征處理子單元用于對文本特征進行空間跨注意力處理以及時序注意力處[0144]運動控制特征處理子單元用于對運動控制特征進行空間跨注意力處理以及時序[0149]動作序列輸出模塊902用于將樣本圖像序列中的起始樣本圖像、樣本動作序列中[0150]第一損失確定模塊903用于根據樣本動作序列和輸出動作序列之間的差異,確定[0152]第一樣本確定模塊901用于提取樣本圖像序列中每個樣本圖像中樣本對象的姿態[0174]文本注意力特征確定子單元用于將文本特征輸入空間跨注意力子網絡和時序注[0175]運動控制注意力特征確定子單元用于將運動控制特征輸入空間跨注意力子網絡[0176]去噪子單元用于基于圖像注意力特征、文本注意力特征通過諸如因特網的計算機網絡和/或各種電信網絡與其他設備交換信[0181]計算單元1101可以是各種具有處理和計算能力的通用和/或專用處理組件。計算中,視頻生成方法和深度學習模型的訓練方法中的至少之一可被實現為計算機軟件程序,機程序可在包括至少一個可編程處理器的可編程系統上執行和/或解釋,該可編程處理器[0183]用于實施本公開的方法的程序代碼可以采用一個或多個編程語言的任何組合來理器或控制器,使得程序代碼當由處理器或控制器執行時使流程圖和/或框圖中所規定的包部分地在機器上執行且部分地在遠程機器上執行或完全在遠程機器或服務器器以及鍵盤和指向裝置(例如,鼠標或者軌跡球用戶可以通過該鍵盤面或者該網絡瀏覽器來與此處描述的系統和技術的實施方式交互)、或者包括這種后臺部字數據通信(例如,通信網絡)來將系統的部件相互連接。通信網絡的示例包括:過通信網絡進行交互。通過在相應的計算機上運行并且彼此具有客戶端-服務器關系的計

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論