版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領
文檔簡介
US2021280190A1,2021.0基于音頻驅動的人臉對話生成模型的人臉本發明公開了一種基于音頻驅動的人臉對立唇音同步判別網絡和基于質量注意力的音頻建基于質量注意力的音頻驅動唇形網絡的整體以及待生成人物的人臉圖像輸入訓練完成的網改善了唇形生成的同步效果和整體人臉的圖像然頭部運動、唇音同步效果良好的真實人臉視2S1)建立唇音同步判別網絡和基于質量注意S2)采集若干人物在說話時的視頻并將每個視頻劃分為人物音頻以及連續幀的人臉圖S3)將唇音同步訓練集輸入唇音同步判別網絡中進行訓練,直至唇音同步判別網絡的S4)將唇音同步訓練集輸入基于質量注意力的音頻驅動判別損失函數構建基于質量注意力的音頻驅動唇形網絡QAW的整體損失函數,獲得基于質量注意力的音頻驅動唇形網絡QAW的整體損失值并使用梯度下降法更新網絡參數,直至整生成人物的人臉圖像輸入訓練完成的基于質量注意力的音頻驅動唇形網絡QAW中,訓練完成的基于質量注意力的音頻驅動唇形網絡QAW處理后輸出當前人物在讀取當前回復音頻時所述的步驟S1)中,基于質量注意力的音頻驅動唇形網絡QAW包括依次連對話生成模型的FSIM損失函數以及重構損失函數構建基于質量注意力的音頻驅動唇形網人臉生成器包括音頻編碼器、人臉編碼器和人臉解碼器,人2.根據權利要求1所述的基于音頻驅動的人臉對話生成模型的人臉視頻生成方法,其3.根據權利要求1所述的基于音頻驅動的人臉對話生成模型的人臉視頻生成方法,其所述的音頻編碼器包括依次連接的第一卷積層Conv、第二卷積層Conv、第三卷積層3第九空間注意力機制SA、第九融合函數Concat、第六二維卷積Conv2d和第七二維卷積針對唇音同步訓練集中的每組人物音頻以及連續幀的人臉圖意力機制SA的輸出和第二唇形特征向量共同輸入第一融合函數Concat中進行處理后輸入積層Conv的輸出共同輸入第二融合函數Concat中進行處理后輸出至第十五卷積層Conv中第四空間注意力機制SA的輸出和第十一卷積層Conv的輸出共同輸入第四融合函數Concat輸出和第十卷積層Conv的輸出共同輸入第五融合函數Concat中進行處理后輸出至第十八出共同輸入第六融合函數Concat中進行處理后依次輸出至第十九卷積層Conv和第一位置輸入第七空間注意力機制SA中進行處理,將第七空間注意力機制SA的輸出和第八卷積層Conv的輸出共同輸入第七融合函數Concat中進行處理后依次輸出至第二十卷積層Conv和卷積層Conv的輸出共同輸入第八融合函數Concat中進行處理后依次輸出至第二十一卷積4的輸出和第二二維卷積Conv2d的輸出共同輸入第九融合函數Concat中進行處理后依次輸4.根據權利要求1所述的基于音頻驅動的人臉對話生成模型的人臉視頻生成方法,其5.根據權利要求1所述的基于音頻驅動的人臉對話生成模型的人臉視頻生成方法,其s量判別器的質量評估損失函數以及人臉對話生成模型的質量評估損失索引6.根據權利要求5所述的基于音頻驅動的人臉對話生成模型的人臉視頻生成方法,其每幀人臉圖像之間的曼哈頓L1距離獲得的損失7.根據權利要求5所述的基于音頻驅動的人臉對話生成模型的人臉視頻生成方法,其所述的視頻質量判別器的對抗損失函數Ldisc具i~Lg表示生成的人臉視頻輸入到視頻質量判別器生成的一維向量的第i個數,N表示視頻質量判別器生成的一維向量的中的元素總個數,D()表示視頻質量判別器判別輸入為真的概率;xi~LG表示真實的人臉視頻輸入到視頻質量判別器生成的一維向量的第i個8.根據權利要求5所述的基于音頻驅動的人臉對話生成模型的人臉視頻生成方法,其g和GG分別表示使用Sobel算子計算獲得的生成的人臉視頻和真實的人臉視頻中對應的視頻幀的梯度幅度,Pg和PG分別表示根據生成的人臉視頻和真實的人臉視頻中對應的視頻幀的梯度幅度計算獲得的對應的視頻幀相位一致性;T1和T2分別表示第一和第二調59.根據權利要求1所述的基于音頻驅動的人臉對話生成模型的人臉視頻生成方法,其字輸入對話系統中后直接輸入至chatgpt模塊中生成回復文字,待回復音頻輸入對話系統中后首先輸入至自然語言處理模塊中進行處理后轉換為待回復音頻中的文字,再輸入至將回復音頻以及待生成人物的人臉圖像輸入訓練完成的基于質量注意力的音頻驅動唇形網絡QAW的人臉生成器中,訓練完成的人臉生成器處理后輸出當前人物在讀取當前回6使用戶產生違和感,如何提高人臉動畫技術的真實性仍然是計算機動畫中亟待解決的難[0003]為了解決模型合成人臉動畫中人物在說話過程中面部運動不自然的問題,就算是后期圖像增強也無法生成高質量的人臉序列。[0007]S1)建立唇音同步判別網絡和基于質量注意力的音頻驅動唇形網絡QAW(Quality_[0008]S2)采集若干人物在說話時的視頻并將每個視頻劃分為人物音頻以及連續幀的人[0009]S3)將唇音同步訓練集輸入唇音同步判別網絡中進行訓練,使其判別唇音同步人[0010]S4)將唇音同步訓練集輸入基于質量注意力的音頻驅動唇形基于判別損失函數構建基于質量注意力的音頻驅動唇形網絡QAW的整體損失函數,獲得基于質量注意力的音頻驅動唇形網絡QAW的整體損失值并使用梯度下降法更新網絡參數,直7及待生成人物的人臉圖像輸入訓練完成的基于質量注意力的音頻驅動唇形網絡QAW中,訓練完成的基于質量注意力的音頻驅動唇形網絡QAW處理后輸出當前人物在讀取當前回復音干二維卷積Conv2d和若干層卷積層Conv,每層卷積層Conv由三個依次連接的二維卷積似度方法(CosineSimilarity)獲得第一音頻特征向量和第一唇形特征向量之間的相似度[0014]其中,Similarity(A,B)表示第一音頻特征向量A和第一唇形特征向量B之間的相[0016]基于質量注意力的音頻驅動唇形網絡QAW是從音頻中提取聲音波形信息,從視頻模型可以生成一系列與輸入音頻匹配的唇部運動序列。函數;人臉編碼器包括依次連接的第二二維卷積Conv2d、第七卷積層Conv、第八卷積層8二十一卷積層Conv、第三位置注意力機制CA、第九空間注意力機制SA、第九融合函數間注意力機制SA的輸出和第二唇形特征向量共同輸入第一融合函數Concat中進行處理后三卷積層Conv的輸出共同輸入第二融合函數Concat中進行處理后輸出至第十五卷積層六卷積層Conv的輸出和第十一卷積層Conv的輸出共同輸入第四空間注意力機制SA中進行制SA的輸出和第十卷積層Conv的輸出共同輸入第五融合函數Concat中進行處理后輸出至輸入第六空間注意力機制SA中進行處理,將第六空間注意力機制SA的輸出和第九卷積層Conv的輸出共同輸入第六融合函數Concat中進行處理后依次輸出至第十九卷積層Conv和卷積層Conv的輸出共同輸入第七融合函數Concat中進行處理后依次輸出至第二十卷積層和第七卷積層Conv的輸出共同輸入第八融合函數Concat中進行處理后依次輸出至第二十機制SA的輸出和第二二維卷積Conv2d的輸出共同輸入第九融合函數Concat中進行處理后9臉解碼器由包含殘余的卷積層和上采樣的轉置卷積[0020]空間注意力機制SA有兩個輸入端,分別為人臉Face特征向量輸入和音頻Audio特至二維卷積Conv2d和激活函數sigmoid中進行處理,激活函數sigmoid的輸出和音頻A分別經過寬度方向和高度方向的兩個平均池化層AvgPool,然后輸出共同輸入到融合函數Concat中在通道維度上進行拼接,拼接后的向量輸入到二維卷積Conv2d中,二維卷積方向的兩個卷積層Conv中,兩個卷積層Conv的輸出再分別輸入到鏈各個激活函數Sigmoid中,兩個激活函數Sigmoid的輸出和輸入端的特征向量相乘后再與和輸入端的特征向量相頻質量判別器的包含唇形的下半張臉的質量評估損失函數以及人臉對話生成模型的質量[0029]所述的重構損失函數Lrecon為根據生成的人臉視頻以及真實的人臉視頻中對應的每幀人臉圖像之間的曼哈頓L1距離獲得的損失gen[0030]所述的視頻質量判別器的包含唇形的下半張臉的質量評估損失函數L具體如gen[0034]其中,xi~Lg表示生成的人臉視頻輸入到視頻質量判別器生成頻中對應的視頻幀的梯度幅度,Pg和PG分別表示根據生成的人臉視頻和真實的人臉視頻中對應的視頻幀的梯度幅度計算獲得的對應的視頻幀相位一致性;T1和T2分別表示第一和第二調解參數,用于控制相位一致性和梯度幅度的權重;特征相似性索引(FSIM,feature視頻或真實的人臉視頻中的視頻幀,Sobelx和Sobely分別表示Sobel算子在圖像的水平X方字輸入對話系統中后直接輸入至chatgpt模塊中生成回復文字,待回復音頻輸入對話系統中后首先輸入至自然語言處理模塊中進行處理后轉換為待回復音頻中的文字,再輸入至[0040]將回復音頻以及待生成人物的人臉圖像輸入訓練完成的基于質量注意力的音頻驅動唇形網絡QAW的人臉生成器中,訓練完成的人臉生成器處理后輸出當前人物在讀取當[0041]本發明設計了音唇同步判別網絡和基于Quality_Attention_Wav2lip的音頻驅動唇形網絡;方法通過選取姿勢幀的前T幀作為基于質量注意力的音頻驅動唇形Quality_[0049]如圖1所示,本發明的基于音頻驅動的人臉對話生成模型的人臉視頻生成方法具卷積Conv2d和若干層卷積層Conv,每層卷積層Conv由三個依次連接的二維卷積Conv2d構[0053]其中,Similarity(A,B)表示第一音頻特征向量A和第一唇形特征向量B之間的相[0056]基于質量注意力的音頻驅動唇形網絡QAW是從音頻中提取聲音波形信息,從視頻模型可以生成一系列與輸入音頻匹配的唇部運動序列。第二十卷積層Conv、第二位置注意力機制CA、第八空間注意力機制SA、第八融合函數間注意力機制SA的輸出和第二唇形特征向量共同輸入第一融合函數Concat中進行處理后三卷積層Conv的輸出共同輸入第二融合函數Concat中進行處理后輸出至第十五卷積層六卷積層Conv的輸出和第十一卷積層Conv的輸出共同輸入第四空間注意力機制SA中進行制SA的輸出和第十卷積層Conv的輸出共同輸入第五融合函數Concat中進行處理后輸出至輸入第六空間注意力機制SA中進行處理,將第六空間注意力機制SA的輸出和第九卷積層Conv的輸出共同輸入第六融合函數Concat中進行處理后依次輸出至第十九卷積層Conv和卷積層Conv的輸出共同輸入第七融合函數Concat中進行處理后依次輸出至第二十卷積層和第七卷積層Conv的輸出共同輸入第八融合函數Concat中進行處理后依次輸出至第二十機制SA的輸出和第二二維卷積Conv2d的輸出共同輸入第九融合函數Concat中進行處理后入端后,人臉Face特征向量分別經過平均池化層AvgPool和最大池化層MaxPool中進行處分別經過寬度方向和高度方向的兩個平均池化層AvgPool,然后輸出共同輸入到融合函數Concat中在通道維度上進行拼接,拼接后的向量輸入到二維卷積Conv2d中,二維卷積方向的兩個卷積層Conv中,兩個卷積層Conv的輸出再分別輸入到鏈各個激活函數Sigmoid中,兩個激活函數Sigmoid的輸出和輸入端的特征向量相乘后再與和輸入端的特征向量相recon[0070]重構損失函數Lrecon為根據生成的人臉視頻以及真實的人臉視頻中對應的每幀人臉圖像之間的曼哈頓L1距離獲得的損失構成[0075]其中,xi~Lg表示生成的人臉視頻輸入到視頻質量判別器生成頻中對應的視頻幀的梯度幅度,Pg和PG分別表示根據生成的人臉視頻和真實的人臉視頻中對應的視頻幀的梯度幅度計算獲得的對應的視頻幀相位一致性;T1和T2分別表示第一和第[0081]S2)采集若干人物在說話時的視頻并將每個視頻劃分為人物音頻以及連續幀的人[0082]S3)將唇音同步訓練集輸入唇音同步判別網絡中進行訓練,使其判別唇音同步人[0083]S4)將唇音同步訓練集輸入基于質量注意力的音頻驅動唇形基于判別損失函數構建基于質量注意力的音頻驅動唇形網絡QAW的整體損失函數,獲得基于質量注意力的音頻驅動唇形網絡QAW的整體損失值并使用梯度下降法更新網絡參數,直及待生成人物的人臉圖像輸入訓練完成的基于質量注意力的音頻驅動唇形網絡QAW中,訓練完成的基于質量注意力的音頻驅動唇形網絡QAW
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
- 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
- 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
- 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 2026幼兒園衛生保健知識考試試題及答案
- 2026年初中美術教學專項試卷
- 審計期末考試常見題目與參考答案
- 撤銷處分,班級意見,思想報告2026(3篇)
- 高空作業承包合同(范本)
- 五年級下冊數學北師大含答案 練習七
- 四川省南充市高坪中學2025-2026學年下學期期中測試七年級歷史試卷(含答案)
- 蝴蝶豌豆花考核試題及答案揭曉
- 2026中國新能源電池行業市場現狀分析需求調研及投資評估規劃研究報告
- 2026中國現代農業行業市場供需分析及投資前景預測報告
- 2026年交管12123駕照學法減分題庫含答案【完整版】
- 內蒙古能源集團招聘面試題及答案
- 酒店與旅游行業前廳部經理績效考核表
- 688個高考英語高頻詞音標表格完整版
- 物流落貨合同(標準版)
- 人行執法證管理辦法
- 2025年中考數學總復習《手拉手相似模型》專項測試卷(附答案)
- 帶教老師遴選制度
- 上學期高一語文10月月考試題匯編:古代詩歌閱讀
- 電路分析基礎-期末考試試題
- NBT20129-2023壓水堆核電廠核島應急柴油發電機組的安裝、試驗與驗收技術規程
評論
0/150
提交評論