CN119091362B 基于多模態(tài)融合的可控視頻生成方法及系統(tǒng) (中科南京人工智能創(chuàng)新研究院)_第1頁(yè)
CN119091362B 基于多模態(tài)融合的可控視頻生成方法及系統(tǒng) (中科南京人工智能創(chuàng)新研究院)_第2頁(yè)
CN119091362B 基于多模態(tài)融合的可控視頻生成方法及系統(tǒng) (中科南京人工智能創(chuàng)新研究院)_第3頁(yè)
CN119091362B 基于多模態(tài)融合的可控視頻生成方法及系統(tǒng) (中科南京人工智能創(chuàng)新研究院)_第4頁(yè)
CN119091362B 基于多模態(tài)融合的可控視頻生成方法及系統(tǒng) (中科南京人工智能創(chuàng)新研究院)_第5頁(yè)
已閱讀5頁(yè),還剩46頁(yè)未讀 繼續(xù)免費(fèi)閱讀

下載本文檔

版權(quán)說(shuō)明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)

文檔簡(jiǎn)介

基于多模態(tài)融合的可控視頻生成方法及系統(tǒng)本發(fā)明公開了一種基于多模態(tài)融合的可控視頻序列。本發(fā)明保持了視頻序列的時(shí)空連貫2S2、使用預(yù)定義的分詞器將多模態(tài)特征矩陣轉(zhuǎn)置編碼信息;應(yīng)用上下文感知權(quán)重調(diào)節(jié)器對(duì)特征序列中的各模態(tài)特征進(jìn)行動(dòng)態(tài)權(quán)重分配,對(duì)姿態(tài)圖數(shù)據(jù),使用骨骼關(guān)鍵點(diǎn)檢測(cè)算法提取人體關(guān)鍵點(diǎn)坐標(biāo),3對(duì)于預(yù)處理后的文本數(shù)據(jù),使用預(yù)訓(xùn)練的BERT模型作為編碼器,提取文本對(duì)于預(yù)處理后的RGB圖像數(shù)據(jù),使用預(yù)訓(xùn)練的ResNet模型作為編碼器對(duì)于預(yù)處理后的音頻數(shù)據(jù),使用預(yù)訓(xùn)練的VGGish模型作為編碼列;45.根據(jù)權(quán)利要求4所述的基于多模態(tài)融合的可控視S121、對(duì)音頻數(shù)據(jù)進(jìn)行去噪處理,得到去噪后的信6.根據(jù)權(quán)利要求4所述的基于多模態(tài)融合的可控視頻生成57.根據(jù)權(quán)利要求4所述的基于多模態(tài)融合的可控視S12i、對(duì)邊緣算子圖數(shù)據(jù)進(jìn)行初步分析,計(jì)算圖S12v、計(jì)算每個(gè)歸一化的特征的重要性得分,8.根據(jù)權(quán)利要求4所述的基于多模態(tài)融合的可控視頻6所述存儲(chǔ)器存儲(chǔ)有可被所述處理器執(zhí)行的指令,所述指令用于被所現(xiàn)權(quán)利要求1~8任一項(xiàng)所述的基于多模態(tài)融合的可78[0027]對(duì)RGB圖像數(shù)據(jù),將其調(diào)整為統(tǒng)一的尺寸并進(jìn)行色彩空間轉(zhuǎn)換,得到轉(zhuǎn)換后的圖9[0035]S13、將預(yù)處理后的多模態(tài)數(shù)據(jù)分別輸入到相應(yīng)的特征提取模塊中,提取特征向特征序列;圖的拓?fù)浣Y(jié)構(gòu)分析來(lái)動(dòng)態(tài)調(diào)整各模態(tài)特征的權(quán)重,能夠根據(jù)當(dāng)前任務(wù)和輸入數(shù)據(jù)的特性,自適應(yīng)地調(diào)整不同模態(tài)特征的重要性,從而在視頻生成過(guò)程中更好地利用最相關(guān)的信息。態(tài)調(diào)整梅爾刻度的非線性映射函數(shù)。對(duì)壓縮后的頻譜圖應(yīng)用動(dòng)態(tài)特征增強(qiáng)(Dynamic[0075]根據(jù)本申請(qǐng)的一個(gè)方面,步驟S12中處理紅外圖像數(shù)據(jù)時(shí)還可以構(gòu)建多尺度熱量的復(fù)雜度自動(dòng)劃分圖像區(qū)域。對(duì)每個(gè)區(qū)域應(yīng)用改進(jìn)的熱量流動(dòng)分析(EnhancedThermal在不同空間尺度上計(jì)算熱量梯度。應(yīng)用熱量模式識(shí)別(ThermalPatternRecognition,模態(tài)融合的可控視頻生成提供了豐富和精確的熱量特征輸入。多尺度熱量動(dòng)態(tài)特征提取統(tǒng)能夠根據(jù)熱量分布的復(fù)雜度自動(dòng)劃分圖像區(qū)域,特別適合處理復(fù)雜的熱場(chǎng)景,如在生成包含多個(gè)熱源或熱量分布不均勻的視頻時(shí),能夠精確地捕捉每個(gè)區(qū)域的熱特性。增強(qiáng)的熱動(dòng)態(tài)變化。這對(duì)于生成涉及熱量變化的視頻至關(guān)重要,例如在模擬火災(zāi)場(chǎng)景或展示工業(yè)過(guò)在不同空間尺度上計(jì)算熱量梯度,這種多尺度分析使得系統(tǒng)能夠同時(shí)捕捉大尺度的熱量分質(zhì)量的熱量特征表示增強(qiáng)了系統(tǒng)在生成涉及溫度和熱量變化的視頻時(shí)的表現(xiàn)力。例如,在還為多模態(tài)融合提供了寶貴的輸入,使得生成的視頻在視覺、音頻和熱量信息上都能達(dá)到高度的一致性和真實(shí)感。本實(shí)施例提升了系統(tǒng)在處理和生成涉及復(fù)雜熱量分布的視頻時(shí)的能力,為多模態(tài)融合的可控視頻生成任務(wù)提供了強(qiáng)有力的支持,提高了生成視頻在特定應(yīng)[0084]根據(jù)本申請(qǐng)的一個(gè)方面,步驟S12中的對(duì)邊緣算子圖數(shù)據(jù),使用高斯平滑去除噪實(shí)現(xiàn)了更加精確和連貫的邊緣檢測(cè)。這對(duì)于生成具有清晰輪廓和結(jié)構(gòu)的視頻內(nèi)容至關(guān)重描述符。這種高質(zhì)量的邊緣特征為后續(xù)的視頻生成過(guò)程提供了強(qiáng)有力的結(jié)構(gòu)和形狀指導(dǎo)。[0106]S238、網(wǎng)絡(luò)結(jié)構(gòu)固化和知識(shí)提取。分析網(wǎng)絡(luò)中每個(gè)連接和節(jié)點(diǎn)的重要性,使用和特征重要性,動(dòng)態(tài)生成新節(jié)點(diǎn);使用自適應(yīng)節(jié)點(diǎn)生成閾值(AdaptiveNodeGenerationThreshold,ANGT該閾值根據(jù)網(wǎng)絡(luò)性能和資源限制動(dòng)態(tài)調(diào)整。應(yīng)用啟發(fā)式連接搜索網(wǎng)絡(luò)復(fù)雜度和性能。貝葉斯優(yōu)化,從預(yù)定義的激活函數(shù)庫(kù)中選擇最優(yōu)函數(shù)。構(gòu)建動(dòng)態(tài)學(xué)習(xí)率調(diào)節(jié)(Dynamic梯度流調(diào)節(jié)器(GradientFlowRegulator,GFR確保在動(dòng)態(tài)變化的網(wǎng)絡(luò)中梯度能夠有效用結(jié)構(gòu)剪枝(StructurePruning,SP)算法,移除不重要的連接和節(jié)點(diǎn)。使用知識(shí)蒸餾定結(jié)構(gòu)網(wǎng)絡(luò)中。動(dòng)態(tài)拓?fù)渲貥?gòu)算法通過(guò)動(dòng)態(tài)調(diào)整網(wǎng)絡(luò)結(jié)構(gòu),可以更好地適應(yīng)不同的輸入數(shù)的網(wǎng)絡(luò)結(jié)構(gòu)使系統(tǒng)能夠更好地處理和融合來(lái)自不同模態(tài)的復(fù)雜特征,從而生成質(zhì)量更高、有特定風(fēng)格和內(nèi)容的動(dòng)畫,系統(tǒng)可以自動(dòng)調(diào)整網(wǎng)絡(luò)結(jié)構(gòu)以最佳地映射文本語(yǔ)義到視覺特中的坐標(biāo)。[0132]將經(jīng)過(guò)各自編碼器處理后的多模態(tài)特征通過(guò)分詞器(tokenizer)進(jìn)行處理,將不態(tài)權(quán)重分配不僅提高了特征融合的精度,還增強(qiáng)了模型對(duì)不同模態(tài)輸入的適應(yīng)性和靈活確保了不同模態(tài)的信息能夠在同一個(gè)序列中進(jìn)行交互和融合。本實(shí)施例用到了DiT[0137]本實(shí)施例在實(shí)際應(yīng)用中具有廣泛的有益效果,能夠提升視頻生成的質(zhì)量和可控計(jì)的編碼器可以高效提取各模態(tài)的關(guān)鍵特征,并通過(guò)tokenizer將這些特征拼接成統(tǒng)一的是在遠(yuǎn)程教育中,多模態(tài)視頻生成技術(shù)能夠提供更直觀和生動(dòng)的教學(xué)資源。在虛擬現(xiàn)實(shí)戶的沉浸感和交互體驗(yàn)。通過(guò)結(jié)合深度圖像和點(diǎn)云圖等數(shù)據(jù),生成的虛擬場(chǎng)景更加逼真和立體。在醫(yī)療影像和健康監(jiān)測(cè)中,通過(guò)多模態(tài)數(shù)據(jù)融合生成高質(zhì)量的診斷視頻和可視化報(bào)康監(jiān)測(cè)視頻更加全面和準(zhǔn)確。輸入的處理能力,還為后續(xù)的融合過(guò)程提供了更加豐富和精確的特征表示。在分配和多層次深度融合。能夠根據(jù)當(dāng)前任務(wù)和輸入數(shù)據(jù)的特性,自適應(yīng)地調(diào)整不同模態(tài)特上精確控制視頻內(nèi)容的生成,同時(shí)保持了視頻序列的時(shí)空連貫性。自適應(yīng)分辨

溫馨提示

  • 1. 本站所有資源如無(wú)特殊說(shuō)明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁(yè)內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫(kù)網(wǎng)僅提供信息存儲(chǔ)空間,僅對(duì)用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
  • 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。

最新文檔

評(píng)論

0/150

提交評(píng)論