CN115826601B 基于逆向強(qiáng)化學(xué)習(xí)的無人機(jī)路徑規(guī)劃方法 (中國人民解放軍海軍航空大學(xué))_第1頁
CN115826601B 基于逆向強(qiáng)化學(xué)習(xí)的無人機(jī)路徑規(guī)劃方法 (中國人民解放軍海軍航空大學(xué))_第2頁
CN115826601B 基于逆向強(qiáng)化學(xué)習(xí)的無人機(jī)路徑規(guī)劃方法 (中國人民解放軍海軍航空大學(xué))_第3頁
CN115826601B 基于逆向強(qiáng)化學(xué)習(xí)的無人機(jī)路徑規(guī)劃方法 (中國人民解放軍海軍航空大學(xué))_第4頁
CN115826601B 基于逆向強(qiáng)化學(xué)習(xí)的無人機(jī)路徑規(guī)劃方法 (中國人民解放軍海軍航空大學(xué))_第5頁
已閱讀5頁,還剩32頁未讀 繼續(xù)免費(fèi)閱讀

下載本文檔

版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請進(jìn)行舉報(bào)或認(rèn)領(lǐng)

文檔簡介

為了解決深度確定性策略梯度算法在規(guī)劃軟件采集專家操縱UAV避障的演示軌跡數(shù)據(jù)集;2步驟1.采集專家操縱UAV避障的專家演示軌跡數(shù)據(jù)集和步驟2.構(gòu)建經(jīng)驗(yàn)池,所述經(jīng)驗(yàn)池由專家演示軌跡數(shù)據(jù)集和自探索軌跡數(shù)據(jù)集共同組在線策略網(wǎng)絡(luò)參數(shù)的優(yōu)化則分為專家演示軌跡樣本和自探exp對于專家演示軌跡數(shù)據(jù),將在線策略網(wǎng)絡(luò)基于當(dāng)前專家狀態(tài)預(yù)測的即時(shí)策略ai與真exp按照原始DDPG算法的在線策略梯度值V,VU(O")更新參數(shù)θμ:采用融合梯度v,s(o")更新在線策略網(wǎng)絡(luò)的參數(shù):經(jīng)驗(yàn)池由專家演示軌跡數(shù)據(jù)集Texpert和自探索軌跡數(shù)據(jù)集Tdiscover共同組成,并采用混合采樣機(jī)制從兩個(gè)數(shù)據(jù)集中分別采樣形成最終在線值函數(shù)網(wǎng)絡(luò)Q(s,a|θQ)參數(shù)的優(yōu)化具體包括以下3通過梯度下降法最小化損失函數(shù)J(θQ)對在線值函數(shù)網(wǎng)絡(luò)參數(shù)θQ進(jìn)行優(yōu)化更新,令J已知專家操控UAV避障生成的軌跡ζ:則該軌跡的獎(jiǎng)勵(lì)值r(ζ)為:4所述步驟4中基于最大熵逆向強(qiáng)化學(xué)習(xí)算法求解獎(jiǎng)勵(lì)函數(shù)具體包括iλ0為拉格朗日乘子;式中λj對應(yīng)著獎(jiǎng)勵(lì)函數(shù)中特征函數(shù)的權(quán)重將上式轉(zhuǎn)化為獎(jiǎng)勵(lì)函數(shù)特征分量權(quán)重θ的最小化負(fù)對數(shù)似然函數(shù)求解損失5所述步驟5中訓(xùn)練DDPG,直至DDPG在專家軌跡隱含的最優(yōu)獎(jiǎng)勵(lì)函數(shù)下以最優(yōu)策略完成飛行d)s=s9;6克利大學(xué)的JohnSchulman博士以及OpenAI相繼提出了DDPG(Deepdeterministicpolicygradient,深度確定性策略梯度)算法、異步優(yōu)勢AC(AsynchronousAdvantageActor[0004]盡管這些方法在UAV路徑規(guī)劃方面有明顯優(yōu)勢,但往往需要探索大量隨機(jī)障礙環(huán)熵的IRL算法求解專家演示軌跡中隱含的最7[0015]經(jīng)驗(yàn)池由專家演示軌跡數(shù)據(jù)集Texpert和自探索軌跡數(shù)據(jù)集Tdiscov[0018]進(jìn)一步地,所述步驟3中引入專家經(jīng)驗(yàn)損失函數(shù)指導(dǎo)的DDPG算法包括在線策略網(wǎng)expexp8[0045]已知專家操控UAV避障生成的軌跡[0058]進(jìn)一步地,所述步驟4中基于最大熵逆向強(qiáng)化學(xué)習(xí)算法求解獎(jiǎng)勵(lì)函數(shù)具體包括以9λ0為拉格朗日乘子;[0083]對被采樣的專家軌跡中連續(xù)的專家狀態(tài)z,和對應(yīng)的真實(shí)專家策略g,做離散化處[0091]隨機(jī)初始化在線策略網(wǎng)絡(luò)Q(s,a|θQ)和在線值函數(shù)網(wǎng)絡(luò)μ(s|θμ)的網(wǎng)絡(luò)參數(shù)θμ和[0101]本發(fā)明針對UAV路徑規(guī)劃問題,提出了一種基于逆向強(qiáng)化學(xué)習(xí)的無人機(jī)路徑規(guī)劃[0115]基于模擬器PhoenixRC軟件中自帶的復(fù)雜障礙場景獲取專家演示軌跡以及基于Python搭建簡單障礙場景用于UAV同環(huán)境交互[0116]專家演示軌跡的采集基于運(yùn)行游戲公司開發(fā)的專業(yè)無線電控制飛行模擬軟件[0118]從PhoenixRC模擬器中收集到的部分專家演示軌跡如圖3所示。在模擬器中收集最佳的飛行策略;3)模擬器直觀顯示避障過程中每一時(shí)刻的單目RGB圖像以及UAV的航向[0119]為測試算法性能搭建如圖4所示的三維障礙環(huán)境Q,使UAV在同環(huán)境交互中生成自由專家演示軌跡數(shù)據(jù)集Texpert和自探索軌跡數(shù)據(jù)集Tdiscover共同組成,并采用混合采樣機(jī)制[0126]引入專家經(jīng)驗(yàn)損失函數(shù)指導(dǎo)的DDPG算法包括在線策略網(wǎng)絡(luò)μ(s|θμ)、在線值函數(shù)expexp的在線策略梯度值v,-s(o")更新參數(shù)θμ:[0143]采用一種包含專家經(jīng)驗(yàn)損失在線策略梯度和原始在線策略梯度[0150]已知專家操控UAV避障生成的軌跡λ0為拉格朗日乘子。Q'及其權(quán)重;一致的情況下對比測試B本發(fā)明改進(jìn)算法和原始算法對網(wǎng)絡(luò)收斂速度的影響。設(shè)計(jì)獎(jiǎng)勵(lì)函[0213]對于最大熵逆向強(qiáng)化學(xué)習(xí)算法對避障效果的影響分析,UAV采用基于最大熵逆向強(qiáng)化學(xué)習(xí)求解出的最優(yōu)獎(jiǎng)勵(lì)函數(shù)的獎(jiǎng)勵(lì)值曲線如圖8所示。采用最優(yōu)獎(jiǎng)勵(lì)函數(shù)進(jìn)行訓(xùn)練的[0214]綜合專家經(jīng)驗(yàn)損失和逆向強(qiáng)化學(xué)習(xí)的改進(jìn)DDPG算法。圖9給出了綜合專家經(jīng)驗(yàn)損

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫網(wǎng)僅提供信息存儲空間,僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對任何下載內(nèi)容負(fù)責(zé)。
  • 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論