版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請進(jìn)行舉報(bào)或認(rèn)領(lǐng)
文檔簡介
為了解決深度確定性策略梯度算法在規(guī)劃軟件采集專家操縱UAV避障的演示軌跡數(shù)據(jù)集;2步驟1.采集專家操縱UAV避障的專家演示軌跡數(shù)據(jù)集和步驟2.構(gòu)建經(jīng)驗(yàn)池,所述經(jīng)驗(yàn)池由專家演示軌跡數(shù)據(jù)集和自探索軌跡數(shù)據(jù)集共同組在線策略網(wǎng)絡(luò)參數(shù)的優(yōu)化則分為專家演示軌跡樣本和自探exp對于專家演示軌跡數(shù)據(jù),將在線策略網(wǎng)絡(luò)基于當(dāng)前專家狀態(tài)預(yù)測的即時(shí)策略ai與真exp按照原始DDPG算法的在線策略梯度值V,VU(O")更新參數(shù)θμ:采用融合梯度v,s(o")更新在線策略網(wǎng)絡(luò)的參數(shù):經(jīng)驗(yàn)池由專家演示軌跡數(shù)據(jù)集Texpert和自探索軌跡數(shù)據(jù)集Tdiscover共同組成,并采用混合采樣機(jī)制從兩個(gè)數(shù)據(jù)集中分別采樣形成最終在線值函數(shù)網(wǎng)絡(luò)Q(s,a|θQ)參數(shù)的優(yōu)化具體包括以下3通過梯度下降法最小化損失函數(shù)J(θQ)對在線值函數(shù)網(wǎng)絡(luò)參數(shù)θQ進(jìn)行優(yōu)化更新,令J已知專家操控UAV避障生成的軌跡ζ:則該軌跡的獎(jiǎng)勵(lì)值r(ζ)為:4所述步驟4中基于最大熵逆向強(qiáng)化學(xué)習(xí)算法求解獎(jiǎng)勵(lì)函數(shù)具體包括iλ0為拉格朗日乘子;式中λj對應(yīng)著獎(jiǎng)勵(lì)函數(shù)中特征函數(shù)的權(quán)重將上式轉(zhuǎn)化為獎(jiǎng)勵(lì)函數(shù)特征分量權(quán)重θ的最小化負(fù)對數(shù)似然函數(shù)求解損失5所述步驟5中訓(xùn)練DDPG,直至DDPG在專家軌跡隱含的最優(yōu)獎(jiǎng)勵(lì)函數(shù)下以最優(yōu)策略完成飛行d)s=s9;6克利大學(xué)的JohnSchulman博士以及OpenAI相繼提出了DDPG(Deepdeterministicpolicygradient,深度確定性策略梯度)算法、異步優(yōu)勢AC(AsynchronousAdvantageActor[0004]盡管這些方法在UAV路徑規(guī)劃方面有明顯優(yōu)勢,但往往需要探索大量隨機(jī)障礙環(huán)熵的IRL算法求解專家演示軌跡中隱含的最7[0015]經(jīng)驗(yàn)池由專家演示軌跡數(shù)據(jù)集Texpert和自探索軌跡數(shù)據(jù)集Tdiscov[0018]進(jìn)一步地,所述步驟3中引入專家經(jīng)驗(yàn)損失函數(shù)指導(dǎo)的DDPG算法包括在線策略網(wǎng)expexp8[0045]已知專家操控UAV避障生成的軌跡[0058]進(jìn)一步地,所述步驟4中基于最大熵逆向強(qiáng)化學(xué)習(xí)算法求解獎(jiǎng)勵(lì)函數(shù)具體包括以9λ0為拉格朗日乘子;[0083]對被采樣的專家軌跡中連續(xù)的專家狀態(tài)z,和對應(yīng)的真實(shí)專家策略g,做離散化處[0091]隨機(jī)初始化在線策略網(wǎng)絡(luò)Q(s,a|θQ)和在線值函數(shù)網(wǎng)絡(luò)μ(s|θμ)的網(wǎng)絡(luò)參數(shù)θμ和[0101]本發(fā)明針對UAV路徑規(guī)劃問題,提出了一種基于逆向強(qiáng)化學(xué)習(xí)的無人機(jī)路徑規(guī)劃[0115]基于模擬器PhoenixRC軟件中自帶的復(fù)雜障礙場景獲取專家演示軌跡以及基于Python搭建簡單障礙場景用于UAV同環(huán)境交互[0116]專家演示軌跡的采集基于運(yùn)行游戲公司開發(fā)的專業(yè)無線電控制飛行模擬軟件[0118]從PhoenixRC模擬器中收集到的部分專家演示軌跡如圖3所示。在模擬器中收集最佳的飛行策略;3)模擬器直觀顯示避障過程中每一時(shí)刻的單目RGB圖像以及UAV的航向[0119]為測試算法性能搭建如圖4所示的三維障礙環(huán)境Q,使UAV在同環(huán)境交互中生成自由專家演示軌跡數(shù)據(jù)集Texpert和自探索軌跡數(shù)據(jù)集Tdiscover共同組成,并采用混合采樣機(jī)制[0126]引入專家經(jīng)驗(yàn)損失函數(shù)指導(dǎo)的DDPG算法包括在線策略網(wǎng)絡(luò)μ(s|θμ)、在線值函數(shù)expexp的在線策略梯度值v,-s(o")更新參數(shù)θμ:[0143]采用一種包含專家經(jīng)驗(yàn)損失在線策略梯度和原始在線策略梯度[0150]已知專家操控UAV避障生成的軌跡λ0為拉格朗日乘子。Q'及其權(quán)重;一致的情況下對比測試B本發(fā)明改進(jìn)算法和原始算法對網(wǎng)絡(luò)收斂速度的影響。設(shè)計(jì)獎(jiǎng)勵(lì)函[0213]對于最大熵逆向強(qiáng)化學(xué)習(xí)算法對避障效果的影響分析,UAV采用基于最大熵逆向強(qiáng)化學(xué)習(xí)求解出的最優(yōu)獎(jiǎng)勵(lì)函數(shù)的獎(jiǎng)勵(lì)值曲線如圖8所示。采用最優(yōu)獎(jiǎng)勵(lì)函數(shù)進(jìn)行訓(xùn)練的[0214]綜合專家經(jīng)驗(yàn)損失和逆向強(qiáng)化學(xué)習(xí)的改進(jìn)DDPG算法。圖9給出了綜合專家經(jīng)驗(yàn)損
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
- 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
- 5. 人人文庫網(wǎng)僅提供信息存儲空間,僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對任何下載內(nèi)容負(fù)責(zé)。
- 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請與我們聯(lián)系,我們立即糾正。
- 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 固體廢物監(jiān)測員崗中沖突解決考核試卷含答案
- 墨錠制作工安全技能考核試卷含答案
- 起重機(jī)械維修工崗位內(nèi)部考核試卷含答案
- 高頻電感器制造工崗位安全責(zé)任制模擬考核試卷含答案
- 重力勘探工安全防護(hù)能力考核試卷含答案
- 腸衣加工工崗中應(yīng)急能力考核試卷含答案
- 孕期健康宣教計(jì)劃模板
- 闌尾炎微創(chuàng)手術(shù)指導(dǎo)
- 全陪導(dǎo)游工作總結(jié)
- 采購管理制度及采購流程模板
- 2025年四川省水電投資經(jīng)營集團(tuán)有限公司招聘真題
- 2026北京朝陽區(qū)王四營鄉(xiāng)人民政府編外輔助崗招聘2人筆試參考題庫及答案詳解
- 精益管理基礎(chǔ)消除八大浪費(fèi)模板
- 番茄商品果外觀品質(zhì)評價(jià)標(biāo)準(zhǔn)
- 光儲充施工安全方案
- 2026貴州建養(yǎng)公路技術(shù)咨詢有限公司招聘6人筆試參考題庫及答案詳解
- 2026年醫(yī)療器械質(zhì)量工程師考試試題及答案
- 2025九年級化學(xué)上冊(全冊)考點(diǎn)總結(jié)
- 派駐紀(jì)檢組日常監(jiān)督課件
- 2026年度黃山市屯溪區(qū)事業(yè)單位統(tǒng)一公開招聘工作人員40名考試重點(diǎn)試題及答案解析
- GB/T 38145-2019高含量貴金屬合金首飾金、鉑、鈀含量的測定ICP差減法
評論
0/150
提交評論