CN118647032B 基于內在好奇心機制的多無人機通信系統優化控制方法 (東南大學)_第1頁
CN118647032B 基于內在好奇心機制的多無人機通信系統優化控制方法 (東南大學)_第2頁
CN118647032B 基于內在好奇心機制的多無人機通信系統優化控制方法 (東南大學)_第3頁
CN118647032B 基于內在好奇心機制的多無人機通信系統優化控制方法 (東南大學)_第4頁
CN118647032B 基于內在好奇心機制的多無人機通信系統優化控制方法 (東南大學)_第5頁
已閱讀5頁,還剩37頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

基于內在好奇心機制的多無人機通信系統本發明公開了一種基于內在好奇心機制的通過好奇心驅動的探索找到城市環境中的照明人機集中控制策略,以最大化累積通信服務分2S4:基于強化學習框架,將優化問題轉化為標在時間步長為t時,無人機的電池剩余電量表示為無人機的電池電3s本=g(s,a;p)充分利用前向模型產生的預測誤差作為訓練智能體策略的內在好奇的計算公式如下:所述步驟S5中,使用DDPG_ICM算法在探索密集型階段訓練網絡;演開發密集型階段被設計為在實際飛行中實施;4At2.根據權利要求1所述的基于內在好奇心機制的多無人機通信系統優化控制方法,其3.根據權利要求2所述的基于內在好奇心機制的多無人機通信系統優化控制方法,其所有無人機都有一個回程鏈路將它們連接到外部網絡;由于無人機式中Gn=10-"ao/2d:Pt表示無人機功率譜密度,ne表示環境噪聲的功率譜密度,表示Ru是每個用戶所需的最小吞吐量;無人機k在時間步長t內,無人機k的能耗由三個部分組成:5行距離記為de[0,dnee],無人機水平飛行能耗Phor由以下公式計算:4.根據權利要求3所述的基于內在好奇心機制的多無人機通信系統優化控制方法,其6[0002]無人駕駛飛行器(UAV)作為未來無線通信系統的重要組成部分越來越受歡迎。帶有無線電收發器的無人機可以作為移動基站代替地面基站(BSs),為地面用戶提供改進的的功率控制與傳統的基于固定基礎設施的網絡相比,無人機支持的超密集網絡表現更好。一種考慮多無人機系統以實現節能通信的覆蓋模型使用K_means聚類方法對地面設備進行研究工作并沒有研究能量收集在多無人機通信系統服務路徑問題中所起的[0005]一個使用太陽能無人機的能源管理框架適用于蜂窩異構網絡(HetNets)。該框架機可以使用收集的太陽能或充電站來補充電池的能量。由無人機支持的HetNets中的能源7有的深度確定性策略梯度(deepdeterministicpolicygradient,DDPG)技術使得在城市種基于內在好奇心機制的多無人機通信系統優化控制方法可以很好地[0014]在L×L的目標區域中,一組數量為NU的無人機群SU向一組數量為Nu的地面用戶Su8個目標區域中。無人機在目標區域內以固定的高度H飛行,每架無人機都有高度定向的天機k對用戶u的信噪比SINRku由以下s:表示覆蓋用戶u的無人機集合。[0026]無人機k的初始電池電量記為一個episode的時間片段被分割成NT個時間步無人機k的飛行距離記為d?e[0,dnax],無人機水平飛行能耗Phor由以下公式計算:9衡量智能體對基于成功服務的用戶數量的總體用戶滿意度的即戲,e[0,L].在時間步長為t時,無人機的電池剩余電量表示為無人機的電池電量有無人機的運動,在時間步長t上形成動作At,以體現無人機的集體運動。移動距離de[0,dnax)和移動方向fe[0,2)構成了無人機k在時間步長t中的動作在每個時練過程中離開目標區域,則取消當前的運動。在當前狀態St下執行當前動作At將導致負獎為:[0054]其中損失函數LI用于測量實際動作at與預測動作之間的差異。元組(st,st+[0057]本發明使用DDPG_ICM算法求解最優策略。ICM的目標是讓智能體完全自主地探索[0058]使用DDPG_ICM算法在探索密集型階段訓練網絡。演員網絡U(sl")和評論家網絡空間和連續動作空間的多無人機通信系統服務路徑問題提供了一種有潛力的集中控制方[0070]如圖所示,本發明所述的基于內在好奇心機制的多無人機通信系統優化控制方[0072]在L×L的目標區域中,一組數量為NU的無人機群SU向一組數量為Nu的地面用戶Su個目標區域中。無人機在目標區域內以固定的高度H飛行,每架無人機都有高度定向的天s!表示覆蓋用戶u的無人機集合。[0077]Ru是每個用戶所需的最小吞吐量。無人機k只在kes!及滿足下式的情況下才會[0082]無人機k的初始電池電量記為一個episode的時間片段被分割成NT個時間步無人機k的飛行距離記為de[0,dnex],無人機水平飛行能耗Phor由以下公式計算:表示在時間步長t內被成功服務的用戶總數。考慮衡量智能體對基于成功服務的用戶數量的總體用戶滿意度的即戲,e[0,L].在時間步長為t時,無人機的電池剩余電量表示為無人機的電池電量練過程中離開目標區域,則取消當前的運動。在當前狀態St下執行當前動作At將導致負獎要求也越來越高。除了由無人機和環境交互得到的外部獎勵以外,內在好奇心模塊[0101]在時間步長為t內的內部獎勵用表示,好奇心探索機制在解決稀疏獎勵問題上為:[0110]其中損失函數LI用于測量實際動作at與預[0113]S5:使用DDPG_ICM算法求解最優策略。ICM的目標是讓智能體完全自主地探索環[0114]使用DDPG_ICM算法在探索密集型階段訓練網絡。演員網絡U(sl")和評論家網絡M的經驗回放緩沖池ε

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論