CN116405942B 基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決策方法 (南京航空航天大學)_第1頁
CN116405942B 基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決策方法 (南京航空航天大學)_第2頁
CN116405942B 基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決策方法 (南京航空航天大學)_第3頁
CN116405942B 基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決策方法 (南京航空航天大學)_第4頁
CN116405942B 基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決策方法 (南京航空航天大學)_第5頁
已閱讀5頁,還剩32頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

RuoyangChen.ADRL-BasedHieraGameforPhysicalLa基于動態聯盟博弈的物理層安全無線傳輸本發明公開了一種基于動態聯盟博弈的物于考慮物理層安全的無線傳輸環境中存在的竊與對抗關系采用多階段序貫博弈和動態聯盟博弈來建模,以為達成三者各自的效用最大為目聯盟博弈的聯盟形成算法來完成三方設備的結2法和基于深度強化學習的智能決策算法來實現三方設備的表示三方設備在動態聯盟博弈中所有可能產生的聯盟。2.根據權利要求1所述的基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決Ux(t),u(t)和u,(t),包含系統運行過程中各方的收益和損耗;其優化問題表示為:3(5)設計基于聯盟切換準則的聯盟形成算法求解各個時間片中動態聯盟博弈gf的均衡(6)設計基于深度強化學習的智能決策算法來求解多階段序貫博弈s"在整個系統運行3.根據權利要求2所述的基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決功率分配采用l級離散分配,表示為p(t)e同時干擾機也采4.根據權利要求2所述的基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決45.根據權利要求2所述的基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決合法用戶在時間片t中的效用函數ux(t)表示為:干擾機在時間片t中的效用函數ug(t)表示為:56.根據權利要求2所述的基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決聽設備按照優化目標[EP]決策和μE(t),其次是合法用戶按照優化目標決策L(t),最后是干擾機按照優化目標ml決策fo,g"的三個階段在每個時7.根據權利要求2所述的基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決8.根據權利要求2所述的基于動態聯盟博弈的物理層安全無線傳輸中三方設備智能決強化學習過程的狀態空間綜合考慮了網絡拓撲、瞬6[0002]近年來,物理層安全(PhysicalLayerSecurity[0003]雖然PLS在不同方面得到了廣泛的關注,但大多數現有的發明研究都沒有充分探著三方設備中的任何兩方都可能暫時形成聯盟并動態調整,即隨著時間的推移合并或分7率分配采用l級離散分配,表示為同時干擾機也采用l[0010](1)在每個時間片中,計算三方設備的相關物理量,包括合法用戶的上傳速率和保密傳輸速率竊聽設備的竊聽速率Re(t),上傳速率的計算方法[0013]其中,表示基站m處的加性高斯白噪聲(AdditiveGaussianWhiteNoise,nm8[0019](2)基于各方設備各自的物理量分別構造三方設備在各個時間片的效用函數Ux(t),ux(t)和ug(t),包含系統運行過程中各方的收益和損耗;[0032]干擾機在時間片t中的效用函數ug(t)表示為:間片內更換盟友,則干擾機為通知聯盟變更而建立的額外連接所引起的潛在配置成本,9[0036](3)分別建立三方設備的策略集,生成三方設備各自的長期平均效用最大化優化[0038]式中,"(t)表示竊聽設備在各時間片的激活選擇,μE(t)表示竊聽設備在各時間μL(t)表示合法用戶在各時間片的單位激勵量。對于干擾機,其策略集表示為[0044](4)構建多階段序貫博弈來建模三方設備的策略性交互,多階段序貫博弈表達式設備按照優化目標[EP]決策和μE(t),其次是合法用戶按照優化目標[CP]決策L(t),最后是干擾機按照優化目標unl決策(e).g"的三個階段在每個時表示三方設備在動態聯盟博弈中所有可能產生的聯盟。sf是[0049](5)設計基于聯盟切換準則的聯盟形成算法求解各個時間片中動態聯盟博弈gf的定的聯盟劃分CP"(t):該聯盟形成算法是分布式運行,即同一時間片內各方獨立地計算自且ciui)ifcs)i,運行時間0≤t≤T中的全局均衡解,實現三方設備除了結盟選擇以外的決策變量(即算法是基于近端策略優化算法(ProximalPolicyOptimization,PPO)和演員_評論家框架nkjm和習的三方設備智能決策方法,該方法可以在動態演化的多個時間片中產生PLS中各方的最[0062]圖4是基于強化學習的智能決策方法訓與現有方法在三方設備累計效用上的對比[0065]本發明的主要思想是首先提出了一種包含動態三邊聯盟的多階段序貫博弈框架M={1,2,…,M}。每個合法用戶為其上行傳輸占用一個正交信道,上行信道的集合亦表示[0071]其中,表示基站m處的加性高斯白噪聲(AdditiveGaussianWhiteNoise,nm信道增益,和分別為合法用戶n和干擾機j采用的l級離散功率分配,表示為類似地,在時間片t中合法用戶n到竊聽設備k的SINR為:[0076]相應地,在在時間片t中,竊聽設備k在信道neN上的竊聽速率可以表示[0078]根據PLS中保密傳輸速率的定義,保密傳輸速率是指合法用戶能夠安全傳輸到其支付)在三方的效用中都起著重要的作用,因此對于三方設備的效用函數的構造綜合考慮[0084](2)吸引干擾機合作的單位激勵量,記為re(t)e[0,"],其中為竊聽設備聽設備性能增益的乘積。這種性能增益可以表示為竊聽設備在干擾機幫助下的成功攔截[0095](2)目標基站選擇a(),vneN,vmeM,其中或0表示合法用戶n是[0106]對于干擾機而言,給定μE(t)和μL(t),在每個時間片t中決定(1)干擾功率分配盟博弈來將求解三方設備的聯盟選擇問題轉化為求解穩定聯衡解。方法得到各個時間片內三方設備的穩定聯盟劃∈G更愿意加入一個可能的聯盟caeAU(0),而不是另一個聯盟的條件可以uf"()>uf"(),vcnc,eAut0)ca*Gn其中,符號表示博弈方i在時間片t中對聯盟的偏好順序,uf"tc和uf"co分別表示博弈方i加入聯盟[0123]viec,viec,VC.,cneA,C*ci,a)i,vieca,vcaeA,(DistributedCoalitionSelectionandCoalitionFormation,DCSCF)方法,用于在每先計算自己的效用,然后根據聯盟切換準則決定是否離開當前聯盟,加入另一個存在于則動態且獨立地選擇其最優聯盟加入。中的決策僅依賴于前一個時間片的決策和因此產生的系統狀態,(例如前一個時隙中的聯夫決策過程(MarkovDecisionProcesses,MDP)來描述合法用戶、竊聽設備和干擾機的策{CP(t),S(t),A-1(t)},其中CP(t)是當前聯盟劃分,表示所有sf={NT(t),cp(t)Jvr.鄰接矩陣NT(t)定義為:[0137](2)動作空間Ai:對Ri:對于在時間片t中的三方設備x,N和J,他們實時的獎勵值分別表Optimization,PPO)和演員_評論家框架(Actor_Critic,AC)的深度強化學習算法來求解這的狀態價值v,(s)~v'(s),其中真正的狀態價值v'(s)=γt為折扣生成竊聽設備的決策變量"(t)和μE(t)$;用N個智能體來生成合法用戶的決a來生成干擾機的決策所有智能體的集合記為AGT,并且,每個智能體具有自己的AC框迭代地應用所提出的DCSCF方法,以形成穩定聯盟劃分CP"(i),并計算他們的獎勵r,,veeAGT.然后,經驗回放池存儲前一個狀態動作a;,后續狀態和每個智能體e的獎勵其中po(afIS)是e的演員網絡[0147]圖3說明了本發明所提出的深度強化學習方法結構的概述,包括所有智能體的交每個智能體內部的詳細AC框架以及環境和網絡參數的更新過程(即演員網絡的θ和評論家l=[0.1,0.9],cx=[0.1,0.5],cone=[0.1,0.6],RAin=4bps/HZ,?=10和此外,信道增益的不確定性被設置為3種

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論