計算機行業(yè)CUDA:英偉達護城河的構(gòu)筑、松動與國產(chǎn)突圍_第1頁
計算機行業(yè)CUDA:英偉達護城河的構(gòu)筑、松動與國產(chǎn)突圍_第2頁
計算機行業(yè)CUDA:英偉達護城河的構(gòu)筑、松動與國產(chǎn)突圍_第3頁
計算機行業(yè)CUDA:英偉達護城河的構(gòu)筑、松動與國產(chǎn)突圍_第4頁
計算機行業(yè)CUDA:英偉達護城河的構(gòu)筑、松動與國產(chǎn)突圍_第5頁
已閱讀5頁,還剩14頁未讀 繼續(xù)免費閱讀

下載本文檔

版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請進行舉報或認領(lǐng)

文檔簡介

目錄CUDA:NVIDIA的加速計算平臺 3三大技術(shù)內(nèi)核:簡單易用、彈性擴展、生態(tài)深厚 6核心一:弱化并行編程復(fù)雜度,大幅降低開發(fā)門檻 6核心二:模塊化架構(gòu)設(shè)計,實現(xiàn)跨代GPU性能自適應(yīng) 7核心三:近20年軟件生態(tài)積累,覆蓋開發(fā)全流程 8何以成為英偉達的護城河? 平臺通用性強,跨場景協(xié)同構(gòu)筑技術(shù)壁壘 軟件生態(tài)深厚,全棧鎖定推高轉(zhuǎn)換成本 全球裝機量領(lǐng)先,規(guī)模效應(yīng)驅(qū)動網(wǎng)絡(luò)飛輪 12架構(gòu)迭代靈活,代際領(lǐng)先拉開性能差距 13性價比優(yōu)勢突出,高粘性強化客戶依賴 14趨勢展望:CUDA護城河穩(wěn)固,但正從靜態(tài)轉(zhuǎn)向動態(tài)演進” 14趨勢一:從訓(xùn)練轉(zhuǎn)向推理,推理是壁壘薄弱環(huán)節(jié) 14趨勢二跨越生產(chǎn)可用門檻,推理側(cè)率先分流 15趨勢三:自研DSA分流推理需求,壟斷定價權(quán)邊際松動 16趨勢四:國產(chǎn)替代雙軌提速,推理賽道是現(xiàn)實突破口 17風(fēng)險提示 20UnifiedDevice是英偉達開發(fā)的一套軟件平臺,讓開發(fā)者能夠用普通編程語言直接調(diào)用的計算能力。用GPU的并行計算功能。開發(fā)者可以使用C++、Python和Fortran等語言進行編程,也可以利用PyTorch等GPU加速庫和框架。這種靈活性使開發(fā)者能夠?qū)PU計算集成到軟件棧的任何層,從而實現(xiàn)最佳的功能和性能。在AI的訓(xùn)練和推理環(huán)節(jié)中,CUDA作為連接大模型與AI芯片的平臺,發(fā)揮著重要作用。圖1:CUDA在整個英偉達計算生態(tài)中的核心樞紐地位資料來源:英偉達官網(wǎng)為什么是在加速計算及深度學(xué)習(xí)上的性能遠超。CPU由大腦。它是所有現(xiàn)代計算系統(tǒng)必不可少的組成部分,因為它負責(zé)執(zhí)行計算機和操具有許多更小、更專業(yè)的核心。這些核心協(xié)同運行,并將處理任務(wù)并GPU擅長處理高度并行工作負載中計算結(jié)果。圖2:GPU將更多晶體管用于計算數(shù)據(jù)處理資料來源:英偉達官網(wǎng)和的主要區(qū)別在于它們的內(nèi)部架構(gòu)和設(shè)計目的。。許多應(yīng)用程序GPUCPU上運行。CPU的設(shè)計(線程GPU專為高度并行計算而設(shè)計,并CPU則將更多晶體管用于數(shù)據(jù)緩存和流程控制。從技術(shù)上看,將大部分晶體管用于數(shù)據(jù)處理,而還需要預(yù)留芯片面積用于大型緩存、控制單元等。CPUGPUCPU架構(gòu)CPU中,每個線程都會盡可能縮(白色條形圖(綠色條形圖的核心里堆了巨大的緩存和極CPU能夠立刻執(zhí)行。CPU(上下文切換)在GPUGPU可以在任何時候以零成本地從停滯的T1T2就會開始處理數(shù)據(jù),以此類推,T3T4也相繼接替。與此同時,T1切換的時候沒活干,這個機制就失效了。GPU適合跑幾千個并發(fā)線程的原因。圖3:GPU與CPU的計算線程差異資料來源:英偉達官網(wǎng)為什么需要雜的算法也需要更多的計算能力才能運行。計算機行業(yè)一直以來都依賴各Dennard個月翻一番,正如摩爾定律所預(yù)測的那樣。指令級并行等技術(shù)也有助于2001Dennard縮放技術(shù)與摩2005200520世紀90212.4年1.8倍。圖4:2001年左右的圖形性能軌跡資料來源:英偉達官網(wǎng)以每秒處理三角形數(shù)2.42001年,PC圖形能力已經(jīng)足以取代昂貴的大型專用圖形系統(tǒng)。開發(fā)者們看到了新機會,這種強大的并行計算能力不限于畫圖。開發(fā)者開始利用圖形硬件去加速科學(xué)計算任務(wù),比如醫(yī)學(xué)影像、電磁學(xué)模擬等,這成為后來的運動的早期動力。英偉達的GPU要求高,GPUPU20033D場景或圖像的每個組成部分并行運行自定義代碼。在誕生之前,如果用戶想用計算一個簡單的矩陣加法,那得演一場“戲”。要把成千上萬個數(shù)字,轉(zhuǎn)換成一張張圖片的像素顏色值(,,,abShdrPU圖片但當(dāng)時沒有統(tǒng)一標準,效率極低且調(diào)試非常復(fù)雜。2006年,英偉達推出了CUDA,使任何計算工作負載都能利用的吞吐量能力,而無需依賴圖形APIGPU計算已被用于加速幾乎所有類型的計算工作負載,從流體動力學(xué)或能量傳輸?shù)瓤茖W(xué)模擬到數(shù)據(jù)庫和分析等商業(yè)應(yīng)用。此外,GPU的強大功能和可編程性也為圖像分類、擴散或大型語言模型等生成式人工智能等新算法和技術(shù)的進步奠定了基礎(chǔ)。2025IIA600AIDIA400個庫、600模型、眾多軟件開發(fā)3700GPU5300萬次。核心一:弱化并行編程復(fù)雜度,大幅降低開發(fā)門檻在傳統(tǒng)觀念中,寫并行計算代碼極其復(fù)雜。而CUDA允許開發(fā)者使用熟悉的C/C++語言,像寫普通的單線程程序一樣去寫代碼,復(fù)雜的并行化過程由CUDA編譯器在底層自動完成。CUDA編程模型為程序員提供了三個關(guān)線程塊Shrdmory(共享內(nèi)存ock內(nèi)部的所有線程可以共同訪問的、極快的高速內(nèi)存,這方便了線程之間互相傳話、協(xié)同數(shù)據(jù);3)Synchrontonbrrrs(同步屏障,一種同步機制,讓所有線程在某一個A和BI為每一個硬件I(PU圖5:CUDA代碼示例資料來源:英偉達官網(wǎng)核心二:模塊化架構(gòu)設(shè)計,實現(xiàn)跨代性能自適應(yīng)編程模型通過“模塊獨立動態(tài)調(diào)度在低端與旗艦GPUGPU中處理器核心數(shù)量的增加而自動地擴展。任何問題或應(yīng)用程序都可以分解模塊都允許將一個子問題分解成更小的部分,并通過并行線程執(zhí)行并相互協(xié)作。GPU中的程序能夠擴展到任意數(shù)量的多處理器上運行。就可以像玩俄羅斯方塊一樣,GPU的物理計算核心,流式多處理器(SM,Strmngutprocssors,并且可以以任意順序進行調(diào)度。假設(shè)你的程序84SM28SM)SM1行度更高,算力直接拉滿。將復(fù)雜的并行編程模型封裝為類C的開發(fā)門檻。還實現(xiàn)了“硬件透明上都能自動獲得最佳的性能擴展。40604SM8SM能夠建立龐大生態(tài)的底層技術(shù)基石之一,它讓軟件資產(chǎn)具備了極高跨代復(fù)用價值。圖6:CUDARuntime示例資料來源:英偉達官網(wǎng)核心三:近20年軟件生態(tài)積累,覆蓋開發(fā)全流程不只是一個編程模型,而是英偉達歷經(jīng)近年持續(xù)迭代形成CC++FortranPython已迭13.3.1C++Python1.0(-即插即用的性能加速,省去重復(fù)開發(fā)。三是分析與調(diào)試工具:NVIDIANsight、、Compute等工具支撐開發(fā)者NVIDIACommandGPUGPU加速應(yīng)用:2006。六是全產(chǎn)品線硬件覆蓋:GeForce、PRO、Jetson嵌入式平臺(JetsonThor,面向機場景)圖7:CUDA生態(tài)示意圖資料來源:英偉達官網(wǎng)1.0最初僅支持C當(dāng)前支GPU、C++、Fortran、Python等。英偉達推出C/C++2026513.3C++C++23支已在生產(chǎn)工作負載GPUCPU目標進行了驗證,MetaTritonBench內(nèi)核15%Python生態(tài)方面,NVIDIACUDA13.3PythonPythonGPUPython中的主機API。Python為生態(tài)系統(tǒng)提供一個統(tǒng)一構(gòu)建的基礎(chǔ),以便共同組成不同的PythonNVIDIAGPU的門Python接口直接調(diào)用GPU并行開發(fā),編譯器自動生代碼;OpenCLGPU編程。庫GPUGPU底層平臺之上搭GPU加速庫。工具包自帶大量通用計算庫,行業(yè)合作伙伴也為生態(tài)貢獻豐富第三方庫,包括數(shù)學(xué)計算庫、并行算法庫、圖像視頻庫、通信互聯(lián)庫、深度學(xué)習(xí)庫、第三方合作庫等。性能分析與調(diào)試工具完善高效的代碼編寫、排錯、調(diào)優(yōu)工具是編程體系不可或缺的一環(huán)。CUDA捷地完成PUIIAsghtvoproosGDBQNX系統(tǒng)上的應(yīng)用程GNUGDB的擴展。該工具為開發(fā)人員提供了應(yīng)用程序的機制。這使得開發(fā)人員能夠避免GPU內(nèi)存檢測必備工具,可解析上萬并發(fā)線程引發(fā)的各類內(nèi)存訪問異常等。數(shù)據(jù)中心工具與集群管理英偉達千塊大模型業(yè)務(wù),GPU1)NGC平臺提同時支持托管第三方容器,企業(yè)也可搭建私有鏡像倉庫。TensorFlowPyTorch容器每月會提供針對性能優(yōu)化的更新bare上,將容器部署在任意位置(云端、內(nèi)部私有云和邊緣)是行AGPUOperator利用中的Operator框架來自動管理配置GPU所需的所有軟件組件。這些組件包括NVIDIA驅(qū)動程序(用于啟用PUubrnts設(shè)備插件、NIIA容器工具包、使用GFD的監(jiān)控等等。3)集群管理工具。主流Command的最新架GPU管理。借助自主開發(fā)定制監(jiān)控程序。GPU加速應(yīng)用英偉達2006年發(fā)布后,大量軟件應(yīng)用完成展移植工作的是科研學(xué)術(shù)界,各類標準仿真軟件、自研科研代碼均完成GPU大縮短模型訓(xùn)練、推理耗時,當(dāng)前幾乎所有主流深度學(xué)習(xí)框架均依托CUDA13.3C++GPU并行GPU加速過GPU覆蓋生態(tài)的廣泛普及,讓開發(fā)者隨時隨地獲取用于開發(fā)與程序移植。GeForcePRO、Jetson嵌入式平臺(TegraSoC,當(dāng)前旗艦為采用JetsonThor場景具備向下兼容特性,成為開發(fā)者GPU架構(gòu)(raP、4顯存、nk6互聯(lián),raubn144算3.3倍。開發(fā)者可在筆記本、臺式機、工作站、代碼;全球所有公有云廠商均有搭兼容顯卡的算力實例。CUDA平臺通用性強,跨場景協(xié)同構(gòu)筑技術(shù)壁壘英偉達通過構(gòu)建的是加速計算平臺,其市場覆蓋范圍遠超能夠達到的水平GPUTPU的工作,本質(zhì)上屬于為特定算法固化的專用加速CUDA正是英偉達連接硬件與應(yīng)用的核心系統(tǒng)。圖8:英偉達基于CUDA構(gòu)建的加速計算平臺應(yīng)用廣泛資料來源:英偉達官網(wǎng)軟件生態(tài)深厚,全棧鎖定推高轉(zhuǎn)換成本CUDA已發(fā)展成一個龐大的生態(tài)系統(tǒng),而非簡單的編程語言。CUDA是一、cuDNN、TritonTriton在內(nèi)的諸多并包含大量英偉達官方貢獻,這軟件棧實質(zhì)上生長生態(tài)底座之上。CUDA軟框架-庫-硬件"的正反饋循環(huán)持續(xù)強化其網(wǎng)絡(luò)效應(yīng)。全球裝機量領(lǐng)先,規(guī)模效應(yīng)驅(qū)動網(wǎng)絡(luò)飛輪已建立起龐大的全球裝機基礎(chǔ)與跨平臺通用能力,形成了強大的網(wǎng)絡(luò)效應(yīng)壁壘。CUDA20年間在全球構(gòu)建起數(shù)以億計運行GPUJonResearch報告,2025GPU市94%1.6%2025GPU97%,較202495%ISC2026高性能計算大會發(fā)布數(shù)500400多臺,市場份81%。圖9:AIBGPU市場份額情況資料來源:JPR的默認開發(fā)平臺地位,由于英偉達GPU框架均優(yōu)先確保對的性能優(yōu)化與兼容性支持,而框架層的優(yōu)先適配又進一步吸引開發(fā)作為首選開發(fā)環(huán)境,形成裝機量-框架適配-開發(fā)者聚集”的CUDA成為英偉達的護城河。硬件部署的廣度與平臺通用性不僅鎖定了全球開發(fā)者的路徑依賴,更通過規(guī)模效應(yīng)持續(xù)抬高競爭者的進入門檻。架構(gòu)迭代靈活,代際領(lǐng)先拉開性能差距CUDA的通用可編程架構(gòu)賦予其緊跟AI算法快速演進的能力,這是ASIC難以企及的關(guān)鍵優(yōu)勢。AI算法迭代日新月異,從注意力機制到混合專家模型再到各類混合架構(gòu),新范式往往伴隨著非規(guī)則的并行計算模式與復(fù)雜的分布式通信需求。允許開發(fā)者直接編寫自定義內(nèi)核,快速實現(xiàn)并驗等固定架構(gòu)芯片受限于預(yù)設(shè)的指令集與數(shù)據(jù)流設(shè)計,面對算法的架構(gòu)代際演進中,通過軟硬件協(xié)同優(yōu)化實30-50算法創(chuàng)新的性價比優(yōu)勢突出,高粘性強化客戶依賴CUDA在總擁有成本(TCO)與客戶價值層面建立了顯著的競爭壁壘。英偉達平臺在每美元性能與每瓦性能上均具備領(lǐng)先優(yōu)勢,能夠為數(shù)據(jù)中心帶來最高的Token產(chǎn)出密度與營收轉(zhuǎn)化效率。根據(jù)英偉達官網(wǎng),NVIDIA50的成1/352-3GPU的大規(guī)??蛻舳?,這意味著巨大的成本節(jié)約與收入增長空間。生態(tài)的企業(yè),更換平臺不僅意味著重寫已演變?yōu)橛昧司碗x不開的高粘性平臺。表1:Blackwell每瓦的TokenHopper50倍以上(HGXH200)(GB300NVL72)GPU每小時成本(美元(HGXH200)(GB300NVL72)GPU每小時成本(美元)$1.41$2.652x每美元FLOPS(PFLOPS)2.85.62x每GPU每秒Token產(chǎn)出906,00065x每兆瓦Token產(chǎn)出54K2.8M50x每百萬Token成本(美元)$4.20$0.12降為1/35資料來源:英偉達官網(wǎng),

NVIDIABlackwell

BlackwellVSHopper趨勢展望:“動態(tài)演進”“動態(tài)演進特征,云廠商與加速器供應(yīng)商正加大力度自研底層軟件庫,長期來看,非Sconnysts數(shù)據(jù),2025I加速器市場2026趨勢一:從訓(xùn)練轉(zhuǎn)向推理,推理是壁壘薄弱環(huán)節(jié)一個關(guān)鍵的結(jié)構(gòu)性變化是訓(xùn)練與推理的分化,訓(xùn)練是護城河最難被替代的環(huán)節(jié),但推理是壁壘薄弱的環(huán)節(jié)GPU(((參數(shù)梯度中單個比特的翻轉(zhuǎn)就可能導(dǎo)致運行失敗cuDNN20推理是將訓(xùn)練好的模型部署到生產(chǎn)環(huán)境。工作負載是靜態(tài)的(,內(nèi)核預(yù)先已知(24/7全天運行的固定架構(gòu)模型不需要完靈活性,它只需要能夠高效運行這種特定計算模式的最經(jīng)濟的芯片。2023202520262/3Gartner預(yù)計,2026IaaS用于推理、202965%Gartner測算,智能體單任務(wù)消耗的token5-30IDC年0.0005PetaTokens20301526673418%。圖10:2030年全球企業(yè)將擁有22億個活躍Agent資料來源:IDC趨勢二:ROCm跨越生產(chǎn)可用門檻,推理側(cè)率先分流的ROCm已完成從“技術(shù)驗證項目”到“生產(chǎn)級算力平臺”的關(guān)鍵跨越,這是生態(tài)松動中最直接的正面競爭變量。是面GPUGPU進行編程所需的工7FP4/FP673.57623.18BQuen1.57B3倍;PyTorch、、、等主Day0軟件棧下載量同比增長約10GPU內(nèi)核生成工具持續(xù)降低編程門檻。20267月,MetaPyTorchMonarch在大規(guī)模分布式訓(xùn)練基礎(chǔ)設(shè)施層面亦獲得一線框架的原生納入。圖11:AMDROCm軟件棧資料來源:AMD官網(wǎng)巨頭訂單是O制性使的AI202510與D9006W的PUD向penI1.6億股認股權(quán)證;20262官宣多年期、跨世6GW600-10001GW基于MI450GPU2026機架級架構(gòu)并1.6億股績效認股權(quán)證。6GW軟件生態(tài)已具備承接超大規(guī)模推理負載的能力;云端巨頭的策略已從選單一供應(yīng)商轉(zhuǎn)向TCO。但ROCm與mnsor-、3NIMkernel的Code30ROCm遷移成本這一核心壁壘將。趨勢三:自研DSA分流推理需求,壟斷定價權(quán)邊際松動大廠自研DSA對體系的沖擊本質(zhì)是經(jīng)濟學(xué)而非技術(shù)。GPUBernstein估GPU優(yōu)勢40%TPUv6e21070TrendForce202645%GPU16%。長久以來,定制化芯片多被視為云計算巨頭的內(nèi)部玩具大的自用算力需求。2025-2026芯片SAA202510合作部署至多100萬顆TPU、算力容量超1GW,交易價值達數(shù)百億美元,40TPUv7部署6020264nthropc進一步簽TPU3主要TPU亦公開披露其模型訓(xùn)練GPUCerebras100200公司正把“算力多樣化、避免單點依賴”作為明確戰(zhàn)略。圖12:谷歌Gemini3主要基于自研TPU訓(xùn)練并在多模態(tài)領(lǐng)域登頂資料來源:GoogleGemini3趨勢四:國產(chǎn)替代雙軌提速,推理賽道是現(xiàn)實突破口出口管制重塑了中國中國市場無法獲得英偉達最先進產(chǎn)品,國內(nèi)對關(guān)鍵行業(yè)與國有智算基礎(chǔ)設(shè)施的采購導(dǎo)向則進一步壓縮了降級版芯片的空間,需求端并非在性能與生IDC數(shù)據(jù),2025400萬張,其中英偉達以約220萬張出貨量占據(jù)約55%的市場份額。根據(jù)Research2026芯片市場份額將萎縮8%50%2027。壁壘:其一是華為昇騰、寒武高;其二是海光、摩爾線程、沐曦、壁仞為代表的類CUDA兼容路線,采用GPGPU架構(gòu)+高轉(zhuǎn)換質(zhì)量編譯器實現(xiàn)CUDA應(yīng)用低成本遷移。圖13:到2026年英偉達的市場份額萎縮至8%,華為等本土廠商將實現(xiàn)明顯增長資料來源:BernsteinResearch自研生態(tài)路線以華為昇騰、寒武紀為代表,通過軟硬件深度協(xié)同釋放自有芯片性能上限,并追求最高程度的供應(yīng)鏈自主可控。2025MindSpore,也是出于長遠考慮,如果我們投入巨資兼容過去的版本,哪天系列應(yīng)轉(zhuǎn)向“開放兼容”;Ascend950SIMD/SIMTNPU高能效優(yōu)勢的同時增強算法適配靈活性,進一步收窄與CUDA生態(tài)的編程體驗差距。8.0200多個深度優(yōu)化基礎(chǔ)算子、80多個融合算子、100多個scndCPI2人月縮短至1.5Pyor、MindSpore、TensorFlow、飛槳、ONNX等主流框架。自研路線的另一代表Neuware軟件棧。類兼容陣營在2025-2026年密集登陸資本市場,資本加持下硬件追趕+生態(tài)兼容的雙輪模式開始形成規(guī)模效應(yīng)。通用并行計算架構(gòu),DTK硬件優(yōu)200099%對AI芯片202512月登陸科創(chuàng)板,MUSASDK4.0Intelx86202512月登陸科創(chuàng)板,其自研GPU生態(tài)的02026313305,591萬16萬次。表2:國產(chǎn)AI芯片企業(yè)生態(tài)對比公司 生態(tài) 對策略 生態(tài)規(guī)模關(guān)鍵數(shù)據(jù) 開源情況華為昇騰(未上市)

異構(gòu)計算架構(gòu)+Mind系列

CUDA,全自研對標;CANN全面開源開放

超60萬開發(fā)者了解/使用CANN,算子認證開發(fā)者超6000人;鯤鵬+昇騰整體開

全面開源,Mind列套件及工具鏈全面開底層接口套件發(fā)者665萬、伙伴8800+、解決方案認證23900+寒武紀Cambricon自建生態(tài);云邊端編程框架適配等基礎(chǔ)系統(tǒng)軟原生支持PyTorch、688256.SHNeuWare基一體化件技術(shù)已取得專利141項vLLM、Diffusers等主流礎(chǔ)系統(tǒng)軟件AI框架,新模型可快速遷平臺移至寒武紀平臺海光信息DTK(DCU兼容ROCm、類集成超2000個算子,對標發(fā)布"雙芯"戰(zhàn)略,宣布全688041.SHToolkit)軟CUDA環(huán)境CUDA算子覆蓋度超99%面開放DCU軟件棧核心技件棧術(shù),共建開放軟件棧生態(tài)標準。海光DCU已在2

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
  • 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
  • 5. 人人文庫網(wǎng)僅提供信息存儲空間,僅對用戶上傳內(nèi)容的表現(xiàn)方式做保護處理,對用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對任何下載內(nèi)容負責(zé)。
  • 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔(dān)用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論