/記得星標(biāo)我/
比大部分人早一步看見未來
大模型訓(xùn)練正式進(jìn)入萬卡、十萬卡規(guī)模化時代,算力競爭的核心邏輯已經(jīng)發(fā)生根本性轉(zhuǎn)變。單純堆疊GPU芯片不再是集群性能的決勝因素,高速互聯(lián)網(wǎng)絡(luò)的質(zhì)量,才是決定整體算力利用率、模型訓(xùn)練速度、集群穩(wěn)定性的關(guān)鍵瓶頸。
行業(yè)實測數(shù)據(jù)顯示,稠密大模型訓(xùn)練的通信耗時占比超過30%,MoE稀疏模型通信占比更是突破50%,網(wǎng)絡(luò)微小抖動、延遲波動、偶然丟包,都會造成大規(guī)模GPU空轉(zhuǎn)等待,直接導(dǎo)致集群算力利用率大幅下滑。
在行業(yè)長期深陷進(jìn)口IB價格高昂、RoCE大規(guī)模不穩(wěn)的兩難格局下,中科曙光scaleFabric全棧自研國產(chǎn)IB已實現(xiàn)批量出貨與大規(guī)模商用落地,憑借原生無損RDMA架構(gòu),徹底打破傳統(tǒng)技術(shù)路線桎梏,成為當(dāng)前萬卡、十萬卡智算集群的最優(yōu)組網(wǎng)選擇。
![]()
萬卡時代網(wǎng)絡(luò)困局:兩條傳統(tǒng)路線均存在致命短板
萬卡級超大規(guī)模集群依托高頻All-Reduce通信、張量并行、流水線并行等機(jī)制完成分布式訓(xùn)練,數(shù)萬GPU實時高頻數(shù)據(jù)交互,對網(wǎng)絡(luò)的延遲、抖動、丟包、帶寬穩(wěn)定性提出極致要求。任何細(xì)微的網(wǎng)絡(luò)問題,都會在大規(guī)模并行場景中指數(shù)級放大,最終拉長訓(xùn)練周期、浪費巨額算力成本。但長期以來,國內(nèi)智算集群僅能選擇進(jìn)口IB或以太網(wǎng)RoCE兩條路線,但就目前看來,二者均無法同時滿足高性能、低成本、高穩(wěn)定、自主可控的產(chǎn)業(yè)化需求。
進(jìn)口InfiniBand技術(shù)成熟、性能領(lǐng)先,但在國內(nèi)規(guī)模化落地過程中,壟斷帶來的成本問題與供應(yīng)鏈風(fēng)險愈發(fā)突出。成本層面,進(jìn)口400G IB網(wǎng)卡單價高達(dá)數(shù)千美元,800G光模塊、高速DAC線纜價格翻倍增長,一套萬卡集群的網(wǎng)絡(luò)硬件投入動輒上億元,大幅抬高智算基建門檻。供應(yīng)鏈層面,高端IB設(shè)備被納入出口管制清單,供貨周期普遍拉長至3至6個月,斷供風(fēng)險持續(xù)存在。同時海外廠商長期采用軟硬件捆綁銷售模式,采購高端GPU必須配套采購其網(wǎng)絡(luò)設(shè)備,企業(yè)喪失自主選型與議價能力,國產(chǎn)算力集群建設(shè)高度依賴海外供應(yīng)鏈。
RoCE方案憑借硬件采購成本僅為進(jìn)口IB一半的優(yōu)勢,成為國內(nèi)中小規(guī)模集群的主流選擇,適配千卡以下實驗訓(xùn)練、常規(guī)推理等輕量化場景。但該方案屬于以太網(wǎng)補(bǔ)丁式改造,先天架構(gòu)缺陷無法通過軟件調(diào)優(yōu)根治,一旦集群規(guī)模突破千卡、邁向萬卡級別,各類性能問題會集中爆發(fā)。對于持續(xù)數(shù)十天的大模型預(yù)訓(xùn)練任務(wù),一次故障回滾、重啟訓(xùn)練帶來的算力損耗與時間成本,足以抹平RoCE的硬件價格優(yōu)勢。除此之外,RoCE運(yùn)維難度極高,沒有通用適配參數(shù),需要運(yùn)維團(tuán)隊根據(jù)模型類型、流量特征、集群規(guī)模持續(xù)迭代水線閾值、擁塞控制、隊列調(diào)度等參數(shù),高度依賴資深專家經(jīng)驗。
國產(chǎn)IB批量商用落地:全棧自研打破性能成本不可能三角
針對行業(yè)長期存在的高性能必高價、低成本不穩(wěn)定、自研方案缺性能的行業(yè)痛點,中科曙光歷經(jīng)三年核心技術(shù)攻堅,推出scaleFabric 400G原生無損RDMA高速網(wǎng)絡(luò)。目前該產(chǎn)品已實現(xiàn)穩(wěn)定批量出貨,完成大規(guī)模商用交付,實現(xiàn)從底層112G PAM4 SerDes IP、交換芯片、高速網(wǎng)卡,到驅(qū)動程序、全網(wǎng)管理軟件的全棧自研,徹底擺脫海外技術(shù)依賴,在國內(nèi)率先實現(xiàn)國際級性能、RoCE級成本、全鏈路自主可控的三重突破,徹底打破高速網(wǎng)絡(luò)行業(yè)的不可能三角。
我們先來看技術(shù)架構(gòu)層面,scaleFabric對標(biāo)國際主流NDR技術(shù)標(biāo)準(zhǔn),采用先進(jìn)ADC-DSP架構(gòu),針對性解決超高速長距傳輸?shù)男盘査p、噪聲干擾、信號失真等核心難題。
在信號優(yōu)化方面,自研電感峰化補(bǔ)償技術(shù)搭配FFE/DFE聯(lián)合均衡算法,有效補(bǔ)償PCB鏈路、高速線纜帶來的高頻信號損耗,保障跨節(jié)點、長距離傳輸?shù)男盘柾暾浴?/p>
在抗干擾方面,搭載反射補(bǔ)償與噪聲白化DSP算法,精準(zhǔn)抵消鏈路阻抗不匹配產(chǎn)生的信號反射,將不規(guī)則有色噪聲均勻化處理,大幅降低系統(tǒng)誤碼率,適配機(jī)房復(fù)雜電磁環(huán)境與布線工況。
在穩(wěn)定性保障方面,通過高性能LDO電源凈化設(shè)計,過濾電源紋波與電壓波動,為高速信號處理、時鐘系統(tǒng)提供穩(wěn)定供電,從硬件底層筑牢傳輸穩(wěn)定性。相較于RoCE的被動流控機(jī)制,scaleFabric沿用原生IB信用流控機(jī)制,傳輸前校驗接收端緩沖區(qū)資源,先確認(rèn)后發(fā)送,從根源杜絕丟包與緩沖區(qū)溢出問題,無需依賴PFC調(diào)控,徹底規(guī)避大規(guī)模集群的PFC風(fēng)暴風(fēng)險。最終實現(xiàn)260納秒交換機(jī)轉(zhuǎn)發(fā)時延、0.9微秒端到端通信時延,核心性能全面對標(biāo)國際一線產(chǎn)品。
再來看看實地應(yīng)用的表現(xiàn),目前scaleFabric已在國家超算互聯(lián)網(wǎng)鄭州核心節(jié)點深度部署,支撐三套萬卡級超算集群穩(wěn)定運(yùn)行。依托極簡自研架構(gòu)優(yōu)勢,整套3萬卡規(guī)模集群從設(shè)備上電、組網(wǎng)調(diào)試到業(yè)務(wù)全線開通,僅耗時36小時,相較于RoCE集群數(shù)周的調(diào)優(yōu)周期,部署效率提升十倍以上,大幅縮短大型智算集群建設(shè)周期。
截至目前,該商用節(jié)點已穩(wěn)定運(yùn)行超10個月,累計承載十萬級AI訓(xùn)練、超算仿真作業(yè),全程無網(wǎng)絡(luò)故障、無訓(xùn)練中斷、無大規(guī)模算力閑置,完全適配7×24小時不間斷高強(qiáng)度算力調(diào)度需求。
在集群擴(kuò)展能力上,scaleFabric突破傳統(tǒng)IB規(guī)模上限,單子網(wǎng)可支持11.4萬卡集群擴(kuò)展,是傳統(tǒng)進(jìn)口IB的2.33倍,可無縫適配未來十萬卡級超大規(guī)模智算集群迭代升級。同時產(chǎn)品端口密度較行業(yè)主流提升25%,單芯片支持80個400G端口或40個800G端口,高集成度有效減少交換機(jī)、光模塊、高速線纜用量,精簡組網(wǎng)架構(gòu),降低硬件堆疊帶來的運(yùn)維壓力與能耗損耗。
批量出貨帶來的規(guī)模化效應(yīng),徹底重構(gòu)了行業(yè)高速網(wǎng)絡(luò)的成本體系。相較于同規(guī)格進(jìn)口IB設(shè)備,scaleFabric整體組網(wǎng)成本降低30%以上,硬件建設(shè)成本與國產(chǎn)高端RoCE方案完全持平,徹底改寫了國產(chǎn)高速網(wǎng)絡(luò)高價小眾的固有認(rèn)知。
規(guī)模化商用價值:性能、穩(wěn)定性、自主可控全方位升級
scaleFabric批量交付落地,不只是單一產(chǎn)品的商業(yè)化落地,更是國產(chǎn)高端高速網(wǎng)絡(luò)產(chǎn)業(yè)的里程碑突破。長期以來,國內(nèi)萬卡級高端智算網(wǎng)絡(luò)被海外廠商壟斷,國產(chǎn)方案始終無法兼顧性能、穩(wěn)定性與安全性。scaleFabric的規(guī)模化應(yīng)用,徹底填補(bǔ)國產(chǎn)原生無損RDMA網(wǎng)絡(luò)的技術(shù)空白,從性能表現(xiàn)、運(yùn)行穩(wěn)定性、供應(yīng)鏈安全三大維度,解決制約國產(chǎn)AI算力規(guī)模化發(fā)展的核心瓶頸。
在性能層面,完美適配高端算力場景極致需求。大模型預(yù)訓(xùn)練、氣象仿真、流體力學(xué)、AI for Science等高端場景,對網(wǎng)絡(luò)延遲一致性、帶寬穩(wěn)定性、傳輸精度要求極高,微小的網(wǎng)絡(luò)波動都會直接影響模型收斂速度與仿真結(jié)果精度。scaleFabric依托原生RDMA架構(gòu),無需CPU內(nèi)核調(diào)度介入,實現(xiàn)硬件級直接內(nèi)存?zhèn)鬏敚舆t更低、抖動更小。在大規(guī)模All-Reduce高頻通信場景中,能夠有效縮短梯度同步耗時,加速模型迭代收斂。實測數(shù)據(jù)顯示,同等GPU配置與訓(xùn)練任務(wù)下,scaleFabric集群的訓(xùn)練吞吐與收斂速度較RoCE集群提升15%以上,長期訓(xùn)練累積的效率優(yōu)勢顯著,可有效縮短訓(xùn)練周期、降低算力能耗成本。
在穩(wěn)定性層面,原生架構(gòu)適配超大規(guī)模長期運(yùn)行。區(qū)別于RoCE后天改造的模擬無損機(jī)制,scaleFabric從協(xié)議底層規(guī)避PFC風(fēng)暴、網(wǎng)絡(luò)死鎖、路由震蕩等高頻故障,網(wǎng)絡(luò)穩(wěn)定性不會隨集群規(guī)模擴(kuò)張衰減。在數(shù)萬卡高并發(fā)、高負(fù)載極端工況下,性能平滑下降,不會出現(xiàn)RoCE式斷崖式崩盤。同時搭載自研鏈路質(zhì)量診斷與快速自愈系統(tǒng),可全網(wǎng)實時監(jiān)測鏈路狀態(tài)、精準(zhǔn)定位故障節(jié)點,毫秒級完成路由切換與故障修復(fù),全程無需人工干預(yù),實現(xiàn)即插即用、長期免維護(hù),完美適配超大規(guī)模集群不間斷運(yùn)行需求。
在安全層面,全棧自研筑牢算力基建底座。當(dāng)前高端算力設(shè)備出口管制持續(xù)收緊,算力基礎(chǔ)設(shè)施自主可控已成為國家戰(zhàn)略剛需。以往國產(chǎn)高端集群依賴進(jìn)口IB設(shè)備,不僅成本高昂,更面臨斷供、技術(shù)封鎖、生態(tài)綁定等風(fēng)險。scaleFabric實現(xiàn)芯片IP、硬件設(shè)備、軟件棧全鏈路國產(chǎn)自研,無海外核心技術(shù)依賴,穩(wěn)定批量供貨的能力,徹底打破海外壟斷,擺脫卡脖子困境。同時產(chǎn)品深度適配國產(chǎn)CPU、國產(chǎn)GPU、國產(chǎn)加速卡等全品類自研算力硬件,全面兼容國產(chǎn)算力生態(tài),為東數(shù)西算、超算互聯(lián)網(wǎng)等國家級算力工程提供安全可控、可迭代的高速網(wǎng)絡(luò)底座。
在生態(tài)層面,極低遷移門檻助力行業(yè)普及。行業(yè)對國產(chǎn)自研產(chǎn)品的核心顧慮集中在兼容性差、遷移成本高、生態(tài)不完善。scaleFabric完全兼容國際標(biāo)準(zhǔn)IB協(xié)議,PyTorch、TensorFlow、NCCL、OpenMPI等主流AI框架與通信庫無需代碼修改即可無縫遷移,原有業(yè)務(wù)、模型、運(yùn)維習(xí)慣完全復(fù)用,大幅降低替換成本。同時中科曙光聯(lián)合科大訊飛、中興通訊等數(shù)十家產(chǎn)業(yè)鏈企業(yè),依托光合組織成立高速網(wǎng)絡(luò)專項工作組,持續(xù)推進(jìn)國產(chǎn)高速網(wǎng)絡(luò)標(biāo)準(zhǔn)制定、場景適配與技術(shù)迭代,構(gòu)建完整國產(chǎn)化產(chǎn)業(yè)生態(tài),推動國產(chǎn)IB從可用向好用、規(guī)模化可用升級。
- 04 -
行業(yè)選型邏輯重構(gòu):國產(chǎn)IB成為萬卡集群最優(yōu)解
scaleFabric的成熟商用與批量落地,徹底重構(gòu)了國內(nèi)智算集群的網(wǎng)絡(luò)選型邏輯。過去行業(yè)只能在“高價穩(wěn)定的進(jìn)口IB”和“低價不穩(wěn)的RoCE”之間被動取舍,二元對立的選型困境長期制約國內(nèi)算力基建高質(zhì)量發(fā)展。如今國產(chǎn)IB的技術(shù)成熟與規(guī)模化落地,打破了固有矛盾,形成了適配不同集群規(guī)模、不同業(yè)務(wù)場景的科學(xué)化選型體系,實現(xiàn)性能、成本、穩(wěn)定性、安全性的全方位平衡。
從細(xì)分場景來看,100卡以下小型實驗、推理集群,業(yè)務(wù)并發(fā)壓力小、網(wǎng)絡(luò)故障風(fēng)險低,RoCE的低成本優(yōu)勢依然適用,可作為優(yōu)先選型。100至500卡中型混合業(yè)務(wù)集群,可采用“前端RoCE+后端國產(chǎn)IB”的混合組網(wǎng)模式,兼顧前端業(yè)務(wù)的兼容性與后端核心訓(xùn)練的高穩(wěn)定、低時延需求。
對于500卡以上大型集群,尤其是萬卡、十萬卡級大模型訓(xùn)練、高性能計算核心場景,國產(chǎn)IB已是行業(yè)唯一最優(yōu)解。此類場景對網(wǎng)絡(luò)無損傳輸、超低時延、長期穩(wěn)定性存在剛性需求,RoCE的架構(gòu)缺陷會被無限放大,無法支撐長期穩(wěn)定訓(xùn)練;進(jìn)口IB則存在高昂成本與供應(yīng)鏈安全隱患。而scaleFabric憑借持平RoCE的成本、對標(biāo)國際的性能、自主可控的供應(yīng)鏈與成熟的商用落地經(jīng)驗,成為超大規(guī)模智算集群的無可替代的組網(wǎng)方案。
站在行業(yè)發(fā)展視角,AI大模型規(guī)模化迭代已成必然趨勢,智算集群正向十萬卡級別快速演進(jìn),高速網(wǎng)絡(luò)將取代單純算力堆疊,成為決定集群算力釋放能力的核心核心要素。中科曙光scaleFabric的批量商用,不僅實現(xiàn)了國產(chǎn)高速網(wǎng)絡(luò)的跨越式技術(shù)突破,更重新定義了超大規(guī)模智算集群的性價比標(biāo)準(zhǔn)與選型規(guī)則。
![]()
依托全棧自研技術(shù)、十萬級作業(yè)驗證的穩(wěn)定性、普惠化成本優(yōu)勢與自主安全的供應(yīng)鏈體系,國產(chǎn)IB徹底改寫了國內(nèi)高端智算網(wǎng)絡(luò)的市場格局。未來,隨著技術(shù)持續(xù)迭代、產(chǎn)業(yè)生態(tài)不斷完善,國產(chǎn)IB將成為超大規(guī)模智算集群的主流組網(wǎng)方案,持續(xù)賦能國產(chǎn)大模型研發(fā)、高端科學(xué)計算與全國一體化算力網(wǎng)絡(luò)建設(shè),助力國內(nèi)算力產(chǎn)業(yè)實現(xiàn)高水平科技自立自強(qiáng)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.