今天下午,備受關(guān)注的東方算芯在上海舉辦了一場盛大的發(fā)布會。
在開場演講中,東方算芯創(chuàng)始人魏少軍博士首先指出,算力是智能時(shí)代的核心引擎,但受國際環(huán)境影響,我國整個(gè)產(chǎn)業(yè)在高端算力芯片、核心架構(gòu)、先進(jìn)制程甚至底層生態(tài)方面都在面臨著前所未有的制約與調(diào)整。為此,魏少軍博士認(rèn)為,我們必須要走出一條屬于自己的路,打造架構(gòu)自主、技術(shù)原創(chuàng)、生態(tài)自理和供應(yīng)鏈安全可控的生態(tài)。
正是基于這種思考,上海東方算芯科技有限公司于2024年5月在上海浦東成立。依托自主原創(chuàng)的軟件定義芯片、近存計(jì)算兩大核心技術(shù)以及全國產(chǎn)化供應(yīng)鏈體系,東方算芯旨在研發(fā)打造高性能、高能效、高靈活性的大算力芯片產(chǎn)品,搭建自主可控的生態(tài)系統(tǒng)。
在發(fā)布會上,東方算芯也揭開了公司首顆芯片DF1000的神秘面紗。
![]()
作為一顆依托全國產(chǎn)供應(yīng)鏈打造的軟件定義近存計(jì)算3D AI芯片,DF1000是聚焦架構(gòu)層面的創(chuàng)新優(yōu)化,在國產(chǎn)成熟工藝條件下實(shí)現(xiàn)了高性能算力輸出。而基于3D混合鍵合技術(shù)實(shí)現(xiàn)晶圓級堆疊,東方算芯有效提升了芯片的訪存帶寬,降低供應(yīng)鏈依賴。除此以外,DF1000系列還遵循 OAM 2.0規(guī)范,提供標(biāo)準(zhǔn)化接口可無縫適配國內(nèi)各大主流 OEM廠商的AI服務(wù)器平臺,支持大模型訓(xùn)練、推理等應(yīng)用場景。
得益于這種領(lǐng)先設(shè)計(jì),基于該芯片打造的單卡在BF16的精度下算力高達(dá)520 TFLOPS,能提供6.4TB/S的超高顯存帶寬,其Scale-up互聯(lián)帶寬也高達(dá)900 GB/s。這樣一顆芯片,再配套自主編程框架與軟件生態(tài),具備計(jì)算效率高、通用性強(qiáng)、訪存帶寬大、能效表現(xiàn)優(yōu)的特點(diǎn),為AI產(chǎn)業(yè)提供穩(wěn)定的國產(chǎn)算力底座。
之所以能在全國產(chǎn)供應(yīng)鏈上獲得如此優(yōu)秀的性能表現(xiàn),如上所述,“軟件定義+3D堆疊近存計(jì)算”的設(shè)計(jì)功不可沒。“這種設(shè)計(jì)讓芯片在實(shí)現(xiàn)高速度、低功耗的同時(shí)依然保持很強(qiáng)的可變動性能,滿足應(yīng)用靈活多樣的需求”,魏少軍博士說。從他的介紹我們得知,這次技術(shù)和產(chǎn)品的發(fā)布,是東方算芯核心團(tuán)隊(duì)自2006年從清華大學(xué)起步以來,歷經(jīng)二十年厚積薄發(fā)的成果。
首先看“軟件定義架構(gòu)”方面。據(jù)介紹,該方案擁有粗粒度塊狀架構(gòu)、分布式集合通信極致以及計(jì)算單元數(shù)據(jù)通路復(fù)用三個(gè)特征。
具體而言,東方算芯團(tuán)隊(duì)也已經(jīng)構(gòu)建了從硬件到軟件的全棧可重構(gòu)計(jì)算體系,動態(tài)重構(gòu)多精度融合計(jì)算陣列,能夠根據(jù)模型特性自動選擇最優(yōu)數(shù)據(jù)通路;以 TensorTile 為基本調(diào)度單元,構(gòu)建全異步、無阻塞的數(shù)據(jù)流執(zhí)行引擎,實(shí)現(xiàn)極致計(jì)算資源利用率。“通過任務(wù)處理的空間并行和硬件資源的時(shí)分復(fù)用,顯著提升硬件資源利用率,從而降低對芯片制造工藝的要求。”東方算芯方面強(qiáng)調(diào)。
![]()
至于“近存計(jì)算技術(shù)”,按照東方算芯所說,這為我國提供了規(guī)避HBM存儲器供應(yīng)風(fēng)險(xiǎn)、不依賴海外先進(jìn)制造工藝的選擇。
眾所周知,過去幾年,全球主要的AI芯片都是包含HBM。但要實(shí)現(xiàn)這些設(shè)計(jì),不但需要擁有HBM,還需要CoWoS產(chǎn)能。過去兩年,這兩種技術(shù)的價(jià)格和產(chǎn)能,讓不少芯片廠商頭疼。對于國內(nèi)廠商而言,因?yàn)閲H競爭關(guān)系,還需要考慮供應(yīng)問題。
在這種環(huán)境下,東方算芯的“近存計(jì)算”成為了本土AI供應(yīng)鏈破局的一個(gè)選擇。
據(jù)介紹,通過采用業(yè)界領(lǐng)先的混合鍵合封裝技術(shù),東方算芯在研芯片上實(shí)現(xiàn)了邏輯層與DRAM層的無凸點(diǎn)垂直互連。相比傳統(tǒng)2.5D HBM方案(依賴硅中介層和微凸點(diǎn)),這種設(shè)計(jì)能將互連間距從數(shù)十微米壓縮至亞微米級別,帶來數(shù)量級提升的互連密度與帶寬密度。從數(shù)據(jù)上看,如上所述,這樣的設(shè)計(jì)能帶來6.4 TB/s的訪存帶寬以及高達(dá)900 GB/s的Scale-up互聯(lián)帶寬,性能數(shù)倍于傳統(tǒng)HBM方案。
![]()
除了上述兩項(xiàng)技術(shù)外,東方算芯還推出了一個(gè)被稱為Infinity Chiplet 3.5D+的擴(kuò)展架構(gòu),旨在實(shí)現(xiàn)更強(qiáng)算力、更大規(guī)模,并突破通信墻。
![]()
如下圖所示,據(jù)東方算芯方面介紹,東方算芯基于國產(chǎn)成熟工藝芯片的有效算力性能在與國際4nm芯片時(shí)不落下風(fēng)。
![]()
在發(fā)布會現(xiàn)場,東方算芯還披露了涵蓋基礎(chǔ)軟件與應(yīng)用軟件、高性能服務(wù)器和大規(guī)模集群系統(tǒng)在內(nèi)的解決方案。
軟件方面,如魏少軍博士所說,算力產(chǎn)業(yè)的競爭最終是體系與生態(tài)的競爭。為此,在過去兩年,東方算芯同步打造了自主可控的底層軟件棧,覆蓋編譯器、算子庫、集合通訊部分布式訓(xùn)練框架及一站式攻作鏈,全面兼容主流深度學(xué)習(xí)框架。為用戶提供簡潔高效的遷移與部署方案。
![]()
硬件方面,東方算芯還隨著芯片推出了通用模組產(chǎn)品、一體機(jī)和超節(jié)點(diǎn)等產(chǎn)品。
其中,巔峯 DF1000通用模組產(chǎn)品算力為4.16 PFLOPS@BF16的算力,Scale-up帶寬為7200GB/s,Scale-out帶寬為3.2Tbps,訪存帶寬51.2TB/S,CPU為120核,整機(jī)功耗12KW;擎元 QY100一體機(jī)算力為4.16 PFLOPS@BF16的算力,Scale-up帶寬為7200GB/s,Scale-out帶寬為3.2Tbps,訪存帶寬51.2TB/S,CPU為120核,整機(jī)功耗12.5KW;拓域 TY64 超節(jié)點(diǎn)產(chǎn)品,其算力為33.28 PFLOPS@BF16,Scale-up帶寬為57.6TB/s,Scale-out帶寬為25.6Tbps,訪存帶寬409.6 TB/s,CPU為960核,整機(jī)功耗120KW。
在發(fā)布這些產(chǎn)品之余,東方算芯還披露了公司未來幾年的產(chǎn)品路線圖:
![]()
綜上所述,基于“軟件定義+3D堆疊近存計(jì)算”和全國產(chǎn)化的供應(yīng)鏈體系,東方算芯為國產(chǎn)算力繞開對國際最先進(jìn)制造工藝和HBM存儲器的依賴開拓了一條新路徑。
用魏少軍博士的話來說:“今天,一條中國自主原創(chuàng)的算力芯片新路線正式啟航。”
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.