![]()
芯東西(公眾號:aichip001)
作者 ZeR0
編輯 漠影
芯東西7月13日報道,剛剛,備受業界關注的上海AI芯片獨角獸東方算芯發布其首顆大算力芯片——軟件定義近存計算3D AI芯片DF1000,同步推出包含巔峯DF1000加速卡、拓域TY64超節點、擎元QY100服務器、慧算HS512智算集群以及自主開放軟件棧在內的全棧產品矩陣,并公布基于全國產供應鏈的三代產品路線圖。
![]()
DF1000是國內首顆采用DRAM-LOGIC Wafer-level混合鍵合3D垂直封裝的AI芯片,在14nm工藝節點下實現520TFLOPS@BF16的算力,訪存帶寬達6.4TB/s,已完成完整流片驗證,并實現128卡大規模集群全功能穩定運行。
![]()
不用先進制程、不用HBM,東方算芯軟件定義近存計算芯片實現了比肩國際先進制程產品的性能,并坐擁六大優勢:計算效率高、通用性好、訪存帶寬大、能效優越、完全避開受限的先進存儲、不依賴最先進制造工藝。
同時,東方算芯研發的自主開放軟件棧CAAP,擁抱主流開源生態開發框架,兼容主流算子開發編程模型,支持超節點與萬卡級智算集群。
東方算芯成立于2024年5月20日,總部在上海張江,致力于成為世界領先的超高性能計算芯片及系統方案提供者,團隊規模超過500人,估值約為123億元。
其創始人、董事長兼CEO魏少軍是清華大學長聘教授、國際歐亞科學院院士、國家集成電路產業發展咨詢委員會委員,在中國芯片設計領域聲望頗高。東方算芯的核心技術便源自清華大學微電子所過去二十年在可重構計算芯片技術、軟件定義近存芯片設計領域的技術積累。
據東方算芯副總裁郭煒分享,DF1000芯片在國內成熟芯片制程工藝條件下可實現從芯片設計、晶圓制造、3D 先進封裝到封測的全鏈條閉環,不依賴尖端制程,不懼外部條件制約,供應鏈穩定可控、可持續迭代,為國產高端芯片突破制程依賴提供了切實可行的技術路徑。
魏少軍教授談道,歷經兩年埋頭攻堅,東方算芯完成從實驗室技術到工程化、從單芯片到128集群穩定運行、從架構到全生態搭建,重點完成三項關鍵工作:
(1)堅定探索原創技術路線:軟件定義芯片技術提升硬件資源利用效率,獲得更高算力;近存計算3D架構大幅縮短存算距離,獲得更大帶寬。
(2)構建自主可控的產業體系:完成芯片的流片與驗證,實現大規模集群的全功能穩定運行,驗證全國產化供應鏈支撐體系。
(3)構建全棧自主的軟件生態:打造自主可控底層軟件棧,涵蓋編譯器、運行時、算子庫、集合通信庫、分布式訓練框架及一站式工具鏈。
東方算芯已明確部署“量產一代、研發一代、預研一代”的產品發展戰略,保持技術領先,保持生態開放,保持長期穩定。
魏少軍教授總結說,DF1000的戰略意義遠不止一顆芯片、一款產品,它解決了高端算力芯片對先進制程過度依賴的問題,解決了大模型時代算力系統最核心的存儲墻、帶寬墻與功耗墻的問題,構建了自主可控、可持續演進的中國算力產業新生態,為中國算力提供了可行答案。
值得一提的是,東方算芯DF1000已入選2026世界人工智能大會(WAIC)最高榮譽SAIL獎(卓越人工智能引領者獎)TOP30榜單。
一、繞開制程與存儲困境,國產AI芯片需要解局新路徑
5nm及以下的先進制程、HBM3及更先進的內存、2.5D/3D先進封裝,已成為海外高端AI芯片設計方案的標準配方。但這條正統路線置于中國AI芯片產業,卻存在三道裂縫。
第一道是摩爾定律紅利衰減,隨著晶體管微縮逼近物理極限,制程競賽進度放緩,芯片加工生產成本越來越高,能買到的性能收益卻越來越薄。
第二道是傳統2D平面芯片面臨的“存儲墻”,即處理器計算速度的增長遠快于內存帶寬的提升,算力一路飆升,數據搬運速度卻跟不上,片外訪存的延遲、能耗遠超計算本身。
大模型參數量爆炸,對內存占用的需求進一步膨脹,致使“存儲墻”直接轉化為“能耗墻”和“成本墻”,從性能瓶頸變成了商業瓶頸。無論是大模型企業還是基礎設施企業,都在探索減少數據搬運、改進存儲架構的創新方案。
第三道是地緣博弈。海外EUV光刻設備、先進制程工藝節點、HBM存儲等高性能芯片相關技術的對華供應遭封鎖,全球HBM產能被完全掌控在SK海力士、三星、美光三家外企手里,國內先進制程與國際前沿水平存在代際差。
對于中國芯片廠商來說,三道裂縫疊在一起,就涉及到長遠的自主可控問題。
所幸在摩爾定律逐漸失效的今天,先進制程不再是實現高算力的必選項,性能提升的來源轉向包括架構、存儲、封裝、通信在內的系統級創新。
面臨未來AI芯片設計的“大算力、大內存、大互聯”需求,國產芯片需要跨過“三堵墻”:
- 算力墻:如何在先進制程受限下提升算力?
- 內存墻:訪存帶寬如何匹配快速增長的算力?
- 通信墻:如何利用有限封裝尺寸,提供更大互連帶寬?
對此,東方算芯積蓄了跳出跟隨式研發路徑的三張技術底牌。
二、詳解三大原創技術路線:軟件定義 + 3D DRAM + Infinity Chiplet
東方算芯擺脫對海外先進制程與HBM供應鏈依賴的底氣,源自其三大核心技術路線。
1、軟件定義Tile原生架構:提升硬件利用率
傳統GPU的算力利用率被卡在30%-40%,很大程度上是固定硬件結構與多變負載錯配的稅。而軟件定義架構能根據實際情況靈活調整算力配置,實現張量和向量計算單元數據復用,既保持通用計算的靈活性,又充分利用有限芯片面積資源,提升整體硬件利用率。
![]()
東方算芯構建了從硬件到軟件的全棧可重構計算體系,基于動態重構多精度融合計算陣列,通過空間并行+時分復用雙機制動態調度硬件資源,根據模型特性,自動選擇最優數據通路;其可重構Transformer加速器針對Attention等核心算子進行硬件級優化,支持DeepSeek、Qwen、GLM等主流大模型的架構演進。
其全異步數據流編程模型以Tensor Tile為基本調度單元,構建全異步、無阻塞的數據流執行引擎,計算與數據搬運深度重疊,通過軟件管理的顯式數據流消除傳統緩存機制的開銷,實現極致計算資源利用率。
在這一技術方向,東方算芯核心團隊積累深厚。其董事長兼CEO魏少軍長期從事超大規模集成電路設計方法學研究、可重構計算架構研究和通信專用集成電路技術研究,長期參與國家級集成電路重大專項及產業政策制定,是軟件定義芯片與可重構計算領域的重要推動者。
2、3D近存計算技術:劈開訪存瓶頸
為了縮短數據傳輸路徑、大幅提升訪存帶寬,DF1000芯片采用3D晶圓級混合鍵合封裝技術,實現邏輯層與DRAM層的無凸點垂直互連。
![]()
相比依賴硅中介層和微凸點的傳統2.5D HBM方案,3D混合鍵合將互連間距從數十微米壓縮至亞微米級別,大幅縮短計算與存儲之間的數據通路,帶來數量級提升的互連密度與帶寬密度,同等容量下帶寬可達到HBM3E的5倍,突破“內存墻”。
3、Infinity Chiplet 3.5D + 擴展結構:突破“通信墻”
東方算芯Infinity Chiplet 3.5D+封裝技術用3D DRAM替代傳統AI芯片的數據存儲結構,節省了片上面積,無需HBM,因而節省了HBM的封裝面積、接口占用芯粒面寬。
相比傳統AI芯片的2.5D封裝技術,這一技術方案在相同封裝尺寸限制下,可提供更強算力、更大訪存帶寬、更大互聯規模。
此外,因為沒有HBM限制,未來該方案可實現更大規模的芯片算力擴展。
![]()
單芯片性能只是入場券,落地需要構建千卡、萬卡連成像一個巨型芯片的智算集群。東方算芯針對云端大模型訓練與推理的規模化需求,構建了一套從芯片到集群的原生分布式算力體系(包括芯片級軟件定義通信處理器、服務器級原生以太網超節點,以及軟件級分布式編程模型與運行時系統),實現算力資源的全棧協同優化。
通過將這些核心技術組合,東方算芯采用成熟國產制程工藝和DRAM存儲芯片,展現了一份獨特的高端算力芯片“東方范式”。
三、四大AI算力產品:巔峯加速卡、拓域超節點、擎元服務器、慧算集群
基于DF1000芯片,東方算芯打造了4類AI算力產品:巔峯 DF1000 加速卡、拓域 TY64 超節點、擎元 QY100 服務器、慧算 HS512 智算集群,可適配人工智能、互聯網、金融、超算等各類復雜算力場景。這些AI算力新品均將在世界人工智能大會WAIC 2026期間展出。
(1)巔峯DF1000加速卡:東方算芯首款AI加速卡產品,遵循OAM 2.0規范,提供風冷、液冷多種形態,提供標準化接口,適配國內主流OEM服務器平臺,支持大模型訓練、推理等應用場景,可滿足高速率token輸出需求。
(2)拓域TY64超節點:分布式液冷64卡超節點服務器,采用標準液冷機柜設計,算力密度與互聯帶寬處于行業領先水平,提供高算力、高帶寬、低延遲、高吞吐的軟硬件一站式系統化解決方案,在降低系統成本的同時增強可靠性,單節點算力可達33PFLOPS@BF16。
![]()
(3)擎元QY100服務器:基于第一代芯片與標準化部件打造的高集成化、高可靠性產品,單機8卡AI服務器,含風冷與液冷兩個版本,支持國產CPU、國產操作系統,無需客戶進行額外的硬件集成與調試,可直接向最終用戶交付,大幅縮短客戶部署周期,降低技術門檻。
(4)慧算HS128和HS512智算集群:面向大規模數據并行訓練與推理的128卡和512卡集群方案,采用“整體交付、開箱即用”的產品形態,整合了算力、網絡、存儲、軟件等全要素資源,提供端到端的全流程服務,具有高集成度、高可靠性、按需配置、快速交付等特點,集群支持可根據客戶需求配置具體規模。
![]()
結語:系統級創新+全國產供應鏈,國產大算力芯片的自主可控新路徑
進入后摩爾時代,跳出制程內卷去探索架構創新,成為大算力AI芯片設計的共同選擇。如今AI芯片的競爭正在邁入拼全棧的階段,從片內帶寬、算力利用率,到片外互連、集群穩定性,乃至供應鏈安全,每個環節都至為關鍵,系統級創新已是全行業公認的下一個礦脈。
過去幾年,國內AI算力基礎設施的天花板一直受限于技術封鎖,制程卡一關,HBM卡一關,先進封裝再卡一關,美國出口管制每加長一行,天花板就壓低一寸。DF1000的產業意義正在于此,以“軟件定義架構+3D堆疊近存計算”對沖制程代差與HBM缺口,原生分布式執行模型撐起集群規模,全部依靠國內成熟供應鏈,實現拆除路徑依賴的換道創新。
而全供應鏈可控的分量,將放在時間維度上來看清。算力的性能決定模型的上限,算力的主權決定產業的未來。唯有一顆對標國際第一梯隊的大算力芯片,從設計、制造、存儲到封裝的供應全部攥在自己手里,算力才能從一種要排隊、要許可、隨時可能斷供的進口資源,變成一種可持續、可迭代、按需擴產的國內AI基礎設施。
東方算芯堅持自主架構、自主工具鏈、自主軟件棧,底層實現全棧自主可控,同時堅持開放、通用、中立、兼容的產業理念,不搞封閉壁壘,不依附外部專有生態,提供標準化配置、低門檻遷移工具與完善的開發支持,與全行業共建開放共享、安全可控、自主演進的新一代戰略生態,推動我國算力產業真正走向高質量、可持續、自主自強的發展道路。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.