華為正在重新定義“芯片新范式”,在超節點上收獲未來,迎來新一輪算力架構重構的機會窗口。
華為Fellow,半導體首席科學家廖恒,在鯤鵬昇騰開發者大會2026(KADC2026)上給出了一個公式:系統業務性能=超節點規格x單顆芯片規格。在這種范式里,單芯片不再是決定算力的唯一因素。
在智能體式AI時代,競爭已經越來越從追求單芯片的絕對算力,轉向適合不同場景與業務需求的比較優勢。在推理解碼/后訓練階段,內存帶寬>內存容量>算力。
所以廖恒說,在Agentic AI時代,就要在系統層面重構計算機,把更多NPU、CPU、內存、網絡和軟件棧,通過靈衢互聯組織成一個更大的邏輯機器。這就是昇騰超節點與鯤鵬超節點的底層邏輯。
![]()
(來源:廖恒在KADC2026演講PPT )
芯片的先進性仍然是基石。昇騰950PR與950DT的突破,首先體現在低精度格式。自主創新HiF8,實現顯存減半,算力翻倍。950系列兼容多元,支持FP8、MXFP8、HiF8、MXFP4等低精度格式,單芯片FP8算力達到1PFLOPS、FP4算力達到2PFLOPS,互聯帶寬提升至2TB/s。
微架構的設計,原生實現 了SIMD 與SIMT 雙編程模式一體化融合,讓昇騰芯片從專用化進一步走向GPU式靈活性 + NPU式高能效。這一設計給開發者帶來更友好的開發體驗, 以Transformer經典算子Softmax為例,開發所需的代碼量減少了70%。配合SIMD+SIMT融合后的更細粒度執行模式,昇騰950將內存訪問粒度從512B縮小到128B,提升MoE路由、KV cache、嵌入、解碼等不連續訪問場景下的有效內存帶寬。
950PR與950DT的分工,也顯示出昇騰對AI負載比較優勢的把握。950PR更偏推理預填充、推薦業務和容量性價比,強調內存容量、批次大小和序列長度;950DT則更偏解碼、訓練和帶寬敏感負載,其內存容量144GB、帶寬4TB/s,高于950PR的128GB和1.6TB/s。
這些是面向智能體時代的架構調整,業務需求將會制造更多長上下文、多輪調用、工具返回和持續記憶,解碼與緩存管理的重要性上升。昇騰超節點的最佳實踐,也正圍繞這些瓶頸展開,以單柜64卡為基本單元,最大支持8192張NPU卡高速互聯,面向超大規模訓練和海量推理并發;相比傳統集群,大模型訓練效率、可靠性和推理性能均有提升。廖恒還展示了正在實際部署的 1.6 萬卡柜內(Scale-Up)加柜外(Scale-Out)混合系統,
如果說昇騰解決的問題是智能從哪里算出來,鯤鵬要提供智能體在哪里運行的答案。智能體群長時復雜的工作中,GPU/NPU負責模型計算,CPU發揮著控制中心、環境執行器和系統調度器的關鍵作用,大量任務如控制流、工具執行、容器沙箱、RPC通信、狀態回滾和內存管理,天然屬于通用計算。
在KADC2026上,華為公司Fellow、ICT操作系統副首席科學家胡欣蔚提出,CPU正在回到舞臺中央,智能體的爆發,正將CPU從過去的“輔助角色”推至“核心調度器”的位置。
鯤鵬超節點的價值,正是把傳統CPU服務器從松散集群升級為低時延、大帶寬、統一內存的邏輯通用計算機。它支持百納秒級低時延、TB級帶寬和內存池化,通過內存語義通信實現跨節點數據以讀寫方式高效傳輸,解決了通用計算場景中高時延、數據搬移開銷大、協同效率低的問題。
例如,鯤鵬超節點依托多級緩存共享、增量快照共享和遠程分叉(remote-fork)能力,可實現十毫秒級回滾,并支撐智能體任務成功率提升10%以上。
鯤鵬之上,構建了三層智能體系:底層是鯤鵬超節點與靈衢互聯,提供24TB統一內存池;中間層是openEuler異構融合操作系統,打通CPU與AI加速器;上層Agent Infra提供輕量沙箱、記憶服務和全鏈路安全能力。
鯤鵬與昇騰之間,形成了一種新的異構融合關系。靈衢互聯協議是超節點的共同底座,它統一了內存語義、IO語義和網絡通信語義,讓CPU、NPU、內存、SSD、DPU、網絡設備不再只是通過傳統以太網松散協作,而是在超節點內部以更接近大型計算機的方式運行。CPU與GPU協同作戰,體現出胡欣蔚所說的追求“智能體擴展”(Agentic Scaling)。
真正讓昇騰從硬件產品變成生態底座的,是CANN軟件。2025年8月以來,CANN加快全面開源開放,兼容主流開源生態,讓開發者盡量保持原有習慣。CANN通過分層解耦,將算子庫、加速庫、圖計算、編程語言等軟件代碼開源,支持PyTorch、vLLM、SGLang、xLLM、VeRL、Triton、TileLang等社區和項目。
在 PyTorch 生態適配方面,昇騰通過 torch_npu 等組件對齊 PyTorch 開源社區的 2300 多個常用 API,降低開發者代碼遷移成本;在分布式訓練方面,已適配 PyTorch FSDP2,即全分片數據并行第二代,使 20 多個主流大模型能夠在昇騰平臺上以較少改動實現開箱即用;同時,昇騰還與多個強化學習開源社區合作,持續合入訓練加速和適配代碼。
這一步非常關鍵。CANN要追趕的是一整套生產體系,模型要快速遷移、算子要快速補齊、推理框架要直接適配、強化學習社區能跑起來。CANN是在開源AI生態的主流工作方式之上,建立起昇騰生態的開發者入口。
openEuler是面向超節點的操作系統。它向下連接CPU、NPU、內存、存儲和網絡資源,向上支撐容器、沙箱、數據庫、推理服務和智能體運行時。在鯤鵬三層智能體系中,openEuler處于中間層,用來打通CPU與AI加速器之間的協同,構筑“通智網存”融合的智能體運行底座。
智能體要規模落地,必須跨過三道坎:token及內存資源消耗高、沙箱環境啟動慢、存在越權與數據泄露風險。 鯤鵬通過軟硬件協同,為這三大挑戰提供了解決方案。基于CCA架構的機密智能體,實現Agent可信授權、安全隔離、記憶加密存儲和秒級恢復;基于鯤鵬超節點打造的AI數據底座極具性價比,實現Agent業務Token開銷降低50%;基于超節點和多級存儲技術,實現了沙箱百毫秒啟動,秒級千并發。
![]()
(來源:胡欣蔚在KADC2026演講PPT)
鯤鵬和昇騰生態所帶來的好用與易用,正體現為推動上下游協同適配,為產業落地提供支撐,并且成為開發者的入口。鯤鵬已發展7000多家合作伙伴、415萬開發者,openEuler系操作系統累計裝機量超過1600萬套;昇騰已發展3000多家合作伙伴、超410萬開發者。
當初中國科技企業不抱任何幻想,堅決開辟系統級創新的戰場。從遭遇的技術斷點出發,華為的鯤鵬超節點和昇騰超節點,共同支撐了這個轉折點:昇騰讓模型算得起來,鯤鵬讓智能體跑得起來,靈衢讓異構資源連成一臺更大的機器,擴展智能的邊界。
自主生態站立起來,在自主的道路上演進。硬件可用性、軟件成熟度、開發者習慣、全球開源影響力、云端運維經驗,都是持續完善的結果。在軟件的層面,也如廖恒所說,在兼容和無所不包的同時,在做厚的同時,也要做薄。
未來半導體競爭的核心,或許不再是制程精度的極限,而是誰能以最低的時間成本,組織最大規模的計算資源。在這一工藝路徑上,華為已經提前起步了。
華為提出“時間(τ)縮微”,替代傳統的“幾何縮微”,作為半導體與電子系統演進的新主線,更是邁向了中國新范式。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.