4月24日,DeepSeek正式發(fā)布并開源DeepSeek V4-Pro與DeepSeek V4-Flash兩款模型,將上下文處理長度從128K一舉擴展至1M,實現(xiàn)近10倍容量躍升。
華為隨即第一時間宣布昇騰超節(jié)點全系列產(chǎn)品全面支持該系列模型,通過芯模技術(shù)緊密協(xié)同,實現(xiàn)模型發(fā)布與算力適配的同步推進,為長上下文大模型的工程化落地注入強勁動力。
![]()
1、DeepSeek V4系列此次升級有多顛覆性?
DeepSeek首次引入KV Cache滑窗與壓縮算法,結(jié)合獨創(chuàng)混合注意力架構(gòu),使V4-Pro在1M上下文場景下單token推理FLOPs僅為V3.2的27%,KV Cache占用降至10%,大幅降低注意計算與訪存開銷。
同時通過架構(gòu)創(chuàng)新強化Agent與Coding場景支持,V4-Pro在Agentic Coding評測中已達(dá)到開源模型最佳水平,交付質(zhì)量甚至優(yōu)于部分閉源競品。
2、在推理性能層面
昇騰950超節(jié)點能實現(xiàn)在8K輸入場景下,DeepSeek V4-Pro實現(xiàn)TPOT約20ms、單卡Decode吞吐4700TPS;V4-Flash更勝一籌,TPOT約10ms、單卡Decode吞吐1600TPS。
這些成績源于三大架構(gòu)升級:
①原生精度加速支持FP8、MXFP8等格式,內(nèi)存占用降低50%+;
②稀疏訪存優(yōu)化強化硬件級帶寬能力;
③Vector與Cube共享Memory設(shè)計減少片上數(shù)據(jù)搬運,有效降低端到端時延。
![]()
昇騰A3超節(jié)點系列進一步夯實規(guī)模化部署能力,Atlas 900 A3液冷及Atlas 800 A3風(fēng)冷超節(jié)點采用平等架構(gòu)與全局內(nèi)存統(tǒng)一編址,點對點互聯(lián)帶寬達(dá)784GB/s,支持32至384卡多規(guī)格配置。
在實際部署中,基于昇騰A3 64卡超節(jié)點結(jié)合大EP模式,V4-Flash在8K/1K輸入輸出場景下通過vLLM引擎可實現(xiàn)單卡Decode吞吐2000+TPS,充分滿足互聯(lián)網(wǎng)、運營商、金融等行業(yè)高并發(fā)需求。
華為云同步發(fā)力,宣布首發(fā)適配DeepSeek V4,其MaaS平臺已為開發(fā)者提供免部署、一鍵調(diào)用V4-Flash API的Tokens服務(wù)。
通過系統(tǒng)層、算子層和集群層的協(xié)同優(yōu)化,從調(diào)度效率、計算效率和數(shù)據(jù)流轉(zhuǎn)效率三個維度保障新模型快速適配與高性能落地,金山辦公、360等企業(yè)已率先通過華為云接入新模型。
![]()
3、開發(fā)生態(tài)方面
昇騰CANN推出PyPTO編程范式,使相關(guān)算子開發(fā)周期縮短至天級,配套TileLang-Ascend在TileAI社區(qū)開源實現(xiàn),加速性能優(yōu)化與功能迭代。
整體來看,DeepSeek V4在模型側(cè)通過1M上下文、結(jié)構(gòu)壓縮與Agent能力提升,顯著擴展應(yīng)用邊界;
華為昇騰則在算力側(cè)以950與A3超節(jié)點為核心,通過10ms/20ms低時延、1600TPS/4700TPS及2000+TPS高吞吐、784GB/s大規(guī)模互聯(lián)等指標(biāo)實現(xiàn)工程化承接。
二者同步推進,不僅讓長上下文、高性能推理、規(guī)模化部署的組合路徑更加清晰,更反映出開源模型與國產(chǎn)算力體系在協(xié)同演進中的加速態(tài)勢,為AI產(chǎn)業(yè)“去英偉達(dá)化”提供堅實技術(shù)支撐。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.