![]()
出品 | 虎嗅科技組
作者 | 梁卡爾
編輯 | 苗正卿
頭圖 | 虎嗅拍攝
這是虎嗅WAIC“追蹤Token商業(yè)新范式”系列文章第【20】期。
聚光燈下,國產(chǎn)AI芯片的競爭正在變“重”。
漫步在今年世界人工智能大會(以下簡稱“WAIC”)的芯片算力展區(qū),會發(fā)現(xiàn)往年廠商們引以為傲、精心陳列在櫥窗里的單片硅晶圓變少了,取而代之的是看上去“重達數(shù)百公斤、塞滿核心器件的巨型算力柜”。其中拿出硬核實力的是華為,這家公司首次在線下展出的昇騰Atlas 950超節(jié)點真機,一個旨在將1024張芯片死死綁定在一起的系統(tǒng)級龐然大物。
按華為的官方資料,該產(chǎn)品基于靈衢互聯(lián)協(xié)議和超節(jié)點架構(gòu),支持1024卡規(guī)模,擁有256TB全局統(tǒng)一內(nèi)存編址空間,并提供1 EFLOPS FP8、2 EFLOPS FP4算力。如果記不住這些參數(shù),那么只需要記住一個變化,也就是國產(chǎn)AI算力競爭重心正在發(fā)生變化。
從拼單卡參數(shù)走向拼系統(tǒng)交付。面對先進制程受限、高端HBM斷供以及CUDA生態(tài)壁壘等一連串硬件短板,中國AI芯片廠商正試圖通過超大帶寬、低時延互連以及全域調(diào)度,將無數(shù)個“不完美”的單卡,拼湊成一個“相對完美”的“巨型計算機”。越來越多廠商開始強調(diào)這種新趨勢。
系統(tǒng)級突圍不是抹平單卡差距,是一種向現(xiàn)實妥協(xié)的突圍,但它絕不是一條捷徑。當競爭從微觀的芯片設(shè)計蔓延至宏觀的系統(tǒng)工程,面對復雜的網(wǎng)絡(luò)互連、艱難的模型遷移,以及數(shù)據(jù)中心那不堪重負的散熱與功耗,廠商們眼前的是一筆更難算清的賬目。
為什么今年大家都在講“超節(jié)點”?
虎嗅和行業(yè)上下游十多位從業(yè)者交流發(fā)現(xiàn),超節(jié)點熱的直接原因,是模型和推理需求都變大了。
從需求端來看,模型變大的速度快過了單卡能力提升的速度。隨著模型參數(shù)向萬億級邁進,以及上下文窗口拉長至1兆以上,單個芯片的性能早已不堪重負。摩爾線程高級副總裁董龍飛將這種“超節(jié)點”技術(shù)生動地形容為“讓256張GPU像一張卡一樣工作”,實現(xiàn)跨卡顯存的直接訪問。
![]()
圖片來源:摩爾線程
華為昇騰950所強調(diào)的統(tǒng)一內(nèi)存編址與全域調(diào)度,本質(zhì)上也是在解決同一個痛點,就是在單卡能力觸及天花板時,必須靠“人多力量大”來拼湊出更大的算力空間。
更具戲劇性的是,智能體讓推理算力的消耗方式變了。摩爾線程創(chuàng)始人、董事長兼CEO張建中指出,算力消耗的主體正在從人類轉(zhuǎn)向AI自身,“已經(jīng)不是我們在用AI,是我們的Agent在用AI”。當Agent開始替人調(diào)用模型,Token消耗量呈指數(shù)級增長。
一位百度云的工作人員在現(xiàn)場向虎嗅印證了這一趨勢。相比訓練,目前國產(chǎn)算力在應用端的推理需求正占據(jù)絕對主導。這也解釋了為什么萬卡集群會和Agent推理放在同一套故事里,因為它們都指向算力需求從單次請求轉(zhuǎn)向高并發(fā)、長上下文和多模型協(xié)同。
然而,在這場由萬卡和超節(jié)點堆砌的“繁榮”背后,有多少是真實的市場需求,有多少是展會上的“軍備競賽”?
在業(yè)內(nèi)人士眼中,萬卡集群不僅是一個技術(shù)指標,更是一張證明自身出貨與交付能力的“商業(yè)名片”。一位昆侖芯展臺的工作人員告訴虎嗅,服務頭部客戶必須具備萬卡級集群能力。
但這種狂熱下也有人在理性反思,海光信息的工作人員表示,萬卡絕不是百卡系統(tǒng)的簡單放大,當規(guī)模跨過臨界點,系統(tǒng)的穩(wěn)定性、網(wǎng)絡(luò)拓撲、功耗和散熱挑戰(zhàn)將面臨指數(shù)級飆升。一位芯片架構(gòu)師告訴虎嗅,公司目前支持的是千卡級擴展,但大部分實際商用場景在8卡或16卡規(guī)模下已綽綽有余。
所以,能拿出萬卡方案的廠商很多,但真正能落地的有待檢驗。一位芯片公司參展商工作人員對虎嗅說,“你要問問看這些卡是不是真的被用起來了”。
系統(tǒng)級突圍的第一道墻
然而,要將成百上千張芯片綁成一個“超節(jié)點”,廠商們撞上的第一道墻,是嚴苛的物理學定律。
超節(jié)點的前提是通信速度。為了讓數(shù)百張GPU像“交響樂隊一樣協(xié)同”,摩爾線程和華為等中國廠商不得不各自開發(fā)了MTLink和靈衢等互連協(xié)議。
華為工作人員告訴虎嗅,靈衢本質(zhì)上是試圖在服務器內(nèi)部和服務器之間建立更可控的數(shù)據(jù)通路,并推動CPU、網(wǎng)卡和存儲等部件都接入同一生態(tài)。
但無論是互連協(xié)議,還是更高層的調(diào)度架構(gòu),都無法繞開底層傳輸介質(zhì)的物理邊界。銅互連的物理邊界很具體,當銅纜距離超過約三米后,信號衰減會明顯加劇,所以為了保證信號完整性,線纜需要做得更粗,這又帶來了發(fā)熱、散熱、布線和重量的問題。
這種物理極限,正在催生一場“光進銅退”的底層革命。光電芯片廠商曦智科技展示的“光互連”方案,試圖用光纖打破“三米魔咒”,將穩(wěn)定連接距離擴展至數(shù)十米,從而讓超節(jié)點不再被嚴格限制在單個機柜內(nèi),進而有機會向多機柜形態(tài)擴展。
![]()
圖片來源:虎嗅拍攝
不過,光互連不是對銅互連的一次性替代,隨著互連速率從過去的10G級別提升到100G、200G,銅纜能夠穩(wěn)定互聯(lián)的距離越來越短,光互連因此從柜間繼續(xù)向柜內(nèi)甚至機內(nèi)推進。展臺上一位曦智科技產(chǎn)品經(jīng)理告訴虎嗅,電纜仍會長期存在,不同技術(shù)仍會在各自適合的場景中長期共存。
不僅如此,光互連方案還必須面對商業(yè)化是否可行的拷問。一位行業(yè)專家坦言,相比于技術(shù)尚不成熟、成本高企的光互連,傳統(tǒng)的銅互連依然憑借極其低廉的價格和成熟的產(chǎn)業(yè)鏈占據(jù)主導地位。對于客戶而言,業(yè)務真的需要如此大規(guī)模的超節(jié)點,答案或許是“不一定每個人都需要”。
這個答案直指要害,系統(tǒng)級路線在技術(shù)上能連起來只是第一步,商業(yè)技術(shù)落地才是關(guān)鍵。
超節(jié)點不是擺進機房就能跑
互連之外,系統(tǒng)級算力的另一道硬約束在機房。
一個完整的超節(jié)點設(shè)備造價可能高達數(shù)億元,其功耗也往往會飆升至驚人的400千瓦。這種龐然大物看似是一臺性能怪獸,但也是一個極其脆弱的系統(tǒng)。董龍飛表示,一旦某張卡、某個模組或交換節(jié)點故障,就會影響整套系統(tǒng)利用率。這意味著,超節(jié)點必須同時解決卡間互連、鏈路可靠性、模組解耦、散熱和軟件協(xié)同等問題。
一位芯寒智能的工作人員從液冷角度給出了解讀,過去業(yè)內(nèi)常以單柜功率10至15千瓦作為是否考慮液冷的參考門檻。但如今,隨著高性能AI服務器紛紛上柜,單柜功率輕而易舉地突破了這一門檻。在高功率、高熱流密度AI算力柜場景下,液冷正在從可選項變成越來越難繞開的工程選項。芯寒智能是一家專注于智算中心相變液冷技術(shù)的創(chuàng)新企業(yè)。
但這并不意味著所有機房都會立刻轉(zhuǎn)向液冷。上述技術(shù)人員表示,對于大量傳統(tǒng)的中小型數(shù)據(jù)中心而言,轉(zhuǎn)向液冷意味著一場傷筋動骨的重構(gòu)。它們不僅缺乏液冷所需的一次側(cè)水機等基礎(chǔ)設(shè)施,更面臨一個致命的商業(yè)代價,就是改造機房往往意味著必須中斷現(xiàn)有的服務器負載。對于絕大多數(shù)承擔著核心業(yè)務的單位機房來說,拉閘停機是不可承受之重。
華為這次展示的Atlas 850E風冷超節(jié)點,正是試圖降低傳統(tǒng)機房改造門檻。華為方面稱,該產(chǎn)品無需對現(xiàn)有風冷IDC機房做液冷基建改造,標準機柜可直接上架部署,并支持單個風冷超節(jié)點擴展至96卡商用部署。試圖在物理約束和改造成本之間搭建一條折中的道路。
這筆賬最后會落到機房改造和運維上。AI芯片的競爭早已不再局限于硅片本身。它是一場包含電力供應、散熱物理、機柜結(jié)構(gòu)乃至舊基建運維在內(nèi)的系統(tǒng)級重資產(chǎn)升級。
芯片路線分化,買方只看算力賬本
虎嗅在WAIC現(xiàn)場觀察發(fā)現(xiàn),國產(chǎn)AI芯片并不是一條路線。
摩爾線程強調(diào)兼顧渲染與仿真的全功能GPU;昆侖芯則認為GPU與AI專用芯片的傳統(tǒng)邊界正在變得模糊;創(chuàng)始人有著谷歌背景的中昊芯英押注在TPU架構(gòu)芯片上,奕行智能則展示了RISC-V架構(gòu)路線,這兩家都在試圖通過更低的功耗或定制化的架構(gòu)打開市場缺口。
然而,在挑剔的買方市場面前,技術(shù)路線標簽并不是最終語言。正如一位公有云服務商(百度云)一線人員所講,客戶在實際采購中根本不關(guān)心是什么架構(gòu),關(guān)心的指標只有具體卡型、價格、軟件平臺適配度,以及進入國產(chǎn)合規(guī)體系所需的工作量。
也就是說,軟件生態(tài)仍是國產(chǎn)算力最難的一關(guān)。
更換底層硬件的“遷移”背后往往是一筆財務支出。但對有些芯片廠商來說,路線決定了其具備一定的競爭優(yōu)勢。上述昆侖芯工作人員表示,其從一開始就走兼容主流生態(tài)的路線,包括CUDA和PyTorch。原因并不復雜,就是客戶原來大量模型和底層代碼都跑在CUDA體系上。
但對于大多數(shù)不得不更換國產(chǎn)芯片的客戶來說,遷移是一項繁重的“苦力活”。正如奕行智能技術(shù)與解決方案總監(jiān)廖顯所形容,從CUDA生態(tài)遷出,本質(zhì)上是企業(yè)要扮演“搬運工”的角色,把模型和算子重新寫到新平臺上。中昊芯英解決方案架構(gòu)師劉輝也提到,開源模型遷移相對容易,但閉源模型仍可能需要額外開發(fā)算子。
![]()
圖片來源:虎嗅拍攝
百度云等頭部云廠商正試圖通過全棧自研體系,向市場兜售低代碼改造成本的樂觀愿景,但國產(chǎn)算力遷移不是一個統(tǒng)一答案,而是需要耗費巨大人力、時間和不確定性風險的定制化工程項目。如果客戶對算力性價比進行考量,軟件生態(tài)仍是最關(guān)鍵的判斷依據(jù)。
國產(chǎn)卡最重要的是可用
WAIC展臺上,一些產(chǎn)業(yè)熱詞很容易制造一種全面追趕的氣氛。但廖顯給出的判斷頗為冷靜:國產(chǎn)AI芯片當前第一關(guān)是“可用”,“你不可用,其他都吹牛”。在他看來,市面上仍有不少芯片停留在Demo階段,一旦真正扔進客戶的真實機房,就會暴露出無數(shù)的工程漏洞。
當被問及客戶是否關(guān)注單Token成本時,廖顯回答,不能僅著眼于單卡吞吐量的提升,更應綜合評估集群部署后的整體TCO(總擁有成本),其中芯片的供應穩(wěn)定性與稀缺性導致的采購成本同樣是不可忽視的變量。
不過,也有芯片行業(yè)人士的回答更直接,可用性尚未夯實的階段,盲目在Token成本上與英偉達貼身肉搏,并不現(xiàn)實,因為“基本上沒有辦法跟它比”。
這并不是唱衰國產(chǎn)算力,而是說明國產(chǎn)算力目前更現(xiàn)實的任務,不用立刻以絕對成本優(yōu)勢擊敗英偉達,要先在供應鏈安全、本地部署、生態(tài)適配和特定場景中,建立“不被卡脖子”的防御性替代能力。
在這個過程中,客戶更注重眼下的采購經(jīng)濟賬,并不為“峰值性能”這樣的期貨概念買單。
昆侖芯工作人員告訴虎嗅,客戶通常先明確自己要跑哪些模型,再拿這些模型到芯片平臺上測試性能。只有性能過關(guān)后,才會進入價格和性價比討論。對于大客戶而言,還要繼續(xù)考察持續(xù)穩(wěn)定供貨能力,“幾萬張卡、幾千張卡,簽完合同供不上貨也不行”。
![]()
圖片來源:虎嗅拍攝
這種務實導致了國產(chǎn)算力應用場景分化。董龍飛把訓練和推理的商業(yè)賬拆得很清楚。也就是,訓練對性價比容忍度相對更高,如果產(chǎn)品性能低10%,原本訓練30天的任務多跑3天仍可接受;但推理不同,如果成本比別人高10%,商業(yè)上就很難競爭。
因此,對成本和并發(fā)更敏感的“推理場景”,正成為國產(chǎn)算力最關(guān)鍵的突破口,也是最殘酷的考場。它不是讓國產(chǎn)卡立刻在公共云低價Token服務里正面擊敗英偉達,而是先在場景中建立可用性。上述公有云工作人員也表示,目前市場對國產(chǎn)算力的最大需求,正來自模型部署后的推理服務。
這也最終決定了國產(chǎn)算力的核心客戶畫像。他們并不是那些資金緊繃、追求極致性能的大模型創(chuàng)業(yè)公司,而是合規(guī)、安全、本地部署和流程改造需求更剛性的國家隊、運營商、金融巨頭與交通電力系統(tǒng)。
華為昇騰在WAIC展示的行業(yè)案例,也說明行業(yè)客戶衡量國產(chǎn)算力的方式并不是單卡峰值,而是業(yè)務指標。無論是在運營商基層流程中縮短的30秒,還是在證券行業(yè)客戶服務或投資服務場景中降低80%的首次Token響應時延。這些行業(yè)客戶衡量國產(chǎn)算力的標尺,從來不是被用來市場營銷的單卡跑分,而是業(yè)務流程能否閉環(huán)、系統(tǒng)是否足夠穩(wěn)定,以及在關(guān)鍵時刻有沒有人出來為故障兜底。
不是所有推理都要進云端
WAIC現(xiàn)場一個容易被亮點遮住的變化是,端側(cè)算力也在形成自己的系統(tǒng)級路線。端側(cè)是云側(cè)的另一面,有芯片廠商工作人員跟虎嗅感嘆,今年WAIC展會現(xiàn)場已經(jīng)三七開,三成是端,七成在云。
“未來AI的發(fā)展一定是端云協(xié)同的”,后摩智能聯(lián)合創(chuàng)始人、產(chǎn)品副總裁信曉旭對虎嗅表示,以情感陪伴機器人等新興硬件為例,用戶與AI的私密對話天然排斥將數(shù)據(jù)上傳至中心化的云端,而低延遲的交互與24小時不間斷的在線需求,更適合在本地完成推理。
安謀科技NPU產(chǎn)品線負責人舒浩表示,端側(cè)AI不是云端AI的縮小版,而是由功耗、實時性、軟件、數(shù)據(jù)和可靠性共同定義的新計算市場。他的同事、CPU產(chǎn)品總監(jiān)朱曉鳴指出,端側(cè)設(shè)備無法像數(shù)據(jù)中心一樣用高功耗和大規(guī)模散熱換性能。
為了突圍,安謀科技正在其CPU、NPU以及存內(nèi)計算之間進行精密的物理空間調(diào)度,試圖在有限的功耗和面積下,死磕AI推理的效率極限。
更有野心的是,端側(cè)正在復制云端的“系統(tǒng)集成”策略,有的廠商試圖將智能體直接封裝進桌面設(shè)備中。此芯科技在其最新發(fā)布的AGX智能體計算平臺上,就展現(xiàn)出了明顯的“軟硬一體化”企圖,向下連接CPU、GPU、NPU和擴展AI卡,向上提供Agent OS、模型接入和行業(yè)應用。
摩爾線程也在把算力向端側(cè)延伸。WAIC上,這家展品顯示,AIBOOK定位為面向開發(fā)者的個人智算平臺,預裝OpenClaw智能體,AICUBE則定位為家庭AI中樞,整合AI PC、AI NAS和智能體能力。
這說明,推理時代的算力不會只往云端集中,也會向端側(cè)重新分配。云端負責大模型訓練、高并發(fā)服務和復雜任務;端側(cè)負責隱私、低延時、本地數(shù)據(jù)和持續(xù)在線。兩條路線不是替代關(guān)系,而是分工關(guān)系。
突圍,還是繞遠?
![]()
圖片來源:太初元碁
回到最初的問題,國產(chǎn)算力的“超節(jié)點”熱的根源。
答案可能并不是二選一。它當然是一種突圍。先進制程和高端GPU供應受限后,國產(chǎn)AI芯片不能只等單卡性能追平。通過互聯(lián)、統(tǒng)一內(nèi)存、超節(jié)點、軟件棧和系統(tǒng)集成,把更多“不完美”的芯片組織成可用算力,是中國AI算力產(chǎn)業(yè)必須走的一步。
然而,它也確實是更重的一條路。因為系統(tǒng)級的路線從來沒有消除問題,它只是將原本屬于微觀層面的半導體瓶頸,重新分配到了更宏觀、也更復雜的商業(yè)世界中。
在這種路線下,單卡性能的不足必須依賴成百上千張卡的協(xié)同來彌補,但這隨即把網(wǎng)絡(luò)拓撲、信號時延與整套系統(tǒng)的可靠性推向了新的物理極限。當龐大的卡群終于被塞進算力柜時,高密度的算力又立刻轉(zhuǎn)化為功耗與散熱壓力,將電力擴容、液冷改造的代價,變成了必需的成本。
硬件的整柜交付也遠非終點,隱藏在冰山下方的CUDA軟件遷移、算子重寫以及框架適配,緊接著變成了一筆企業(yè)無法賴掉的工程支出。即使這些障礙被逐一掃除,廠商們最終仍要向客戶回答一個本質(zhì)的問題,這套系統(tǒng)是不是比原先方案更好。
這就是系統(tǒng)級突圍的現(xiàn)實,它解決了一部分問題,也制造了新的復雜性。WAIC展臺上的參數(shù)再驚艷,也要看下一場發(fā)生在客戶機房里的硬仗國產(chǎn)AI算力誰能突圍。
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4876918.html?f=wyxwapp
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.