今年WAIC最擁擠的地方,依然集中在機器人、大模型和智能體展臺。
這些展品足夠直觀:機器人可以走路、握手,模型可以對話,智能體可以現場完成任務。相比之下,一套由大量機柜組成的AI基礎設施,并不天然具備吸引觀眾的能力。
但在中科曙光展臺,情況有些不同。
首次公開亮相的曙光8000(登峰)被評為大會“鎮館之寶”,展臺前持續聚集著觀眾。這套中國首個全國產十萬卡AI超集群受到關注,不只是因為“十萬卡”這個數字足夠大,更因為它開始回答一個比規模更現實的問題:這么多算力,究竟準備拿來做什么?
![]()
7月18日,曙光8000公布最新運行數據。自7月9日上線以來,系統首周即進入滿載狀態,日均處理作業超過15萬個,單日峰值超過50萬個。
目前,曙光8000已完成近千項超智融合應用適配,其中包括大模型訓練、高通量推理、科學計算等不同類型的任務。
對一套十萬卡系統來說,建成只是一個工程節點。能不能迅速裝入真實任務,才決定它是基礎設施,還是一座昂貴的技術展品。
十萬卡開始尋找具體用途
過去幾年,AI基礎設施最容易傳播的指標是規模。
多少張卡、多少算力、多少參數,構成了行業最直觀的競賽方式。規模擴張有其合理性:沒有足夠大的算力集群,就無法支撐大模型訓練和復雜科學計算。
但當集群進入十萬卡階段,規模本身已經不能完整解釋價值。
一個更現實的問題是,是否存在足夠多的任務,持續消耗如此龐大的計算資源。
從曙光8000目前承接的應用來看,十萬卡的需求來源正在變得更加分散。
其中既有大模型訓練和推理,也有機器人、創新藥、新材料、汽車研發、氣象流體、能源勘探等產業任務;既有大量中小規模作業,也有需要數萬張卡協同運行的科學計算任務。
目前,曙光8000已完成300余項重點應用深度優化,覆蓋20余個科研和產業領域,超過70項應用實現萬卡規模擴展。
這些應用中,有蛋白質折疊模擬、萬億原子級水分子動力學模擬,也有超大規模湍流模擬和科學智能體。
這些名字距離普通消費者很遠,卻可能是十萬卡算力真正能夠長期獲得需求的地方。
大模型訓練具有明顯的階段性。一個模型完成訓練后,算力需求會進入推理和迭代周期。而科學研究、工業仿真和行業智能化,則會持續產生大量計算任務。
藥物研發需要反復篩選分子結構,汽車研發需要持續進行仿真,氣象預測需要不斷更新模型,材料研究則要計算不同微觀結構的變化。
十萬卡不再只服務于某一次超大模型訓練,而是開始承載一批不斷發生、不斷更新的計算任務。
這可能也是曙光8000上線后迅速滿載的重要原因:算力需求并沒有集中在單一行業,而是從多個領域同時涌入。
應用越復雜,越考驗算力是否“好用”
應用數量增加之后,十萬卡面對的另一個問題是,任務并不整齊。
大模型訓練追求大規模并行,模型推理強調吞吐效率,科學計算看重精度和穩定性,工業用戶則更加關心成本、周期和部署門檻。
這些任務很難用一套單一標準調度。
因此,十萬卡是否好用,不只是看峰值性能,而是看系統能不能處理混合負載:既要承接一次占用數萬張卡的大任務,也要同時處理大量中小規模作業。
曙光8000首周日均處理超過15萬個作業,單日峰值超過50萬個。這組數據的意義,不在于數字本身有多大,而在于它說明這套系統承接的并不是少數幾個超大任務,而是大量并發、規模不同的真實需求。
為了讓這些任務同時運行,曙光8000采用智能調度引擎、數據親和性算法和多元融合調度策略,根據任務類型、數據位置和資源狀態進行分配。
這套機制解決的,不只是“有沒有空閑卡”,而是如何減少數據搬運和等待時間,把合適的資源交給合適的任務。
底層的網絡、存儲和散熱,也都服務于同一件事:讓任務持續跑下去。
曙光8000通過scaleFabric類IB原生RDMA高速互連,解決大規模節點之間的數據交換;ParaStor分布式存儲負責持續供給數據;浸沒式相變液冷則支撐高密度系統在高負載狀態下運行。
這些技術單獨拿出來,都不是一個容易進入公眾討論的話題。但對于使用者而言,它們最終會轉化成更直接的體驗:任務是否需要長時間排隊,擴展到數千卡后效率是否明顯下降,運行過程中是否頻繁中斷。
從這個角度看,十萬卡真正的門檻,不在于能否把足夠多的卡裝進機房,而在于能否把它們組織成一種穩定、可調用的生產工具。
比造出十萬卡更難的是讓更多人用上
曙光8000此次釋放出的另一個信號,是超大規模算力正在從封閉集群轉向公共服務。
過去,萬卡級算力通常屬于少數大型科技公司或科研機構。要使用這類資源,往往需要自建數據中心、采購設備、部署軟件,并承擔長期運維成本。
這種模式決定了,大規模算力很難被更廣泛的企業和開發者使用。
曙光8000接入國家超算互聯網后,試圖把十萬卡能力轉化為可按需調用的服務。企業、科研團隊和開發者無需自行建設超大集群,也可以在已有環境中獲得相應算力。
圍繞十萬卡共創者、智能體生態和核心生態伙伴等計劃,曙光8000也在吸引更多應用進入平臺。
這件事的重要性在于,十萬卡能否持續滿載,最終取決于它能否形成一個循環:更多用戶帶來更多任務,更多任務推動軟件和系統優化,更成熟的系統又進一步降低使用門檻。
相比建成一套十萬卡系統,建立這樣的應用循環更難,也更需要時間。
目前,曙光8000首周滿載、近千項應用適配,只能說明它完成了早期驗證。后續還要面對成本、商業模式、開發環境和生態遷移等問題。
但至少從WAIC現場可以看到,十萬卡競爭的敘事正在變化。
過去行業更關心,誰能建出更大的集群;現在開始關心,這些集群是否有足夠多的任務,是否能被不同用戶使用,以及最終能產生多少科研成果和產業價值。
機器人和智能體展示的是AI如何進入現實世界,而曙光8000所代表的,是支撐這些應用持續運行的另一面。
十萬卡不是答案。
讓十萬卡持續裝入真實任務,才是下一階段真正需要回答的問題。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.