Token經濟時代,衡量AI價值的標準,正從模型能力轉向Token生產效率。AI因此從工具演變為新的關鍵生產要素,而存儲也從單純的資源供給,升級為支撐Token持續、高效生產的系統能力。
過去幾年,AI行業信奉一個樸素的邏輯:算力不夠,就堆更多的GPU、更貴的GPU。但對于中小企業和個人開發者來說,通常只能是望“卡”興嘆。而在算力欠缺的背后,更需要搞明白一個事實,那就是GPU有效算力利用率僅30%-60%。
2026 年 5 月 Dell World 大會上,NVidia CEO 黃仁勛對彭博表態:"當前 AI 產業最大的制約因素根本不是 GPU 算力,而是存儲",并解釋"GPU 大部分時間都在等待數據"。當大模型推理從“以算力為中心”走向“以效能為核心”,數據和存儲才是下一階段AI基礎設施的核心命題。
![]()
"AI的競爭,本質上是算力效率的競爭。"芯展速產品副總裁許瑋表示,推理成本的優化已從單純堆疊算力,轉向數據和存儲“存算協同”的系統級效率提升。要做的是如何在有限的條件下,去盡最大可能挖掘每一塊GPU的利用率,從而去實現算力的平權。
內存墻,AI發展的新瓶頸
算力,是AI時代繞不過去的詞語。
這幾年,AI產業的競爭幾乎圍繞"算力"展開。無論是英偉達GPU持續供不應求,還是云廠商不斷擴建AI數據中心,行業普遍認為,只要擁有更多GPU,就意味著擁有更強的算力能力。然而,隨著大模型推理和AI Agent進入規模化應用,一個越來越明顯的現象開始出現:GPU越來越強,但真正能夠釋放出來的算力卻沒有同步提升。
許瑋透露,即便是英偉達最新一代GPU,在實際推理場景中的有效算力利用率也普遍只有30%至70%,大量昂貴的計算資源并沒有持續處于計算狀態,而是在等待數據。
問題的根源,在于AI計算體系出現了越來越嚴重的"算存失衡"。
AI推理并不是一個單純的計算過程,而是一個完整的數據流動過程。模型參數需要不斷讀取,KV Cache需要持續更新,數據需要在GPU、顯存、CPU以及存儲系統之間頻繁交換。計算、存儲、通信三個環節環環相扣,任何一個環節跟不上,都將拖慢整個系統的效率。
過去二十年間,GPU計算能力實現了跨越式增長,整體算力提升約6萬倍。相比之下,顯存容量卻僅增長幾十倍。計算能力與存儲能力增長速度的巨大落差,使得數據供應速度遠遠趕不上GPU計算速度,一道越來越寬的"內存墻"由此形成。
許瑋指出,“內存墻”讓昂貴的算力芯片普遍處于“吃不飽”的等待狀態,正在成為AI推理性能的核心瓶頸。現在,這一矛盾進一步被放大。算力越堆越多,能用的卻越來越少。
隨著模型參數不斷增加、上下文窗口持續擴展,以及AI Agent需要處理更長、更復雜的任務鏈路,推理過程中KV Cache規模迅速膨脹,占用大量GPU顯存。當顯存資源不足時,系統不得不頻繁在GPU、CPU內存和存儲之間進行數據交換,甚至重復計算歷史Token,不僅增加了推理延遲,也進一步降低了GPU利用率。
從本質上來看,“內存墻”并非單純的存儲容量不足,而是計算能力增長速度遠遠超過數據供給能力所形成的系統性瓶頸。當算力與存儲無法保持同步演進,GPU便難以持續"吃飽",整個AI基礎設施的性能天花板也不再由計算芯片決定,而開始受到存儲架構和數據流動效率的制約。
“因此,對于當前AI產業而言,真正需要解決的問題,已經不是如何繼續堆疊更多算力,而是如何打破‘內存墻’,讓已有算力得到更充分、更高效的釋放。”許瑋說道。
不堆算力,用存儲擴展顯存
事實上,無論是消費級的RTX 5090還是數據中心的B300,都同樣面臨"內存墻"帶來的制約。GPU計算能力不斷提升,但顯存容量和數據供給能力的增長卻相對有限,導致算力增長與系統整體效率并不同步。
當下,大量開發者和企業希望利用消費級GPU進行AI推理與微調,但面臨兩個核心瓶頸:一個是多卡并行效率受限:消費級GPU默認P2P通信被限制,多卡數據需經CPU中轉,延遲高,數據傳輸路徑被迫拉長。資源消耗大,大量的PCIe帶寬被低效的數據搬運所浪費,系統整體性能被卡在“通信”環節。
另一個則是長上下文處理困難:傳統KV Cache顯存利用率通常低于40%,極大地限制了單卡兵法能力。并有嚴重的內存碎片化問題,超長文本(8K+ token)易觸發OOM,長文檔問答幾乎不可用。
面對日益突出的"內存墻",行業并非沒有應對方案。最直接的路徑,依然是繼續提升算力,去堆更貴的芯片。只是,這樣的做法雖然能夠提升性能,但成本卻呈現非線性增長——投入不斷增加,性能收益卻難以保持同樣幅度的提升。
“你可以極端地去堆最貴的GPU卡,也不能說他錯,只不過這種所謂的標準配置是一種商業妥協。”在許瑋看來,用戶不應該只看GPU參數,而要看整個系統的效能。
所謂系統效能,不僅包括GPU自身的計算能力,更包括數據如何流動、顯存如何利用、多卡之間如何通信,以及整個推理過程能否保持高效率。對于企業而言,真正需要關注的不是擁有多少TOPS,而是在訓練和推理過程中,能夠以多高效率完成Token生成。
在這樣的背景下,行業開始出現另一條技術路線——用存儲擴展顯存,不是做更貴的專業卡,而是釋放消費級GPU的潛力。芯展速也是選擇的這一路徑,并在WAIC 2026上展示了AI90解決方案。許瑋稱,“推理成本的優化已從單純堆疊算力,轉向數據和存儲‘存算協同’的系統級效率提升。”
據介紹,針對P2P通信的缺失,AI90通過智能P2P互聯技術解鎖硬件P2P,優化GPU間的數據通路,使消費級GPU在跨卡通信時無需再經過CPU和主機內存中轉,實現GPU直連,實現GPU之間的直連,提升多卡并行效率。
至于KV Cache的不足問題,AI90通過將KV Cache從HBM卸載至高性能SSD,構建"HBM+DRAM+SSD"三級存儲體系,讓原本受限于顯存容量的大模型推理擁有更大的緩存空間,緩解長上下文場景下的顯存壓力。
"AI的競爭,本質上是算力效率的競爭。"許瑋表示,當大家都在堆GPU的時候,我們選擇從存儲側切入,是為了讓每一塊GPU都能真正發揮出全部算力。
算力平權,仍需整個產業鏈作答
不做GPU,但做GPU的“放大器”,AI90更強調的是AI部署成本的下降,中小企業、開發者甚至個人用戶,也能夠基于消費級GPU部署本地AI,而不必完全依賴昂貴的數據中心資源。
![]()
根據芯展速在WAIC展會上公布的數據,在AI90的解決方案下,Llama 3 70B模型推理,4卡5090集群吞吐量從120 tk/s提升至610 tk/s;64K上下文首Token延遲從27.99秒降至0.564秒,顯存利用率從30%-40%提升至85%-95%,支持上下文從約8K擴展至128K+。
不過,現階段仍然有很多工作要做,比如異構GPU架構的適配,以及更多生態伙伴共同支持。
在許瑋看來,“這是一個超千億的市場,用存儲擴展顯存,本質不是為了和誰競爭,更多的是希望讓每一塊錢的算力投資產出更多Token,讓每一家中小企業和開發者都用得起大模型。”
“將存儲變為‘算力的放大器’,這不僅是技術選擇,更是AI基礎設施走向普惠的必然路徑,算力平權的‘iPhone時刻’也終會到來。”(文 | 志讀科技,作者 | 杜志強,編輯 | 楊林)
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.