快科技8月5日消息,英偉達在FMS 2026峰會上宣布,將旗下的GPU存儲加速API cuFile全面開源,同時公布SCADA全新存儲架構,徹底打破傳統CPU主導IO的傳輸瓶頸,實測場景下GPU存儲IOPS最高實現5倍提升。
長期以來,GPU讀取數據必須通過CPU進行調度,這種宿主模式在處理AI推理產生的大量512字節微小請求時,會造成嚴重的微秒級延遲。
雖然之前的GPUDirect Storage(GDS)實現了數據鏈路的CPU繞過,但指令控制仍需CPU參與,使得系統在小粒度讀寫任務中提前觸發性能瓶頸、IO資源率先耗盡。
![]()
此次推出的SCADA技術徹底解決了這一難題,SCADA允許GPU直接發起存儲I/O請求,管理NVMe硬盤的隊列深度,實測數據顯示,在處理數據分析任務時,SCADA的速度是CPU觸發模式的5.3倍,而硬件成本最高可降低21.7倍。
在美光展示的參考設計中,使用3顆H100顯卡成功驅動了44塊PCIe Gen6 SSD,實現了驚人的2.3億次隨機讀IOPS。這意味著單臺服務器的存儲吞吐達到了118GB/s,且負責調度的單顆CPU在整個過程中幾乎處于空閑狀態。
![]()
同時針對AI推理中KV緩存頻繁產生的小數據讀寫,英偉達正式推出Storage-Next產業聯盟計劃,重點優化512字節扇區的讀寫表現,以解決傳統硬盤在4KB扇區下造成的8倍讀取放大問題。
該構想最早在2025年GTC大會提出,目前聯盟成員已超40家閃存與存儲廠商,包含DDN、鎧俠、美光,還有存儲控制器企業、散熱廠商以及標準化組織,各方將共同制定一套新標準:當GPU取代CPU成為存儲訪問主體時,固態硬盤應當如何適配運行。
硬件層面上,為承載cuFile開源生態與SCADA全新存儲架構的落地,英偉達打造了新一代基于Vera BlueField-4存儲處理器的STX架構系統,并計劃在2026年下半年正式推出商用整機。
![]()
雖然目前英特爾也已加入開源組織并參與代碼維護,標志著傳統CPU主導IO調度的格局被顛覆,cuFile與SCADA也從英偉達私有技術,升級為全行業通用開源標準,有效改善了跨平臺兼容性。
但該技術的規模化普及仍受兩大核心條件制約,一是STX+SCADA新架構的跨硬件、跨平臺適配優化進度。二是美光、三星等廠商能否針對512字節小包場景完成主控與固件的底層重寫。
這兩點最終決定了這套新一代AI存儲架構的商用普及節奏。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.