公眾號記得加星標??,第一時間看推送不會錯過。
DRAM供貨壓力和合約價格持續上漲,反映出生成式AI對高性能存儲的巨大需求。超大規模數據中心的擴張進一步加劇了這一壓力,目前數據中心已消耗全球DRAM產量的相當大一部分。
在本研究中,我們提出了一種新架構:光纖存儲器(Fiber Memory),它重新構想了光纖在超大規模數據中心中的作用,將其部署為一種主動式、循環延遲線存儲器,用于存儲不可變數據,例如大語言模型(LLM)權重。
我們提出了一種考慮光纖物理現實的數據并行光廣播延遲線存儲架構。通過結合空分復用多芯光纖(MCF:multiplexed multi-core fibers)、無源光分路放大接口、共封裝光學(CPO)和區域全光再生,我們的案例評估表明,與傳統的HBM3e配置相比,光纖存儲器可以消除10,000個AI加速器上的冗余權重存儲,并將權重傳輸能耗降低超過70%。
![]()
引言與研究動機
存儲器是運行大語言模型(LLM)的現代計算集群中的瓶頸。傳統硬件平臺依賴將高帶寬存儲器(HBM)或雙倍數據速率(DDR)DRAM直接堆疊在處理器旁邊,以將數十億模型參數輸入計算流水線。這種范式導致DRAM需求激增,從而造成供應緊張、成本高昂,以及超大規模數據中心內熱管理和功耗的限制。在本研究中,我們提出了一種新范式——將光纖網絡用作存儲器,以避免不必要的數據復制。
見解 1:在數據中心內,DRAM 內存中的數據冗余極其低效;
試想:在一個超大規模數據中心中,服務于同一個LLM的所有節點上都復制著相同的模型參數(例如注意力機制和多層感知機MLP權重)。不僅模型參數被大量復制,更糟糕的是,對這些復制數據的訪問(請求-響應)也由每個服務于同一模型的節點以完全相同的方式執行。復制導致了過度的能量消耗。
見解2:光纖即存儲;
超大規模數據中心中光纖的絕對數量(10,000到100,000公里光纖線路)在任何時刻都承載著海量的比特數據。一個跨越數據中心的簡單光纖環路,其容量可達數TB,數據以光速的2/3(c)在環路中流經每個計算節點。實際上,我們可以將光纖轉變為延遲線存儲器——這是電子計算機最早使用的存儲器類型之一,盡管與20世紀40年代和50年代初的水銀延遲線存儲器相比,它在速度、容量和長度上都有了巨大的提升。與其讓數千個節點消耗本地電能從HBM或DDR中獲取相同的權重,不如由一個集中式光發射器將模型參數一次性注入共享光纖網絡。推理節點被動地"分接"光纖中持續循環的數據,即時提取權重,從而消除整個集群中的冗余權重存儲和獲取能耗。
我們的方案得到了日益普及的共封裝光學(CPO)技術的支持,該技術將硅光引擎直接集成在處理器基板上,從而繞開了高功耗的電收發器。在共封裝光學中,硅開關芯片和光引擎(硅光芯片)被放置在同一個封裝基板上。電信號只需傳輸毫米級距離而非厘米級,從而避免了消耗光-電轉換大部分功耗的數字信號處理單元。這一能力消除了在RAM中緩沖的需求,并實現了將數據直接饋入計算單元的可能性。
現有的最先進數據中心網絡硬件也致力于最小化數據傳輸成本,但仍然基于中間緩沖。例如,NVIDIA的NVNe-tIO SmartNIC接收傳入網絡數據包,并利用GPUDirect RDMA將原始數據直接流式傳輸到GPU的VRAM;一些FPGA SmartNIC講數據短暫緩沖在數據流水線寄存器、小型FIFO或FPGA塊RAM中。然而,在我們的方法中,我們力求不僅消除對不可變數據的存儲需求,還消除數據在到達計算單元途中的任何緩沖需求。
在這項工作中,我們:
(1) 證實了將數據中心光纖用作AI加速器高速延遲線存儲器的可行性。
(2) 勾勒出一種利用多芯光纖、無源分路器和光放大器的光網絡架構,無需電子轉換即可分發權重數據流。
(3) 詳細描述了數據表示、對齊和交織策略,以實現從光纖直接饋入處理脈動陣列。
(4) 提供了與標準HBM系統相比,Fiber Memory在性能、延遲和能耗方面的定量評估。
光纖作為存儲器
光纖"傳輸過程中"存儲數據的能力由帶寬-延遲積(BDP)決定。光在標準二氧化硅光纖中的傳播速度(v)由下式給出:
其中n ≈ 1.5是光纖芯的折射率。長度為L的光纖線路的總傳播延遲(τ)為:
![]()
如果發射器以總數據速率B對光進行調制,則任何單一時刻存儲在光纖線纜內部的數據總量M為:
將超大規模數據中心光纖線纜的路由長度匯總,得到光纖總長度(L)在10,000到100,000公里之間。使用超密集波分復用(WDM),單條商用光纖可以達到約100 Tb/s(12.5 TB/s)的總帶寬(B)。將這些參數代入BDP方程,可以揭示網絡巨大的潛在存儲能力。對于100,000公里的光纖總長度,存儲容量為:
![]()
這個容量足以在飛行狀態中完整存儲多個大規模LLM(例如量化為INT8或FP16的1萬億參數模型)。
![]()
圖1:Ring與Pod架構。權重服務器將模型參數注入波分復用的19芯MCF環。區域分路器將信號廣播到各個獨立的Pod,從而最小化累積損耗和本地收發器開銷。
![]()
圖2:非對稱分路放大接收器示意圖。無源1:99分路器提取1%的信號功率用于本地執行,同時讓99%的信號通過。區域PDFA在Pod級別恢復信號幅度,最小化有源器件數量。
雖然這個例子展示了單條光纖的基本潛力,但我們的完整光纖存儲架構聚合了多束多芯光纜以實現更高的總帶寬和容量。我們利用空分復用的19芯多芯光纖(MCF)。將19個獨立纖芯封裝在單個物理玻璃包層內,共享一個保護套,使我們將延遲線的空間占用壓縮了90%以上,從而使得1000公里環路的物理安裝在標準數據中心線槽內高度可控。
為了利用這種傳輸途中的存儲能力,同時保持物理可實現性,我們將光網絡組織成Ring和Pod架構(圖1)。中央權重服務器將權重存儲在非易失性存儲器中,并在啟動時將權重寫入光纖環。區域無源光分路器隨后將光信號廣播到不同的本地"Pod"(每個Pod包含10個推理機箱)。在每個Pod內部,信號沿著本地化分配總線運行。
傳統網絡收發器采用點對點模式:它們接收光信號,將其轉換到電域(O-E),處理或路由,然后重新調制回光信號(E-O)。這個O-E-O周期非常耗能,并引入數百納秒的數字處理延遲。相反,我們的架構使用無源、高度非對稱的"分路放大"接口。如圖2所示,每個機箱使用1:99無源光分路器對傳入的本地分配總線進行分路。
- 分支A(分路):將極小部分光功率(1%)直接引向本地AI加速器上的共封裝光接收器。由于分路器到硅光電探測器的距離僅為毫米級,這種分路幾乎是瞬時的,且不引入電子緩沖。
- 分支B(環路):將剩余光功率(99%)引導回本地總線,繼續向下游機箱傳播。使用高度非對稱的1:99分路器確保每個機箱的通路插入損耗極小。
為了放大這些O波段(1310 nm)的多波長WDM信號流,我們采用摻鐠的光纖放大器(PDFA)。PDFA利用摻雜Pr3?離子的氟化物玻璃基質,在1280–1330 nm窗口內提供寬頻、穩定的增益。重要的是,PDFA具有較長的上能級壽命(約110 μs),使其不受多波長設置中困擾半導體光放大器(SOA)的通道間交叉增益調制(XGM)和快速增益飽和的影響。
這使我們每個Pod每條線纜只需部署兩個PDFA(一個前置放大PDFA在Pod頭部,一個在線前置放大PDFA)即可補償所有分路、分接和光纖損耗。
PDFA直接在光域中放大光載波,避免了O-E-O轉換。PDFA的延遲僅由通過摻雜氟化物光纖段(通常小于15米)的飛行時間決定,小于75 ns。區域部署的全光2R再生(再放大和再整形)可在沒有電轉換的情況下抑制噪聲累積。
數據并行機箱架構。我們將基礎網絡"節點"定義為一個8加速器組成的底板機箱(類似于NVIDIA HGX等標準密集計算平臺),而不是單個單片芯片。整個機箱接收完整的14線纜MCF束(承載所有256個有源纖芯),使機箱能夠同時攝取整個128 GB模型數據流。這保證了每個機箱100%獨立,可以完成端到端推理,而無需通過后端網絡傳輸激活數據。
然而,將256根物理光纖端接到單個硅芯片上會帶來嚴重的制造和熱挑戰。為了解決這個問題,我們將256個光學纖芯在機箱板上的8個加速器之間進行物理分配。每個單獨的加速器封裝只物理分接一個32芯的子組。在每個加速器的本地PIC內部(圖3),一組硅微環諧振器(MRR)對每個纖芯僅解復用8個波長。這限制了片上接收器接口總共只有256個MRR(32芯×8波長),利用當前的硅光封裝技術,這具有高度可制造性、熱穩定性和商業可行性。
![]()
圖3:共封裝光學(CPO)加速器集成。光子集成電路(PIC)與計算硅位于同一中介層上。無源微環諧振器(MRR)對來自32個MCF纖芯的光波長進行解復用,并將原始權重參數直接饋入脈動陣列寄存器。
大規模LLM推理
LLM的執行在內存訪問模式上具有高度不對稱性。在推理的自回歸解碼階段,加速器一個接一個地順序生成token。對于每個生成的token,處理器必須從內存中讀取完整的模型權重集(W),而激活數據(A)主要由前序token的鍵值(KV)緩存組成。
對于中小批量的任務,權重的體量遠遠超過激活數據的規模。在典型工作負載中,模型權重占用了總內存帶寬消耗的90%到99%。例如,為了在700億參數模型(FP16,140 GB大小)中生成單個token,GPU必須將整個140 GB參數加載到其寄存器中,而激活和KV緩存傳輸總量不到1.4 GB。
![]()
圖4:流式權重數據包的結構。該數據包以鎖定同步前導碼開始,隨后是包含層ID和縮放因子的FEC保護頭,然后是包含原始權重元素的有效載荷(展開以映射到加速器的空間陣列),以及一個循環冗余校驗。
由于LLM推理受內存帶寬限制,性能受限于權重從HBM傳輸的速度。在我們的范式下,我們將激活數據和KV緩存放入加速器上的小型本地DRAM或高密度SRAM,同時從光纖流式傳輸100%的龐大權重數據。
由于權重是從光纖連續接收的,計算單元必須與傳入的光脈沖同步執行矩陣向量乘法。標準處理器使用內存地址請求數據,但光纖存儲運行在基于推送的確定性流模型上:加速器只需等待所需層參數流過光分路器。
為了結構化這個數據流,權重被打包成流式權重數據包(SWP:Streamed Weight Packets ),如圖4所示。每個SWP包含以下部分:前導碼——一種高度獨特的光脈沖模式,允許接收器的時鐘和數據恢復(CDR)電路鎖定到傳入數據相位;幀頭——包含節點從操作抖動和停頓中恢復所需的信息,利用復制機制,并保護量化縮放因子;有效載荷——原始權重矩陣元素(W?),專門格式化為匹配脈動陣列的處理布局;CRC——用于最終數據包邊界驗證的尾部循環冗余校驗字段。
由于權重矩陣直接從分路器讀入執行寄存器而無需本地緩沖,權重服務器預先展開矩陣布局,從而消除了加速器上復雜的地址轉換、行解碼或布局變換的需求。
延遲線系統的一個主要挑戰是協調單個節點的處理速率與恒定速度的光學數據流。如果節點因大批量處理或長時間的KV緩存查找而落后,它可能會錯過下一個權重數據包的開頭,從而被迫等待整個環路周期(τ)以使權重重新出現。為了構建魯棒性和調度靈活性,權重服務器可以實現交錯復制和填充。如圖5所示,我們可以在層數據包之間使用容隙空間(空的光載波窗口或高頻空閑模式),為節點提供安全余量,使其在下一層有效載荷開始之前完成其激活和KV緩存的內存交換。此外,我們可以在物理環內的多個點復制和交錯權重,減少節點開始新推理周期的最壞情況等待時間。然而,容隙空間和交錯都會縮小光纖網絡的有效存儲容量。
![]()
圖5:交錯與填充比較。在情況A中,連續的層參數緊密排列;輕微的計算延遲導致節點錯過第N+1層。在情況B中,包含空或冗余的容隙空間允許具有操作抖動的節點安全地同步和解碼傳入數據流。
Llama-3-70B 定量案例研究
為了在物理一致且實際的設計約束下評估我們的架構,我們分析了一個運行700億參數密集模型(Llama-3-70B)的集群部署,該模型量化為INT8(70 GB占用)。
我們配置系統如下:模型大小(W)——1個模型=70 GB(INT8),光纖總容量擴展到128 GB,以容納時序容隙空間和冗余層副本。該設計中高達45%的容隙空間用于容納與較長上下文長度相關的注意力延遲增加。集群大小——1,250個獨立的8加速器機箱(總計10,000個加速器),組織成125個區域Pod(每個Pod 10個機箱)。
空分復用盤繞(Space-Division Multiplexed Spooling):為了以物理一致的延遲存儲128 GB(1.024 Tb),我們利用14條并行多芯鏈路(19芯MCF),其中每條鏈路由20個級聯的標準商用50公里線盤組成。在14根線纜中,這提供了總共266個光學纖芯,留下10個纖芯未分配用于熱插拔冗余,保持256個有源纖芯。
直接檢測頻譜方案(Direct-Detection Spectral Plan):為了消除對高功耗相干DSP的需求,我們利用O波段(λ?≈1312 nm)中石英光纖的自然零色散窗口。為了防止在1000公里傳輸中的符號間干擾(ISI),我們使用密集波分復用(DWDM)替代寬帶粗波分復用,采用以λ?為中心的緊密100 GHz(約0.6 nm)通道間隔。256個有源纖芯中的每一個承載8個DWDM通道,運行在50 Gbaud PAM4(每波長100 Gb/s),單芯帶寬為800 Gb/s(100 GB/s)。總鏈路帶寬(B)——256個有源纖芯的總帶寬為25.6 TB/s(204.8 Tb/s)。
光在1000公里盤繞光纖環路中傳播的延遲(τ)為:
![]()
在25.6 TB/s的總帶寬下,整個線纜束中飛行中存儲的最大數據量M為:
這足以容納我們的70 GB Llama-3-70B INT8模型,并留下58 GB用于時序容隙和交錯數據包副本。
通過采用純數據并行機箱模型,完整的25.6 TB/s模型帶寬被路由到每個機箱。內部,256個纖芯被劃分到8個本地處理引擎中。因此,每個單個本地加速器芯片處理的權重傳輸帶寬為:
![]()
這與定位高端AI處理引擎的典型內存帶寬相匹配(例如,NVIDIA H100具有3.35 TB/s HBM3),并完全在標準硅光學的能力范圍之內。
我們將直接檢測模型與標準HBM3e基準進行比較。我們每個節點提供25.6 Tb/s的權重吞吐量,與配備兩個1.6 TB/s HBM3e的AI加速器封裝相當。使用4.0 pJ/bit作為HBM3e本地內存讀取的實際能耗指標,10,000個傳統HBM3e集群節點的權重傳輸功率為:
這個1024 kW的計算代表了假設連續峰值帶寬利用率的理論最大值。盡管實際推理工作負載會遇到計算微停頓,略微降低動態讀取速率,但我們有意忽略了大規模HBM3e集群固有的大量靜態泄漏和刷新功率開銷,使基準保持保守平衡。此外,雖然Fiber Memory完全消除了權重傳輸的能耗,但節點仍將消耗一小部分本地能量來訪問片上SRAM或高密度DRAM,以滿足激活數據和KV緩存所需的其余1%到10%的內存帶寬。
中央發射器與激光器:我們調制256個有源纖芯×8個通道=2,048個激光器。在每激光器100 mW光功率和O波段分布反饋(DFB)激光器插頭效率5%的條件下,中央激光源功耗為:
![]()
中央延遲線放大:1000公里環路需要在每個50公里線盤之間進行在線放大,以防止信號完全消失。14根線纜各20級,我們部署280個在線PDFA,每個25 W:
O波段PDFA與全光2R再生器:125個Pod路由完整的14線纜束,我們在每個Pod中為每條線纜部署2個PDFA(一個前置放大和一個在線)和1個區域全光2R再生器。PDFA提供光學再放大(1R),每個放大器需要25 W電功率。我們采用配置為交叉相位調制的非線性半導體光放大器(SOA)進行全光再整形(2R),消耗4 W用于熱偏置:
![]()
本地IM-DD PIC接收器、均衡器與FEC:通過利用直接檢測PAM4而非相干技術,我們繞過了高功耗ADC和大型相干DSP。短距離接收器電子器件以0.7 pJ/bit的聚合能耗運行:
其它開銷:適度的冷卻風扇、監控光電二極管和控制電子器件相對于主要項來說可以忽略不計。我們估計總P_overhead = 5,000 W。
將這些項相加得到光纖存儲器的總功耗:
![]()
比較基準模型和光纖模型,Fiber Memory在整個集群中實現了總權重傳輸功率72.1%的降低(284.8 kW對比1,024 kW),同時完全消除了在本地HBM3e堆棧中存儲700 TB復制靜態模型權重的靜態泄漏功率、冷卻開銷和高昂資本支出。
挑戰與物理約束
部署多公里循環光纖存儲器需要仔細管理光纖的物理限制。
光纖衰減與分路器損耗。在我們的多芯光纖中,工作在O波段(1310 nm)的標準單模纖芯的物理損耗約為0.32 dB/km。如前文所述,1:99本地分路器引入的通路插入損耗僅為0.043 dB。對于Pod中的10個機箱,累積分路損耗僅為約0.43 dB。一個PDFA提供+20 dB到+30 dB的增益。連接連續50公里光纖段的PDFA位于每個Pod的輸入端,補償分布分路和線路損耗;放置在Pod分配總線中間的PDFA抵消分路器和本地傳播損耗。
放大與O波段放大器噪聲累積。光放大器會引入放大自發發射(ASE)噪聲。每個放大步驟都會通過添加隨機相位和幅度波動來降低光信噪比(OSNR)。ASE噪聲的累積限制了信號在變得不可讀之前能夠傳播的距離。N個級聯放大級后的OSNR可以通過標準分析模型近似:
![]()
其中P_in是輸入信號功率,G是放大器增益,n_sp是摻鐠氟化物纖芯的自發發射因子,hν是1310 nm處的光子能量,Δν是光帶寬。為了將OSNR維持在低誤碼率檢測所需的閾值以上——對于50 Gbaud PAM4格式通常需要>15 dB,以使前向糾錯前的BER保持在可接受限值以下——我們必須限制連續的模擬放大步驟。主要的ASE噪聲貢獻者是連接20個50公里干線段的在線PDFA(每個需要放大器增益G≈16 dB以補償0.32 dB/km的O波段衰減)和為10機箱Pod服務的分配放大器。使用這些物理增益參數評估OSNR近似值后發現,信號在通過級聯干線段和本地1:99機箱分路器后接近15 dB閾值。我們在Pod級別將數據流路由通過區域全光2R再生器(再放大和再整形)以防止信號退化。該器件利用非線性SOA或高非線性光纖內部的交叉相位調制,將數據干凈地傳輸到新的光探測光束上,在信號分配給Pod內的100個加速器之前重置OSNR。
色散管理(Chromatic Dispersion Management)。為了消除過度的色散,我們的架構將操作限制在O波段的零色散區域。我們部署了一個具有100 GHz間隔的8通道密集WDM網格,將整個傳輸限制在以λ?=1312 nm為中心的窄700 GHz(約4.2 nm)光譜窗口內。通過限制總光譜覆蓋范圍(Δλ)并將其精確定位在光纖的零色散波長處,我們確保所有有源通道的物理色散系數保持在|D|≤0.1 ps/(nm·km)的范圍內,無需主動色散補償即可最小化脈沖展寬。
前向糾錯與LLM容錯性。為了最大化昂貴光再生器之間的距離,我們利用直接集成在加速器PIC接收器中的高通量前向糾錯(FEC)。低開銷的Reed-Solomon或低密度奇偶校驗(LDPC)碼可以將高達10?3的原始輸入誤碼率糾正到干凈的10?12操作標準,延遲開銷極小(<100 ns)。
此外,LLM還表現出對微小噪聲的魯棒性。量化的神經網絡權重具有高度容錯性:只要縮放因子和層歸一化保持不變,權重矩陣中隨機的單比特翻轉對模型輸出的影響可以忽略不計。通過對SWP頭部和縮放因子特別應用強FEC保護,我們可以容忍原始權重有效載荷中微小、未糾正的比特翻轉,從而放寬網絡的OSNR和物理收發器要求。
熱管理、激光器可靠性與外部光源。硅光芯片對溫度變化高度敏感。微環諧振器(MRR)依賴亞微米尺寸來實現波長共振;微小的溫度偏移會使折射率發生漂移,導致MRR錯過其目標波長通道。此外,激光二極管是任何光學系統中最脆弱的組件。在熱的處理器中介層上工作的高功率激光二極管會迅速退化,構成嚴重的可靠性風險。為了應對這些挑戰,我們采用外部激光源。高功率激光器被安置在服務器機架前面板的獨立、冷卻、熱插拔機箱模塊中,遠離熱的加速器芯片。光通過無源光纖引導進入CPO封裝。主動熱調諧被降級到集成在MRR中的微熱電加熱器,每通道僅消耗微瓦級功率即可穩定光學對準。
結論與未來展望
我們提出了光纖存儲器,這是一種將數據中心光纖網絡重新利用為主動式循環延遲線存儲系統的新架構。通過在并行空分復用多芯光纖上持續流式傳輸靜態、高度復制的LLM權重,我們繞過了在每個計算節點上部署大規模、冗余的本地HBM或DDR存儲塊的需求。
我們的分析表明,我們的設計是開發實驗原型的一個合理起點。通過同時向數千個推理流水線傳送相同的權重參數,光纖存儲器可以將權重傳輸能耗降低超過70%(與HBM3e相比),同時減少數據復制成本。將光纖存儲器擴展到更大的模型只需增加50公里光纖段和PDFA的數量,以增加在環路中循環的數據量。我們的工作應被視為一階架構可行性研究和進一步研究的呼吁,而非最終化的實現藍圖。
未來的工作將研究針對增長上下文的權重插入策略設計、高級同步協議、環形網絡是否可以用于系統管理和處理用戶查詢等標準網絡任務,以及能夠原生調度混合神經架構以與光速數據流交織的自定義編譯器管道。
*免責聲明:本文由作者原創。文章內容系作者個人觀點,半導體行業觀察轉載僅為了傳達一種不同的觀點,不代表半導體行業觀察對該觀點贊同或支持,如果有任何異議,歡迎聯系半導體行業觀察。
今天是《半導體行業觀察》為您分享的第4466內容,歡迎關注。
加星標??第一時間看推送
![]()
![]()
求推薦
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.