DRAM太貴了,怎麼辦?

DRAM供貨壓力和合約價格持續上漲,反映出生成式AI對高性能儲存的巨大需求。超大規模資料中心的擴張進一步加劇了這一壓力,目前資料中心已消耗全球DRAM產量的相當大一部分。

在本研究中,我們提出了一種新架構:光纖儲存器(Fiber Memory),它重新構想了光纖在超大規模資料中心中的作用,將其部署為一種主動式、循環延遲線儲存器,用於儲存不可變資料,例如大語言模型(LLM)權重。

我們提出了一種考慮光纖物理現實的資料平行光廣播延遲線儲存架構。通過結合空分復用多芯光纖(MCF:multiplexed multi-core fibers)、無源光分路放大介面、共封裝光學(CPO)和區域全光再生,我們的案例評估表明,與傳統的HBM3e配置相比,光纖儲存器可以消除10,000個AI加速器上的冗餘權重儲存,並將權重傳輸能耗降低超過70%。

引言與研究動機

儲存器是運行大語言模型(LLM)的現代計算叢集中的瓶頸。傳統硬體平台依賴將高頻寬儲存器(HBM)或雙倍資料速率(DDR)DRAM直接堆疊在處理器旁邊,以將數十億模型參數輸入計算流水線。這種範式導致DRAM需求激增,從而造成供應緊張、成本高昂,以及超大規模資料中心內熱管理和功耗的限制。在本研究中,我們提出了一種新範式——將光纖網路用作儲存器,以避免不必要的資料複製。

見解 1:在資料中心內,DRAM 記憶體中的資料冗餘極其低效;

試想:在一個超大規模資料中心中,服務於同一個LLM的所有節點上都複製著相同的模型參數(例如注意力機制和多層感知機MLP權重)。不僅模型參數被大量複製,更糟糕的是,對這些複製資料的訪問(請求-響應)也由每個服務於同一模型的節點以完全相同的方式執行。複製導致了過度的能量消耗。

見解2:光纖即儲存;

超大規模資料中心中光纖的絕對數量(10,000到100,000公里光纖線路)在任何時刻都承載著海量的位元資料。一個跨越資料中心的簡單光纖環路,其容量可達數TB,資料以光速的2/3(c)在環路中流經每個計算節點。實際上,我們可以將光纖轉變為延遲線儲存器——這是電子電腦最早使用的儲存器類型之一,儘管與20世紀40年代和50年代初的水銀延遲線儲存器相比,它在速度、容量和長度上都有了巨大的提升。與其讓數千個節點消耗本地電能從HBM或DDR中獲取相同的權重,不如由一個集中式光發射器將模型參數一次性注入共享光纖網路。推理節點被動地"分接"光纖中持續循環的資料,即時提取權重,從而消除整個叢集中的冗餘權重儲存和獲取能耗。

我們的方案得到了日益普及的共封裝光學(CPO)技術的支援,該技術將矽光引擎直接整合在處理器基板上,從而繞開了高功耗的電收發器。在共封裝光學中,矽開關晶片和光引擎(矽光晶片)被放置在同一個封裝基板上。電訊號只需傳輸毫米級距離而非釐米級,從而避免了消耗光-電轉換大部分功耗的數字訊號處理單元。這一能力消除了在RAM中緩衝的需求,並實現了將資料直接饋入計算單元的可能性。

現有的最先進資料中心網路硬體也致力於最小化資料傳輸成本,但仍然基於中間緩衝。例如,NVIDIA的NVNe-tIO SmartNIC接收傳入網路封包,並利用GPUDirect RDMA將原始資料直接流式傳輸到GPU的VRAM;一些FPGA SmartNIC講資料短暫緩衝在資料流水線暫存器、小型FIFO或FPGA塊RAM中。然而,在我們的方法中,我們力求不僅消除對不可變資料的儲存需求,還消除資料在到達計算單元途中的任何緩衝需求。

在這項工作中,我們:

(1) 證實了將資料中心光纖用作AI加速器高速延遲線儲存器的可行性。

(2) 勾勒出一種利用多芯光纖、無源分路器和光放大器的光網路架構,無需電子轉換即可分發權重資料流。

(3) 詳細描述了資料表示、對齊和交織策略,以實現從光纖直接饋入處理脈動陣列。

(4) 提供了與標準HBM系統相比,Fiber Memory在性能、延遲和能耗方面的定量評估。

光纖作為儲存器

光纖"傳輸過程中"儲存資料的能力由頻寬-延遲積(BDP)決定。光在標準二氧化矽光纖中的傳播速度(v)由下式給出:

其中n ≈ 1.5是光纖芯的折射率。長度為L的光纖線路的總傳播延遲(τ)為:

如果發射器以總資料速率B對光進行調製,則任何單一時刻儲存在光纖線纜內部的資料總量M為:

將超大規模資料中心光纖線纜的路由長度彙總,得到光纖總長度(L)在10,000到100,000公里之間。使用超密集波分復用(WDM),單條商用光纖可以達到約100 Tb/s(12.5 TB/s)的總頻寬(B)。將這些參數代入BDP方程,可以揭示網路巨大的潛在儲存能力。對於100,000公里的光纖總長度,儲存容量為:

這個容量足以在飛行狀態中完整儲存多個大規模LLM(例如量化為INT8或FP16的1兆參數模型)。

圖1:Ring與Pod架構。權重伺服器將模型參數注入波分復用的19芯MCF環。區域分路器將訊號廣播到各個獨立的Pod,從而最小化累積損耗和本地收發器開銷。
圖2:非對稱分路放大接收器示意圖。無源1:99分路器提取1%的訊號功率用於本地執行,同時讓99%的訊號通過。區域PDFA在Pod等級恢復訊號幅度,最小化有源器件數量。

雖然這個例子展示了單條光纖的基本潛力,但我們的完整光纖儲存架構聚合了多束多芯光纜以實現更高的總頻寬和容量。我們利用空分復用的19芯多芯光纖(MCF)。將19個獨立纖芯封裝在單個物理玻璃包層內,共享一個保護套,使我們將延遲線的空間佔用壓縮了90%以上,從而使得1000公里環路的物理安裝在標準資料中心線槽內高度可控。

為了利用這種傳輸途中的儲存能力,同時保持物理可實現性,我們將光網路組織成Ring和Pod架構(圖1)。中央權重伺服器將權重儲存在非易失性儲存器中,並在啟動時將權重寫入光纖環。區域無源光分路器隨後將光訊號廣播到不同的本地"Pod"(每個Pod包含10個推理機箱)。在每個Pod內部,訊號沿著本地化分配匯流排運行。

傳統網路收發器採用點對點模式:它們接收光訊號,將其轉換到電域(O-E),處理或路由,然後重新調製回光訊號(E-O)。這個O-E-O周期非常耗能,並引入數百納秒的數字處理延遲。相反,我們的架構使用無源、高度非對稱的"分路放大"介面。如圖2所示,每個機箱使用1:99無源光分路器對傳入的本地分配匯流排進行分路。

- 分支A(分路):將極小部分光功率(1%)直接引向本地AI加速器上的共封裝光接收器。由於分路器到矽光電探測器的距離僅為毫米級,這種分路幾乎是瞬時的,且不引入電子緩衝。

- 分支B(環路):將剩餘光功率(99%)引導回本地匯流排,繼續向下游機箱傳播。使用高度非對稱的1:99分路器確保每個機箱的通路插入損耗極小。

為了放大這些O波段(1310 nm)的多波長WDM訊號流,我們採用摻鐠的光纖放大器(PDFA)。PDFA利用摻雜Pr³⁺離子的氟化物玻璃基質,在1280–1330 nm窗口內提供寬頻、穩定的增益。重要的是,PDFA具有較長的上能級壽命(約110 μs),使其不受多波長設定中困擾半導體光放大器(SOA)的通道間交叉增益調製(XGM)和快速增益飽和的影響。

這使我們每個Pod每條線纜只需部署兩個PDFA(一個前置放大PDFA在Pod頭部,一個線上前置放大PDFA)即可補償所有分路、分接和光纖損耗。

PDFA直接在光域中放大光載波,避免了O-E-O轉換。PDFA的延遲僅由通過摻雜氟化物光纖段(通常小於15米)的飛行時間決定,小於75 ns。區域部署的全光2R再生(再放大和再整形)可在沒有電轉換的情況下抑制噪聲累積。

資料平行機箱架構。我們將基礎網路"節點"定義為一個8加速器組成的底板機箱(類似於NVIDIA HGX等標準密集計算平台),而不是單個單片晶片。整個機箱接收完整的14線纜MCF束(承載所有256個有源纖芯),使機箱能夠同時攝取整個128 GB模型資料流。這保證了每個機箱100%獨立,可以完成端到端推理,而無需通過後端網路傳輸啟動資料。

然而,將256根物理光纖端接到單個矽晶片上會帶來嚴重的製造和熱挑戰。為瞭解決這個問題,我們將256個光學纖芯在機箱板上的8個加速器之間進行物理分配。每個單獨的加速器封裝只物理分接一個32芯的子組。在每個加速器的本地PIC內部(圖3),一組矽微環諧振器(MRR)對每個纖芯僅解復用8個波長。這限制了片上接收器介面總共只有256個MRR(32芯×8波長),利用當前的矽光封裝技術,這具有高度可製造性、熱穩定性和商業可行性。

圖3:共封裝光學(CPO)加速器整合。光子積體電路(PIC)與計算矽位於同一中介層上。無源微環諧振器(MRR)對來自32個MCF纖芯的光波長進行解復用,並將原始權重參數直接饋入脈動陣列暫存器。

大規模LLM推理

LLM的執行在記憶體訪問模式上具有高度不對稱性。在推理的自回歸解碼階段,加速器一個接一個地順序生成token。對於每個生成的token,處理器必須從記憶體中讀取完整的模型權重集(W),而啟動資料(A)主要由前序token的鍵值(KV)快取組成。

對於中小批次的任務,權重的體量遠遠超過啟動資料的規模。在典型工作負載中,模型權重佔用了總記憶體頻寬消耗的90%到99%。例如,為了在700億參數模型(FP16,140 GB大小)中生成單個token,GPU必須將整個140 GB參數載入到其暫存器中,而啟動和KV快取傳輸總量不到1.4 GB。

圖4:流式權重封包的結構。該封包以鎖定同步前導碼開始,隨後是包含層ID和縮放因子的FEC保護頭,然後是包含原始權重元素的有效載荷(展開以對應到加速器的空間陣列),以及一個循環冗餘校驗。

由於LLM推理受記憶體頻寬限制,性能受限於權重從HBM傳輸的速度。在我們的範式下,我們將啟動資料和KV快取放入加速器上的小型本地DRAM或高密度SRAM,同時從光纖流式傳輸100%的龐大權重資料。

由於權重是從光纖連續接收的,計算單元必須與傳入的光脈衝同步執行矩陣向量乘法。標準處理器使用記憶體地址請求資料,但光纖儲存運行在基於推送的確定性流模型上:加速器只需等待所需層參數流過光分路器。

為了結構化這個資料流,權重被打包成流式權重封包(SWP:Streamed Weight Packets ),如圖4所示。每個SWP包含以下部分:前導碼——一種高度獨特的光脈衝模式,允許接收器的時鐘和資料恢復(CDR)電路鎖定到傳入資料相位;幀頭——包含節點從操作抖動和停頓中恢復所需的資訊,利用複製機制,並保護量化縮放因子;有效載荷——原始權重矩陣元素(Wᵢ),專門格式化為匹配脈動陣列的處理佈局;CRC——用於最終封包邊界驗證的尾部循環冗餘校驗欄位。

由於權重矩陣直接從分路器讀入執行暫存器而無需本地緩衝,權重伺服器預先展開矩陣佈局,從而消除了加速器上複雜的地址轉換、行解碼或佈局變換的需求。

延遲線系統的一個主要挑戰是協調單個節點的處理速率與恆定速度的光學資料流。如果節點因大批次處理或長時間的KV快取尋找而落後,它可能會錯過下一個權重封包的開頭,從而被迫等待整個環路周期(τ)以使權重重新出現。為了建構魯棒性和調度靈活性,權重伺服器可以實現交錯複製和填充。如圖5所示,我們可以在層封包之間使用容隙空間(空的光載波窗口或高頻空閒模式),為節點提供安全余量,使其在下一層有效載荷開始之前完成其啟動和KV快取的記憶體交換。此外,我們可以在物理環內的多個點複製和交錯權重,減少節點開始新推理周期的最壞情況等待時間。然而,容隙空間和交錯都會縮小光纖網路的有效儲存容量。

圖5:交錯與填充比較。在情況A中,連續的層參數緊密排列;輕微的計算延遲導致節點錯過第N+1層。在情況B中,包含空或冗餘的容隙空間允許具有操作抖動的節點安全地同步和解碼傳入資料流。

Llama-3-70B 定量案例研究

為了在物理一致且實際的設計約束下評估我們的架構,我們分析了一個運行700億參數密集模型(Llama-3-70B)的叢集部署,該模型量化為INT8(70 GB佔用)。

我們配置系統如下:模型大小(W)——1個模型=70 GB(INT8),光纖總容量擴展到128 GB,以容納時序容隙空間和冗餘層副本。該設計中高達45%的容隙空間用於容納與較長上下文長度相關的注意力延遲增加。叢集大小——1,250個獨立的8加速器機箱(總計10,000個加速器),組織成125個區域Pod(每個Pod 10個機箱)。

空分復用盤繞(Space-Division Multiplexed Spooling):為了以物理一致的延遲儲存128 GB(1.024 Tb),我們利用14條平行多芯鏈路(19芯MCF),其中每條鏈路由20個級聯的標準商用50公里線盤組成。在14根線纜中,這提供了總共266個光學纖芯,留下10個纖芯未分配用於熱插拔冗餘,保持256個有源纖芯。

直接檢測頻譜方案(Direct-Detection Spectral Plan):為了消除對高功耗相干DSP的需求,我們利用O波段(λ₀≈1312 nm)中石英光纖的自然零色散窗口。為了防止在1000公里傳輸中的符號間干擾(ISI),我們使用密集波分復用(DWDM)替代寬頻粗波分復用,採用以λ₀為中心的緊密100 GHz(約0.6 nm)通道間隔。256個有源纖芯中的每一個承載8個DWDM通道,運行在50 Gbaud PAM4(每波長100 Gb/s),單芯頻寬為800 Gb/s(100 GB/s)。總鏈路頻寬(B)——256個有源纖芯的總頻寬為25.6 TB/s(204.8 Tb/s)。

光在1000公里盤繞光纖環路中傳播的延遲(τ)為:

在25.6 TB/s的總頻寬下,整個線纜束中飛行中儲存的最巨量資料量M為:

這足以容納我們的70 GB Llama-3-70B INT8模型,並留下58 GB用於時序容隙和交錯封包副本。

通過採用純資料平行機箱模型,完整的25.6 TB/s模型頻寬被路由到每個機箱。內部,256個纖芯被劃分到8個本地處理引擎中。因此,每個單個本地加速器晶片處理的權重傳輸頻寬為:

這與定位高端AI處理引擎的典型記憶體頻寬相匹配(例如,NVIDIA H100具有3.35 TB/s HBM3),並完全在標準矽光學的能力範圍之內。

我們將直接檢測模型與標準HBM3e基準進行比較。我們每個節點提供25.6 Tb/s的權重吞吐量,與配備兩個1.6 TB/s HBM3e的AI加速器封裝相當。使用4.0 pJ/bit作為HBM3e本地記憶體讀取的實際能耗指標,10,000個傳統HBM3e叢集節點的權重傳輸功率為:

這個1024 kW的計算代表了假設連續峰值頻寬利用率的理論最大值。儘管實際推理工作負載會遇到計算微停頓,略微降低動態讀取速率,但我們有意忽略了大規模HBM3e叢集固有的大量靜態洩漏和刷新功率開銷,使基準保持保守平衡。此外,雖然Fiber Memory完全消除了權重傳輸的能耗,但節點仍將消耗一小部分本地能量來訪問片上SRAM或高密度DRAM,以滿足啟動資料和KV快取所需的其餘1%到10%的記憶體頻寬。

中央發射器與雷射器:我們調製256個有源纖芯×8個通道=2,048個雷射器。在每雷射器100 mW光功率和O波段分佈反饋(DFB)雷射器插頭效率5%的條件下,中央雷射源功耗為:

中央延遲線放大:1000公里環路需要在每個50公里線盤之間進行線上放大,以防止訊號完全消失。14根線纜各20級,我們部署280個線上PDFA,每個25 W:

O波段PDFA與全光2R再生器:125個Pod路由完整的14線纜束,我們在每個Pod中為每條線纜部署2個PDFA(一個前置放大和一個線上)和1個區域全光2R再生器。PDFA提供光學再放大(1R),每個放大器需要25 W電功率。我們採用配置為交叉相位調製的非線性半導體光放大器(SOA)進行全光再整形(2R),消耗4 W用於熱偏置:

本地IM-DD PIC接收器、均衡器與FEC:通過利用直接檢測PAM4而非相干技術,我們繞過了高功耗ADC和大型相干DSP。短距離接收器電子器件以0.7 pJ/bit的聚合能耗運行:

其它開銷:適度的冷卻風扇、監控光電二極體和控制電子器件相對於主要項來說可以忽略不計。我們估計總P_overhead = 5,000 W。

將這些項相加得到光纖儲存器的總功耗:

比較基準模型和光纖模型,Fiber Memory在整個叢集中實現了總權重傳輸功率72.1%的降低(284.8 kW對比1,024 kW),同時完全消除了在本地HBM3e堆疊中儲存700 TB複製靜態模型權重的靜態洩漏功率、冷卻開銷和高昂資本支出。

挑戰與物理約束

部署多公里循環光纖儲存器需要仔細管理光纖的物理限制。

光纖衰減與分路器損耗。在我們的多芯光纖中,工作在O波段(1310 nm)的標準單模纖芯的物理損耗約為0.32 dB/km。如前文所述,1:99本地分路器引入的通路插入損耗僅為0.043 dB。對於Pod中的10個機箱,累積分路損耗僅為約0.43 dB。一個PDFA提供+20 dB到+30 dB的增益。連接連續50公里光纖段的PDFA位於每個Pod的輸入端,補償分佈分路和線路損耗;放置在Pod分配匯流排中間的PDFA抵消分路器和本地傳播損耗。

放大與O波段放大器噪聲累積。光放大器會引入放大自發發射(ASE)噪聲。每個放大步驟都會通過加入隨機相位和幅度波動來降低光訊號雜訊比(OSNR)。ASE噪聲的累積限制了訊號在變得不可讀之前能夠傳播的距離。N個級聯放大級後的OSNR可以通過標準分析模型近似:

其中P_in是輸入訊號功率,G是放大器增益,n_sp是摻鐠氟化物纖芯的自發發射因子,hν是1310 nm處的光子能量,Δν是光頻寬。為了將OSNR維持在低誤位元率檢測所需的閾值以上——對於50 Gbaud PAM4格式通常需要>15 dB,以使前向糾錯前的BER保持在可接受限值以下——我們必須限制連續的模擬放大步驟。主要的ASE噪聲貢獻者是連接20個50公里幹線段的線上PDFA(每個需要放大器增益G≈16 dB以補償0.32 dB/km的O波段衰減)和為10機箱Pod服務的分配放大器。使用這些物理增益參數評估OSNR近似值後發現,訊號在通過級聯幹線段和本地1:99機箱分路器後接近15 dB閾值。我們在Pod等級將資料流路由通過區域全光2R再生器(再放大和再整形)以防止訊號退化。該器件利用非線性SOA或高非線性光纖內部的交叉相位調製,將資料乾淨地傳輸到新的光探測光束上,在訊號分配給Pod內的100個加速器之前重設OSNR。

色散管理(Chromatic Dispersion Management)。為了消除過度的色散,我們的架構將操作限制在O波段的零色散區域。我們部署了一個具有100 GHz間隔的8通道密集WDM網格,將整個傳輸限制在以λ₀=1312 nm為中心的窄700 GHz(約4.2 nm)光譜窗口內。通過限制總光譜覆蓋範圍(Δλ)並將其精確定位在光纖的零色散波長處,我們確保所有有源通道的物理色散係數保持在|D|≤0.1 ps/(nm·km)的範圍內,無需主動色散補償即可最小化脈衝展寬。

前向糾錯與LLM容錯性。為了最大化昂貴光再生器之間的距離,我們利用直接整合在加速器PIC接收器中的高通量前向糾錯(FEC)。低開銷的Reed-Solomon或低密度奇偶校驗(LDPC)碼可以將高達10⁻³的原始輸入誤位元率糾正到乾淨的10⁻¹²操作標準,延遲開銷極小(<100 ns)。

此外,LLM還表現出對微小噪聲的魯棒性。量化的神經網路權重具有高度容錯性:只要縮放因子和層歸一化保持不變,權重矩陣中隨機的單位元翻轉對模型輸出的影響可以忽略不計。通過對SWP頭部和縮放因子特別應用強FEC保護,我們可以容忍原始權重有效載荷中微小、未糾正的位元翻轉,從而放寬網路的OSNR和物理收發器要求。

熱管理、雷射器可靠性與外部光源。矽光晶片對溫度變化高度敏感。微環諧振器(MRR)依賴亞微米尺寸來實現波長共振;微小的溫度偏移會使折射率發生漂移,導致MRR錯過其目標波長通道。此外,雷射二極體是任何光學系統中最脆弱的元件。在熱的處理器中介層上工作的高功率雷射二極體會迅速退化,構成嚴重的可靠性風險。為了應對這些挑戰,我們採用外部雷射源。高功率雷射器被安置在伺服器機架前面板的獨立、冷卻、熱插拔機箱模組中,遠離熱的加速器晶片。光通過無源光纖引導進入CPO封裝。主動熱調諧被降級到整合在MRR中的微熱電加熱器,每通道僅消耗微瓦級功率即可穩定光學對準。

結論與未來展望

我們提出了光纖儲存器,這是一種將資料中心光纖網路重新利用為主動式循環延遲線儲存系統的新架構。通過在平行空分復用多芯光纖上持續流式傳輸靜態、高度複製的LLM權重,我們繞過了在每個計算節點上部署大規模、冗餘的本地HBM或DDR儲存塊的需求。

我們的分析表明,我們的設計是開發實驗原型的一個合理起點。通過同時向數千個推理流水線傳送相同的權重參數,光纖儲存器可以將權重傳輸能耗降低超過70%(與HBM3e相比),同時減少資料複製成本。將光纖儲存器擴展到更大的模型只需增加50公里光纖段和PDFA的數量,以增加在環路中循環的資料量。我們的工作應被視為一階架構可行性研究和進一步研究的呼籲,而非最終化的實現藍圖。

未來的工作將研究針對增長上下文的權重插入策略設計、高級同步協議、環形網路是否可以用於系統管理和處理使用者查詢等標準網路任務,以及能夠原生調度混合神經架構以與光速資料流交織的自訂編譯器管道。 (半導體行業觀察)