一台AI伺服器很可能先用完記憶體,再用完算力。訓練把權重、啟動值和最佳化器同時堆進HBM;推理讓KV快取隨上下文和並行膨脹;Agent又把狀態佔用拉長到幾分鐘甚至更久。
一、昂貴的GPU為什麼還會停下來等資料
一台裝著高端GPU的伺服器開始工作後,資料會沿著一條很清楚的路徑移動。最熱的權重、啟動值和KV快取留在HBM,CPU正在處理的索引和工具狀態放在系統DRAM,更冷的會話與檢查點繼續下沉到CXL記憶體和SSD。任何一層供數太慢,GPU都只能等待。
記憶體需求因此有四本帳。模型帳記錄權重和執行階段緩衝,訓練帳記錄梯度、最佳化器和啟動值,推理帳記錄每條會話的KV快取,系統帳則裝著資料集、索引、檢查點和工具狀態。四本帳會在同一台機器裡重疊,卻由完全不同的變數驅動。