晶片峰值算力繼續上升,系統吞吐卻越來越取決於資料能否及時到達。HBM、持久記憶體與互聯正在共同定義AI基礎設施的效率邊界。
一、峰值算力上升,不保證系統完成更多工
AI基礎設施正在進入系統效率主導的階段。一顆加速器只有在資料已經進入計算單元時,才能把電晶體轉化為有效吞吐。權重沒有裝入、啟動值沒有就位、梯度仍在同步、KV Cache無法及時讀取,或者Checkpoint尚未寫回時,更多峰值算力只會擴大等待資源的規模。
過去討論AI硬體,常用每秒浮點運算次數衡量代際進步。這個指標仍然重要,但它描述的是晶片能夠完成多少計算,沒有說明資料能否按時到達。真實工作負載需要同時經過四個環節:持久記憶體提供資料集和模型檔案,DDR與CXL承擔較大容量的中間層,HBM向計算核心提供高頻寬資料,網路再完成加速器之間的同步和結果搬運。任何一個環節跟不上,理論算力都無法完全兌現。