HBM裝不下,SSD又太慢。真正決定AI推理成本的,是誰能讓“工作記憶”及時搬家。
導讀|AI智能體工作越久,留下的KV Cache越多。真正決定推理成本的,可能不是能存下多少,而是誰能讓“記憶”在HBM、DRAM、CXL記憶體和SSD之間及時搬家。 |
假設一個AI智能體正在替你完成複雜任務。
它先讀幾十份檔案,再搜尋網頁、呼叫工具、比較方案,最後生成報告。每走一步,它都要保留一部分中間狀態,否則下一步只能從頭重算。
這些狀態中,最典型的就是KV Cache。
它不等於人類意義上的記憶,更像AI推理時留下的“計算現場”。智能體工作越久、並行使用者越多,這個現場就越大。
於是,一個過去很少被討論的矛盾出現了:
GPU還能算,但旁邊已經沒有足夠便宜、又足夠快的地方,繼續堆放這些“計算現場”。
01. KV Cache不是檔案,而是不能隨便丟的半成品
大模型生成回答時,通常是一個Token接一個Token地產生。
每生成一個新Token,模型都要參考前面的內容。如果每次都把整段對話重新計算一遍,GPU會浪費大量時間。
所以,系統會把此前注意力計算得到的Key和Value保存下來,後面直接復用。這就是KV Cache。
它像工廠生產線上的半成品:馬上還會用,不能隨便扔;數量不斷增加,又不能全堆在最貴的位置;如果找不到,只能重新生產。
上下文越長,KV Cache越大;同時服務的使用者越多,需要保留的獨立快取也越多。三星半導體指出,在部分大模型推理場景中,KV Cache需求可以達到數百GB,並可能超過GPU視訊記憶體和系統DRAM容量。
這說明AI推理的瓶頸,正在從“算得夠不夠快”,擴展到“計算結果放在那裡”。
02. HBM太貴,SSD又太慢
最理想的位置當然是HBM。
它離GPU最近,頻寬高、延遲低,資料拿來就能用。但HBM容量有限,而且每一GB都十分寶貴,還要存放模型權重、啟動資料和其他內容。
如果大量長期不用的KV Cache一直佔據HBM,就像把普通紙箱長期堆在機場登機口:位置極貴,卻沒有創造相應價值。
把KV Cache全部放到SSD也不現實。
SSD容量大、單位成本低,但距離GPU更遠。如果資料需要時才從SSD讀取,GPU可能停下來等待;如果重新計算,又會浪費算力和電力。
所以,這不是一道“HBM還是SSD”的選擇題。
真正需要的是一套分層系統:最熱的資料留在HBM;近期可能使用的內容放進DRAM或CXL記憶體池;更大、呼叫頻率更低的上下文進入高速SSD;系統再根據任務變化,持續把資料搬來搬去。
03. 獨到判斷:AI缺的不是更大的倉庫,而是更聰明的搬運系統
傳統記憶體產業最常比較的是容量、頻寬、IOPS和每TB成本。
但在AI上下文時代,僅僅擁有大容量已經不夠。
真正困難的是判斷:那段KV Cache下一秒就會被呼叫?那段可以暫時移出HBM?那段值得保留給其他會話復用?那段已經沒有價值,可以直接刪除?什麼時候必須提前搬回,才不會讓GPU停頓?
這意味著AI記憶體的核心能力,正在從“保存資料”轉向“安排資料”。
未來更重要的指標,可能不只是存了多少,而是每生成一個Token,需要搬動多少資料、搬了多遠,以及搬回來的速度能否跟上GPU。
AI的下一場記憶體戰爭,爭奪的不是最大的倉庫,而是誰能讓“記憶”搬家時幾乎不打斷推理。
04. CXL、DPU和上下文記憶體,正在補上這套系統
CXL的價值,不只是給伺服器增加幾根記憶體條。
它可以把多個記憶體裝置組成共享池,讓記憶體不再完全固定屬於某一台伺服器,再按需求動態分配。
三星使用1TB CXL記憶體池測試KV Cache解除安裝。在其八GPU、特定軟硬體環境中,最佳化後的方案維持了約92%的本地DRAM性能,同時提供更大容量。這個結果不能代表所有部署,但說明把較冷快取搬出本地記憶體,已經從概念進入系統驗證。
2026年3月,Marvell發佈面向機架級記憶體池化的260通道CXL交換晶片。值得關注的不是某一款晶片,而是交換機正在進入記憶體系統:未來伺服器不僅交換網路資料,也可能交換和調度記憶體資源。
NVIDIA則進一步把這一問題延伸到快閃記憶體。
其BlueField-4 STX和CMX架構,在GPU記憶體與通用共享記憶體之間增加了一層面向KV Cache的上下文記憶體。它不是把SSD簡單變快,而是讓記憶體處理器負責KV資料的讀寫、中繼資料、放置、預取和共享,儘量在GPU真正需要之前把上下文送回來。
這些路線共同指向同一件事:記憶體開始主動參與推理,而不再只是站在計算系統旁邊保存檔案。
05. 產業價值可能向“控制資料流動”的環節遷移
如果這個判斷成立,受益的不會只有記憶體顆粒。
HBM仍然不可替代,因為最熱的資料必須靠近GPU;DRAM和CXL記憶體承擔更大的中間層;企業級SSD則可能從長期保存檔案,擴展到保存可復用、但不必常駐HBM的上下文。
更容易被忽略的,是控制資料流動的環節:CXL交換晶片決定記憶體資源如何連接;記憶體擴展控製器負責接入和管理外部DRAM;DPU或記憶體處理器承擔KV搬運、中繼資料和安全;高速網路決定共享快取能否跨伺服器呼叫;調度軟體決定那些資料留下、遷移、預取或刪除。
AI記憶體的價值,不會只流向“存得最多”的企業,也可能流向最懂得何時搬、往那搬、何時搬回的企業。
06. 這條路線仍然存在變數
“記憶搬家”並不意味著所有KV Cache都值得保存。
模型可以通過快取壓縮、量化和更高效的推理演算法,減少KV Cache體積。有時重新計算一段快取,可能比從遠端搬回來更划算。
CXL記憶體池也仍受制於延遲、軟體成熟度、裝置相容和部署成本。NVIDIA的上下文記憶體屬於新架構,廠商公佈的性能提升還需要更多真實業務驗證。
因此,不能簡單得出“AI越發展,所有記憶體和SSD需求都會同比增長”的結論。
更準確的判斷是:AI會迫使記憶體系統更加分層,也會讓資料放置和遷移策略變得更重要。最終勝出的路線,取決於誰能在容量、延遲、頻寬、能耗和成本之間取得平衡。
寫在最後 AI記憶體真正要解決的,是“記憶住在那裡”
過去,記憶體負責回答一個問題:資料能不能被可靠保存?
AI推理時代,它還要回答另一個問題:這段資料此刻應該住在那裡?
當AI從一次問答走向長對話、工具呼叫和連續工作的智能體,KV Cache將不再只是GPU旁邊的一塊臨時快取,而會成為需要在整個資料中心裡持續流動的“計算現場”。
所以,AI的下一場記憶體戰爭,可能並不發生在某一塊更大的硬碟上。它發生在HBM、DRAM、CXL記憶體和SSD之間。
誰能讓AI的“記憶”搬得更少、搬得更準,並在GPU開口之前送到,誰才可能真正降低下一代推理的成本。 (焦點矩陣)
