AI的下一場記憶體戰爭:不是容量,而是“記憶搬家”

AI速讀
AI推理的性能瓶頸正從算力轉向記憶體管理。由於KV Cache體積隨上下文增加而劇增,單靠高價的HBM或低速的SSD無法兼顧成本與效率。文章研判,未來產業價值將向「控制資料流動」的環節遷移,透過CXL記憶體池與記憶體處理器實現動態分層搬運。最終勝出者將是能讓記憶體在GPU需要前精準送達、並在容量、延遲與成本間取得平衡的技術方案。

HBM裝不下,SSD又太慢。真正決定AI推理成本的,是誰能讓“工作記憶”及時搬家。

導讀|AI智能體工作越久,留下的KV Cache越多。真正決定推理成本的,可能不是能存下多少,而是誰能讓“記憶”在HBM、DRAM、CXL記憶體和SSD之間及時搬家。

假設一個AI智能體正在替你完成複雜任務

它先讀幾十份檔案,再搜尋網頁、呼叫工具、比較方案,最後生成報告。每走一步,它都要保留一部分中間狀態,否則下一步只能從頭重算。

這些狀態中,最典型的就是KV Cache

它不等於人類意義上的記憶,更像AI推理時留下的“計算現場”智能體工作越久、並行使用者越多,這個現場就越大。

於是,一個過去很少被討論的矛盾出現了:

GPU還能算,但旁邊已經沒有足夠便宜、又足夠快的地方,繼續堆放這些“計算現場”。

01. KV Cache不是檔案,而是不能隨便丟的半成品

大模型生成回答時,通常是一個Token接一個Token地產生。

每生成一個新Token,模型都要參考前面的內容。如果每次都把整段對話重新計算一遍,GPU會浪費大量時間

所以,系統會把此前注意力計算得到的Key和Value保存下來,後面直接復用。這就是KV Cache

它像工廠生產線上的半成品:馬上還會用,不能隨便扔;數量不斷增加,又不能全堆在最貴的位置;如果找不到,只能重新生產。

上下文越長,KV Cache越大;同時服務的使用者越多,需要保留的獨立快取也越多。三星半導體指出,在部分大模型推理場景中,KV Cache需求可以達到數百GB,並可能超過GPU視訊記憶體和系統DRAM容量

這說明AI推理的瓶頸,正在從“算得夠不夠快”,擴展到“計算結果放在那裡”。

02. HBM太貴,SSD又太慢

最理想的位置當然是HBM

它離GPU最近,頻寬高、延遲低,資料拿來就能用。但HBM容量有限,而且每一GB都十分寶貴,還要存放模型權重、啟動資料和其他內容。

如果大量長期不用的KV Cache一直佔據HBM,就像把普通紙箱長期堆在機場登機口:位置極貴,卻沒有創造相應價值。

把KV Cache全部放到SSD也不現實

SSD容量大、單位成本低,但距離GPU更遠。如果資料需要時才從SSD讀取,GPU可能停下來等待;如果重新計算,又會浪費算力和電力

所以,這不是一道“HBM還是SSD”的選擇題。

真正需要的是一套分層系統最熱的資料留在HBM;近期可能使用的內容放進DRAM或CXL記憶體池;更大、呼叫頻率更低的上下文進入高速SSD;系統再根據任務變化,持續把資料搬來搬去。

03. 獨到判斷:AI缺的不是更大的倉庫,而是更聰明的搬運系統

傳統記憶體產業最常比較的是容量、頻寬、IOPS和每TB成本。

但在AI上下文時代,僅僅擁有大容量已經不夠

真正困難的是判斷:那段KV Cache下一秒就會被呼叫?那段可以暫時移出HBM?那段值得保留給其他會話復用?那段已經沒有價值,可以直接刪除?什麼時候必須提前搬回,才不會讓GPU停頓

這意味著AI記憶體的核心能力,正在從“保存資料”轉向“安排資料”。

未來更重要的指標,可能不只是存了多少,而是每生成一個Token,需要搬動多少資料、搬了多遠,以及搬回來的速度能否跟上GPU

AI的下一場記憶體戰爭,爭奪的不是最大的倉庫,而是誰能讓“記憶”搬家時幾乎不打斷推理。

04. CXL、DPU和上下文記憶體,正在補上這套系統

CXL的價值,不只是給伺服器增加幾根記憶體條

它可以把多個記憶體裝置組成共享池,讓記憶體不再完全固定屬於某一台伺服器,再按需求動態分配

三星使用1TB CXL記憶體池測試KV Cache解除安裝。在其八GPU、特定軟硬體環境中,最佳化後的方案維持了約92%的本地DRAM性能,同時提供更大容量。這個結果不能代表所有部署,但說明把較冷快取搬出本地記憶體,已經從概念進入系統驗證

2026年3月,Marvell發佈面向機架級記憶體池化的260通道CXL交換晶片。值得關注的不是某一款晶片,而是交換機正在進入記憶體系統:未來伺服器不僅交換網路資料,也可能交換和調度記憶體資源

NVIDIA則進一步把這一問題延伸到快閃記憶體

其BlueField-4 STX和CMX架構,在GPU記憶體與通用共享記憶體之間增加了一層面向KV Cache的上下文記憶體。它不是把SSD簡單變快,而是讓記憶體處理器負責KV資料的讀寫、中繼資料、放置、預取和共享,儘量在GPU真正需要之前把上下文送回來

這些路線共同指向同一件事:記憶體開始主動參與推理,而不再只是站在計算系統旁邊保存檔案。

05. 產業價值可能向“控制資料流動”的環節遷移

如果這個判斷成立,受益的不會只有記憶體顆粒

HBM仍然不可替代,因為最熱的資料必須靠近GPU;DRAM和CXL記憶體承擔更大的中間層企業級SSD則可能從長期保存檔案,擴展到保存可復用、但不必常駐HBM的上下文。

更容易被忽略的,是控制資料流動的環節CXL交換晶片決定記憶體資源如何連接;記憶體擴展控製器負責接入和管理外部DRAM;DPU或記憶體處理器承擔KV搬運、中繼資料和安全;高速網路決定共享快取能否跨伺服器呼叫;調度軟體決定那些資料留下、遷移、預取或刪除。

AI記憶體的價值,不會只流向“存得最多”的企業,也可能流向最懂得何時搬、往那搬、何時搬回的企業。

06. 這條路線仍然存在變數

“記憶搬家”並不意味著所有KV Cache都值得保存

模型可以通過快取壓縮、量化和更高效的推理演算法,減少KV Cache體積。有時重新計算一段快取,可能比從遠端搬回來更划算

CXL記憶體池也仍受制於延遲、軟體成熟度、裝置相容和部署成本。NVIDIA的上下文記憶體屬於新架構,廠商公佈的性能提升還需要更多真實業務驗證

因此,不能簡單得出“AI越發展,所有記憶體和SSD需求都會同比增長”的結論

更準確的判斷是:AI會迫使記憶體系統更加分層,也會讓資料放置和遷移策略變得更重要。最終勝出的路線,取決於誰能在容量、延遲、頻寬、能耗和成本之間取得平衡

寫在最後 AI記憶體真正要解決的,是“記憶住在那裡”

過去,記憶體負責回答一個問題:資料能不能被可靠保存

AI推理時代,它還要回答另一個問題:這段資料此刻應該住在那裡?

當AI從一次問答走向長對話、工具呼叫和連續工作的智能體,KV Cache將不再只是GPU旁邊的一塊臨時快取,而會成為需要在整個資料中心裡持續流動的“計算現場”

所以,AI的下一場記憶體戰爭,可能並不發生在某一塊更大的硬碟上。它發生在HBM、DRAM、CXL記憶體和SSD之間。

誰能讓AI的“記憶”搬得更少、搬得更準,並在GPU開口之前送到,誰才可能真正降低下一代推理的成本。 (焦點矩陣)