視訊記憶體不夠用?NVIDIA可能在下一盤更大的棋

AI速讀
NVIDIA 據傳正探索將 NVMe SSD 作為 GPU 記憶體的溢出層,旨在解決 AI 模型對 VRAM 容量需求暴增的痛點。透過減少資料在 CPU 與系統記憶體間的跳轉,實現 SSD 與 GPU 的直連,能顯著提升大數據集的處理效率。儘管 SSD 頻寬遠低於 GDDR6X/HBM,但此「記憶體分層管理」策略將使 AI 系統的評價標準從單純的容量轉向「調度智慧」。此趨勢若落地,將提升企業級 SSD 控制器廠商的戰略價值,使儲存設備從配件轉變為計算核心鏈路的一部分。

2026年8月,一則關於NVIDIA正在探索用高速NVMe SSD擴展GPU視訊記憶體的消息,在硬體圈引發了不小的討論。表面看,這只是又一個"堆料"傳聞。但如果仔細拆解背後的技術路徑,會發現這可能觸及了一個被所有人忽略的問題:視訊記憶體容量的增長速度,正在被AI模型和遊戲資產的膨脹速度反超

聚焦

這次的重點不是讓NAND快閃記憶體假裝成HBM或者GDDR,那是不可能的事情。真正的野心是重構GPU的資料流動路徑,讓原本躺在硬碟裡"睡大覺"的資料,能用更短的路徑直達GPU計算單元。

一條被詬病已久的老路

傳統架構裡,資料從SSD到GPU要經歷一條相當曲折的旅程

SSD → CPU → 系統記憶體DRAM → 視訊記憶體VRAM → GPU

這條路徑至少經過5次跳轉,每一次跳轉都意味著延遲、CPU佔用和資料複製開銷。這不是危言聳聽,而是過去二十年PC架構的基本設定,CPU始終是資料流動的"看門人"。

而NVIDIA正在推動的方向,是把這條路徑壓縮成

NVMe SSD → GPU直連資料通道 → GPU端解壓縮 → 視訊記憶體/計算單元

跳數從5降到3,中間複製次數大幅減少,CPU負載也隨之下降。這背後依託的不是空想,而是已經存在多年的三項底層技術

  • RTX IO
    NVIDIA在2020年就已公佈的GPU直連記憶體技術
  • Microsoft DirectStorage
    微軟2022年正式落地的遊戲記憶體API,DirectStorage 1.1版本已支援GPU端解壓縮
  • GPUDirect Storage / cuFile
    NVIDIA面向資料中心和AI場景的記憶體直連方案,早已在CUDA生態裡投入實用

洞察一:這不是新故事,是老故事的新篇章

索尼在PS5上早就驗證過這套邏輯。定製SSD配合專用解壓縮晶片Kraken,讓《瑞奇與叮噹:時空跳轉》實現了幾乎無載入時間的場景切換。NVIDIA現在做的,某種程度上是把主機上驗證過的思路,搬到PC和資料中心的GPU架構裡。

資料不會說謊:跳數少了,代價小了

結合行業公開測試資料和架構邏輯,可以整理出一份對比

對比維度
傳統路徑
GPU直連路徑
資料跳轉次數
5次
3次
CPU負載指數
100
約35
資料複製次數指數
100
約40
有效可用容量指數(相對VRAM基準)
100
可達220以上
適用場景
常規遊戲負載
大紋理、開放世界、AI推理、巨量資料集
核心瓶頸
視訊記憶體容量硬限制
SSD頻寬和延遲仍落後於原生視訊記憶體

這份對比裡最值得玩味的是最後一行的"有效容量"數字。它不是說SSD真的變成了視訊記憶體,而是說當SSD作為溢出層和流式載入層參與工作時,GPU能夠處理的有效資料集規模被顯著放大了

警示:頻寬差距依然是硬傷 必須潑一盆冷水。

目前主流PCIe 5.0 SSD的理論頻寬峰值在14GB/s左右,而GDDR6X視訊記憶體頻寬普遍在800GB/s到1TB/s量級,HBM3更是達到3TB/s以上等級。這中間隔著接近百倍的量級差距。所以這套架構本質上是"記憶體分層管理",不是"視訊記憶體替代方案",誰要是把它理解成SSD能當視訊記憶體用,那就是徹底會錯意了。

AI推理才是真正的戰場

遊戲場景固然重要,但真正讓這個技術路徑變得迫切的,其實是AI推理端的現實壓力。

大語言模型的參數規模增長速度,早已超過了視訊記憶體容量的迭代速度。史丹佛團隊在2023年提出的FlexGen方案,微軟DeepSpeed團隊的ZeRO-Infinity技術,核心思路都是把暫時用不上的模型參數"解除安裝"到NVMe SSD,需要時再快速調回視訊記憶體。這些學術和工程實踐早就證明了一件事:當視訊記憶體不夠用的時候,聰明的資料調度比單純堆視訊記憶體更划算

洞察二:這可能重新定義"視訊記憶體不足"這件事

過去我們判斷一張顯示卡夠不夠用,只看視訊記憶體容量數字。但如果GPU直連記憶體這條路真的跑通,未來評價一套AI推理系統的標準,可能會從"視訊記憶體有多大"變成"資料調度架構有多聰明"。這是一個認知層面的轉變,很多人可能還沒意識到。

跳出框架的一個猜想

以下是一個大多數討論都沒有觸及的角度。

如果GPU直連記憶體真的成為標配架構,受益最大的可能不是顯示卡廠商,而是企業級SSD控製器廠商。目前市場上主導PCIe 5.0企業級SSD控製器的玩家,包括慧榮科技(Silicon Motion)、群聯電子(Phison)等控製器方案商,它們的議價能力可能會被重新評估。因為在這套新架構裡,SSD不再只是"記憶體配件",而是直接參與到GPU計算資料流的核心鏈路里,控製器的解壓縮能力、佇列深度調度能力,會變成和視訊記憶體頻寬同等重要的架構指標。

換句話說,這場架構變革如果落地,記憶體行業可能會迎來一次話語權的重新分配,這是一個值得資本市場提前關注的訊號,而不只是一個技術八卦。

深度提醒

也要警惕過度炒作的可能性。目前這仍然是行業探索方向,不是量產落地的產品路線圖。歷史上英特爾的Optane傲騰記憶體,也曾經承諾過類似的"記憶體即記憶體"願景,最終因為成本和生態問題黯然退場。

技術路徑正確,不代表商業落地一定順利,這中間還隔著成本、生態適配、軟體最佳化等一系列現實門檻。

寫在最後

這場變革如果真正推進,它傳遞的核心訊號其實很清晰

未來GPU性能的天花板,將越來越依賴於整個資料鏈路的協同效率——計算、視訊記憶體、記憶體、解壓縮引擎、軟體調度,缺一不可,而不再只是GPU晶片本身的算力堆疊。

這意味著PCIe匯流排頻寬、SSD延遲表現、控製器架構設計、壓縮引擎效率、軟體層的記憶體調度策略,這些原本被視為"配角"的技術環節,未來在遊戲和AI兩大領域的戰略權重都會明顯上升。

一句話總結

視訊記憶體容量之爭打了十幾年,下一個十年的勝負手,可能不在晶片面積上,而在資料怎麼流動這件事上。 (芯在說)