2026年8月,一則關於NVIDIA正在探索用高速NVMe SSD擴展GPU視訊記憶體的消息,在硬體圈引發了不小的討論。表面看,這只是又一個"堆料"傳聞。但如果仔細拆解背後的技術路徑,會發現這可能觸及了一個被所有人忽略的問題:視訊記憶體容量的增長速度,正在被AI模型和遊戲資產的膨脹速度反超。
聚焦
這次的重點不是讓NAND快閃記憶體假裝成HBM或者GDDR,那是不可能的事情。真正的野心是重構GPU的資料流動路徑,讓原本躺在硬碟裡"睡大覺"的資料,能用更短的路徑直達GPU計算單元。
一條被詬病已久的老路
傳統架構裡,資料從SSD到GPU要經歷一條相當曲折的旅程
SSD → CPU → 系統記憶體DRAM → 視訊記憶體VRAM → GPU
這條路徑至少經過5次跳轉,每一次跳轉都意味著延遲、CPU佔用和資料複製開銷。這不是危言聳聽,而是過去二十年PC架構的基本設定,CPU始終是資料流動的"看門人"。
而NVIDIA正在推動的方向,是把這條路徑壓縮成
NVMe SSD → GPU直連資料通道 → GPU端解壓縮 → 視訊記憶體/計算單元
跳數從5降到3,中間複製次數大幅減少,CPU負載也隨之下降。這背後依託的不是空想,而是已經存在多年的三項底層技術
- RTX IO
NVIDIA在2020年就已公佈的GPU直連記憶體技術 - Microsoft DirectStorage
微軟2022年正式落地的遊戲記憶體API,DirectStorage 1.1版本已支援GPU端解壓縮 - GPUDirect Storage / cuFile
NVIDIA面向資料中心和AI場景的記憶體直連方案,早已在CUDA生態裡投入實用
洞察一:這不是新故事,是老故事的新篇章
索尼在PS5上早就驗證過這套邏輯。定製SSD配合專用解壓縮晶片Kraken,讓《瑞奇與叮噹:時空跳轉》實現了幾乎無載入時間的場景切換。NVIDIA現在做的,某種程度上是把主機上驗證過的思路,搬到PC和資料中心的GPU架構裡。
資料不會說謊:跳數少了,代價小了
結合行業公開測試資料和架構邏輯,可以整理出一份對比
這份對比裡最值得玩味的是最後一行的"有效容量"數字。它不是說SSD真的變成了視訊記憶體,而是說當SSD作為溢出層和流式載入層參與工作時,GPU能夠處理的有效資料集規模被顯著放大了。
警示:頻寬差距依然是硬傷 必須潑一盆冷水。
目前主流PCIe 5.0 SSD的理論頻寬峰值在14GB/s左右,而GDDR6X視訊記憶體頻寬普遍在800GB/s到1TB/s量級,HBM3更是達到3TB/s以上等級。這中間隔著接近百倍的量級差距。所以這套架構本質上是"記憶體分層管理",不是"視訊記憶體替代方案",誰要是把它理解成SSD能當視訊記憶體用,那就是徹底會錯意了。
AI推理才是真正的戰場
遊戲場景固然重要,但真正讓這個技術路徑變得迫切的,其實是AI推理端的現實壓力。
大語言模型的參數規模增長速度,早已超過了視訊記憶體容量的迭代速度。史丹佛團隊在2023年提出的FlexGen方案,微軟DeepSpeed團隊的ZeRO-Infinity技術,核心思路都是把暫時用不上的模型參數"解除安裝"到NVMe SSD,需要時再快速調回視訊記憶體。這些學術和工程實踐早就證明了一件事:當視訊記憶體不夠用的時候,聰明的資料調度比單純堆視訊記憶體更划算。
洞察二:這可能重新定義"視訊記憶體不足"這件事
過去我們判斷一張顯示卡夠不夠用,只看視訊記憶體容量數字。但如果GPU直連記憶體這條路真的跑通,未來評價一套AI推理系統的標準,可能會從"視訊記憶體有多大"變成"資料調度架構有多聰明"。這是一個認知層面的轉變,很多人可能還沒意識到。
跳出框架的一個猜想
以下是一個大多數討論都沒有觸及的角度。
如果GPU直連記憶體真的成為標配架構,受益最大的可能不是顯示卡廠商,而是企業級SSD控製器廠商。目前市場上主導PCIe 5.0企業級SSD控製器的玩家,包括慧榮科技(Silicon Motion)、群聯電子(Phison)等控製器方案商,它們的議價能力可能會被重新評估。因為在這套新架構裡,SSD不再只是"記憶體配件",而是直接參與到GPU計算資料流的核心鏈路里,控製器的解壓縮能力、佇列深度調度能力,會變成和視訊記憶體頻寬同等重要的架構指標。
換句話說,這場架構變革如果落地,記憶體行業可能會迎來一次話語權的重新分配,這是一個值得資本市場提前關注的訊號,而不只是一個技術八卦。
深度提醒
也要警惕過度炒作的可能性。目前這仍然是行業探索方向,不是量產落地的產品路線圖。歷史上英特爾的Optane傲騰記憶體,也曾經承諾過類似的"記憶體即記憶體"願景,最終因為成本和生態問題黯然退場。
技術路徑正確,不代表商業落地一定順利,這中間還隔著成本、生態適配、軟體最佳化等一系列現實門檻。
寫在最後
這場變革如果真正推進,它傳遞的核心訊號其實很清晰
未來GPU性能的天花板,將越來越依賴於整個資料鏈路的協同效率——計算、視訊記憶體、記憶體、解壓縮引擎、軟體調度,缺一不可,而不再只是GPU晶片本身的算力堆疊。
這意味著PCIe匯流排頻寬、SSD延遲表現、控製器架構設計、壓縮引擎效率、軟體層的記憶體調度策略,這些原本被視為"配角"的技術環節,未來在遊戲和AI兩大領域的戰略權重都會明顯上升。
一句話總結
視訊記憶體容量之爭打了十幾年,下一個十年的勝負手,可能不在晶片面積上,而在資料怎麼流動這件事上。 (芯在說)
