#大模型推理
SSD走向推理主鏈路:處於爆發臨界點上的AI SSD
大語言模型推理正在同時遭遇容量牆與I/O牆。模型參數持續擴大,長上下文、多輪對話和智能體任務又使KV Cache快速膨脹;MoE模型雖然降低了單次計算的啟動參數量,卻需要保存遠大於視訊記憶體或記憶體容量的專家權重。在雲側算力中心,這一矛盾表現為昂貴的HBM資源被模型權重和KV Cache長期佔用,GPU有效利用率受到資料搬運制約;在邊緣側和端側,有限的DRAM或統一記憶體則直接限制了本地可運行模型的規模。由此,SSD開始從模型檔案的靜態存放裝置進入大模型推理的即時資料路徑,成為HBM、VRAM和DRAM之後的正式記憶體層級。 這一變化最早在推理基礎設施和叢集架構中得到清晰體現。月之暗面的Mooncake採用以KV Cache為中心的分離式推理架構,將GPU叢集中原本未被充分利用的CPU、DRAM和SSD組織為分佈式快取資源[1];Mooncake Store進一步支援由DRAM與SSD/NVMe構成的多級快取,使冷資料能夠在容量更大、成本更低的快閃記憶體層長期保留[2]。2026年,輝達推出CMX上下文記憶體記憶體平台,在Vera Rubin基礎設施中增加一個面向KV Cache最佳化、通過乙太網路連接的快閃記憶體層級,由BlueField-4負責NVMe SSD管理、資料保護和網路傳輸。輝達將其定義為介於GPU記憶體與共享記憶體之間的pod級上下文層[3]。這些架構釋放出一個明確的產業訊號:SSD正在成為推理系統需要直接調度的資源,而不再只是模型載入前後的外圍裝置。 但推理基礎設施開始呼叫SSD,並不意味著傳統SSD已經適合承擔常駐推理任務。傳統SSD面向檔案和塊資料記憶體設計,其性能指標主要圍繞順序頻寬、隨機IOPS、資料可靠性與單位容量成本展開;LLM推理需要的卻是具有嚴格時序約束的資料供應。KV Cache會在prefill階段集中生成並持續寫入,在後續請求中按會話、模型層和Token位置反覆讀取;MoE推理則需要根據路由結果,在每一層計算前及時取得特定專家權重。一次讀取未能趕上計算窗口,就可能讓GPU、NPU或CPU進入等待狀態,而SSD在高佇列深度下取得的峰值IOPS,並不等同於低佇列深度、細粒度訪問時的穩定延遲。 這種矛盾還延伸至SSD內部。NAND Flash以頁為單位讀取、以塊為單位擦除,FTL需要執行地址對應、垃圾回收和磨損均衡,容易產生寫放大與尾延遲;持續寫入KV Cache還會對快閃記憶體壽命提出遠高於普通消費負載的要求。傳統LBA排布並不瞭解模型層、MoE專家、KV塊及其訪問順序之間的語義關係,相互關聯的資料可能被分散到不同物理位置,難以形成可預測的平行讀取。檔案系統、塊裝置和NVMe軟體棧中的排隊、中斷、資料複製與頁快取,也會增加端到端延遲。如果缺少面向模型執行順序的地址佈局、快取劃分、優先順序調度、非同步預取和壽命管理,SSD雖然擁有TB級容量,卻仍難以像DRAM或VRAM一樣穩定參與每一個Token的生成。
《AI產業全景圖譜》新書節選|基準之戰:測試體系與模型話語權的角逐
轉自中信智庫、中信建投證券研究發展部出品 武超則等著《AI產業全景圖譜:技術範式、投資機遇與未來生態》,中信出版集團。 《AI產業全景圖譜》新書第一章“模型為王:AI 新範式的確立與演進”內容節選——基準之戰:測試體系與模型話語權的角逐。 基準測試為整個大模型行業提供了一個標準化的目標和一把統一的“標尺”。通過科學適當的基準測試手段,能夠客觀量化地衡量大模型的性能,精準地定位下一階段研發迭代的重點方向,有力地約束大模型安全可控。不同於傳統的自然語言處理模型,大模型具有複雜性、多樣性、開放性,同時還具備一定的泛化特徵。因此在大模型充分發展之前,此前用於自然語言處理工具的測試手段並不適用,需要建構全新的基準測試框架,而這種測試框架也將隨著大模型自身能力的不斷升級而持續迭代。 根據各類測試結果,很多公開的排行榜(如Hugging Face的Open LLM Leaderboard和LMSys的Chatbot Arena)將基準測試的驅動作用進一步放大,激勵著全球開發者和公司不斷最佳化模型。隨著模型規模的擴大,模型會表現出一些在小模型上不存在的“湧現能力”,如思維鏈推理。基準測試是系統性發現、追蹤和研究這些能力的關鍵工具。基準測試能幫助我們揭示和量化模型的潛在風險,如偏見、毒性內容生成和對特定攻擊的脆弱性。