登入
關鍵字
#大模型推理
官方認證
北風窗
2026/08/31
•
已編輯
押注稀疏計算:墨芯能否走出GPU之外的新路線?
墨芯登榜“強芯TOP100” 在中國國產AI晶片賽道,除了傳統的通用GPU路線,還有一家企業正在押注另一條技術路徑——稀疏計算。 如今,AI晶片競爭已經不只是“誰的峰值算力更高”,而是逐漸轉向性能、功耗、成本、軟體生態和實際應用效率的綜合競爭,這也正是墨芯押注稀疏計算的價值所在。 而墨芯面臨的關鍵問題,也已經從“能不能做出晶片”,轉向稀疏計算能否成為主流,以及技術優勢能否轉化為規模化商業應用。
科技
#AI晶片
#GPU
#稀疏計算
讚
留言
分享
官方認證
RexAA
2026/08/11
•
SSD走向推理主鏈路:處於爆發臨界點上的AI SSD
大語言模型推理正在同時遭遇容量牆與I/O牆。模型參數持續擴大,長上下文、多輪對話和智能體任務又使KV Cache快速膨脹;MoE模型雖然降低了單次計算的啟動參數量,卻需要保存遠大於視訊記憶體或記憶體容量的專家權重。在雲側算力中心,這一矛盾表現為昂貴的HBM資源被模型權重和KV Cache長期佔用,GPU有效利用率受到資料搬運制約;在邊緣側和端側,有限的DRAM或統一記憶體則直接限制了本地可運行模型的規模。由此,SSD開始從模型檔案的靜態存放裝置進入大模型推理的即時資料路徑,成為HBM、VRAM和DRAM之後的正式記憶體層級。 這一變化最早在推理基礎設施和叢集架構中得到清晰體現。月之暗面的Mooncake採用以KV Cache為中心的分離式推理架構,將GPU叢集中原本未被充分利用的CPU、DRAM和SSD組織為分佈式快取資源[1];Mooncake Store進一步支援由DRAM與SSD/NVMe構成的多級快取,使冷資料能夠在容量更大、成本更低的快閃記憶體層長期保留[2]。2026年,輝達推出CMX上下文記憶體記憶體平台,在Vera Rubin基礎設施中增加一個面向KV Cache最佳化、通過乙太網路連接的快閃記憶體層級,由BlueField-4負責NVMe SSD管理、資料保護和網路傳輸。輝達將其定義為介於GPU記憶體與共享記憶體之間的pod級上下文層[3]。這些架構釋放出一個明確的產業訊號:SSD正在成為推理系統需要直接調度的資源,而不再只是模型載入前後的外圍裝置。 但推理基礎設施開始呼叫SSD,並不意味著傳統SSD已經適合承擔常駐推理任務。傳統SSD面向檔案和塊資料記憶體設計,其性能指標主要圍繞順序頻寬、隨機IOPS、資料可靠性與單位容量成本展開;LLM推理需要的卻是具有嚴格時序約束的資料供應。KV Cache會在prefill階段集中生成並持續寫入,在後續請求中按會話、模型層和Token位置反覆讀取;MoE推理則需要根據路由結果,在每一層計算前及時取得特定專家權重。一次讀取未能趕上計算窗口,就可能讓GPU、NPU或CPU進入等待狀態,而SSD在高佇列深度下取得的峰值IOPS,並不等同於低佇列深度、細粒度訪問時的穩定延遲。 這種矛盾還延伸至SSD內部。NAND Flash以頁為單位讀取、以塊為單位擦除,FTL需要執行地址對應、垃圾回收和磨損均衡,容易產生寫放大與尾延遲;持續寫入KV Cache還會對快閃記憶體壽命提出遠高於普通消費負載的要求。傳統LBA排布並不瞭解模型層、MoE專家、KV塊及其訪問順序之間的語義關係,相互關聯的資料可能被分散到不同物理位置,難以形成可預測的平行讀取。檔案系統、塊裝置和NVMe軟體棧中的排隊、中斷、資料複製與頁快取,也會增加端到端延遲。如果缺少面向模型執行順序的地址佈局、快取劃分、優先順序調度、非同步預取和壽命管理,SSD雖然擁有TB級容量,卻仍難以像DRAM或VRAM一樣穩定參與每一個Token的生成。
科技
#大模型推理
#SSD
#月之暗面
讚
留言
分享
官方認證
RexAA
2026/07/30
•
《AI產業全景圖譜》新書節選|基準之戰:測試體系與模型話語權的角逐
轉自中信智庫、中信建投證券研究發展部出品 武超則等著《AI產業全景圖譜:技術範式、投資機遇與未來生態》,中信出版集團。 《AI產業全景圖譜》新書第一章“模型為王:AI 新範式的確立與演進”內容節選——基準之戰:測試體系與模型話語權的角逐。 基準測試為整個大模型行業提供了一個標準化的目標和一把統一的“標尺”。通過科學適當的基準測試手段,能夠客觀量化地衡量大模型的性能,精準地定位下一階段研發迭代的重點方向,有力地約束大模型安全可控。不同於傳統的自然語言處理模型,大模型具有複雜性、多樣性、開放性,同時還具備一定的泛化特徵。因此在大模型充分發展之前,此前用於自然語言處理工具的測試手段並不適用,需要建構全新的基準測試框架,而這種測試框架也將隨著大模型自身能力的不斷升級而持續迭代。 根據各類測試結果,很多公開的排行榜(如Hugging Face的Open LLM Leaderboard和LMSys的Chatbot Arena)將基準測試的驅動作用進一步放大,激勵著全球開發者和公司不斷最佳化模型。隨著模型規模的擴大,模型會表現出一些在小模型上不存在的“湧現能力”,如思維鏈推理。基準測試是系統性發現、追蹤和研究這些能力的關鍵工具。基準測試能幫助我們揭示和量化模型的潛在風險,如偏見、毒性內容生成和對特定攻擊的脆弱性。
科技
#AI產業
#大模型
#推理能力
讚
留言
分享
官方認證
RexAA
2026/06/28
•
DeepSeeK 突然發佈 DSpark,讓 AI 的回答不再「擠牙膏」
最近忙著大規模招兵買馬的 DeepSeek,也始終沒有忘記開源這條主線。 今天,DeepSeek 與北京大學團隊聯合發佈論文《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》,提出了一套新的大模型推理加速框架 DSpark。 技術報告 🔗 https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf 論文披露,DSpark 已經進入 DeepSeek-V4-Flash preview 和 DeepSeek-V4-Pro preview 的生產服務系統,並替代此前的 MTP-1 方案。
科技
#DeepSeeK
#DSpark
#大模型
讚
留言
分享
官方認證
RexAA
2026/06/03
•
大模型訓練推理最佳化部署最佳實踐,助力企業 AI 規模化落地
當前,生成式 AI 正由技術探索邁向產業深度應用,大模型訓練、微調、推理、部署全流程最佳化,已成為企業實現 AI 高效落地、提升核心競爭力的關鍵支撐。IDC 發佈《大模型訓練推理最佳化部署的最佳實踐》報告,基於行業實踐與技術演進趨勢,系統梳理大模型全生命周期關鍵最佳化技術,並結合產業真實案例,為企業提供系統、可落地的技術指引。 1 生成式 AI 落地提速,市場需求持續攀升 生成式 AI 應用正從網際網路場景向金融、製造、醫療、能源、政府與公共事業等核心行業全面滲透,由單點試點轉向規模化部署。據 IDC 調研與預測: ● 2026 年近半數中國企業部署的生成式 AI 應用場景將達到 10 個以上,AI 智能體成為數位化轉型核心驅動力;
科技
#AI
#大模型
#推理
讚
留言
分享
官方認證
RexAA
2024/08/30
•
美大學教授警告:大模型根本不會推理,全靠記憶力強!
大模型根本不會推理! 亞利桑那州立大學教授Subbarao Kambhampati最近發表了一系列言論,直指當前大語言模型(LLM)推理能力的迷思。這番言論引發了業內熱議,不少網友紛紛表示:原來AI這麼強的推理能力,都是假的? Kambhampati教授一針見血地指出: 許多關於LLM推理能力的說法都忽視了一個事實:LLM不僅僅是訓練於"事實",更多時候還包括了這些事實的演繹閉包。因此,所謂的"推理"實際上變成了(近似)檢索。
科技
#AI大模型
#推理
#記憶力
讚
留言
分享