Arm發佈CSS for Mobile 2:GPU唱主角

今天去了趟上海的Arm Everywhere China,Arm發佈了新一代AI原生計算平台,說實話這種晶片計算平台的發佈特別硬核,實在是考驗我的吸收理解能力,我儘量寫通俗一些,讓大家都能看懂。

一年前,Arm Unlocked上海站的主角是Lumex CSS,這是Arm第一代面向手機的計算子系統,把CPU、GPU、系統互聯和軟體做成一個完整平台交給晶片廠,不再是一個個單獨的IP核。

今天,Arm發佈了第二代移動終端計算子系統(CSS for Mobile 2),也就是去年Lumex的第二代。

只看參數表的話,這是一次標準意義上的年度升級,CPU單線程提升15%,GPU基準性能最高提升24%。

不過,一整天的活動聽下來,我越來越確定一件事,GPU才是Arm今年真正想講的故事。

01. 從IP到Lumex再到CSS for Mobile 2,Arm向前邁進一步

Lumex今年改成了CSS for Mobile 2,有人可能會疑惑為什麼換名字,我們特地問了Arm這個問題,其實是有意為之,改名就是為了簡化命名體系,CSS for Mobile表意清晰,一看就知道是針對移動領域的平台,與之相比,此前COMPUTEX上還發佈了CSS for PC,這樣大家一眼就能看清每個平台針對那個品類。

名字變了背後,是Arm在交付方式上向前邁了一步,前文有提到,以前Arm交付的是單個IP核,晶片廠商自己拿回去組合,從Lumex開始,甚至從Arm CSS for Client開始,Arm在IP授權的基礎上,又多了一種選擇,即把CPU、GPU、系統互連、物理實現、軟體工具鏈預先整合好,做成一個完整平台交給晶片廠商。

要特別說明的是,這不是捆綁銷售,合作夥伴既可以整套採用CSS平台,也可以單獨選用其中某個元件,還可以和自研或第三方IP結合,根據產品定位、性能目標和市場需求靈活搭配。

大家可以理解為CSS提供的是一個經過系統級最佳化的參考方案,用不用、用多少,主動權在客戶手裡。

CSS for Mobile 2的三大件分別是C2 CPU叢集、Mali G2-Ultra NX GPU和SI L2系統互連,而這三大件的設計,都圍繞同一個原點:智能體。

Arm認為,手機上的AI正在從問答助手變成能自主完成任務的智能體,而智能體的工作流可以拆成四步:

第一步是感知,聽懂使用者在說什麼、理解意圖;

第二步是記憶,調取日曆、照片、偏好等上下文資訊;

第三步是推理,根據已知資訊規劃下一步該做什麼、生成結構化指令;

第四步是行動,呼叫對應的App或服務把事情辦完。

當然,全程還有一個編排層在調度,決定每一步該跑在那個計算資源上,CPU就是這個體系的編排調度中心,C2 CPU叢集整合了雙SME2引擎,就是專門用來跑輕量級AI任務的。

按Arm官方的說法,輕量模型通常指20億至30億參數規模,比如Gemma-2B、騰訊混元HY-1.8B-2Bit,這個規模的模型放在CPU上跑,延遲比NPU還低,而且跨平台相容性好。

具體參數方面,最新AI模型性能最高提升1.7倍,語音轉文字延遲降低40%,單線程性能提升15%。這些提升貫穿智能體工作流的各個環節,比如更快的語音處理縮短互動起始延遲,更快的記憶檢索讓智能體迅速調取上下文,更快的推理速度讓決策更及時等。

值得一提的是,目前vivo X300系列、OPPO Find X9系列、三星S26系列,包括iPhone等幾乎所有旗艦手機,都已經採用了SME2技術,這意味著Arm在CPU端的AI能力已經實現了大規模落地。

02. 手機GPU撞牆之後

說完CPU,來說說今年的重頭戲:GPU。

當前手機遊戲的畫面越來越複雜,高解析度、高影格率、大世界、光線追蹤,每一項都在增加GPU的工作量。而手機的功耗預算就那麼多,散熱空間也有限,GPU的性能增長追不上遊戲複雜度的增長,這是所有手機GPU廠商都要面對的一堵牆。

Arm的解法是Mali G2-Ultra NX,這個名字裡的“NX”,就是Neural Accelerators(神經網路加速器)的意思。

從這就可以看出,Arm做了一個和很多廠商不同的選擇,沒有把AI加速器做成獨立的NPU放在GPU旁邊,而是直接整合進了著色器核心內部。

這個設計的好處是資料不用在GPU和NPU之間來回搬運,神經圖形任務和渲染任務可以平行跑,共享GPU的記憶體系統和快取,延遲更低、效率更高。而且這部分加速器面積極小,帶電源門控,不用的時候直接關掉不耗電。

其實就像兩個人一起拼樂高,如果一個在客廳、一個在臥室,零件要來回傳遞,效率很低;如果兩個人坐在同一張桌子前,共享一個零件盒,隨時能看到對方拼到那了,配合起來就快得多。

基於NX加速器,Arm帶來了三項神經圖形技術:

神經超級採樣(NSS):GPU 先渲染低解析度畫面,再用神經網路重建到高解析度,最高提升2倍 FPS,外部記憶體流量降低50%。

神經影格率提升(NFRU):在兩幀之間生成AI中間幀,支撐120 FPS持續遊戲,DRAM流量降低33%。

神經超級採樣與降噪(NSSD):把超分和降噪結合,專門用於複雜光追場景,在低採樣率的光追畫面上同時提升解析度和去除噪點。

說到這裡難免有人會問:這和NVIDIA的DLSS有什麼區別?

Arm也很坦誠,直言不諱表示底層要實現的場景確實高度相似,超分、幀生成、降噪,但手機必須在功耗和散熱約束下重新設計整套東西,所以Arm的模型更小更省電,而且是開放的,手機廠商驗證之後可以按自己的產品需求修改和定製,目前Arm正與騰訊遊戲合作探索神經動態全域光照等下一代技術。

說白了,移動端再怎麼堆料,在絕對畫質方面肯定比不過桌面顯示卡,但我認為Arm的方向是對的,在手機個位數性能釋放的功耗預算裡,用AI來補畫面,確實是一條“曲線救國”路。

03. 拋開AI,傳統圖形渲染依舊有硬實力

說了這麼多AI,不如實際跑跑看效果。

在Arm Everywhere China上,Arm展現了和Sumo Digital基於虛幻引擎5.5聯合打造了一款叫《光影新生》demo,支援MegaLights,場景內最多1400盞動態光源,光照與陰影全部為光線追蹤即時計算,沒有預烘焙,實際效果非常驚豔。

作為參考,它原來只有15 FPS,但在Mali G2-Ultra NX平台上跑到了持續60 FPS,相當於影格率最高4倍的提升,同時DRAM流量還最多降低了70%。

如果以為G2-Ultra NX只靠AI,那就小看它了,這一代GPU在傳統渲染上也有實打實的提升,主要有兩項關鍵升級。

其中一個是全新的執行引擎,這是Mali七代產品以來最大的指令集架構升級,每個線程束的暫存器數量比上一代多了一倍,支援動態暫存器分配。

在面對UE5 Nanite和Lumen這類越來越複雜的著色器程序,暫存器翻倍能有效減少溢出到記憶體的情況,讓大著色器更高效地運行。

另一個是第三代光線追蹤單元,採用了更緊湊的光線-三角形資料結構,光追基準測試的DRAM流量降低13%。同時硬體支援不透明度微貼圖(OMM),能高效處理植被、織物這類透明幾何體,演示中影格率提升30%,光追負載降低70%。

硬體能力到位了,開發者能不能方便地用上才是關鍵,Arm在這方面也做了不少鋪墊。

針對開發者生態,Arm推出了神經圖形開發套件(Arm Neural Graphics Development Kit),目前NSS和NFRU模型已經在Hugging Face和GitHub上開放。

國內大廠的合作進展也很快,騰訊Magic Dawn、Unity中國團結引擎已整合;網易《燕雲十六聲》今年將推出NSS版本,騰訊《暗區突圍:無限》、疊紙的《無限暖暖》也在整合中。另外據小米官方資訊,玄戒O3也採用了G2-Ultra NX。

還是那句話,AI不是萬能的,神經圖形更像是一個工具,用在什麼場景、用到什麼程度,最終還是開發者說了算。

04. 寫在最後

一整天活動下來,有兩點觀察想和大家分享。

第一、神經圖形在移動端確實到了可用的節點,模型、外掛、demo都有了,還有明確的接入周期和國內廠商的適配名單,這些都是技術從概念走向落地的訊號。當然最終效果還要看量產機型和實際遊戲,但至少路徑我覺得是清晰的,不再是PPT上的畫餅。

第二是關於CSS平台模式的一點思考,Arm把CPU、GPU、互連、軟體整合得越來越深,那各家終端的差異化從那裡來?

針對這個問題,Arm也對雷科技表示,平台解決的是基礎能力的下限, 保證每一家採用CSS 的晶片都能達到不錯的性能、能效和相容性,而差異化交給合作夥伴在平台上做,核心數量、頻率、工藝節點、自研IP的混接,都由廠商自己決定。

相當於Arm的平台化不是要把廠商變成貼牌工廠,而是把重複造輪子的工作交給自己,讓廠商把精力放在真正能體現差異的地方。

以上就是我在Arm Everywhere China的所見所聞,至於Arm這種模式能不能走通,等量產機型出來就會有答案了。 (雷科技)