一句話,一個周末,Claude直接把自家最前沿的模型跑在了一台全新的AMDMI355X機架上!
人類工程師全程沒動手改過一行程式碼。
誰能想到,輝達花20年堆起的CUDA護城河,就這樣被跨了過去。
一個周末,Claude把AMD新GPU調通了
故事是這樣的。
前段時間,AMD給Anthropic送來一台搭載MI355X的機架。
團隊看完,心裡已經做好了打硬仗的準備。新平台配新軟體棧,註定需要新一輪適配。
不過,Anthropic手裡正好有Claude。
團隊乾脆先讓一名工程師試試:把Claude接上機器,丟給它一句,「去,把這台機器跑起來。」
等周末結束回到工位,螢幕上已經多出一條持續上漲的性能曲線——結果不僅跑起來了,性能還在一輪輪不停地提升。
Anthropic聯合創始人兼首席計算官Tom Brown講完,蘇姿丰馬上接過話:
聽說Anthropic只有一名工程師在處理MI355X時,她第一反應是讓AMD團隊趕緊去幫忙。
結果團隊回來告訴她,對方說不用,已經全部搞定了。
很快,這場周末實驗便接上了真正的部署計畫。
就在最近,Anthropic宣佈,將在AMDHelios系統中部署最高2GW的Instinct GPU,首批1GW計畫於2027年上半年啟動。
並且,雙方還會直接使用Claude最佳化AMD工作負載,加速ROCm軟體開發。
晶片說明書,迎來一位非人類讀者
Claude之以能實現對CUDA生態的「降維打擊」,是因為AMD直接給AI開發了一套能上手調GPU的工具。
在AMD Advancing AI 2026大會上發佈的ROCm.AI,就是給Claude、Codex和Cursor準備的一整套GPU工具箱。
入口叫AMD Skills,裡面裝的全是經過驗證的ROCm知識。
Agent拿到這些知識後,可以自己裝環境、部署模型、讀日誌、查故障,再通過ROCm CLI呼叫真實機器。開發者說出目標,剩下的路讓Agent自己找。
劃重點,AMD甚至連晶片說明書的寫法都改了。
公司AI軟體與解決方案副總裁Anush Elangovan在現場透露,每一代AMD GPU都會公開指令集,並提供AI可讀的ISA。
Agent在讀懂手冊之後,就能直接上手調性能。
AMD把這部分工作交給Hyperloom。它會拉起推理服務,先跑出基線,再去找CPU和GPU的瓶頸,測試不同配置,生成定製核心,最後把新方案重新跑一遍。
現場演示裡,Hyperloom把MiniMaxM3的輸出速度提升了38%。AMD還讓它一次跑過1.4萬個模型,把測試結果沉澱成下一次可以直接復用的經驗。
AMD還在和前沿模型公司一起訓練這種能力。Elangovan的原話很有意思:讓前沿模型「天生會說AMD程式設計」。
以後看一塊晶片,峰值算力和視訊記憶體頻寬當然重要,AI能不能讀懂它、呼叫它、把性能調出來,也會擺上同一張參數表。
晶片公司要爭取的開發者,現在多了一類:Agent。
來自ASI的降維打擊
CUDA從2006年一路走到今天,靠的是無數工程師一行行碼出來的生態。
編譯器、數學庫、偵錯程式、性能分析工具、開發文件,該有的全有。
更難複製的,是那一代代工程師攢下來的手感。
算子怎麼調,通訊怎麼提速,視訊記憶體怎麼分配,分佈式部署那裡最容易出問題,這些經驗全鎖在少數專家的腦子裡。
後來者就算造出性能接近的晶片,也得把這條軟體長路從頭走一遍。晶片流片可以按季度推進,生態積累卻只能按年去熬。
而Agent補的就是這一段。
它會讀平台文件,呼叫性能分析工具,找到速度卡在那裡,再改程式碼、編譯、測試。一個方案沒有效果就換下一個;跑分變好就沿著這個方向繼續最佳化。
人類培養一名頂級GPU工程師要按年算,多啟動一個Agent只需要再開一個任務。
一名工程師放出一群Agent,就能平行排查報錯、定位性能瓶頸。一次跑通的配置、寫好的核心和踩過的坑,也能馬上成為下一批Agent的起點。
把按年計算的追趕壓縮成按任務計算,AI最值錢的地方就在這裡。這也是ASI式能力對CUDA生態的降維打擊。
如今,中國工程師已經站在這場AI改造GPU軟體棧的最前線,他們沉澱下來的底層經驗,也在被整理成更多Agent可以呼叫的能力。
追趕CUDA的新起點已經出現:把硬體介面和軟體工具交給AI,讓Agent直接開工。
20年的生態差距,第一次可以交給一群Agent晝夜不停地往回追。(市場資訊)
