昨天,OpenAI 公佈了 Jalapeño 的首批性能測試結果。
這是 OpenAI 的第一顆定製推理晶片,由 OpenAI 負責核心架構設計,Broadcom 參與晶片實現和網路連線,Celestica 負責電路板、機架和系統整合。
OpenAI 計畫在 2026 年年底前開始部署 Jalapeño。Gen 2 已經進入深度開發階段,Gen 3 也開始成形。
這不是一塊用來秀肌肉的樣品,而是 OpenAI 準備長期投入的一條晶片產品線。
跟 Nvidia 正面對打
這次 OpenAI 使用 SemiAnalysis 的公共 InferenceX 基準,測試了 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三個開放權重模型。
其中,GPT-OSS 對比 Nvidia GB200,DeepSeek 和 Kimi 對比 GB300。測試採用固定的 8K 輸入、1K 輸出和 STP 模式,衡量完整請求的吞吐量、功耗和延遲。
綜合三個模型,Jalapeño 在峰值吞吐狀態下,每瓦能夠完成的 AI 工作量達到 Nvidia 對比系統的 1.5 至 1.9 倍,端到端延遲優勢達到 1.7 至 3.6 倍。
在強調即時響應的高互動任務中,性能優勢進一步擴大到 2.1 至 4.1 倍。
更關鍵的是,Jalapeño 在整個測試區間都處於帕累托前沿(pareto frontier)。
這個詞聽著挺學術,理解起來很簡單:在相同延遲下,它能提供更高吞吐量;在相同吞吐量下,它又能提供更低延遲。競爭對手很難在不犧牲一項指標的情況下超過它。
既想馬兒跑得快,又想馬兒吃得少。
以前只能選一個,現在 OpenAI 說它兩個都要。
最誇張的資料出現在 DeepSeek R1 上。
GB300 此前能夠達到的最佳 Token 間時間為 5.90 毫秒,相當於每個使用者每秒獲得約 169 個 Token。
把 Jalapeño 限制在相同輸出速度下,它每千瓦可以處理 12,258 個混合 Token,而 GB300 隻有 118 個。
差距達到 104.3 倍。
這個數字是真的,但不能理解成 Jalapeño 的整體性能是 GB300 的一百多倍。
它反映的是一個特定場景:當雙方都必須維持 169.41 token/s/user 的高互動速度時,Jalapeño 還能同時服務大量請求,GB300 的總體吞吐量卻已經降得很低。
就像兩家餐廳都承諾一分鐘上一道菜。GB300 為了兌現承諾,只敢接一桌;Jalapeño 保持同樣速度,還能同時接很多桌。
如果比較雙方各自的峰值單位功耗吞吐量,Jalapeño 在 DeepSeek R1 上的優勢約為 1.7 倍。這個數字沒有 104.3 倍那麼炸裂,卻更適合判斷兩套系統的整體能效差距。
另外兩個模型也呈現出相同趨勢。
Jalapeño 運行 GPT-OSS 時,峰值單位功耗性能約為 GB200 的 1.9 倍;運行 Kimi K2.5 時,約為 GB300 的 1.5 倍。在匹配 Nvidia 此前最佳互動速度的條件下,兩者的單位功耗吞吐量優勢分別擴大到 53.7 倍和 56.1 倍。
Jalapeño 的額定功耗為 700 W,測試任務中的持續實測功耗沒有超過 550 W。
作為對比,GB200 和 GB300 的公開封裝額定功耗分別為 1,200 W 和 1,400 W。
不過,550 W 是 Jalapeño 在特定任務中的實測值,1,200 W 和 1,400 W 是 Nvidia 晶片的額定功耗,兩邊不是完全相同的測量口徑。
OpenAI 正式計算單位功耗成績時,使用的是各款晶片的公開額定功耗進行統一換算。
即便把宣傳濾鏡摘掉,Jalapeño 的表現依然很猛。
它把計算、記憶體、網路、軟體和機架放在一起設計,儘量將模形狀態和 KV Cache 保留在本地,減少資料在核心與晶片之間來回搬運。
Nvidia 的 GPU 需要兼顧訓練、推理、科學計算和圖形處理,優勢是通用、成熟、生態龐大。Jalapeño 則是一台專門為大模型推理改裝的賽車。
賽車不一定能去野外,但在賽道上,它連後排座椅都嫌重。
AI 開始設計自己的晶片
Jalapeño 另一個有意思的地方,是 AI 直接參與了晶片開發。
OpenAI 只用了 9 個月,就把它從初始設計推進到流片。AI 幫助工程師探索實現方案、縮短設計和驗證周期,還參與最佳化了晶片裡的算術電路。
OpenAI 不只用 AI 設計晶片,還故意把晶片設計成容易被 AI 程式設計的樣子。
工程師描述資料放在那裡、不同部分怎樣通訊、任務什麼時候同步,Codex 和 GPT-Astra 再繼續最佳化任務的對應、放置和調度。
三個原本不在生產計畫裡的開放權重模型,只用了 2 個月就被適配到較高性能。在 GPT-OSS 的部分注意力和混合專家模組上,AI 生成的實現比人類專家編寫的版本快 1.5 至 1.8 倍。
注意,這只是選定模組,不是整個模型快了 1.8 倍。
OpenAI 想做一條龍
Jalapeño 真正重要的地方,不是某一個跑分超過了 Nvidia。
OpenAI 正在把模型、產品、API、推理軟體、晶片、記憶體、網路和資料中心連接起來。
模型在真實場景裡遇到的問題,可以直接反饋給晶片團隊;晶片獲得的新能力,模型和軟體又能馬上針對它最佳化。
蘋果曾經用類似的方法,把晶片、作業系統和硬體產品綁在一起,做出了很難被單點複製的體驗。
OpenAI 現在想把這套邏輯搬到 AI 上:
AI 幫助設計晶片,晶片負責運行 AI,AI 再繼續最佳化晶片上的程序。
這個循環一旦跑起來,真正可怕的可能不是第一代 Jalapeño 有多快,而是 Gen 2 和 Gen 3 會以什麼速度進化。
真正的競爭開始了
現在就說 Nvidia 要涼,肯定太早。
這些資料由 OpenAI 使用公共基準測試並自行公佈,還沒有經過大規模生產環境的長期驗證。晶片的製造成本、良率、整機成本和真實部署規模也沒有公開。
OpenAI 自己也明確表示,未來仍會廣泛部署 Nvidia 和其他合作夥伴的加速器,用於訓練和推理。
原因很現實。
OpenAI 缺的不是某一種晶片,而是所有能夠買到的算力。自家廚房剛開始試營業,沒必要當場註銷外賣帳號。
但 OpenAI 和 Nvidia 之間的關係已經變了。
過去,OpenAI 主要是 Nvidia 的大客戶。模型越大、使用量越高,就得購買更多 GPU。
現在,它開始有能力把規模最大、使用最頻繁、最消耗營運成本的推理任務,逐步遷移到自己的晶片上。
Nvidia 的優勢依然巨大,但它最大的客戶正在學習自己造一部分鏟子。
Jalapeño 還沒有掀翻桌子。
它只是第一次把手伸進 Nvidia 的飯碗,而且已經夾走了一塊不小的肉。
當模型公司開始掌握晶片,晶片公司也在向雲服務和模型擴張,未來真正的競爭可能不再是那一塊晶片跑得更快。
而是誰能把模型、軟體、晶片、網路和資料中心,組成一台效率最高的完整機器。
到那時,OpenAI 究竟還是 Nvidia 的客戶,還是已經成了它最危險的競爭對手?(AI范兒)
