晶片效能對比 Nvidia Blackwell

根據已發布的首批基準測試結果,OpenAI 首代 Jalapeño ASIC 功耗為 700 瓦,在每千瓦吞吐量上較 1,400 瓦的 Nvidia Blackwell 旗艦級產品高出 1.5 倍至 1.9 倍,延遲更低達 3.6 倍。這些數據將 Jalapeño 定位為對 Nvidia 頂級資料中心 GPUGB300 的直接效率挑戰。
架構與 Broadcom 共同開發
根據 Wccftech 引述 SemiAnalysis 的報導,Jalapeño 封裝內含一顆以 TSMC N3P 製程打造的單一 reticle 大小運算晶粒,搭配一顆 N3E I/O 晶粒與 HBM4 記憶體,每封裝可提供 15.4 TB/s 的記憶體頻寬。核心與記憶體被分割為對應的區塊,使其擁有低延遲的本地 HBM 視圖與高頻寬的集合通訊網路。OpenAI 與 Broadcom 共同開發此晶片,並搭配自家 Gluon 核心程式語言,而非依賴 Nvidia 的 CUDA 堆疊。
矩陣引擎與 MXFP 數值格式
矩陣引擎採用權重固定(weight-stationary) systolic array 架構,並使用 MXFP 數值格式,透過讓群組數字共用單一指數,將 AI 運算壓縮至 4 位元(MXFP4)。權重固定的資料流將模型權重鎖定在處理陣列中,MXFP 縮小了傳輸中的數值規模,systolic array 則以儲存格對儲存格的方式傳遞資料,無需往返記憶體;該報導認為這種組合消除了資料傳輸瓶頸。根據 Wccftech 的說法,此設計並未使用推測解碼技巧來灌水效能數字。
純量與向量核心
在矩陣引擎周圍,Jalapeño 配備採用配對 L1 快取的 64 位元亂序執行純量核心,以處理控制程式碼、記憶體管理與調度,以及 FP32/INT32 向量核心則用於 softmax、正規化等高精度步驟,因為 MXFP 壓縮並不適合這些運算。亂序執行純量核心會將資料串流傳送至佇列,確保依序執行的矩陣與向量單元隨時都有準備就緒的運算元。
對 Nvidia CUDA 護城河的策略性威脅
透過打造自訂 ASIC 及隨附的核心語言,OpenAI 將可降低對 Nvidia 硬體與軟體的依賴;Wccftech 將此態勢描述為對 Nvidia CUDA 生態系的威脅。Jalapeño 的結果取自 SemiAnalysis,且被定位為首次公開的基準測試,而非經 Nvidia 驗證的數據,因此 1.5×–1.9× 每千瓦效能及 3.6× 延遲等主張仍待獨立驗證。
分享這篇文章







