OpenAI 在 8 月 25 日公布自研推論晶片 Jalapeño 的第一批測試結果。這是最近 72 小時內的重要延伸題目,不是 8 月 27 日當天才發生的發布;而且目前看到的性能數字主要來自 OpenAI 自己的測量,不能直接當成已完成的獨立晶片評測。
OpenAI 公布了哪些數字?
OpenAI 表示,Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 等測試中,相比 NVIDIA GB300,AI work per watt 約提升 1.5 到 1.9 倍,端到端延遲則降低約 1.7 到 3.6 倍。若看互動式工作負載,OpenAI 給出的效能提升範圍約為 2.1 到 4.1 倍。
測試採用 SemiAnalysis InferenceX,並將比較對象的晶片功耗以公開規格正規化。OpenAI 另外表示,Jalapeño 標示功耗為 700W,但在測試工作負載中的持續實測功耗不超過 550W。這些條件會直接影響最後的比較結果。
這些結果應該怎麼讀?
首先,這是一份公司發布的第一方 benchmark,不是獨立實驗室完成的全面驗證。它可以讓外界理解 OpenAI 想優化的方向:推論服務的總延遲、每瓦產出與大模型服務成本;但不同 batch size、輸入輸出長度、軟體堆疊與功耗定義,都可能讓結果改變。
其次,Jalapeño 目前不是可以買回家安裝的消費產品,OpenAI 也沒有在這份結果中公布一般開發者的供貨方式或價格。文章裡的「擊敗」只能理解為在 OpenAI 指定測試條件下的宣稱,不應延伸成所有 AI 工作負載都比 NVIDIA 快。
為什麼 OpenAI 要自己做推論晶片?
大型 AI 服務的成本不只來自模型訓練,也來自每天持續發生的推論請求。若晶片能在相同電力下處理更多工作,或在相同工作量下降低延遲,服務商就有機會改善資料中心的容量與營運成本。這也是 Jalapeño 把每瓦效能與端到端延遲放在核心位置的原因。
OpenAI 表示,Jalapeño 從 AI 輔助設計到 tape-out 約花了 9 個月。這顯示模型可以參與硬體設計流程,但不等於晶片已經大規模量產,也不代表所有設計與驗證工作都能由 AI 自動完成。
目前可以確定的事
Jalapeño 的首批結果值得關注,因為它把 OpenAI 從單純使用 GPU 的服務商,推向設計推論基礎設施的角色。但截至目前,最準確的說法仍是「OpenAI 公布了一組自測結果」;要判斷是否能在更廣泛的模型、軟體與資料中心條件下重現,還要等更多透明測試與外部驗證。
