你敢信,OpenAI第一次做芯片,竟然把英偉達全系幹趴下了?!

就在啱啱,OpenAI首顆自研芯片Jalapeño「墨西哥辣椒」,交出了首批實測成績單——
AI推理性能,全面反超英偉達GB200和GB300。

實測速度直接起飛!
Jalapeño一秒能狂吐1459個Token,英偉達GB200只有535個,連一半都不到。
「辣椒」跑完一個任務只要1.65秒,GB300卻得花將近6秒,整整3.6倍的差距。
最狠的是,哪怕把GB300逼到它自己最快的解碼速度,Jalapeño的吞吐也依然是它的104.3倍。
而Jalapeño的標稱功耗只有700W,GB300是1400W,整整一半。
著名半導體分析師Dylan Patel更是直接放出狠話,「被掀翻的不只是Blackwell,就連英偉達Rubin芯片也被超越了」!

一時間,整個AI圈都炸了。網友們紛紛驚歎,OpenAI簡直殺瘋,英偉達也被擊敗了。
奧特曼的表態則是霸氣又剋制,「我們造了一顆芯片,快得離譜」!


01
一顆「辣椒」,幹翻了英偉達旗艦
這可不是OpenAI自說自話。
SemiAnalysis鑽進實驗室實測了一趟,寫下的結論是——
Jalapeño把他們此前測過的每一顆英偉達、AMD、谷歌的芯片,全乾趴下了。
差距有多大?英偉達最新那顆Vera Rubin喫掉的電,夠喂將近三顆Jalapeño。

測試中,OpenAI挑了三個公開模型來跑:GPT-OSS 120B,還有一款670B和1T的模型。
這一輪測試,覆蓋了從中型到萬億參數的MoE架構。整體結果如下:
每瓦特AI工作負載提升1.5–1.9倍
端到端延遲降低1.7–3.6倍
在高度交互式工作負載上,性能提升2.1–4.1倍

前面提及的1459個Token/s,是在GPT-OSS 120B上測的。
換算成出詞間隔,兩個Token之間只隔0.69毫秒。
人正常朗讀一秒鐘大概吐五六個字,而它一秒甩出1459個,眼睛跟不上,螢幕也刷不過來。

綠色是Jalapeño,藍色是現有最強。三個模型上分別快2.7倍、4.1倍和3.8倍
1.65秒對5.99秒的那四秒差距,放在聊天裏還能忍,放到Agent身上就是另一回事,因為一個任務要連着走幾十步,差值是要乘上去的。
然後說那個全網都在轉的104.3倍。
它的準確意思是,把GB300推到自己最快的解碼速度,也就是每秒169個Token,在那一個點上,Jalapeño的吞吐是它的104.3倍。
三個模型上都是這個走勢,GPT-OSS到53.7倍,1T模型到56.1倍。


同一個模型,隨着要求的出詞速度往上抬,領先幅度從1.7倍一路漲到104.3倍
換句話說,對手跑到極限開始喘的地方,正是它還在從容巡航的地方。
如果按各自最好的工作點算峯值,差距會溫和很多,三個模型上分別是1.9倍、1.7倍和1.5倍。

真正拉開距離的是高交互場景

左圖橫軸是出詞速度,右圖橫軸是完整請求的延遲。綠色的Jalapeño在整條曲線上都壓着藍色的GB200
SemiAnalysis這邊,則是把供電、散熱、網絡全算進去,然後再攤到每顆芯片頭上。
結果,Jalapeño每顆1.125千瓦,GB200是1.87千瓦,而Vera Rubin是3.3千瓦。
在這個口徑下跑GPT-OSS,Jalapeño每兆瓦每秒吐出約5300萬個Token,GB200 NVL72只有約1000萬。

紫色那條一騎絕塵的就是Jalapeño,橫軸是交互速度,縱軸是每兆瓦每秒吐出的Token數
成本方面,每芯片每小時的總擁有成本,Jalapeño是1.56美元,跟H100的1.55美元幾乎一樣,而Vera Rubin是3.61美元。

綠色是Vera Rubin,紫色是Jalapeño。過了每秒200個Token,紫色一路走到綠色夠不到的地方
最要命的是,這些成績還不是Jalapeño的全部實力。
它連投機解碼和Token預測都沒開,也沒做prefill和decode的分離部署,而圖上其他每顆芯片跑的都是各自最優配置,該開的優化一個不落。
SemiAnalysis估算,光投機解碼這一項就能把每Token成本再壓掉2/3以上。

一顆Jalapeño,還能跑起「毀滅戰士」
02
九個月,GPT‑Astra一路幹到了流片室
這麼一顆東西,從設計到流片OpenAI只用了九個月。相比之下,業內常見的時間是18-36個月。
做過ASIC的都知道,這個周期裏最磨人的活是驗證。仿真得一輪輪重跑,改一個地方就得從頭再來。
OpenAI之所以能「開掛」,是因為它把自家最強的模型請進了流片室——
協助開發Jalapeño的模型叫GPT-Astra,也就是外界一直在傳的GPT-6!
|
|
在整個過程裏,GPT-Astra基本上成了團隊的最強輔助。
它幫着探索實現方案,把「設計-測量-驗證」這一整圈往死裏壓,還順手微操了算術電路。
微操到什麼程度呢?SemiAnalysis挖到的數字是,AI輔助設計讓SIMD單元面積減少8%,矩陣引擎面積減少10%。
同時,這些模塊在時序和功耗上都比初版更好。

計算die居中,兩側各三顆HBM4,上方那條是I/O小芯片
主計算die約840平方毫米,而EUV光刻機的掩模版極限是858平方毫米,這塊硅離物理天花板只差18平方毫米。
可以說,基本上把光刻機能畫的地方佔滿了,一點沒留。

粉色那行是Jalapeño,最右邊三列是每瓦HBM帶寬、每瓦FLOPs和算力帶寬比
每瓦HBM帶寬這一項,Jalapeño是22,第二名Rubin是11.1,GB300只有5.71。它比第二名高出整整一倍。
而每瓦FLOPs它是19.1,Rubin是19.4,兩者幾乎打平,可Rubin要燒1800瓦以上,Jalapeño只要700瓦。
這還只是用A0步進跑的。B0已經在晶圓廠裏了,每瓦性能比A0還要再高約25%。
就這樣,靠着Codex加GPT-Astra這對王炸組合,OpenAI在短短兩個月內,把三個原本壓根沒排進計劃的開源模型,一路爆改到了高性能狀態。
更嚇人的是,在最喫性能的「注意力」和MoE模塊上,AI手敲的代碼跑起來,直接比人類頂尖專家快了1.5到1.8倍。
AI設計芯片,芯片跑AI,AI再回頭優化芯片上的AI。
這個飛輪,OpenAI已經轉起來了。


CUDA護城河,死了?
一直以來,英偉達最深的護城河一直是CUDA。
將近二十年攢下來的軟件棧養出了全世界工程師的肌肉記憶,換一次硬件就得推倒重來。
而SemiAnalysis在文章裏下了一句相當重的判斷,說CUDA的護城河可能已經死了。

理由,就是速度。
他們還補了一個更扎心的對照,英偉達的Rubin其實比Jalapeño早一個月完成CoWoS流片。
可到現在為止,外界能看到的Rubin成績只有CoreWeave工程樣片那點數據,英偉達並沒有像OpenAI這樣把第三方放進實驗室隨便測。
所以問題出在軟件起步的速度上,英偉達的硬件本身沒毛病。
而從零開始甚至還讓OpenAI佔了便宜,不用背歷史包袱,架構可以完全按白紙來畫。
SemiAnalysis最後那句寫得很有畫面感——
他們說GPT-5.6 Sol這類跑在英偉達GPU上的OpenAI模型,被用來設計了一顆真正威脅CUDA護城河的芯片,英偉達自己的GPU正在實時催生自己的「接班人」。

03
10吉瓦,這纔剛開場
Jalapeño只是一條戰線的第一槍。
去年10月,OpenAI和博通搞了個大動作,簽了個10GW定製加速器的合作大單。

奧特曼和博通CEO陳福陽一起展示Jalapeño晶圓,銘牌上寫着「Jalapeño Intelligence Processor」
10GW量級,差不多相當於十座核電機組滿發。

左邊CPU主機櫃,右邊ASIC櫃,一櫃128顆芯片,兩櫃合計約160千瓦
順便說,裝CPU的托盤叫Katsu日式炸豬排,裝芯片的叫Vindaloo印度咖喱,交換機叫Chana鷹嘴豆,從日本菜一路辣到印度菜,這幫人是真想讓你記住這套系統。
而Jalapeño只是路線圖上的第一代,OpenAI在報告裏寫得明明白白——
Gen2已經在深度開發,Gen3也正在成形。
量產要到2027年才逐步爬坡,下一個里程碑是100兆瓦。

不過,就在今天,OpenAI還被爆出,數據中心大總管Chris Malone走了!
Malone可是負責「星際之門」(Stargate)的掌門人。
如今,IPO越來越近,在這個節骨眼上,失去算力基礎設施的關鍵統帥,不禁讓人對OpenAI背後的暗流湧動浮想聯翩。

當然,一顆Jalapeño,還不足以掀翻英偉達。
但真正危險的信號在於,OpenAI已經把模型、芯片和軟件擰成了一個加速飛輪。
今天的Jalapeño只是第一代,後面還有Gen2、Gen3,以及10GW的算力版圖。哪怕核心高管離場,也擋不住這條路線繼續向前。
英偉達依然坐在王座上。
只是這一次,替代者沒有在門外排隊,它已經跑進了機房。
英偉達的對手,終於開始自己造英偉達了。

