OpenAI首顆「辣椒」芯片壓倒英偉達!GPT-6幹崩CUDA

新智元
6小時前

你敢信,OpenAI第一次做芯片,竟然把英偉達全系幹趴下了?!

就在啱啱,OpenAI首顆自研芯片Jalapeño「墨西哥辣椒」,交出了首批實測成績單——

AI推理性能,全面反超英偉達GB200和GB300。

實測速度直接起飛!

Jalapeño一秒能狂吐1459個Token,英偉達GB200只有535個,連一半都不到。

「辣椒」跑完一個任務只要1.65秒,GB300卻得花將近6秒,整整3.6倍的差距。

最狠的是,哪怕把GB300逼到它自己最快的解碼速度,Jalapeño的吞吐也依然是它的104.3倍。

而Jalapeño的標稱功耗只有700W,GB300是1400W,整整一半。

著名半導體分析師Dylan Patel更是直接放出狠話,「被掀翻的不只是Blackwell,就連英偉達Rubin芯片也被超越了」!

一時間,整個AI圈都炸了。網友們紛紛驚歎,OpenAI簡直殺瘋,英偉達也被擊敗了。

奧特曼的表態則是霸氣又剋制,「我們造了一顆芯片,快得離譜」!

01

一顆「辣椒」,幹翻了英偉達旗艦

這可不是OpenAI自說自話。

SemiAnalysis鑽進實驗室實測了一趟,寫下的結論是——

Jalapeño把他們此前測過的每一顆英偉達、AMD谷歌的芯片,全乾趴下了。

差距有多大?英偉達最新那顆Vera Rubin喫掉的電,夠喂將近三顆Jalapeño。

測試中,OpenAI挑了三個公開模型來跑:GPT-OSS 120B,還有一款670B和1T的模型。

這一輪測試,覆蓋了從中型到萬億參數的MoE架構。整體結果如下:

每瓦特AI工作負載提升1.5–1.9倍

端到端延遲降低1.7–3.6倍

在高度交互式工作負載上,性能提升2.1–4.1倍

前面提及的1459個Token/s,是在GPT-OSS 120B上測的。

換算成出詞間隔,兩個Token之間只隔0.69毫秒。

人正常朗讀一秒鐘大概吐五六個字,而它一秒甩出1459個,眼睛跟不上,螢幕也刷不過來。

綠色是Jalapeño,藍色是現有最強。三個模型上分別快2.7倍、4.1倍和3.8倍

1.65秒對5.99秒的那四秒差距,放在聊天裏還能忍,放到Agent身上就是另一回事,因為一個任務要連着走幾十步,差值是要乘上去的。

然後說那個全網都在轉的104.3倍。

它的準確意思是,把GB300推到自己最快的解碼速度,也就是每秒169個Token,在那一個點上,Jalapeño的吞吐是它的104.3倍。

三個模型上都是這個走勢,GPT-OSS到53.7倍,1T模型到56.1倍。

同一個模型,隨着要求的出詞速度往上抬,領先幅度從1.7倍一路漲到104.3倍

換句話說,對手跑到極限開始喘的地方,正是它還在從容巡航的地方。

如果按各自最好的工作點算峯值,差距會溫和很多,三個模型上分別是1.9倍、1.7倍和1.5倍。

真正拉開距離的是高交互場景

左圖橫軸是出詞速度,右圖橫軸是完整請求的延遲。綠色的Jalapeño在整條曲線上都壓着藍色的GB200

SemiAnalysis這邊,則是把供電、散熱、網絡全算進去,然後再攤到每顆芯片頭上。

結果,Jalapeño每顆1.125千瓦,GB200是1.87千瓦,而Vera Rubin是3.3千瓦。

在這個口徑下跑GPT-OSS,Jalapeño每兆瓦每秒吐出約5300萬個Token,GB200 NVL72只有約1000萬。

紫色那條一騎絕塵的就是Jalapeño,橫軸是交互速度,縱軸是每兆瓦每秒吐出的Token數

成本方面,每芯片每小時的總擁有成本,Jalapeño是1.56美元,跟H100的1.55美元幾乎一樣,而Vera Rubin是3.61美元。

綠色是Vera Rubin,紫色是Jalapeño。過了每秒200個Token,紫色一路走到綠色夠不到的地方

最要命的是,這些成績還不是Jalapeño的全部實力。

它連投機解碼和Token預測都沒開,也沒做prefill和decode的分離部署,而圖上其他每顆芯片跑的都是各自最優配置,該開的優化一個不落。

SemiAnalysis估算,光投機解碼這一項就能把每Token成本再壓掉2/3以上。

一顆Jalapeño,還能跑起「毀滅戰士」

02

九個月,GPT‑Astra一路幹到了流片室

這麼一顆東西,從設計到流片OpenAI只用了九個月。相比之下,業內常見的時間是18-36個月。

做過ASIC的都知道,這個周期裏最磨人的活是驗證。仿真得一輪輪重跑,改一個地方就得從頭再來。

OpenAI之所以能「開掛」,是因為它把自家最強的模型請進了流片室——

協助開發Jalapeño的模型叫GPT-Astra,也就是外界一直在傳的GPT-6!

在整個過程裏,GPT-Astra基本上成了團隊的最強輔助。

它幫着探索實現方案,把「設計-測量-驗證」這一整圈往死裏壓,還順手微操了算術電路。

微操到什麼程度呢?SemiAnalysis挖到的數字是,AI輔助設計讓SIMD單元面積減少8%,矩陣引擎面積減少10%。

同時,這些模塊在時序和功耗上都比初版更好。

計算die居中,兩側各三顆HBM4,上方那條是I/O小芯片

主計算die約840平方毫米,而EUV光刻機的掩模版極限是858平方毫米,這塊硅離物理天花板只差18平方毫米。

可以說,基本上把光刻機能畫的地方佔滿了,一點沒留。

粉色那行是Jalapeño,最右邊三列是每瓦HBM帶寬、每瓦FLOPs和算力帶寬比

每瓦HBM帶寬這一項,Jalapeño是22,第二名Rubin是11.1,GB300只有5.71。它比第二名高出整整一倍。

而每瓦FLOPs它是19.1,Rubin是19.4,兩者幾乎打平,可Rubin要燒1800瓦以上,Jalapeño只要700瓦。

這還只是用A0步進跑的。B0已經在晶圓廠裏了,每瓦性能比A0還要再高約25%。

就這樣,靠着Codex加GPT-Astra這對王炸組合,OpenAI在短短兩個月內,把三個原本壓根沒排進計劃的開源模型,一路爆改到了高性能狀態。

更嚇人的是,在最喫性能的「注意力」和MoE模塊上,AI手敲的代碼跑起來,直接比人類頂尖專家快了1.5到1.8倍。

AI設計芯片,芯片跑AI,AI再回頭優化芯片上的AI。

這個飛輪,OpenAI已經轉起來了。

CUDA護城河,死了?

一直以來,英偉達最深的護城河一直是CUDA。

將近二十年攢下來的軟件棧養出了全世界工程師的肌肉記憶,換一次硬件就得推倒重來。

而SemiAnalysis在文章裏下了一句相當重的判斷,說CUDA的護城河可能已經死了。

理由,就是速度。

他們還補了一個更扎心的對照,英偉達的Rubin其實比Jalapeño早一個月完成CoWoS流片。

可到現在為止,外界能看到的Rubin成績只有CoreWeave工程樣片那點數據,英偉達並沒有像OpenAI這樣把第三方放進實驗室隨便測。

所以問題出在軟件起步的速度上,英偉達的硬件本身沒毛病。

而從零開始甚至還讓OpenAI佔了便宜,不用背歷史包袱,架構可以完全按白紙來畫。

SemiAnalysis最後那句寫得很有畫面感——

他們說GPT-5.6 Sol這類跑在英偉達GPU上的OpenAI模型,被用來設計了一顆真正威脅CUDA護城河的芯片,英偉達自己的GPU正在實時催生自己的「接班人」。

03

10吉瓦,這纔剛開場

Jalapeño只是一條戰線的第一槍。

去年10月,OpenAI和博通搞了個大動作,簽了個10GW定製加速器的合作大單。

奧特曼和博通CEO陳福陽一起展示Jalapeño晶圓,銘牌上寫着「Jalapeño Intelligence Processor」

10GW量級,差不多相當於十座核電機組滿發。

左邊CPU主機櫃,右邊ASIC櫃,一櫃128顆芯片,兩櫃合計約160千瓦

順便說,裝CPU的托盤叫Katsu日式炸豬排,裝芯片的叫Vindaloo印度咖喱,交換機叫Chana鷹嘴豆,從日本菜一路辣到印度菜,這幫人是真想讓你記住這套系統。

而Jalapeño只是路線圖上的第一代,OpenAI在報告裏寫得明明白白——

Gen2已經在深度開發,Gen3也正在成形。

量產要到2027年才逐步爬坡,下一個里程碑是100兆瓦。

不過,就在今天,OpenAI還被爆出,數據中心大總管Chris Malone走了!

Malone可是負責「星際之門」(Stargate)的掌門人。

如今,IPO越來越近,在這個節骨眼上,失去算力基礎設施的關鍵統帥,不禁讓人對OpenAI背後的暗流湧動浮想聯翩。

當然,一顆Jalapeño,還不足以掀翻英偉達。

但真正危險的信號在於,OpenAI已經把模型、芯片和軟件擰成了一個加速飛輪。

今天的Jalapeño只是第一代,後面還有Gen2、Gen3,以及10GW的算力版圖。哪怕核心高管離場,也擋不住這條路線繼續向前。

英偉達依然坐在王座上。

只是這一次,替代者沒有在門外排隊,它已經跑進了機房。

英偉達的對手,終於開始自己造英偉達了。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10