OpenAI की पहली "काली मिर्च" चिप Nvidia के GPT-6 को पछाड़ देती है और CUDA को क्रैश कर देती है

📅 2026-08-26

सार:

क्या आप विश्वास कर सकते हैं कि OpenAI के पहले चिप उत्पादन ने वास्तव में पूरी NVIDIA श्रृंखला को हरा दिया है? ! अभी, OpenAI की पहली स्व-विकसित चिप, जलापीनो ने मापा परिणामों का पहला बैच सौंपा - AI अनुमान प्रदर्शन, जो पूरी तरह से NVIDIA GB200 और GB300 को पार कर गया।



मापी गई गति से सीधे उड़ान भरें!

जलपीनो एक सेकंड में 1,459 टोकन उगल सकता है, जबकि एनवीडिया जीबी200 केवल 535 टोकन उगल सकता है, जो आधे से भी कम है।

"पेपर" को एक कार्य पूरा करने में केवल 1.65 सेकंड लगते हैं, लेकिन जीबी300 के लिए लगभग 6 सेकंड लगते हैं, यानी पूरे 3.6 गुना का अंतर।

सबसे क्रूर बात यह है कि भले ही GB300 को इसकी सबसे तेज़ डिकोडिंग गति के लिए मजबूर किया जाए, फिर भी जलेपीनो का थ्रूपुट इससे 104.3 गुना अधिक है।

जलपीनो की नाममात्र बिजली खपत केवल 700W है, जबकि GB300 की 1400W है, जो बिल्कुल आधी है।

प्रसिद्ध सेमीकंडक्टर विश्लेषक डायलन पटेल ने यहां तक ​​कठोर शब्दों में कहा, "यह सिर्फ ब्लैकवेल ही नहीं है जिसे उखाड़ फेंका गया है, यहां तक ​​कि एनवीडिया की रुबिन चिप को भी पीछे छोड़ दिया गया है"!


एक समय के लिए, पूरा एआई सर्कल फट गया। नेटिज़न्स को आश्चर्य हुआ कि ओपनएआई इतना पागल था कि एनवीडिया भी हार गया।

अल्ट्रामैन का बयान दबंग लेकिन संयमित था, "हमने एक चिप बनाई, यह हास्यास्पद रूप से तेज़ है"!



01

एक "मिर्च मिर्च" ने एनवीडिया के फ्लैगशिप को पलट दिया

यह OpenAI अपने बारे में बात नहीं कर रहा है।

सेमीएनालिसिस वास्तविक माप के लिए प्रयोगशाला में गया, और उन्होंने जो निष्कर्ष लिखा वह है——

जलापीनो ने उन सभी एनवीडिया, एएमडी और गूगल चिप को हरा दिया जिनका उन्होंने पहले परीक्षण किया था।

अंतर कितना बड़ा है? एनवीडिया का नवीनतम वेरा रुबिन लगभग तीन जलापीनो को खिलाने के लिए पर्याप्त बिजली की खपत करता है।


परीक्षण के दौरान, OpenAI ने चलाने के लिए तीन सार्वजनिक मॉडल चुने: GPT-OSS 120B, और एक 670B और 1T मॉडल।

परीक्षण के इस दौर में मध्यम से ट्रिलियन मापदंडों तक MoE आर्किटेक्चर को शामिल किया गया है। समग्र परिणाम इस प्रकार हैं:

एआई वर्कलोड प्रति वाट 1.5-1.9 गुना बढ़ गया

एंड-टू-एंड विलंबता 1.7-3.6 गुना कम हुई

अत्यधिक इंटरैक्टिव कार्यभार पर 2.1–4.1x प्रदर्शन में सुधार


पहले उल्लिखित 1459 टोकन को जीपीटी-ओएसएस 120बी पर मापा गया था।

शब्द अंतराल में परिवर्तित, दो टोकन के बीच केवल 0.69 मिलीसेकंड है।

एक व्यक्ति आमतौर पर एक सेकंड में लगभग पांच या छह शब्द पढ़ता है, लेकिन वह एक सेकंड में 1,459 शब्द उगल देता है। आँखें टिक नहीं पातीं, और स्क्रीन उन्हें पढ़ नहीं पाती।


हरा जलेपीनो है, नीला सबसे मजबूत उपलब्ध है। तीनों मॉडल क्रमशः 2.7 गुना, 4.1 गुना और 3.8 गुना तेज हैं।

1.65 सेकंड और 5.99 सेकंड के बीच चार सेकंड के अंतर को चैट में सहन किया जा सकता है, लेकिन जब इसका उपयोग किसी एजेंट पर किया जाता है तो यह अलग बात है, क्योंकि किसी कार्य के लिए लगातार दर्जनों चरणों की आवश्यकता होती है, इसलिए अंतर को कई गुना बढ़ाने की आवश्यकता होती है।

तब कहा गया कि पूरा नेटवर्क 104.3 बार घूम रहा था.

इसका वास्तव में मतलब यह है कि GB300 को उसकी सबसे तेज़ डिकोडिंग गति, जो कि 169 टोकन प्रति सेकंड है, पर धकेलना है, उस समय, जलपीनो का थ्रूपुट उससे 104.3 गुना है।

यह प्रवृत्ति तीन मॉडलों के लिए सही है, GPT-OSS 53.7 गुना और 1T मॉडल 56.1 गुना तक पहुंच गया है।



उसी मॉडल के लिए, जैसे-जैसे आवश्यक शब्द उत्पादन गति बढ़ती है, अग्रणी मार्जिन 1.7 गुना से बढ़कर 104.3 गुना हो जाता है

दूसरे शब्दों में, वह स्थान जहां प्रतिद्वंद्वी अपनी सीमा तक पहुंच जाता है और हांफना शुरू कर देता है, ठीक वही स्थान है जहां वह अभी भी शांति से मंडरा रहा है।

यदि शिखर मूल्यों की गणना उनके संबंधित सर्वोत्तम कार्य बिंदुओं के आधार पर की जाती है, तो तीन मॉडलों के लिए अंतर क्रमशः 1.9 गुना, 1.7 गुना और 1.5 गुना होगा।


जो चीज वास्तव में दूरी पैदा करती है वह है हाई-इंटरैक्शन सीन


बाएं चित्र का क्षैतिज अक्ष शब्द आउटपुट गति है, और दाएं चित्र का क्षैतिज अक्ष पूर्ण अनुरोध का विलंब है। हरा जलेपीनो पूरे वक्र पर नीले GB200 को दबाता है

सेमीएनालिसिस बिजली की आपूर्ति, गर्मी अपव्यय और नेटवर्क को ध्यान में रखता है, और फिर इसे प्रत्येक चिप में फैलाता है।

परिणामस्वरूप, जलपीनो में 1.125 किलोवाट प्रति यूनिट, जीबी200 में 1.87 किलोवाट और वेरा रुबिन में 3.3 किलोवाट है।

इस कैलिबर पर GPT-OSS चलाते समय, जलपीनो प्रति सेकंड लगभग 53 मिलियन टोकन प्रति मेगावाट उगलता है, और GB200 NVL72 केवल 10 मिलियन ही उगलता है।


बैंगनी वाला जलापेनो है, क्षैतिज अक्ष इंटरेक्शन गति है, और ऊर्ध्वाधर अक्ष प्रति मेगावाट प्रति सेकंड निकलने वाले टोकन की संख्या है

लागत के संदर्भ में, जलपीनो के लिए प्रति चिप घंटे के स्वामित्व की कुल लागत $1.56 है, जो H100 के लिए लगभग $1.55 के समान है, जबकि वेरा रुबिन $3.61 है।


हरा वेरा रुबिन है, बैंगनी जलपीनो है। प्रति सेकंड 200 टोकन के बाद, बैंगनी उस स्थान पर चला गया जो हरे रंग की पहुंच से बाहर था

सबसे भयानक बात यह है कि ये परिणाम जलपीनो की पूरी ताकत नहीं हैं।

यह सट्टा डिकोडिंग और टोकन भविष्यवाणी को भी सक्षम नहीं करता है, न ही यह प्रीफ़िल और डिकोड की अलग-अलग तैनाती करता है। हालाँकि, तस्वीर में हर दूसरी चिप अपना स्वयं का इष्टतम कॉन्फ़िगरेशन चला रही है, और जो भी अनुकूलन सक्षम किया जाना चाहिए उनमें से कोई भी नहीं छोड़ा गया है।

सेमीएनालिसिस का अनुमान है कि केवल सट्टा डिकोडिंग से प्रति टोकन लागत 2/3 से अधिक कम हो सकती है।


एक जलापीनो "डूम स्लेयर" भी चला सकता है

02

नौ महीनों में, GPT‑Astra ने टेप-आउट रूम तक सभी तरह से काम किया

ऐसी चीज़ के लिए, डिज़ाइन से लेकर OpenAI के टेप-आउट तक में केवल नौ महीने लगे। इसकी तुलना में, उद्योग में एक सामान्य समय सीमा 18-36 महीने है।

जिस किसी ने ASIC किया है वह जानता है कि इस चक्र में सबसे कठिन काम सत्यापन है। सिमुलेशन को बार-बार चलाना पड़ता है, और यदि आप कोई स्थान बदलते हैं, तो आपको सब कुछ फिर से शुरू करना होगा।

ओपनएआई "धोखा" क्यों दे सकता है इसका कारण यह है कि यह अपने सबसे शक्तिशाली मॉडल को टेप-आउट रूम में आमंत्रित करता है——

जिस मॉडल ने जलापीनो को विकसित करने में मदद की, उसे जीपीटी-एस्ट्रा कहा जाता है, जो कि जीपीटी-6 है जिसके बारे में बाहरी दुनिया में अफवाह है!





पूरी प्रक्रिया के दौरान, GPT-एस्ट्रा मूल रूप से टीम का सबसे मजबूत समर्थन बन गया।

यह कार्यान्वयन समाधानों का पता लगाने में मदद करता है, पूरे "डिज़ाइन-माप-सत्यापन" सर्कल को समाप्त कर देता है, और अंकगणित सर्किट को सूक्ष्म रूप से हेरफेर भी करता है।

माइक्रोमैनेजिंग किस हद तक की जाती है? सेमीएनालिसिस द्वारा खोजे गए आंकड़े यह हैं कि एआई-सहायता प्राप्त डिज़ाइन SIMD इकाई क्षेत्र को 8% और मैट्रिक्स इंजन क्षेत्र को 10% तक कम कर देता है।

वहीं, ये मॉड्यूल समय और बिजली की खपत के मामले में पहले संस्करण से बेहतर हैं।


कंप्यूटिंग डाई केंद्र में है, प्रत्येक तरफ तीन HBM4s हैं, और सबसे ऊपर I/O चिप है

मुख्य गणना डाई लगभग 840 वर्ग मिलीमीटर है, और ईयूवी लिथोग्राफी मशीन की मुखौटा सीमा 858 वर्ग मिलीमीटर है। सिलिकॉन का यह टुकड़ा भौतिक छत से केवल 18 वर्ग मिलीमीटर दूर है।

यह कहा जा सकता है कि वह क्षेत्र जहां फोटोलिथोग्राफी मशीन का उपयोग ड्राइंग के लिए किया जा सकता है, मूल रूप से कब्जा कर लिया गया है, कुछ भी नहीं छोड़ रहा है।


गुलाबी पंक्ति जलपीनो है, और तीन सबसे दाहिने कॉलम एचबीएम बैंडविड्थ प्रति वाट, एफएलओपी प्रति वाट और कंप्यूटिंग पावर-टू-बैंडविड्थ अनुपात हैं

एचबीएम बैंडविड्थ प्रति वाट के संदर्भ में, जलपीनो 22 है, दूसरे स्थान पर रुबिन 11.1 है, और जीबी300 केवल 5.71 है। यह दूसरे स्थान से ठीक दोगुना ऊंचा है।

प्रति वाट फ्लॉप्स 19.1 है, और रुबिन 19.4 है। दोनों लगभग बंधे हुए हैं, लेकिन रुबिन 1,800 वॉट से अधिक जलता है, जबकि जलापीनो केवल 700 वॉट जलता है।

यह केवल A0 चरणों के साथ चल रहा है। B0 पहले से ही फैब में है, और इसका प्रति वाट प्रदर्शन A0 से लगभग 25% अधिक है।

इस तरह, कोडेक्स और जीपीटी-एस्ट्रा के शक्तिशाली संयोजन पर भरोसा करते हुए, ओपनएआई ने तीन ओपन सोर्स मॉडल को केवल दो महीनों में उच्च-प्रदर्शन वाले राज्य में बदल दिया, जिनकी मूल रूप से योजना नहीं बनाई गई थी।

इससे भी अधिक भयावह बात यह है कि सबसे अधिक प्रदर्शन-भूखे "ध्यान" और MoE मॉड्यूल में, AI द्वारा टाइप किया गया कोड शीर्ष मानव विशेषज्ञों की तुलना में 1.5 से 1.8 गुना तेजी से चलता है।

AI चिप को डिज़ाइन करता है, चिप AI चलाती है, और AI चिप पर AI को अनुकूलित करने के लिए वापस जाती है।

यह फ्लाईव्हील, ओपनएआई पहले से ही घूम रहा है।



CUDA खाई, मर गया?

NVIDIA की सबसे गहरी खाई हमेशा CUDA रही है।

पिछले दो दशकों में जमा हुए सॉफ़्टवेयर स्टैक ने दुनिया भर के इंजीनियरों की मांसपेशियों की स्मृति को विकसित किया है। हर बार जब हार्डवेयर बदला जाता है, तो उन्हें इसे तोड़ना पड़ता है और सब कुछ फिर से शुरू करना पड़ता है।

सेमीएनालिसिस ने लेख में एक बहुत ही कठोर निर्णय दिया, जिसमें कहा गया कि CUDA की खाई ख़त्म हो सकती है।


इसकी वजह है स्पीड.

उन्होंने एक अधिक दिल दहलाने वाली तुलना भी जोड़ी: एनवीडिया के रुबिन ने वास्तव में जलापीनो की तुलना में एक महीने पहले CoWoS टेपआउट पूरा किया।

लेकिन अब तक, रुबिन के एकमात्र परिणाम जो बाहरी दुनिया देख सकती है, वह CoreWeave इंजीनियरिंग नमूनों का डेटा है। एनवीडिया ओपनएआई की तरह यादृच्छिक परीक्षण के लिए तीसरे पक्ष को प्रयोगशाला में नहीं डालता है।

तो समस्या उस गति में है जिस गति से सॉफ़्टवेयर प्रारंभ होता है। NVIDIA के हार्डवेयर में कोई खराबी नहीं है।

शुरुआत से शुरू करने से OpenAI को भी फायदा मिलता है। इसे ऐतिहासिक बोझ उठाने की आवश्यकता नहीं है, और वास्तुकला को कागज की एक खाली शीट पर पूरी तरह से चित्रित किया जा सकता है।

सेमीएनालिसिस का अंतिम वाक्य बहुत ग्राफिक है——

वे कहते हैं कि NVIDIA GPU पर चलने वाले GPT-5.6 Sol जैसे OpenAI मॉडल का उपयोग एक चिप को डिजाइन करने के लिए किया गया है जो वास्तव में CUDA खाई के लिए खतरा है। NVIDIA के स्वयं के GPU वास्तविक समय में अपने स्वयं के "उत्तराधिकारियों" को जन्म दे रहे हैं।


03

10 गीगावाट, यह तो बस शुरुआत है

जलापीनो किसी मोर्चे पर पहला शॉट है।

पिछले साल अक्टूबर में, OpenAI और ब्रॉडकॉम ने एक बड़ा कदम उठाया और 10GW कस्टम एक्सेलेरेटर के लिए एक बड़े सहयोग आदेश पर हस्ताक्षर किए।


अल्ट्रामैन और ब्रॉडकॉम के सीईओ चेन फुयांग ने जलापीनो वेफर दिखाया, जिसकी नेमप्लेट पर लिखा था "जलापीनो इंटेलिजेंस प्रोसेसर"

10GW का स्तर पूरी क्षमता पर काम कर रहे दस परमाणु ऊर्जा संयंत्रों के लगभग बराबर है।


बाईं ओर सीपीयू मुख्य कैबिनेट, दाईं ओर एएसआईसी कैबिनेट, एक कैबिनेट में 128 चिप्स, दो कैबिनेट का कुल योग लगभग 160 किलोवाट है

वैसे, सीपीयू रखने वाली ट्रे को कात्सु कहा जाता है, चिप को विंदालू इंडियन करी कहा जाता है, और स्विच को चना छोला कहा जाता है। जापानी भोजन से लेकर मसालेदार भारतीय भोजन तक, ये लोग वास्तव में चाहते हैं कि आप इस प्रणाली को याद रखें।

और जलेपीनो रोडमैप पर केवल पहली पीढ़ी है, OpenAI ने रिपोर्ट में स्पष्ट रूप से कहा है——

Gen2 पहले से ही गहन विकास के अधीन है, और Gen3 भी आकार ले रहा है।

2027 तक बड़े पैमाने पर उत्पादन धीरे-धीरे नहीं बढ़ेगा, और अगला मील का पत्थर 100 मेगावाट है।


हालाँकि, आज ही, यह पता चला कि OpenAI के डेटा सेंटर मैनेजर, क्रिस मेलोन चले गए हैं!

मैलोन स्टारगेट का प्रमुख है।

अब, आईपीओ करीब और करीब आ रहा है। इस मोड़ पर, कंप्यूटिंग बुनियादी ढांचे के प्रमुख कमांडर की हानि लोगों को ओपनएआई के पीछे की अंतर्निहित धारा के बारे में आश्चर्यचकित करती है।


बेशक, एक जलापीनो एनवीडिया को उखाड़ फेंकने के लिए पर्याप्त नहीं है।

लेकिन वास्तविक खतरे का संकेत यह है कि OpenAI ने मॉडल, चिप्स और सॉफ़्टवेयर को एक त्वरित गति वाले फ्लाईव्हील में बदल दिया है।

आज का जलेपीनो केवल पहली पीढ़ी है, इसके बाद Gen2, Gen3 और 10GW कंप्यूटिंग पावर परिदृश्य है। भले ही मुख्य कार्यकारी चले जाएं, लेकिन यह इस मार्ग को आगे बढ़ने से नहीं रोक सकता।

एनवीडिया अभी भी सिंहासन पर बैठा है।

केवल इस बार, प्रतिस्थापन दरवाज़े के बाहर लाइन में नहीं लगा था, यह पहले से ही कंप्यूटर कक्ष में चला गया था।

एनवीडिया के प्रतिद्वंद्वियों ने अंततः अपना स्वयं का एनवीडिया बनाना शुरू कर दिया।

संबंधित टैग

संबंधित लेख

NVIDIA का प्रदर्शन अपेक्षाओं से अधिक है, Q2 राजस्व और लाभ दोगुना है, और अगले वित्तीय वर्ष में राजस्व में 70% की वृद्धि होने की उम्मीद है 2026-08-27 OpenAI "जलापीनो" चिप बेंचमार्क का खुलासा हुआ, तर्कपूर्ण प्रदर्शन NVIDIA फ्लैगशिप GPU से बेहतर है 2026-08-25 क्या राजस्व बढ़ाने के लिए एआई कंपनियों में निवेश करना है? जेन-ह्सुन हुआंग आलोचना का जवाब देते हैं 2026-08-27 एनवीडिया ने ओपनएआई ओहियो एआई पार्क के लिए 10.3 बिलियन अमेरिकी डॉलर का वादा किया है, उन्नयन का एक दौर 200 बिलियन अमेरिकी डॉलर का राजस्व ला सकता है 2026-08-27 OpenAI की "जलापीनो" चिप Nvidia को कड़ी टक्कर क्यों देगी? 2026-08-26 OpenAI की स्व-विकसित चिप ने एक महत्वपूर्ण सफलता हासिल की है: प्रतिक्रिया गति और ऊर्जा दक्षता ने Nvidia GB300 को पछाड़ दिया है 2026-08-26

टिप्पणियाँ

0/500
验证码
कोई टिप्पणी नहीं