NVIDIA के ब्लैकवेल GB300 और GB200 ग्राफिक्स प्रोसेसर निरंतर तकनीकी अनुकूलन के माध्यम से विभिन्न कृत्रिम बुद्धिमत्ता वर्कलोड में अग्रणी प्रदर्शन प्रदर्शित करना जारी रखते हैं। जैसे-जैसे दुनिया भर में AI प्लेटफ़ॉर्म की नई पीढ़ी तैनात की जा रही है, बाहरी दुनिया ने अनुमान लगाया होगा कि NVIDIA अपना ध्यान रुबिन आर्किटेक्चर पर स्थानांतरित कर देगा। हालाँकि, यह पता चला है कि ब्लैकवेल श्रृंखला, जिसे वर्ष के हॉपर आर्किटेक्चर की तरह अनगिनत डेटा केंद्रों में अभ्यास में लाया गया है, अभी भी निरंतर सॉफ़्टवेयर अपग्रेड के माध्यम से अद्भुत क्षमता जारी कर रही है। उनमें से, GB300 कृत्रिम बुद्धिमत्ता कंप्यूटिंग कार्यों में नई प्रदर्शन ऊँचाइयाँ स्थापित करना जारी रखता है।

NVIDIA द्वारा जारी आधिकारिक आंकड़ों के अनुसार, ब्लैकवेल प्लेटफॉर्म के निरंतर अनुकूलन ने समग्र प्रदर्शन और ऊर्जा दक्षता अनुपात में काफी सुधार किया है। केवल 3 महीनों में, NVIDIA ने डीपसीक R1 0528 - 1K/1K वर्कलोड चलाने वाले समान GB200 NVL72 कॉन्फ़िगरेशन पर प्रति मेगावाट थ्रूपुट 4 गुना तक बढ़ा दिया। इस दौरान, कंपनी ने 250,000 से अधिक सिमुलेशन कॉन्फ़िगरेशन चलाकर और कुल 1.4 मिलियन जीपीयू परीक्षण घंटों का उपभोग करके ब्लैकवेल प्लेटफ़ॉर्म में 38 प्रमुख अनुकूलन जोड़े। उल्लेखनीय है कि 90% से अधिक अनुकूलन परिणाम अन्य कृत्रिम बुद्धिमत्ता मॉडल पर लागू किए जा सकते हैं, जो मौजूदा एआई प्लेटफार्मों में गहरे निवेश को बनाए रखने के लिए एनवीआईडीआईए की प्रतिबद्धता को पूरी तरह से प्रदर्शित करता है क्योंकि नए प्लेटफॉर्म धीरे-धीरे अधिक लोकप्रिय हो जाते हैं।

दूसरी ओर, NVIDIA का GB300 "ब्लैकवेल अल्ट्रा" प्लेटफॉर्म कृत्रिम बुद्धिमत्ता प्रशिक्षण के क्षेत्र में अपना दबदबा बनाए हुए है। डीपसीक-वी3 671बी मॉडल को चलाने के लिए 256 जीपीयू का उपयोग करते समय, इसके मेगेट्रॉन कोर कोर ने जीबी200 606 टेरॉप्स की तुलना में 3x प्रदर्शन छलांग हासिल करते हुए, प्रति जीपीयू 1,648 टेरोप्स का आश्चर्यजनक रिकॉर्ड बनाया। DeepSeek-V3 671B को प्री-ट्रेन करने के लिए GB300 NVL72 का उपयोग करने से प्रति GPU 1648 टेरोप्स की विश्व-रिकॉर्ड ऑपरेटिंग दक्षता प्राप्त हो सकती है, जिससे समान प्रशिक्षण कार्य को हार्डवेयर पैमाने के केवल एक अंश के साथ दिए गए प्रदर्शन को प्राप्त करने की अनुमति मिलती है। वहीं, लगातार अनुकूलन के बाद पिछले 6 महीनों में उसी GB300 NVL72 सिस्टम का प्रदर्शन भी 1.5 गुना तक बढ़ गया है।
इसके अलावा, NVIDIA ने अपने कृत्रिम बुद्धिमत्ता उत्पाद मैट्रिक्स में विभिन्न अनुकूलन परिणामों के पूर्ण कार्यान्वयन को बढ़ावा देने के लिए PyTorch और JAX ओपन सोर्स समुदाय के साथ गहन सहयोग भी शुरू किया है। PyTorch के मूल प्रशिक्षण स्टैक TorchTitan का उपयोग करके DeepSeek-V3 671B मॉडल चलाने पर, ब्लैकवेल अल्ट्रा रैक ने बिना किसी प्रारंभिक अनुकूलन के 6x तक प्रदर्शन सुधार हासिल किया। JAX फ्रेमवर्क ने और भी अधिक महत्वपूर्ण वृद्धि हासिल की है। इसकी गति 1025 टेरोप्स प्रति जीपीयू तक बढ़ गई है, और एक जीपीयू का थ्रूपुट 4082 टोकन प्रति सेकंड तक पहुंच सकता है। इस साल जनवरी में बेसलाइन की तुलना में इसने 10 गुना की प्रदर्शन छलांग हासिल की है।





इतना ही नहीं, NVIDIA ने प्री-ट्रेनिंग के लिए सभी मुख्यधारा ढांचे में 256 से 1024 जीपीयू तक विश्व स्तरीय स्केलिंग प्रदर्शन भी हासिल किया है। 1024 जीपीयू के पैमाने तक पहुंचने पर, मेगेट्रॉन कोर 98.5% तक की विस्तार दक्षता बनाए रख सकता है, जबकि टॉर्चटाइटन और जेएक्स फ्रेमवर्क की विस्तार दक्षता भी 97% के स्तर को बनाए रखती है। इस उत्कृष्ट विस्तार प्रदर्शन का समर्थन करने वाला मुख्य घटक प्रत्येक NVL72 रैक के अंदर एकीकृत NVIDIA 800Gb/s स्केल-आउट नेटवर्क चिप है। मॉडल प्रशिक्षण से लेकर अनुमान परिनियोजन तक, NVIDIA कृत्रिम बुद्धिमत्ता के क्षेत्र में लगातार नए मानक स्थापित कर रहा है। रुबिन प्लेटफ़ॉर्म पहले से ही बाज़ार में है और बेहतर प्रदर्शन लाभ ला रहा है, अन्य प्रतिस्पर्धियों को निस्संदेह पकड़ने के लिए काफी दबाव का सामना करना पड़ रहा है।