NVIDIA ने हाल ही में अपने नवीनतम रुबिन जीपीयू आर्किटेक्चर का गहन विश्लेषण किया, जिसमें मल्टी-रैक, मल्टी-सिस्टम और डेटा सेंटर स्तरों पर बड़े पैमाने पर कंप्यूटिंग प्राप्त करने में अपनी प्रमुख सफलताओं का प्रदर्शन किया गया। कंपनी के प्रौद्योगिकी विकास में एक महत्वपूर्ण मील का पत्थर के रूप में, यह त्वरक विरल एनवीएफपी4 संचालन के तहत 50 पेटाफ्लॉप्स कंप्यूटिंग शक्ति प्रदान कर सकता है।

पूर्ण शक्ति पर, रुबिन जीपीयू 224 स्ट्रीमिंग मल्टीप्रोसेसर (एसएम) और 288 जीबी एचबीएम4 मेमोरी को एकीकृत करता है। 336 बिलियन ट्रांजिस्टर के साथ, एनवीडिया ने इसे तीसरी पीढ़ी के ट्रांसफार्मर इंजन के साथ 896 टेंसर कोर से भी सुसज्जित किया। विशाल कच्ची कंप्यूटिंग शक्ति को जारी करने के लिए, NVIDIA ने GPU संसाधनों को केंद्रीकृत L2 कैश के साथ ग्राफिक्स प्रोसेसर क्लस्टर में विभाजित किया है, जो वर्कफ़्लो को समन्वयित करने और संसाधन उपयोग को अनुकूलित करने के लिए GigaThread इंजन द्वारा पूरक है। इसके अलावा, एमआईजी नियंत्रण विभाजन सुविधा इस जीपीयू को कई वर्चुअल जीपीयू में विभाजित करने की अनुमति देती है, जो आधुनिक सीपीयू वर्चुअल कोर को संभालने के समान काम करता है।

मेमोरी कॉन्फ़िगरेशन के संदर्भ में, एनवीडिया ने 12-लेयर स्टैक्ड मॉड्यूल के माध्यम से 288 जीबी एचबीएम4 मेमोरी प्रदान करने के लिए मेमोरी पार्टनर्स के साथ काम किया। समर्पित एचबीएम नियंत्रक 22 टीबी प्रति सेकंड तक की अधिकतम मेमोरी बैंडविड्थ प्राप्त करने के लिए भौतिक परत के साथ सहयोग करता है, जो उद्योग में बेहद प्रतिस्पर्धी है। डेटा ट्रांसफर दक्षता में सुधार के लिए इसके टेंसर मेमोरी मैनेजर को अपग्रेड किया गया है, जबकि संपूर्ण GPU का ऊर्ध्वाधर विस्तार और संचार पूरी तरह से NVLink 6 द्वारा प्रबंधित किया जाता है। NVLink 6 के साथ, पूरी तरह से इंटरकनेक्टेड GPU संचार की आर्किटेक्चरल बैंडविड्थ 3600 जीबी प्रति सेकंड तक पहुंच जाती है, जबकि NVLink-C2C चिप-टू-चिप इंटरकनेक्ट तकनीक 1800 जीबी प्रति सेकंड सीपीयू-जीपीयू संचार बैंडविड्थ प्राप्त करती है। एनवीडिया में बाहरी उपकरणों के साथ डेटा विनिमय के लिए 256 जीबी प्रति सेकंड बैंडविड्थ के साथ एक अंतर्निहित PCIe Gen 6 स्विच भी है।

स्केल-अप संचार NVIDIA की मुख्य शक्तियों में से एक है, जो GPU को रैक-स्केल सिस्टम में अन्य GPU के साथ कुशलतापूर्वक और निर्बाध रूप से संचार करने में सक्षम बनाता है। पारंपरिक अंतर-जीपीयू संचार के लिए अक्सर समन्वय और सिंक्रनाइज़ेशन की आवश्यकता होती है, जिसके परिणामस्वरूप सिस्टम डेटा ट्रांसमिशन के इंतजार में रुक जाता है। इस समस्या को दूर करने के लिए, रुबिन आर्किटेक्चर एक डिवाइस-आरंभित संचार तंत्र पेश करता है, जो प्रत्येक जीपीयू को स्वतंत्र रूप से डेटा ट्रांसमिशन का प्रबंधन करने की अनुमति देता है, इस प्रकार बाहरी अनुकूलन की आवश्यकता को समाप्त करता है और विलंबता को प्रभावी ढंग से कम करता है।

ऐसी उच्च-प्रदर्शन प्रणालियाँ अक्सर भारी बिजली खपत के साथ होती हैं, और एक एकल NVL72 रैक 72 GPU को एकीकृत करता है। वेरा रुबिन NVL72 सिस्टम के लिए, NVIDIA ने बुद्धिमान पावर स्मूथिंग तकनीक विकसित की है जो सभी सिस्टम घटकों को एक ही निश्चित पावर लिफाफे में एकीकृत करती है। उदाहरण के लिए, कृत्रिम बुद्धिमत्ता वर्कलोड चलाते समय, सीपीयू से पूरी तरह से लोड किए गए जीपीयू की प्रतीक्षा में निष्क्रिय अवस्थाओं के बीच बिजली की आवश्यकताओं में बेतहाशा उतार-चढ़ाव हो सकता है। इंटेलिजेंट पावर स्मूथिंग तकनीक के माध्यम से, पिछली पीढ़ी के ग्रेस ब्लैकवेल एनवीएल72 की तुलना में वेरा रुबिन एनवीएल72 सिस्टम की औसत बिजली खपत लगभग 10% कम हो जाती है, और अधिकतम 50 मिलीसेकंड बिजली लगभग 20% कम हो जाती है। इसका पावर बजट अनुकूलन NVIDIA DSX MaxLPS तकनीक द्वारा समर्थित है।