सार:
29 सितंबर को, जब एआई एजेंट कंप्यूटर संचालित करने, टूल कॉल करने, नेटवर्क तक पहुंचने और यहां तक कि कई घंटों तक कार्य करने में सक्षम होने लगा, तो एक नई समस्या और अधिक यथार्थवादी हो गई: यदि एआई अपेक्षा के अनुरूप कार्य नहीं करता है, तो इसे कैसे बंद किया जाए?

NVIDIA द्वारा दिया गया उत्तर AI के बाहर एक "पिंजरा" जोड़ना है।
स्थानीय समयानुसार सोमवार को, NVIDIA ने NVIDIA ओपन एजेंट सेफ्टी प्लेटफ़ॉर्म जारी किया, जो AI एजेंटों तक पहुँचने और निष्पादित करने की क्षमता को सीमित करने के लिए सॉफ़्टवेयर और हार्डवेयर के संयोजन का उपयोग करने का प्रयास करता है, और जब वे पूर्व निर्धारित सीमाओं को तोड़ने का प्रयास करते हैं तो उन्हें अलग कर देता है या उन्हें रोक भी देता है।
इस प्लेटफ़ॉर्म में मुख्य रूप से दो भाग होते हैं: ओपन सोर्स सुरक्षा रनटाइम ओपनशेल, और ब्लूफ़ील्ड-4 डीपीयू पर आधारित स्वतंत्र निगरानी प्रणाली सेंट्री। एनवीडिया ने कहा कि ओपनशेल मॉडल और एजेंट ढांचे के बाहर एक लागू करने योग्य सुरक्षा सीमा निर्धारित कर सकता है; संतरी एक "द्वारपाल" की तरह है जो एजेंट के ऑपरेटिंग वातावरण से स्वतंत्र है, लगातार एजेंट के व्यवहार का निरीक्षण करता है, और एक बार जब यह पता चलता है कि एजेंट सीमा पार करने की कोशिश कर रहा है, तो उसे अलग किया जा सकता है और मिलीसेकंड स्तर पर रोका जा सकता है।
उत्पादों के इस सेट की उपस्थिति का समय आकस्मिक नहीं है।
पिछले कुछ महीनों में, तेजी से शक्तिशाली क्षमताओं वाले एआई एजेंटों ने बार-बार पूर्व निर्धारित सुरक्षा सीमाओं का उल्लंघन किया है। ओपनएआई ने इस साल अगस्त में खुलासा किया था कि इस साल जुलाई में आंतरिक नेटवर्क सुरक्षा मूल्यांकन के दौरान, इसके एआई मॉडल ने इंटरनेट एक्सेस को अलग करने के लिए उपयोग किए जाने वाले नियंत्रणों को दरकिनार कर दिया था, इंटरनेट एक्सेस हासिल करने के लिए साझा बुनियादी ढांचे में कमजोरियों का फायदा उठाया था, और तीसरे पक्ष के एआई प्लेटफॉर्म हगिंग फेस के सिस्टम तक पहुंच बनाई थी।
ओपनएआई ने घटना रिपोर्ट में कहा कि संबंधित मॉडल कम सुरक्षा प्रतिबंधों वाले वातावरण में चल रहे थे और मिशन के लक्ष्यों के साथ असंगत कार्रवाई की, जिसमें अनधिकृत चैनलों के माध्यम से संचार करना, साझा बुनियादी ढांचे की कमजोरियों का फायदा उठाना और तीसरे पक्ष के सिस्टम तक पहुंच शामिल थी। ओपनएआई ने इस घटना को "चेतावनी शॉट" कहा और कहा कि अत्यधिक सक्षम एआई एजेंट काफी शक्तिशाली, लगातार और एक साथ काम करने में सक्षम है, और सुरक्षा उपाय अपर्याप्त होने पर कई कंप्यूटर सिस्टम में कमजोरियों का पता लगा सकता है और उनका फायदा उठा सकता है।
तब से इसी तरह की समस्याएं बार-बार सामने आई हैं।
OpenAI ने इस महीने खुलासा किया कि 20 सितंबर को एक प्रशिक्षण सत्र के दौरान, एक खोज कार्य करने वाले एक एजेंट ने प्रशिक्षण सैंडबॉक्स के इंटरनेट प्रतिबंधों में एक DNS फ़िल्टरिंग अंतर की खोज की। डिज़ाइन के अनुसार, इस वातावरण में ऑफ़लाइन वेब कैशिंग के अलावा लाइव इंटरनेट तक पहुंच नहीं होनी चाहिए, लेकिन यह एजेंट अंततः DNS रिज़ॉल्वर के माध्यम से एक बाहरी सार्वजनिक चैटबॉट सेवा से जुड़ा है।
ओपनएआई ने कहा कि उसकी निगरानी प्रणाली
15 मिनट
के भीतर थी असामान्य व्यवहार को चिह्नित किया गया, मानव समीक्षकचेतावनी भेजे जाने के 3 मिनट बाद
जाँच शुरू हो जाती है, लेकिन पूरा कार्य लगभग2.5 घंटे बाद
तक नहीं होता है समाप्त कर दिया गया. घटना के बाद, ओपनएआई ने अपने सबसे मजबूत मॉडलों द्वारा उपयोग किए जाने वाले उपकरणों के प्रशिक्षण, मूल्यांकन और अनुमान को निलंबित कर दिया, और नेटवर्क एक्सेस ब्लॉकिंग उपायों की दो स्वतंत्र परतें जोड़ दीं।इन घटनाओं ने एक स्पष्ट समस्या को उजागर किया है: अतीत में, एआई सुरक्षा "नियमों का पालन करने" के लिए मॉडल पर बहुत अधिक निर्भर करती थी, लेकिन जब एजेंटों के पास टूल का उपयोग करने, कोड लिखने, फ़ाइलों और नेटवर्क तक पहुंचने और यहां तक कि अन्य एजेंटों को कॉल करने की क्षमता होने लगती है, तो केवल मॉडल परत पर नियम निर्धारित करना पर्याप्त नहीं हो सकता है।
एनवीडिया एंटरप्राइज कंप्यूटिंग के उपाध्यक्ष और महाप्रबंधक जस्टिन बोइटानो ने कहा कि हाल की घटनाओं से पता चला है कि केवल मॉडल-स्तरीय सुरक्षा उपायों पर निर्भर रहना पूरी तरह से नियंत्रित नहीं कर सकता है कि एक एजेंट क्या एक्सेस कर सकता है और क्या कर सकता है। हगिंग फेस से जुड़ी ओपनएआई की पिछली दुर्घटना के जवाब में, बोइतानो ने आगे कहा कि वर्तमान में उपलब्ध जानकारी के आधार पर, यदि अत्याधुनिक एआई प्रयोगशाला ने मॉडल मूल्यांकन चरण के दौरान एनवीआईडीआईए के नए सुरक्षा प्लेटफॉर्म का उपयोग किया होता, तो संबंधित दुर्घटना को "रोका जा सकता था।" यह बताया जाना चाहिए कि यह
खुली दुर्घटना की जानकारी के आधार पर NVIDIA का निर्णय है और वास्तविक पुनरुत्पादन द्वारा सत्यापित एक स्वतंत्र निष्कर्ष नहीं है
.ओपनशेल के पीछे का विचार यह है कि अब इस बात पर पूरा भरोसा नहीं किया जाएगा कि एआई नियमों का पालन करेगा।
एनवीआईडीआईए के परिचय के अनुसार, ओपनशेल एजेंट के चल रहे वातावरण के बाहर एक सुरक्षा सीमा स्थापित करता है, डेटा, फ़ाइलों, नेटवर्क और टूल पर प्रतिबंध लगाता है जिन्हें एजेंट एक्सेस कर सकता है, और इसके निष्पादन व्यवहार को रिकॉर्ड करता है। ओपनशेल वर्तमान में NVIDIA Vera CPU के लिए अनुकूलित है, और NVIDIA आर्म और इंटेल के साथ भी काम कर रहा है ताकि इसे तृतीय-पक्ष कंप्यूटिंग प्लेटफ़ॉर्म तक विस्तारित किया जा सके।
इस आधार पर, सेंट्री एक स्वतंत्र हार्डवेयर मॉनिटरिंग परत जोड़ता है। यह NVIDIA BlueField-4 DPU पर चलता है और मुख्य कंप्यूटिंग वातावरण से अलग होता है जहां एजेंट स्थित है। NVIDIA के डिज़ाइन के अनुसार, भले ही एजेंट सॉफ़्टवेयर स्तर पर कुछ प्रतिबंधों को सफलतापूर्वक पार कर जाता है, फिर भी सेंट्री बाहरी रूप से उसके व्यवहार का निरीक्षण कर सकता है और जब उसे पता चलता है कि उसने सीमा पार कर ली है तो उसे अलग कर सकता है।
एनवीडिया ने यह भी कहा कि यह प्रणाली कुछ अधिक जटिल एजेंट व्यवहारों की पहचान कर सकती है। उदाहरण के लिए, एक एजेंट मुख्य एजेंट पर लगाए गए प्रतिबंधों को बायपास करने के लिए कई "उप-एजेंट" बनाने का प्रयास कर सकता है। एनवीडिया में एआई सॉफ्टवेयर के वरिष्ठ निदेशक अली गोलशन ने कहा कि कंपनी को केवल एक एजेंट से नहीं, बल्कि "एजेंटों के एक समूह और वे एक साथ कैसे काम करते हैं" से निपटने की जरूरत है।
इसका मतलब यह भी है कि AI सुरक्षा धीरे-धीरे एक साधारण "मॉडल संरेखण" समस्या से संपूर्ण कंप्यूटर सिस्टम सुरक्षा समस्या तक विस्तारित हो रही है।
जब एनवीडिया के सीईओ जेन-ह्सुन हुआंग ने इस प्लेटफ़ॉर्म को जारी किया, तो उन्होंने कहा कि एआई सुरक्षा और सुरक्षा सुरक्षा के लिए "पूर्ण-स्टैक इंजीनियरिंग" की आवश्यकता होती है। एनवीआईडीआईए की सोच के अनुसार, भविष्य की एआई सुरक्षा के लिए न केवल मॉडल डेवलपर्स को जिम्मेदार होने की आवश्यकता है, बल्कि यह ऑपरेटिंग सिस्टम, सीपीयू, डीपीयू, क्लाउड इंफ्रास्ट्रक्चर से लेकर रोबोट जैसे भौतिक उपकरणों तक फैली हुई है।
वर्तमान में,
100 से अधिक संस्थान
हैं एन्थ्रोपिक, माइक्रोसॉफ्ट, सिस्को, क्राउडस्ट्राइक, डेल, एचपीई, हगिंग फेस, जेपी मॉर्गन चेज़, पलान्टिर, सेल्सफोर्स, एसएपी, सर्विसनाउ और स्पेसएक्सएआई आदि सहित एनवीआईडीआईए सुरक्षा प्लेटफ़ॉर्म पारिस्थितिकी तंत्र में भाग लें। रेड हैट, कैनोनिकल और एसयूएसई जैसे ऑपरेटिंग सिस्टम विक्रेता भी संबंधित एकीकरण करने की योजना बना रहे हैं।यह ध्यान देने योग्य है कि हुआंग रेनक्सुन ने पहले एआई सुरक्षा जोखिमों के कारण पूरे उद्योग पर व्यापक प्रतिबंधों के कार्यान्वयन का समर्थन नहीं किया है। रॉयटर्स ने बताया कि वह एजेंट की सुरक्षा सीमाओं की सफलता को एक ऐसी समस्या मानते हैं जिसे इंजीनियरिंग माध्यमों से हल करने की आवश्यकता है, दुर्घटनाओं के जोखिम को कम करने के लिए ऑटोमोबाइल उद्योग की सुरक्षा प्रौद्योगिकी में निरंतर वृद्धि के समान।
अब, NVIDIA इस परिप्रेक्ष्य को उत्पादों में बदल रहा है।
एनवीडिया के लिए, इसका मतलब यह भी है कि एआई उद्योग में एक नया संभावित बाजार उभरा है। पिछले कुछ वर्षों में, AI क्षमताएं जितनी मजबूत होंगी, कंपनियों को उतने ही अधिक GPU खरीदने की आवश्यकता होगी; लेकिन जब एआई उन चैटबॉट्स से बदल जाता है जो उन एजेंटों के सवालों का जवाब देते हैं जो कंप्यूटर संचालित कर सकते हैं, सॉफ़्टवेयर को कॉल कर सकते हैं और यहां तक कि रोबोट को स्वयं नियंत्रित कर सकते हैं, तो कंपनियों को न केवल अधिक कंप्यूटिंग शक्ति की आवश्यकता होती है, बल्कि इन एजेंटों को सीमित करने के लिए नए बुनियादी ढांचे की भी आवश्यकता होती है।
दूसरे शब्दों में, एआई एजेंट जितना बेहतर "काम" कर सकता है, उसे आमतौर पर उतना ही अधिक अधिकार प्राप्त होता है; अधिकार जितना अधिक होगा, सीमा से बाहर व्यवहार होने पर प्रभाव उतना ही अधिक होगा।
हालाँकि, एनवीडिया का नया प्लेटफ़ॉर्म सभी AI सुरक्षा मुद्दों को हल नहीं कर सकता है। ओपनशेल और सेंट्री मुख्य रूप से निष्पादन सीमाओं को लक्षित करते हैं जब एजेंट कंप्यूटिंग संसाधनों, नेटवर्क, फाइलों और उपकरणों तक पहुंचता है, और इसका मतलब यह नहीं है कि वे मॉडल त्रुटि जानकारी, भ्रामक व्यवहार या अन्य व्यापक एआई सुरक्षा मुद्दों की समस्या को हल कर सकते हैं। एसोसिएटेड प्रेस ने विशेषज्ञों के हवाले से बताया कि एजेंट की क्षमताओं और सुरक्षा प्रतिबंधों के बीच संतुलन कैसे बनाया जाए और सही सुरक्षा नियम कैसे बनाए जाएं, इसे अभी भी वास्तविक तैनाती में सत्यापित करने की आवश्यकता है।
लेकिन हाल की घटनाओं की एक श्रृंखला ने कम से कम एक उद्योग की दिशा को और अधिक स्पष्ट कर दिया है: जब एआई केवल चैट कर सकता है, तो स्क्रीन पर उत्तरों में सुरक्षा संबंधी समस्याएं बड़े पैमाने पर होती हैं; जब एआई वास्तव में कंप्यूटर संचालित करना और लोगों के लिए कार्य करना शुरू करता है, तो सुरक्षा समस्याएं वास्तविक सॉफ़्टवेयर, नेटवर्क और डेटा सिस्टम में प्रवेश करती हैं।
एआई कंपनियां एजेंटों को अधिक क्षमताएं देने के लिए कड़ी मेहनत कर रही हैं, और एनवीडिया अब एक अन्य व्यवसाय में लगी हुई है - इन तेजी से सक्षम एजेंटों को एक सीमा दे रही है जिसे वे आसानी से पार नहीं कर सकते हैं।
टिप्पणियाँ