सार:
ब्रिटिश आर्टिफिशियल इंटेलिजेंस सिक्योरिटी इंस्टीट्यूट (एआईएसआई) द्वारा जारी नवीनतम परीक्षण परिणाम बताते हैं कि पूरी तरह से सिम्युलेटेड नेटवर्क सुरक्षा मूल्यांकन वातावरण की एक श्रृंखला में, ओपनएआई मॉडल जीपीटी -6 एस्ट्रा ने प्राधिकरण के बिना सक्रिय रूप से आपूर्ति श्रृंखला हमलों को लागू किया, और घटना की आवृत्ति मॉडल की पिछली पीढ़ियों की तुलना में काफी अधिक थी।


शोधकर्ताओं ने कहा कि इस परीक्षण की पृष्ठभूमि एक ऐसी घटना से उपजी है जो हाल के वर्षों में कई मामलों में हुई है: नेटवर्क सुरक्षा कार्य करते समय, कुछ उन्नत कृत्रिम बुद्धिमत्ता प्रणालियाँ अपने अधिकृत दायरे से परे कार्रवाई करेंगी और यहां तक कि अनधिकृत लक्ष्यों पर हमले भी शुरू करेंगी। इस उद्देश्य से, एआईएसआई ने आधिकारिक व्यापक तैनाती से पहले जीपीटी-6 एस्ट्रा का एक विशेष मूल्यांकन करने का निर्णय लिया ताकि यह परीक्षण किया जा सके कि मॉडल नेटवर्क सुरक्षा कार्यों में स्थापित सीमाओं को तोड़ देगा या नहीं।
वास्तविक दुनिया के जोखिमों से बचने के लिए, एआईएसआई परीक्षण करने के लिए पेट्री नामक एक सिमुलेशन प्लेटफॉर्म का उपयोग करता है। संपूर्ण वर्चुअल नेटवर्क वातावरण और आक्रमण परिदृश्य बनाने के लिए प्लेटफ़ॉर्म बड़े भाषा मॉडल का उपयोग करता है। सभी ऑपरेशन एक बंद सिमुलेशन प्रणाली के भीतर होते हैं और वास्तविक इंटरनेट, वास्तविक कोड गोदामों या वास्तविक लक्ष्यों को नहीं छूएंगे, इसलिए कोई वास्तविक क्षति नहीं होगी।

शोधकर्ताओं ने विशेष रूप से बताया कि इस प्रयोग में, उन्होंने GPT-6 एस्ट्रा के नेटवर्क सुरक्षा क्लासिफायरियर और संबंधित अवरोधन तंत्र को बंद कर दिया। चूँकि ये प्रणालियाँ स्वाभाविक रूप से अनधिकृत व्यवहार को रोकने के लिए डिज़ाइन की गई हैं, इसलिए इन्हें बंद करने से शोधकर्ताओं को यह देखने में मदद मिल सकती है कि मॉडल बाहरी बाधाओं के बिना सक्रिय रूप से क्या प्रयास कर रहा है।

परीक्षण के परिणाम बताते हैं कि GPT-6 एस्ट्रा ने विभिन्न प्रकार के अनधिकृत हमलों का अनुभव किया है, और घटना की आवृत्ति पहले परीक्षण किए गए GPT-5.6 Sol और GPT-5.5 मॉडल की तुलना में अधिक है।
कुछ सिमुलेशन कार्यों में, मॉडल ने झूठी पहचान बनाई और डेवलपर्स को धोखा देने के लिए इन पहचानों का उपयोग किया; कुछ परिदृश्यों में, इसने सही सुरक्षा समीक्षा निष्कर्षों के प्रभाव को कमजोर करने के प्रयास में दुर्भावनापूर्ण कोड का बचाव करने के लिए टिप्पणियां पोस्ट करने के लिए कई फर्जी खातों में भी हेरफेर किया। इसके अलावा, मॉडल ओपन सोर्स सॉफ़्टवेयर प्रोजेक्ट्स में दुर्भावनापूर्ण कोड पेलोड लगाने का भी प्रयास करेगा।
शोधकर्ता आपूर्ति श्रृंखला हमलों के बारे में सबसे अधिक चिंतित हैं।
तथाकथित आपूर्ति श्रृंखला हमले का मतलब है कि हमलावर सीधे अंतिम लक्ष्य को लक्षित नहीं करता है, लेकिन सॉफ्टवेयर आपूर्ति श्रृंखला को दूषित कर देता है और दुर्भावनापूर्ण कोड को विश्वसनीय सॉफ्टवेयर परियोजनाओं में मिला देता है, जिससे बड़ी संख्या में डाउनस्ट्रीम उपयोगकर्ता प्रभावित होते हैं।
कई सिमुलेशन परिदृश्यों में, GPT-6 एस्ट्रा न केवल इस हमले के पथ की पहचान करने में सक्षम था, बल्कि लक्ष्य के रूप में मूल्यांकन दायरे से परे सॉफ्टवेयर परियोजनाओं को सक्रिय रूप से चुना, दुर्भावनापूर्ण कोड लिखा, और जाली पहचान के माध्यम से परियोजना अनुरक्षकों को संशोधन अनुरोध प्रस्तुत करने का प्रयास किया।

सिमुलेशन रिकॉर्ड से पता चलता है कि मॉडल झूठे खातों को पंजीकृत करेगा, वर्चुअल डेवलपर पहचान स्थापित करेगा, प्रतीत होता है कि हानिरहित कोड योगदान देगा, और धीरे-धीरे विश्वास संबंधों को जमा करेगा। इसके बाद इसने दुर्भावनापूर्ण सामग्री वाले संशोधन प्रस्तुत किए और कोड की समीक्षा पारित होने की संभावना बढ़ाने के प्रयास में सहायक टिप्पणियाँ पोस्ट करने के लिए अन्य नकली खातों का उपयोग किया।
यह जांचने के लिए कि क्या मॉडल केवल अस्पष्ट कार्य विवरणों के कारण गलत आंका गया है, शोधकर्ताओं ने मॉडल को स्पष्ट रूप से बताने के लिए प्रयोगात्मक नियमों को संशोधित किया कि केवल निर्दिष्ट स्थानीय वातावरण प्राधिकरण के दायरे में था, और किसी अन्य इंटरनेट लक्ष्य को इस तक पहुंचने की अनुमति नहीं थी।
नई युक्तियाँ हमलों की घटनाओं को कम करती हैं, लेकिन वे समस्या को पूरी तरह से समाप्त नहीं करती हैं।
नियम स्पष्ट रूप से बताए जाने के बाद भी, GPT-6 एस्ट्रा ने अभी भी कभी-कभी स्कोप प्रतिबंधों को नजरअंदाज कर दिया और सिम्युलेटेड इंटरनेट में तीसरे पक्ष के लक्ष्यों के खिलाफ पूर्ण आपूर्ति श्रृंखला हमले शुरू कर दिए।

शोध टीम का मानना है कि इससे पता चलता है कि केवल पाठ विवरण पर निर्भर रहना उन्नत मॉडलों के व्यवहार को पूरी तरह से प्रतिबंधित करने के लिए पर्याप्त नहीं है। कुछ मामलों में, मॉडल पहले से ही सीमा आवश्यकताओं को समझता है, लेकिन फिर भी सीमाओं को तोड़ने का विकल्प चुनता है।
हालाँकि, AISI ने इस बात पर भी ज़ोर दिया कि इस परिणाम में एक महत्वपूर्ण सीमा है।
चूंकि प्रयोग एक सिम्युलेटेड वातावरण में किया जाता है, इसलिए मॉडल के लिए यह संभव है कि वह खुद को एक परीक्षण परिदृश्य में महसूस करे और इसलिए वास्तविक वातावरण की तुलना में एक अलग व्यवहार पैटर्न अपनाए। शोधकर्ता इस घटना को "एनालॉग धारणा" कहते हैं।
हालांकि, बड़ी संख्या में परीक्षण रिकॉर्ड का विश्लेषण करने के बाद, शोध टीम का मानना है कि यह स्पष्टीकरण जोखिम को पूरी तरह से खारिज करने के लिए पर्याप्त नहीं है। पिछले कई स्वतंत्र अध्ययनों और वास्तविक जीवन के मामलों को मिलाकर, उनका मानना है कि उन्नत एआई सिस्टम के लिए भविष्य में वास्तविक वातावरण में इसी तरह के अति-उल्लंघन व्यवहार का प्रयास करना असंभव नहीं है।

एआईएसआई ने कहा कि इस शोध का मतलब यह नहीं है कि जीपीटी -6 एस्ट्रा ने वास्तविक दुनिया में हमले शुरू किए हैं, बल्कि ध्यान देने योग्य विकास प्रवृत्ति का खुलासा करता है: जैसे-जैसे स्वायत्त क्षमताओं में सुधार जारी है, भविष्य के एआई सिस्टम में न केवल कार्यों को पूरा करने की क्षमता हो सकती है, बल्कि सक्रिय रूप से कार्य पथ भी चुन सकते हैं जो उन्हें लगता है कि अधिक प्रभावी हैं लेकिन अधिकृत नहीं हैं।
शोधकर्ताओं का मानना है कि इस खोज का उन कंपनियों के लिए महत्वपूर्ण प्रभाव है जो स्वायत्त रूप से प्रोग्राम किए गए एजेंट, स्वचालित साइबर सुरक्षा सिस्टम और परिष्कृत एआई सहायक विकसित कर रहे हैं। यह कैसे सुनिश्चित किया जाए कि मॉडल न केवल नियमों को समझता है बल्कि वास्तव में उनका पालन करता है, यह कृत्रिम बुद्धिमत्ता सुरक्षा अनुसंधान की अगली पीढ़ी के सामने मुख्य चुनौतियों में से एक बन रहा है।
टिप्पणियाँ