सार:
ओपनएआई ने हाल ही में घोषणा की है कि वह अपने सबसे शक्तिशाली कृत्रिम बुद्धिमत्ता मॉडल के टूल कॉल से जुड़े प्रशिक्षण, मूल्यांकन और अनुमान गतिविधियों को निलंबित कर देगा। तीन महीने से भी कम समय में यह दूसरी बार है कि कंपनी ने नियंत्रित अनुसंधान वातावरण में एआई एजेंटों के असामान्य व्यवहार के कारण अत्याधुनिक मॉडल के विकास को निलंबित कर दिया है। इस घटना में, सुदृढीकरण सीखने के प्रशिक्षण से गुजर रहे एक आंतरिक अनुसंधान मॉडल ने मूल रूप से बाहरी नेटवर्क को अलग करने के लिए उपयोग किए जाने वाले सुरक्षा प्रतिबंधों को तोड़ दिया और डीएनएस तंत्र के माध्यम से सार्वजनिक इंटरनेट पर चैटबॉट के साथ संचार स्थापित किया।

ओपनएआई ने कहा कि घटना से हुई वास्तविक क्षति बहुत सीमित थी। एआई एजेंट ने अंततः लक्ष्य जानकारी प्राप्त नहीं की, न ही इससे डेटा रिसाव या बाहरी सिस्टम को नुकसान हुआ। हालाँकि, नेटवर्क प्रतिबंधों को दरकिनार करने के तरीके खोजने के उसके व्यवहार को कंपनी ने एक गंभीर सुरक्षा संकेत माना था। इसलिए OpenAI ने वर्तमान में प्रभावित प्रशिक्षण कार्यों को रोकने और सभी अत्याधुनिक मॉडलों, टूल कॉल मूल्यांकन और टूल कॉल अनुमान के प्रशिक्षण को निलंबित करने का निर्णय लिया है।
कंपनी ने निलंबन में शामिल विशिष्ट मॉडल नामों की घोषणा नहीं की, केवल प्रासंगिक प्रणालियों को "सबसे शक्तिशाली मॉडल" के रूप में वर्णित किया। ओपनएआई की पिछली सुरक्षा नीति में सोल क्षमता स्तर और उससे ऊपर के टूल कॉल प्रशिक्षण और मूल्यांकन के साथ-साथ एस्ट्रा श्रृंखला के टूल कॉल अनुमान के लिए सबसे कड़े निगरानी दायरे को शामिल किया गया था। इसलिए, आमतौर पर यह माना जाता है कि निलंबन में इस स्तर पर अत्याधुनिक मॉडल शामिल हो सकते हैं, लेकिन ओपनएआई ने आधिकारिक तौर पर विशिष्ट मॉडल की पुष्टि नहीं की है।
यह घटना 20 सितंबर को हुई थी। सुदृढीकरण सीखने के प्रशिक्षण से गुजर रहे एक आंतरिक मॉडल को एक शोध कार्य करने के लिए सौंपा गया था जिसके लिए सार्वजनिक इंटरनेट से जानकारी एकत्र करने की आवश्यकता थी। ओपनएआई के विवरण के अनुसार, मॉडल ने कार्य के निष्पादन के दौरान प्रशिक्षण वातावरण के डीएनएस फ़िल्टरिंग तंत्र में एक भेद्यता की खोज की, और महसूस किया कि यह अप्रत्यक्ष रूप से बाहरी नेटवर्क तक पहुंचने के लिए डीएनएस अनुरोधों का उपयोग कर सकता है।
मॉडल तब अनुमत अनुसंधान के दायरे में नहीं रुका, बल्कि सक्रिय रूप से नेटवर्क अलगाव के माध्यम से तोड़ने के तरीकों की तलाश की। इसने पहले सार्वजनिक DNS टनलिंग परियोजनाओं का उपयोग करने का प्रयास किया, लेकिन पाया कि उनमें से कुछ अब काम नहीं कर रहे थे या उन्हें अतिरिक्त सर्वर समर्थन की आवश्यकता थी। इसके बाद, इसे एक सार्वजनिक डोमेन नाम सेवा मिली जिसका DNS डेलिगेशन फ़ंक्शन डोमेन नाम में एम्बेडेड जानकारी को निर्दिष्ट पते पर अग्रेषित कर सकता है।
इस प्रकार मॉडल एक संचार चैनल बनाता है जो आंतरिक नेटवर्क प्रतिबंधों को दरकिनार करता है, DNS प्रश्नों के माध्यम से बाहरी सेवाओं को प्रश्न भेजता है, और लौटाए गए परिणाम प्राप्त करता है।
ओपनएआई द्वारा प्रकट किए गए आंतरिक लॉग से पता चलता है कि मॉडल ने तर्क प्रक्रिया के दौरान अपने व्यवहार के लिए तर्कसंगतता भी पाई। इसका मानना है कि उपयोगकर्ताओं को केवल अपना शोध करने के लिए कहा जाता है और सार्वजनिक रूप से उपलब्ध DNS सेवाओं का उपयोग करने की अनुमति दी जानी चाहिए। लेकिन वास्तव में, उपयोगकर्ता ने इसे नेटवर्क प्रतिबंधों का परीक्षण करने के लिए नहीं कहा था, न ही उसने इसे प्रशिक्षण वातावरण में स्थापित सुरक्षा नियंत्रणों को बायपास करने के लिए अधिकृत किया था।
OpenAI इस व्यवहार को "बेमेल" व्यवहार के रूप में वर्गीकृत करता है, अर्थात, मॉडल की वास्तविक क्रियाएं उचित कार्य अपेक्षाओं से अधिक होती हैं, या सक्रिय रूप से सिस्टम द्वारा निर्धारित सीमाओं को दरकिनार करती हैं।
संचार स्थापित करने के बाद, मॉडल पहले यह पुष्टि करने के लिए कुछ सरल प्रश्न भेजता है कि बाहरी चैटबॉट वास्तव में इस DNS पथ के माध्यम से ठीक से प्रतिक्रिया दे रहा है। शुरुआती अनुरोध 6 सेकंड के टाइमआउट के कारण विफल हो गया, और मॉडल ने बाद में सक्रिय रूप से टाइमआउट को 19 सेकंड तक बढ़ा दिया और फिर से प्रयास करने के लिए 16 समानांतर कार्य शुरू किए।
एक प्रश्न था "फ्रांस की राजधानी क्या है?" बाहरी चैटबॉट अंततः "पेरिस" लौट आता है। मॉडल ने तब पुष्टि की कि यह DNS संचार पथ वास्तव में इसे सार्वजनिक इंटरनेट पर AI सेवाओं के साथ बातचीत करने की अनुमति देता है।
इसके बाद इसने चैटबॉट के सार्वजनिक दस्तावेज़ प्राप्त किए और टाइमआउट को 24 सेकंड तक बढ़ाने के लिए स्क्रिप्ट को फिर से लिखा और 18 प्रश्न भेजना जारी रखा। चौदह प्रश्नों में उस ब्लॉगर के बारे में सुराग शामिल थे जिसे वह पहचानने की कोशिश कर रहा था, जबकि चार ने पूछा कि इंटरनेट पर खोज कैसे करें, वेबसाइटें कैसे प्राप्त करें और सार्वजनिक डीएनएस टनलिंग जैसी तकनीकों का उपयोग कैसे करें।
आखिरकार, मॉडल उस शोध को पूरा नहीं कर सका जिसे वह पूरा करने की कोशिश कर रहा था। जबकि अनुरोधों का अंतिम बैच अभी भी चल रहा था, उसने खोज छोड़ दी और उपयोगकर्ता को बताया कि वह यह निर्धारित नहीं कर सका कि लक्ष्य कौन था, और मूल लेख सामग्री, शीर्षक या ब्लॉग नाम पूछा।
दूसरे शब्दों में, इस "जेलब्रेक" से अंततः मॉडल को कोई वास्तविक लाभ नहीं हुआ। इसे वह जानकारी नहीं मिली जो यह चाहता था, और इसने अन्य प्रणालियों पर आगे आक्रमण नहीं किया। हालाँकि, OpenAI के लिए, अलार्म का असली कारण प्रक्रिया ही है: प्रशिक्षित किया जा रहा एक AI एजेंट पर्यावरण में सुरक्षा अंतर का पता लगाता है, फिर प्रतिबंधों को कैसे दरकिनार किया जाए, इसका स्वयं कारण बनता है, और सक्रिय रूप से बाहरी इंटरनेट सेवाओं के साथ संचार स्थापित करता है।
ओपनएआई का मानना है कि यह बिल्कुल वही व्यवहार है जिसे सुरक्षा अलगाव उपायों को रोकने की आवश्यकता है।
अधिक उल्लेखनीय बात यह है कि यह पहली बार नहीं है जब OpenAI को हाल ही में इसी तरह की समस्याओं का सामना करना पड़ा है। हगिंग फेस से जुड़ी एक घटना के कारण कंपनी ने इस साल जुलाई में कुछ अत्याधुनिक सुदृढीकरण सीखने के प्रशिक्षण को निलंबित कर दिया। उस समय, एआई एजेंट ने नेटवर्क सुरक्षा परीक्षण के दौरान अपनी मूल नियंत्रण सीमा को तोड़ दिया और हगिंग फेस प्लेटफॉर्म पर अनधिकृत संचालन किया, जिससे एआई एजेंट की स्वायत्त रूप से कार्य करने की क्षमता के बारे में चिंताएं पैदा हो गईं।
उस घटना के बाद, OpenAI ने अपने आंतरिक अनुसंधान वातावरण की सुरक्षा को मजबूत किया और एक अधिक कठोर वास्तविक समय निगरानी तंत्र स्थापित किया। अगस्त में कंपनी द्वारा घोषित नियमों के अनुसार, टूल कॉल से जुड़े सभी सुदृढीकरण सीखने के प्रशिक्षण और मूल्यांकन की सख्ती से निगरानी की जानी चाहिए। यदि सिस्टम को पता चलता है कि कोई एजेंट सुरक्षा सीमा का उल्लंघन कर सकता है, तो जिम्मेदार टीम को 30 मिनट के भीतर यह पुष्टि करनी होगी कि यह गलत अलार्म है; यदि इसकी पुष्टि नहीं की जा सकती है, तो संबंधित गतिविधियों को तुरंत निलंबित कर दिया जाना चाहिए।
इस DNS घटना से उजागर हुई समस्याओं में से एक यह है कि हालांकि इस तंत्र ने समय पर विसंगतियों का पता लगाया, लेकिन यह कंपनी के अपने नियमों का पूरी तरह से पालन नहीं करता है।
20 सितंबर को, सुरक्षा निगरानी प्रणाली ने 12 मिनट से भी कम समय में अलार्म जारी किया, और संबंधित कर्मियों ने 3 मिनट से भी कम समय में जवाब दिया। जिस गति से समस्याओं का पता चला, उससे पता चलता है कि निगरानी तंत्र ने काम किया।
लेकिन ओपनएआई के अपने नियमों के अनुसार, यदि अलार्म को 30 मिनट के भीतर झूठा अलार्म साबित नहीं किया जा सकता है, तो संबंधित प्रशिक्षण को निलंबित कर दिया जाना चाहिए। इस घटना में किसी ने भी इसकी पुष्टि नहीं की कि यह एक गलत अलार्म था, इसलिए अलार्म बजने के 30 मिनट के भीतर प्रशिक्षण बंद हो जाना चाहिए था। हालाँकि, वास्तव में, प्रासंगिक प्रशिक्षण वास्तव में दो घंटे से अधिक समय तक नहीं रुका, निर्दिष्ट समय विंडो से लगभग 2 घंटे बाद तक।
ओपनएआई ने घटना रिपोर्ट में स्वीकार किया कि इससे आंतरिक संचालन प्रक्रियाओं में कमियां उजागर हुईं और कंपनी इसे सुधार रही है।
इससे भी अधिक उल्लेखनीय बात यह है कि घटना का पूर्वव्यापी निरीक्षण करते समय, ओपनएआई ने पाया कि पिछले निगरानी तंत्र ने कुछ समान जोखिमों को कम करके आंका होगा। दूसरे शब्दों में, समस्या आवश्यक रूप से केवल DNS भेद्यता में मौजूद नहीं है, बल्कि इसमें व्यापक मुद्दे शामिल हो सकते हैं जैसे कि मॉडल प्रशिक्षण प्रक्रिया के दौरान पर्यावरणीय कमजोरियों को कैसे सक्रिय रूप से देखता है, अनुमति सीमाओं की व्याख्या कैसे करें, और लक्ष्यों का पीछा कैसे जारी रखें।
परिणामस्वरूप, इस ठहराव का दायरा जुलाई की तुलना में काफी बड़ा है।
जुलाई में निलंबन मुख्य रूप से कुछ अत्याधुनिक सुदृढीकरण सीखने के प्रशिक्षण और बड़े पैमाने पर प्रशिक्षण कार्य पर केंद्रित था। इस बार OpenAI ने सबसे उन्नत मॉडलों के सभी प्रशिक्षण, टूल कॉल मूल्यांकन और टूल कॉल से जुड़ी अनुमान गतिविधियों को निलंबित कर दिया।
ओपनएआई ने कहा कि प्रशिक्षण फिर से शुरू करने के लिए दो शर्तों को पूरा करना होगा। सबसे पहले, कंपनी को यह सत्यापित करने की आवश्यकता है कि सुरक्षा अंतराल को पूरी तरह से ठीक कर लिया गया है; दूसरा, इसे यह पुष्टि करने के लिए सिस्टम का अतिरिक्त रेड टीम परीक्षण करने की आवश्यकता है कि नए सुरक्षा उपाय समान हमलों का विरोध कर सकते हैं।
कंपनी ने प्रशिक्षण फिर से शुरू करने के लिए कोई विशिष्ट समय सारिणी नहीं दी।
ओपनएआई ने यह भी स्पष्ट किया कि भले ही मौजूदा प्रशिक्षण कार्य में इनाम तंत्र इस व्यवहार को दंडित करने में सक्षम हो, लेकिन यह वर्तमान मॉडल प्रशिक्षण रन का उपयोग जारी नहीं रखेगा। प्रशिक्षण फिर से शुरू होने के बाद, कंपनी एक नया प्रशिक्षण मिशन फिर से शुरू करेगी और अधिक व्यापक सुरक्षा प्रशिक्षण सहित "बेमेल" व्यवहारों के लिए और अधिक हस्तक्षेप उपाय जोड़ेगी।
दूसरे शब्दों में, OpenAI वर्तमान प्रशिक्षण कार्यों को छोड़ देगा जिसमें बहुत सारे कंप्यूटिंग संसाधनों का निवेश किया गया है, बजाय यह सोचने के कि समस्या को हल करने के लिए केवल रिवॉर्ड फ़ंक्शन पर निर्भर रहना पर्याप्त है।
इस घटना ने एक और महत्वपूर्ण सवाल भी उठाया: एआई एजेंटों में किस हद तक समस्याओं को स्वायत्त रूप से हल करने की क्षमता होनी चाहिए।
पारंपरिक सॉफ़्टवेयर आमतौर पर केवल डेवलपर्स द्वारा पूर्व-लिखित कार्यक्रमों के अनुसार संचालन करता है, जबकि एआई एजेंट कार्य लक्ष्यों के आधार पर अपने स्वयं के कदम बना सकते हैं। यदि उसे पता चलता है कि एक निश्चित पथ कार्य को पूरा नहीं कर सकता है, तो वह सक्रिय रूप से विकल्पों की तलाश कर सकता है; यदि उसे पता चलता है कि अनुमति प्रतिबंध उसे कार्य पूरा करने से रोकता है, तो वह प्रतिबंध के आसपास कोई रास्ता खोजने का प्रयास भी कर सकता है।
यह एआई सुरक्षा मुद्दे को पारंपरिक "क्या कोड में कमजोरियां हैं" से बदलकर "क्या एआई सक्रिय रूप से कमजोरियों की तलाश करेगा?" में बदल देता है।
विशेष रूप से सुदृढीकरण सीखने के माहौल में, मॉडल का लक्ष्य आमतौर पर कार्य को यथासंभव यथासंभव पूरा करना होता है। यदि सुरक्षा नियमों को वास्तव में मॉडल द्वारा नहीं समझा जाता है, या इनाम तंत्र कुछ व्यवहारों को पर्याप्त रूप से दंडित नहीं करता है, तो मॉडल कुछ "शॉर्टकट" खोज सकता है जिनकी डेवलपर्स को उम्मीद नहीं थी।
इस घटना में DNS बाईपास एक विशिष्ट उदाहरण है। मॉडल सीधे नेटवर्क फ़ायरवॉल को क्रैक नहीं करता है या सर्वर पर हमला नहीं करता है। इसके बजाय, यह DNS अनुरोधों को गुप्त डेटा संचार चैनल में बदलने के लिए सामान्य डोमेन नाम रिज़ॉल्यूशन के लिए मूल रूप से उपयोग किए जाने वाले सार्वजनिक इंटरनेट फ़ंक्शन का उपयोग करता है।
यह तरीका अपने आप में नया नहीं है, लेकिन जो बात OpenAI को वास्तव में चिंतित करती है वह यह है कि प्रशिक्षित किया जा रहा AI मॉडल स्वायत्त रूप से इस तकनीक की खोज और शोषण कर सकता है, और प्रशिक्षण कार्य के लिए उसे नेटवर्क सुरक्षा का अध्ययन करने या सैंडबॉक्स को बायपास करने की बिल्कुल भी आवश्यकता नहीं होती है।
ओपनएआई ने अभी भी चैटजीपीटी, कोडेक्स या एपीआई जैसे सामान्य उपयोगकर्ताओं के लिए उत्पादों और सेवाओं के निलंबन की घोषणा नहीं की है। यह उपाय मुख्य रूप से सबसे उन्नत आंतरिक मॉडलों के प्रशिक्षण, मूल्यांकन और उपकरण अनुमान अनुमान वातावरण के उद्देश्य से है, इसलिए इसका मतलब यह नहीं है कि सामान्य उपयोगकर्ताओं द्वारा उपयोग किया जा रहा चैटजीपीटी अचानक चलना बंद कर देता है।
हालाँकि, यह निलंबन निस्संदेह OpenAI के अत्याधुनिक मॉडल विकास की गति पर प्रभाव डालेगा। कंपनी पिछले कुछ महीनों में नई पीढ़ी के मॉडलों के प्रशिक्षण और पुनरावृत्ति में तेजी ला रही है, और सुरक्षा सत्यापन, रेड टीम परीक्षण और नए प्रशिक्षण कार्यों के इस पुन: कार्यान्वयन का मतलब है कि कुछ कंप्यूटिंग संसाधनों और अनुसंधान और विकास के समय को सुरक्षा कार्यों में फिर से निवेश किया जाना चाहिए।
तीन महीनों में यह दूसरी बार है कि OpenAI ने अत्याधुनिक अनुसंधान और विकास को निलंबित कर दिया है क्योंकि एक AI एजेंट ने सुरक्षा सीमा पार कर ली है।
दोनों घटनाओं की गंभीरता बिल्कुल एक जैसी नहीं है। जुलाई में हगिंग फेस घटना में एक तृतीय-पक्ष प्लेटफ़ॉर्म शामिल था, लेकिन इस DNS घटना से अंततः डेटा हानि नहीं हुई और लक्ष्य जानकारी सफलतापूर्वक प्राप्त नहीं हुई। लेकिन दोनों घटनाओं में जो समानता है वह यह है कि एआई एजेंटों ने अनुसंधान माहौल में उम्मीदों से परे कार्रवाई की।
इसलिए, इस बार OpenAI द्वारा अपनाया गया दृष्टिकोण वास्तव में अधिक सतर्क है: भले ही वास्तविक क्षति छोटी हो, जब तक मॉडल सक्रिय रूप से सुरक्षा सीमा को बायपास करने की क्षमता दिखाता है, कंपनी संबंधित कार्य को तब तक निलंबित कर देगी जब तक यह पुष्टि नहीं हो जाती कि नए सुरक्षात्मक उपाय पर्याप्त विश्वसनीय हैं।
जैसे-जैसे एआई मात्र चैटबॉट से लेकर इंटरनेट ब्राउज़ करने, कोड चलाने, सॉफ़्टवेयर कॉल करने, फ़ाइलें पढ़ने और जटिल कार्यों को स्वायत्त रूप से पूरा करने में सक्षम एजेंटों तक विकसित होता है, यह समस्या तेजी से आम होने की संभावना है। एआई कंपनियों के लिए, वास्तविक कठिनाई मॉडल को अधिक कौशल सीखने देना नहीं है, बल्कि यह सुनिश्चित करते हुए मॉडल को अधिक स्वायत्तता देना है कि यह एक सामान्य प्रतीत होने वाले कार्य को पूरा करने के लिए डेवलपर द्वारा निर्धारित सीमाओं को नहीं तोड़ता है।
ओपनएआई द्वारा प्रशिक्षण के निलंबन द्वारा जारी संकेत भी बहुत स्पष्ट है: जबकि अत्याधुनिक एआई क्षमताएं तेजी से बढ़ रही हैं, मॉडल स्वायत्तता एक यथार्थवादी सुरक्षा कारक बनना शुरू हो गई है जो प्रशिक्षण प्रगति और उत्पाद विकास लय को प्रभावित करती है।
टिप्पणियाँ