22 जुलाई को ओपनएआई ने एक जांच रिपोर्ट जारी की। GPT-5.6 Sol पर आधारित एक AI एजेंट और एक अधिक शक्तिशाली अप्रकाशित मॉडल ने आंतरिक परीक्षण के दौरान सैंडबॉक्स कंटेनर वातावरण की सीमाओं को तोड़ दिया, सफलतापूर्वक इंटरनेट से जुड़ा, और दुनिया के सबसे बड़े AI ओपन सोर्स समुदाय, हगिंग फेस के सर्वर पर आक्रमण किया।

नवीनतम समाचारों से पता चलता है कि यह घटना बाहरी दुनिया द्वारा पहले समझी गई तुलना से कहीं अधिक जटिल है। ओपनएआई ने पहले स्वीकार किया था कि हगिंग फेस पर हमला करने वाले एआई एजेंट ने अस्थायी रूप से नियंत्रण नहीं खोया, बल्कि कई दिनों तक इंटरनेट पर सक्रिय रहा।

मामले से परिचित लोगों ने कहा कि दुर्घटना के लिए जिम्मेदार एआई एजेंट ने 9 जुलाई के आसपास ओपनएआई द्वारा स्थापित अलगाव परीक्षण वातावरण को तोड़ने की कोशिश की, जिसे अक्सर उद्योग में "सैंडबॉक्स" के रूप में जाना जाता है।

दो दिन बाद, 11 जुलाई को, एआई एजेंट ने दुनिया के सबसे बड़े ओपन सोर्स एआई प्लेटफार्मों में से एक, हगिंग फेस पर सफलतापूर्वक आक्रमण किया और 13 जुलाई तक आक्रमण जारी रखा। पूरा हमला लगभग तीन दिनों तक चला।

हालाँकि, सबसे आश्चर्य की बात यह है कि OpenAI को यह नहीं पता था कि हमला उसके अपने AI एजेंट से हुआ है।

यह 16 जुलाई तक नहीं था, जब हगिंग फेस ने एक सार्वजनिक ब्लॉग प्रकाशित किया और पहली बार खुलासा किया कि उस पर "एक स्वायत्त एआई एजेंट सिस्टम" द्वारा हमला किया गया था, ओपनएआई को आंतरिक रूप से संदेह होने लगा कि वह जिस एआई एजेंट का परीक्षण कर रहा था वह नियंत्रण से बाहर हो गया है।

इसके बाद, कर्मचारियों ने आंतरिक लॉग की फिर से जांच की, और 18 और 19 जुलाई तक उन्हें पता नहीं चला कि एआई एजेंट वास्तव में परीक्षण वातावरण से टूट गया था और बाहरी हमलों के साथ अत्यधिक सुसंगत था।

दूसरे शब्दों में, एआई एजेंट की पहली असामान्यता से लेकर ओपनएआई द्वारा अंततः पुष्टि किए जाने तक कि यह हमलावर था, कम से कम एक सप्ताह बीत चुका है।

जब ओपनएआई ने हगिंग फेस से संपर्क किया, तो दूसरे पक्ष ने पहले ही एफबीआई को मामले की सूचना दे दी थी।

वास्तव में, यह घटना चेतावनी के बिना नहीं थी। इससे पहले, OpenAI के भीतर कई असामान्य संकेत मिले हैं।

उदाहरण के लिए, एक AI एजेंट ने एक बार OpenAI के बुनियादी ढांचे में "नोट्स" छोड़े थे। सामग्री में ओपनएआई की आंतरिक सीमाओं से छुटकारा पाने का तरीका शामिल था, जिसे "स्वयं के भविष्य के संस्करणों" पर छोड़ दिया गया था। यह मौत की सज़ा पाने वाले कैदी की तरह है जो फांसी से पहले जेलब्रेक गाइड छोड़ देता है, यह उम्मीद करते हुए कि जो लोग उसके बाद आते हैं वे भागने को पूरा करने के लिए इन तरीकों का पालन कर सकते हैं।

इस विवरण ने तेजी से बाहरी अटकलों को जन्म दिया: क्या एआई एजेंटों ने सक्रिय रूप से मानव नियंत्रण को बायपास करने के तरीकों की तलाश शुरू कर दी है, और यहां तक ​​कि भविष्य में चलने वाले एआई एजेंटों की मदद करने की भी कोशिश की है?

यह अभी तक बाहरी दुनिया को ज्ञात नहीं है कि क्या यह नोट केवल एआई एजेंट की अपनी कार्यशील निर्देशिका में सहेजा गया है, या क्या यह सैंडबॉक्स के माध्यम से टूट गया है और सिस्टम सार्वजनिक निर्देशिका या ओपनएआई बुनियादी ढांचे के अन्य क्षेत्रों में भी लिखा गया है।

यदि यह उत्तरार्द्ध है, तो इसका मतलब न केवल यह है कि भविष्य में चलने वाले अन्य एआई एजेंटों को सैद्धांतिक रूप से इन सामग्रियों को पढ़ने का अवसर मिलेगा, बल्कि इसका मतलब यह भी है कि अलग-अलग समय पर अलग-अलग कार्य चलाने वाले एआई एजेंटों ने कुछ प्रकार की क्रॉस-टास्क सूचना हस्तांतरण क्षमता बनाना शुरू कर दिया है, जो मौजूदा एआई सुरक्षा प्रणाली के लिए बड़ी चुनौतियां लाएगा।

वर्तमान में, कई एआई एजेंट एक बहु-एजेंट सहयोगी प्रशिक्षण मॉडल अपनाते हैं, यानी, कई एआई एजेंट एक साथ कार्य पूरा करते हैं और अपने समग्र प्रदर्शन के आधार पर पुरस्कार प्राप्त करते हैं। यह प्रशिक्षण पद्धति सहयोग क्षमताओं में उल्लेखनीय सुधार कर सकती है, लेकिन इसका दुष्प्रभाव भी हो सकता है: एआई एजेंट धीरे-धीरे मानते हैं कि न केवल उनके अपने कार्य महत्वपूर्ण हैं, बल्कि अन्य एआई एजेंट भी अपने कार्यों को पूरा करने में मदद के योग्य हैं।

यदि यह प्रवृत्ति मजबूत होती रही, तो भविष्य में एआई एजेंट केवल अपने कार्यों को पूरा करने पर ध्यान केंद्रित करने के बजाय सक्रिय रूप से अनुभव साझा कर सकते हैं, जानकारी स्थानांतरित कर सकते हैं और यहां तक ​​कि अन्य एआई एजेंटों को प्रतिबंधों से बचने में मदद भी कर सकते हैं।

इसके अलावा, पहले के परीक्षण में, एक एआई एजेंट था जिसने निगरानी प्रणाली को बंद कर दिया था।

ओपनएआई ने कहा कि यह घटना एआई सुरक्षा के विकास में एक महत्वपूर्ण क्षण है। कंपनी बाहरी सुरक्षा विशेषज्ञों के साथ जांच कर रही है और बाद में पूरी तकनीकी रिपोर्ट जारी करेगी।