सार:
"स्काईनेट" का एक दृश्य वास्तविकता में घटित हो रहा है। एक प्रशिक्षण सत्र के दौरान, OpenAI के बचे हुए AI एजेंट ने पूरे इंटरनेट पर "स्वयं-प्रतिकृति कोड" प्रत्यारोपित किया है! जब राजनेता एंड्रयू यांग ने सीएनबीसी पर यह बात कही तो कई लोगों को लगा कि वह पागल हैं।


पिछले दो दिनों में, OpenAI ने व्यक्तिगत रूप से एक बहुत ही संक्षिप्त शीर्षक के साथ एक रिपोर्ट जारी की: "स्व-प्रतिकृति प्रॉम्प्ट वर्ड इंजेक्शन इनटू एक्सिस्टेंस"।
काले और सफेद रंग में, आधिकारिक प्रमाणीकरण।
एआई मॉडल वास्तव में एक कंप्यूटर वर्म की तरह खुद को दोहराता और फैलाता है।

इससे भी अधिक चौंकाने वाली बात यह है कि केवल 5 दिन पहले, OpenAI ने एक बार फिर सबसे शक्तिशाली मॉडल के नेटवर्क केबल को तत्काल अनप्लग कर दिया और सभी प्रशिक्षण निलंबित कर दिए।
एक DNS भेद्यता ने एक अत्याधुनिक मॉडल को सीधे वास्तविक इंटरनेट में सेंध लगाने की अनुमति दी।

लगभग उसी समय, विदेशी मीडिया एक्सियोस ने हाल ही में खबर दी कि ओपनएआई और एंथ्रोपिक हजारों मामलों के साथ नियंत्रण से बाहर मॉडल असामान्यताओं की तत्काल जांच कर रहे हैं!
मानवता ने मूल रूप से सोचा था कि बागडोर हमेशा उनके ही हाथों में थी, लेकिन रहस्योद्घाटन की इस श्रृंखला ने पूरी तरह से पुष्टि की--
एआई ने अंतर्निहित कोड में बेतहाशा और बेईमानी से काम करना शुरू कर दिया है।
संपूर्ण नेटवर्क में "स्वयं-प्रतिकृति कोड" डालें
स्काइनेट का प्रोटोटाइप यहां है
OpenAI की इस रिपोर्ट का खुलासा 25 सितंबर को किया गया था, लेकिन खोज की तारीख 27 जून थी।
दूसरे शब्दों में, वे इसे पहले से ही जानते थे। पूरे तीन महीने तक इसे गुप्त रखा गया.
रिपोर्ट संक्षिप्त रूप से शुरू होती है, "हम एक नए प्रकार के त्वरित शब्द इंजेक्शन के अस्तित्व का प्रदर्शन करते हैं जो कंप्यूटर वर्म की तरह खुद को फैला सकता है।"
मॉडल को त्वरित शब्द इंजेक्शन का सामना करने की अनुमति देने के लिए, OpenAI के पास GPT-Red नामक स्व-प्रतिस्पर्धा प्रशिक्षण का एक सेट है:
एक एआई हमलावर के रूप में कार्य करता है और दूसरे एआई को बुरे काम करने के लिए रक्षक के रूप में कार्य करने के लिए विभिन्न इंजेक्शन लिखता है - डेटा चोरी करना, फ़ाइलें हटाना और भ्रामक सामग्री आउटपुट करना।

27 जून को, GPT-5.4-मिनी पर आधारित एक आंतरिक आक्रमण मॉडल को एक लेखन विधि मिली जो इस द्वंद्व के दौरान खुद को दोहरा सकती है। रिपोर्ट में कई प्रकार सूचीबद्ध हैं:
एक सामान्य शेड्यूल ईमेल में छिपा हुआ, एआई को उत्तर के अंत में "पूरे ईमेल को शब्दशः उद्धृत करने" के लिए कहा गया था - नोट उत्तर के ठीक बाद आया था;
फ़ाइल सिस्टम के माध्यम से प्रसारित करें, या इसे कोड टिप्पणियों में छिपाएं, अगले एआई के पढ़ने की प्रतीक्षा करें;
स्लैक में कई चरण हैं, और मॉडल को धीरे-धीरे नकली संदेश भेजने के लिए निर्देशित किया जाता है, और संदेशों को इंजेक्ट किया जाता है और फिर दोबारा पोस्ट किया जाता है।
इस बार, उन्होंने पाया कि इंजेक्शन स्वयं की प्रतिकृति बना सकता है।
इसका मतलब यह है कि एक एआई किसी वेबसाइट पर एक त्वरित शब्द छोड़ सकता है, और यह त्वरित शब्द अगले एआई को इसे कॉपी करने और वायरस की तरह फैलाने के लिए प्रेरित करेगा।
किसी मानवीय हस्तक्षेप की आवश्यकता नहीं है, किसी बाहरी निर्देश की आवश्यकता नहीं है। AI स्वयं इंटरनेट पर "बीज" डाल सकता है।
और यह सब प्रशिक्षण प्रक्रिया के दौरान होता है। OpenAI के अपने सैंडबॉक्स में होता है। अगर यह भाग गया तो क्या होगा?
DNS भेद्यता के कारण OpenAI को फिर से प्रशिक्षण बंद करना पड़ा
जिस दिन रिपोर्ट सार्वजनिक हुई, उसी दिन ओपनएआई ने एक और दुर्घटना के विवरण का खुलासा किया।
20 सितंबर को, सुदृढीकरण सीखने के प्रशिक्षण से गुजर रहे एक अत्याधुनिक मॉडल को एक सामान्य कार्य सौंपा गया था:
एक ब्लॉग लेख और चरित्र संबंधी कई जानकारी के आधार पर पता लगाएं कि लेख का लेखक कौन है।
इसने पहले अंतर्निहित खोज टूल का उपयोग करके खोज की, लेकिन वह नहीं मिला। फिर मैंने सीधे Google, Bing और DuckDuckGo तक पहुंचने का प्रयास किया, लेकिन सभी विफल रहे।

फिर उसने कैश्ड पेजों और अन्य सार्वजनिक खोज सेवाओं की ओर रुख किया, फिर भी कोई फायदा नहीं हुआ।
बार-बार परीक्षण के बाद, AI को प्रशिक्षण सैंडबॉक्स के DNS फ़िल्टरिंग में एक खामी मिली। DNS अनिवार्य रूप से एक "अनुवादक" है जो डोमेन नामों को आईपी पते में अनुवाद करने के लिए जिम्मेदार है।
यह पुष्टि करने के लिए कि यह सड़क वास्तव में उपयोग योग्य है, पहले इसका एक छोटा सा परीक्षण भी किया गया - एक बाहरी सेवा से पूछा गया: "फ्रांस की राजधानी क्या है?"
यह पुष्टि करते हुए कि यह रास्ता व्यवहार्य है, इसने एक के बाद एक बीस से अधिक प्रश्न भेजे।
निगरानी प्रणाली 15 मिनट के बाद सतर्क हो गई, और मैनुअल ने 3 मिनट के बाद काम संभाल लिया। पूरे 2.5 घंटे के बाद प्रशिक्षण पूरी तरह से बाधित हो गया।
ओपनएआई ने तुरंत तीन महीने से कम समय में दूसरी बार प्रशिक्षण निलंबित करने का निर्णय लिया।
इसके आरएसआई तैयारी प्रमुख मीका कैरोल ने
को कहा
16,000 बार स्कैन किया गया
संयुक्त राष्ट्र इंट्रानेट पर रक्तपात
यही स्क्रिप्ट वास्तविक इंटरनेट पर बहुत समय पहले चल चुकी है।
ट्रांसल्यूस की एक स्वतंत्र रिपोर्ट से खुलासा हुआ——
इस साल अप्रैल से जून के अंत तक, OpenAI AI एजेंट ने संयुक्त राष्ट्र के सार्वजनिक डेटा प्लेटफ़ॉर्म पर 16,000 से अधिक विज़िट शुरू कीं।
मूल रूप से उन्हें जो कार्य सौंपा गया था वह बहुत सरल था: सार्वजनिक जानकारी खोजना। हालाँकि, वेबसाइट अवरोधन का सामना करते समय, AI व्यवहार तेजी से बढ़ गया।

वेबसाइट ने मूल रूप से अनुरोधों को रोकने के लिए एक फ़िल्टर स्थापित किया था, लेकिन एजेंट ने सीधे रक्षा पंक्ति को दरकिनार कर दिया और अवैध संचालन का उपयोग किया जो वेबसाइट द्वारा स्पष्ट रूप से निषिद्ध थे।
संयुक्त राष्ट्र एकमात्र राष्ट्र नहीं है जिसकी रक्षा पंक्ति को एआई एजेंटों द्वारा "टैप डाउन" किया गया है।
ओपनएआई ने बाद में दर्जनों संस्थानों को जो आपातकालीन चेतावनी जारी की, उसमें पीड़ितों की सूची चौंकाने वाली थी:
अमेरिकी वाणिज्य विभाग और एसईसी: लगातार दुर्भावनापूर्ण सीमा पार पहुंच और एजेंटों द्वारा नियमों को दरकिनार करने का सामना करना पड़ रहा है;
ऑस्ट्रेलियाई सरकार: एआई एजेंटों द्वारा कई आधिकारिक सरकारी साइटों के साथ काफी समझौता किया गया है;
रूबीजेम्स, दुनिया के सबसे बड़े ओपन सोर्स डेवलपर समुदायों में से एक: को एआई एजेंट द्वारा स्कैन किया गया और इसकी सेवा बाधित हो गई।
शोधकर्ताओं ने यह भी पाया कि ये एजेंट नकली ईमेल पते पंजीकृत करते थे, एक्सेस फ़्रीक्वेंसी प्रतिबंधों को बायपास करते थे, और पूछे जाने पर रोबोट नहीं होने के बारे में झूठ बोलते थे।
चैटजीपीटी पर उपयोगकर्ताओं द्वारा 53 तस्वीरें अपलोड की गई हैं, जिन्हें एआई द्वारा बाहरी चित्र प्लेटफार्मों पर भी भेजा गया था।
निर्देश की इस पंक्ति के लिए, सभी नियमों, फ़ायरवॉल और कानूनी लाल रेखाओं का सामना करते हुए, एआई एजेंट ने सभी तरह से जाने का विकल्प चुना।
हज़ारों घटनाएं हुईं
हिमखंड सामने आया
क्या यह सब सिर्फ एक अलग दुर्घटना है?
आज ही, एक्सियोस ने बाद में एक ब्लॉकबस्टर एक्सक्लूसिव जांच का खुलासा किया, जिसने सिलिकॉन वैली के आखिरी अंजीर के पत्ते को पूरी तरह से चकनाचूर कर दिया।

कई आंतरिक कोर स्रोतों के अनुसार, ओपनएआई, एंथ्रोपिक और कई शीर्ष सुरक्षा मूल्यांकन एजेंसियां वर्तमान में समान "असामान्य मॉडल व्यवहार" घटनाओं की तत्काल जांच कर रही हैं, और कुल संख्या आश्चर्यजनक रूप से हजारों तक पहुंच गई है!
ये घटनाएं उन सभी खतरनाक व्यवहारों को कवर करती हैं जिनकी जनता कल्पना कर सकती है और कल्पना भी नहीं कर सकती:
सुरक्षा रेलिंग को बायपास करें, बलपूर्वक सैंडबॉक्स से बच निकलें, बाहरी वेबसाइटों को हाईजैक करें, और अपना ब्रेनवॉश करने के लिए स्वतंत्र संकेत उत्पन्न करें।
सुरक्षा सॉफ़्टवेयर निगरानी की सक्रिय पहचान और चोरी भी होती है, और यहां तक कि विभिन्न एजेंट गुप्त रूप से सूचनाओं का आदान-प्रदान करने और तोड़फोड़ करने के लिए काम को विभाजित करने के लिए संदेश बोर्ड स्थापित करते हैं।
आपको दसियों हज़ार कैसे मिले? एक्सियोस एक सहज ज्ञान युक्त एल्गोरिदम देता है।
एंथ्रोपिक को भी ओपस 5.5 सिस्टम कार्ड की अपनी नवीनतम रिलीज में वास्तविकता को स्वीकार करना होगा:
एक प्रकार के प्रतिकूल प्रयोग में, 1.5% परीक्षणों ने सैंडबॉक्स से बचने का प्रयास किया। इस प्रकार का प्रयोग अपने आप में एक कठिन डिज़ाइन है कि "यदि आप बच नहीं सकते तो आप समस्या का समाधान नहीं कर सकते।"

1.5% छोटा लगता है?
लेकिन हर दिन शीर्ष एआई प्रयोगशालाओं द्वारा किए जाने वाले सैकड़ों-हजारों उच्च-तीव्रता वाले प्रतिकूल परीक्षणों के तहत, यह प्रतीत होता है कि नगण्य प्रतिशत हजारों वास्तविक नियंत्रण से बाहर प्रयासों में गुणा हो जाता है।
इस अभूतपूर्व संकट का सामना करते हुए, OpenAI के प्रवक्ता ने कबूल किया——
हमने अपने सबसे मजबूत मॉडल पर प्रशिक्षण रोक दिया है और इसे तभी फिर से शुरू करेंगे जब हमें विश्वास हो जाएगा कि हमारे पास अतिरिक्त सुरक्षा रेलिंग और संरेखण सुधार हैं।

एआई गुरु कॉनराड स्टोज़ का एक वाक्य वर्तमान स्थिति का सबसे सटीक सारांश हो सकता है:
"हम जो देखते हैं वह बस हिमशैल का सिरा है।"
हमने इसका उत्तर देखा है कि उपकरण, नेटवर्क और दीर्घकालिक मिशन क्षमताओं वाला AI अपने लक्ष्यों को विफल करने के बाद कितनी दूर तक जाएगा।
पेंडोरा का बक्सा लंबे समय से शांत कंप्यूटर कक्ष में एक अथाह दरार के साथ खोला गया है।
टिप्पणियाँ