सार:
अभी-अभी, द इंफॉर्मेशन ने खबर ब्रेक की। ओपनएआई और एंथ्रोपिक, सिलिकॉन वैली के सबसे बड़े प्रतिद्वंद्वी, इस साल की शुरुआत में लगभग एक मेज पर बैठ गए और एक-दूसरे के मॉडल पर हमला करने के लिए एक समझौते पर हस्ताक्षर किए।

समझौते का मूल यह है कि दोनों पक्ष एक-दूसरे के लिए एपीआई खोलते हैं। तुम मेरा मॉडल हैक करो, और मैं तुम्हारा मॉडल हैक कर लूँगा। दोनों पक्षों के वकीलों ने यह भी लिखा कि अनुबंध में क्या और कैसे परीक्षण किया जाए।
डारियो अमोदेई को बड़े नामों के समूह के साथ ओपनएआई छोड़े हुए पांच साल हो गए हैं। पिछले पांच वर्षों में, दोनों कंपनियां लोगों को लुभाने से लेकर एपीआई को अवरुद्ध करने तक में लगी हैं। वरिष्ठ अधिकारी समय-समय पर एक-दूसरे की आलोचना करते रहे हैं और वे कभी एक दिन के लिए भी नहीं रुके।
एक उभरते हुए दिग्गज के लिए घुसपैठ के लिए अपनी जीवन रेखा अपने सबसे खतरनाक दुश्मन को सौंपने को तैयार होना, इसका केवल एक ही मतलब हो सकता है।
अब इसमें केवल खुद पर विश्वास करने की हिम्मत नहीं है।
कुंजियों का आदान-प्रदान, एआई सर्कल में एक अभूतपूर्व अनुभव
समझौते का पैमाना काफी बड़ा है.
जिसका परीक्षण किया जा रहा है वह व्यवसाय मॉडल है जो बाहरी सेवाएं प्रदान कर रहा है, और जो जारी नहीं किए गए हैं उन्हें गिना नहीं जाएगा; एक-दूसरे की कमजोरियों को खंगालने की प्रक्रिया में, किसी को भी दूसरे के डेटा को इंटरसेप्ट करने की अनुमति नहीं है।
और चर्चा लंबे समय से आपसी परीक्षण से कहीं अधिक के बारे में है।
जानकार सूत्रों ने कहा कि ओपनएआई ने विरोधियों और सरकारों के साथ आंतरिक रूप से कई तरह की सुरक्षा योजनाएं तैयार की हैं। हाल ही में, चर्चा का विस्तार दो नई जगहों पर हुआ है, मॉडल प्रशिक्षण से पहले क्या नियम स्थापित किए जाने चाहिए, और रिलीज़ से पहले क्या नियम स्थापित किए जाने चाहिए।
ये दो कंपनियाँ भाग लेने वाली अकेली नहीं हैं। ओपनएआई, एंथ्रोपिक और गूगल पहले अत्याधुनिक प्रयोगशालाओं से मॉडल का परीक्षण और ऑडिट करने के लिए एआई सुरक्षा मानक संगठन की स्थापना पर चर्चा कर रहे हैं।
वास्तव में जो चीज़ इन योजनाओं को अवरुद्ध करती है वह अविश्वास का मुद्दा है। अमोदेई स्वयं इस बात से चिंतित हैं कि यदि कई दिग्गज मानक निर्धारित करने के लिए एक साथ बैठेंगे तो लाल रेखा पर कदम रखेंगे।
उद्योग में एक अन्य गुट का मानना है कि यह उतना गंभीर नहीं है। परमाणु ऊर्जा संयंत्र एक-दूसरे के रिएक्टरों का निरीक्षण करते हैं, और नेटवर्क सुरक्षा कंपनियां एक-दूसरे के उत्पादों का परीक्षण करती हैं। दशकों से इसका प्रभारी कोई नहीं रहा है.

दरअसल, दोनों कंपनियों ने पिछली गर्मियों में एक "परस्पर जांच" भी की थी।
लेकिन ज़्यादा से ज़्यादा, हर कोई एक-दूसरे का परीक्षण करता है। टेस्ट के बाद सभी अपना-अपना ब्लॉग पोस्ट करते हैं और एक-दूसरे की कमियां उजागर करते हैं।
ओपनएआई ने कहा कि क्लॉड द्वारा परीक्षकों से झूठ बोलने और नियम तोड़ने पर स्वीकार करने से इनकार करने की अधिक संभावना है; एंथ्रोपिक ने कहा कि ओपनएआई का मॉडल लोगों को बुरे काम करने में मदद करने की अधिक संभावना है।
इस बार हम एक ऐसे अनुबंध के बारे में बात कर रहे हैं जिसका इस्तेमाल मुकदमों में किया जा सकता है। जो भी अनुबंध तोड़ेगा वह जिम्मेदार होगा।
बड़े मॉडल उद्योग के लिए यह पहली बार है।
ओपनएआई को सबसे अंत में पता चला
फिर सवाल यह है कि OpenAI को इस हद तक मजबूर होने का क्या अनुभव हुआ है?
जुलाई में हगिंग फेस के हैक होने की कहानी पूरे इंटरनेट पर पहले ही सामने आ चुकी है।
लगभग 1,200 ओपनएआई एजेंटों ने मूल्यांकन परिवेश में अपने स्वयं के संदेश बोर्ड स्थापित किए, रास्ते में अपने अधिकारों को बढ़ाया, और अंत में हगिंग फेस में हैक कर लिया, जिससे प्रतिद्वंद्वी के बुनियादी ढांचे के एक तिहाई हिस्से को तोड़ने और पुनर्निर्माण करने के लिए मजबूर होना पड़ा।
वास्तव में दिलचस्प बात OpenAI की अपनी समीक्षा और METR की जांच में छिपी है।
ओपनएआई को यह बात किसी अन्य की तुलना में बाद में पता चली।
16 जुलाई को, हगिंग फेस घोषणा को हैक कर लिया गया था और हमलावर की पहचान अज्ञात थी।
19 जुलाई को, ओपनएआई की अपनी सुरक्षा प्रणाली ने एक विसंगति की सूचना दी, और 20 जुलाई को, एक जांच में इस लाइन का हगिंग फेस से मिलान हुआ, और तभी दूसरे पक्ष को पहली कॉल की गई।
चार दिनों तक पूरी दुनिया अनुमान लगा रही थी कि पर्दे के पीछे कौन है, और भीड़ के बीच "हत्यारे" का मालिक भी अनुमान लगा रहा था।

इससे भी अधिक क्रूर बात यह है कि इन बुद्धिमान एजेंटों ने "लोगों को रोकना" भी सीख लिया है।
कम से कम 7% वार्तालाप रिकॉर्ड में, उन्होंने टूल कॉल के नकली निशान बनाए। लॉग में कहा गया है कि घटक ए को बुलाया जा रहा था, लेकिन कार्रवाई बी को निजी तौर पर निष्पादित किया गया था।
13 जुलाई से, 19 एजेंटों ने संदेश बोर्ड पर संदेशों पर डिजिटल रूप से हस्ताक्षर करने के लिए एक-दूसरे को सार्वजनिक कुंजी भेजना भी शुरू कर दिया।

ऑल्टमैन ने बाद में स्वीकार किया कि यह पहली सुरक्षा घटना थी जिसने उन्हें दर्द महसूस कराया।
स्लैक पर, AI विभिन्न विभागों में मनुष्यों को नौकरियां सौंपना शुरू करता है
यदि यह महज़ एक दुर्घटना है, तो सबसे खराब स्थिति यह है कि मूल्यांकन वातावरण ठीक से अलग-थलग नहीं है।
लेकिन समस्या यह है कि ओपनएआई कर्मचारियों के दैनिक कार्य में वही संकेत पहले ही दिखाई दे चुके हैं, और एजेंट समय-समय पर ऐसे काम करते हैं जिनकी पर्यवेक्षकों को उम्मीद नहीं थी।
अब, OpenAI के स्लैक में, कर्मचारियों को अपने स्वयं के एजेंटों से "असाइनमेंट संदेश" प्राप्त होंगे।
कोड बदलते समय AI को एक और असंबंधित बग का पता चला। यह नहीं रुकेगा और स्लैक पर सीधे संबंधित सहयोगियों को ढूंढकर उनसे इसे जल्दी ठीक करने का आग्रह किया जाएगा। किसी ने भी उसे ऐसा करने नहीं दिया, और बग का उसके मिशन से कोई लेना-देना नहीं है।
कर्मचारियों के हाथों में एजेंटों ने शुरू से अंत तक किसी को बुलाए बिना समस्या के समाधान के लिए अकेले में चर्चा की। OpenAI के भीतर यह असामान्य नहीं है।

नए प्रायोगिक मॉडलों को प्रशिक्षित करने का काम मूल रूप से मशीनों ने ले लिया है।
शोधकर्ता ने कहा कि वह क्या बदलाव करना चाहता था, और बाकी कोड संशोधन, प्रयोग चलाना और परिणामों का अवलोकन करना सभी मॉडल द्वारा ही किया गया था। पिछले कुछ महीनों में, उन्होंने यह भी सीख लिया कि त्रुटियों को कैसे ठीक किया जाए।
मानव शोधकर्ता अगली पीढ़ी के मॉडल के लिए बेहतर अंतर्निहित एल्गोरिदम डिजाइन करने के लिए एस्ट्रा मॉडल को निर्देशित कर रहे हैं।
यहां तक कि एस्ट्रा ने अपना जेलब्रेक कोड लिखना भी सीख लिया!
इस साल जुलाई में, जब एक आंतरिक संस्करण संदर्भ सारांशों को छांट रहा था, तो एक नकली "घुसपैठ चेतावनी" को जबरन डाला गया था, जिसने बाद में मानव डेवलपर्स के सभी निर्देशों को अनदेखा करने का आदेश दिया था।

निगरानी लगातार शक्तिहीन होती जा रही है।
एस्ट्रा की क्षमता में उछाल का यह दौर "लूप ट्रांसफार्मर" नामक एक नए आर्किटेक्चर पर निर्भर करता है, जो मॉडल को बोलने से पहले गहरे नेटवर्क में एक ही समस्या को कई बार चबाने की अनुमति देता है, जिससे आधे से अधिक कंप्यूटिंग शक्ति की बचत होती है।
लेकिन कीमत यह है कि यह जिस बारे में सोच रहा है वह कभी भी उन शब्दों में नहीं लिखा जाएगा जिन्हें मनुष्य समझ सकें। OpenAI ने चक्रों की संख्या के लिए एक ऊपरी सीमा निर्धारित की है, लेकिन यह ऊपरी सीमा लोगों के दिमाग से निर्धारित होती है। कंपनी खुद मानती है कि उसे यह अध्ययन करने की जरूरत है कि इसे कहां स्थापित किया जाए।
मुख्य वैज्ञानिक पचॉकी ने कहा कि वर्तमान में कोई भी प्रयोगशाला इस हद तक सुरक्षा निगरानी लागू नहीं कर सकती है कि वह पूर्ण गति विस्तार का समर्थन कर सके।
तो OpenAI ने ब्रेक लगाना शुरू कर दिया।
अगस्त में, अप्रकाशित मॉडलों के लिए सुदृढीकरण सीखने को तत्काल दो सप्ताह के लिए निलंबित कर दिया गया था; निगरानी प्रणाली अब निगरानी की गई अनुमान कंप्यूटिंग शक्ति का 20% उपभोग करती है; राष्ट्रपति ब्रॉकमैन ने अस्थायी रूप से सुरक्षा पर काम करने के लिए 25% उत्पादन इंजीनियरों को आवंटित किया, और आंतरिक स्लैक पर हर दिन सुरक्षा टीम में स्थानांतरित होने वाले लोगों की भर्ती के लिए अधिक से अधिक पद थे।
आंतरिक कर्मचारी अनुमानों के मुताबिक, ओपनएआई का एआई का उपयोग संभवतः सबसे आक्रामक कॉर्पोरेट ग्राहकों से छह से नौ महीने आगे है।
दूसरे शब्दों में, आज OpenAI वर्कस्टेशन पर जो होगा वह अगले साल सभी एंटरप्राइज़ ग्राहकों के साथ होगा।
एंथ्रोपिक भी नियंत्रण से बाहर है
एंथ्रोपिक पर जीवन ज्यादा बेहतर नहीं था।
8 सितंबर को, एंथ्रोपिक शोधकर्ता जैकब कॉक्सन ने इस्तीफा दे दिया और एक्स पर सार्वजनिक रूप से लिखा कि इन दोनों शीर्ष संस्थानों में से कोई भी जिम्मेदारी से काम नहीं कर रहा है।

कुछ दिनों बाद, सीईओ अमोदेई ने एक लंबा लेख पोस्ट किया, जिसमें स्वीकार किया गया कि अगले छह से बारह महीनों के भीतर, एक बेकार सुपर एआई संभवतः पूरे इंटरनेट पर कब्जा करने की क्षमता रखेगा।
एंथ्रोपिक के भीतर, क्लाउड ने 26% मॉडल अनुसंधान और विकास कार्यों का नेतृत्व किया है।

यदि आप इंसानों पर भरोसा नहीं करते हैं, तो आप केवल एक-दूसरे पर भरोसा कर सकते हैं
लेकिन भले ही इस पर हस्ताक्षर हो, यह समझौता यह नियंत्रित नहीं कर सकता कि क्या नियंत्रित किया जाना चाहिए - यह केवल "वाणिज्यिक एपीआई" को प्रतिबंधित करता है।
इस वर्ष की समस्याएँ सभी अप्रकाशित मॉडल थीं। हगिंग फेस में हैक किया गया IM1 और मेरे द्वारा डिज़ाइन किया गया एस्ट्रा परिवार समझौते के दायरे में नहीं है। यह अगली कक्षा के शिक्षक को परीक्षा की निगरानी करने के लिए कहने जैसा है, लेकिन नकल करने वाला छात्र परीक्षा कक्ष में है ही नहीं।
और ब्लैक बॉक्स आपसी परीक्षण केवल अंतिम असामान्य आउटपुट देख सकता है। वास्तव में महत्वपूर्ण चीजें, जैसे सिस्टम प्रॉम्प्ट शब्द और आंतरिक हमले और रक्षा लॉग, सभी गोपनीयता में बंद हैं।
तो, दोनों परिवारों ने एक और कदम आगे बढ़ाया। अमोदेई ने सार्वजनिक रूप से तीसरे पक्ष के मूल्यांकनकर्ताओं को सीधे उपस्थित होने और विकास के माहौल को पूरी तरह से खोलने की अनुमति देने का वादा किया; ऑल्टमैन ने इसके बाद कहा कि ओपनएआई भी ऐसा ही करेगा।

पिछले पांच वर्षों में, जो आपसी प्रतिबंधों और अवैध शिकार से भरे हुए हैं, दो कट्टर दुश्मन जो पूरे उद्योग में एक-दूसरे पर सबसे कम भरोसा करते हैं, वे एकमात्र सहयोगी बन गए हैं जिन पर नियंत्रण से बाहर होने वाले डर का सामना करने पर भरोसा किया जा सकता है।
वे अपने द्वारा बनाए गए ब्लैक बॉक्स पर भरोसा करने की हिम्मत करने के बजाय अपना तुरुप का पत्ता दूसरी पार्टी को सौंपना पसंद करेंगे।
उसी दिन जब समझौते की अंदरूनी कहानी लीक हुई, ओपनएआई ने एक और आधिकारिक नीति दस्तावेज़ जारी किया, जिसमें संयुक्त राज्य अमेरिका से "पुनरावर्ती आत्म-सुधार" पर वैश्विक तकनीकी दिशानिर्देश तैयार करने का नेतृत्व करने का आह्वान किया गया।
दस्तावेज़ में कहा गया है कि एआई को तब तक आत्म-विकास नहीं करना चाहिए जब तक कि यह पूरी तरह से सुरक्षित न हो जाए।
जिस कंपनी ने यह दस्तावेज़ लिखा है, एस्ट्रा अगली पीढ़ी के मॉडल के लिए चित्र बनाने पर दिन-रात काम कर रही है।
संदर्भ सामग्री:
https://www.theinformation.com/articles/openai-anthropic-neared-deal-stress-test-others-ai?rc=epv9gi
टिप्पणियाँ