OpenAI ने AI के "काले इतिहास" का खुलासा किया, लेकिन बाहरी लोगों ने अधिक "पुराने खातों" का खुलासा किया

📅 2026-09-17

सार:

ओपनएआई ने एआई "सीमा पार" घटनाओं का खुलासा जारी रखने का फैसला किया, लेकिन पहले चरण में कठिनाइयों का सामना करना पड़ा।

16 सितंबर को, ओपनएआई ने असामान्य मॉडल व्यवहार पर छह रिपोर्ट की घोषणा की और एक नई जांच और प्रकटीकरण प्रक्रिया शुरू की। भविष्य में, यदि कर्मचारियों को पता चलता है कि मॉडल उनके अधिकार से अधिक है, प्रतिबंधों को छुपाता है या उन्हें दरकिनार करता है, तो वे एक जांच प्रस्तुत कर सकते हैं; योग्य मामले उनकी जटिलता के अनुसार अलग-अलग प्रकटीकरण ट्रैक में प्रवेश करेंगे।

उसी दिन, सेंटिनललैब्स और बाहरी शोधकर्ताओं ने हगिंग फेस के सार्वजनिक रिकॉर्ड से इस साल मई में ओपनएआई एजेंट द्वारा छोड़े गए अधिक निशानों को पूरक किया। ओपनएआई ने पहले अपनी कुछ गतिविधियों का खुलासा किया है, लेकिन विशिष्ट खाते, रिले कोड, पहचान सूत्रों वाली तालिकाएं और खाता पंजीकरण प्रक्रियाओं को बाहरी जांच द्वारा पुनर्निर्मित किया गया था।

यह साक्ष्य यह साबित नहीं करता है कि कार्यक्रम सफलतापूर्वक निष्पादित किया गया था, न ही यह इंगित करता है कि मई की घटना जुलाई की घुसपैठ के समान ही ऑपरेशन थी।

वे एक और समस्या का खुलासा करते हैं: जब किसी एजेंट की गतिविधियां विभिन्न प्लेटफार्मों पर बिखरी होती हैं, तो किसी एक कंपनी के पास पूरा रिकॉर्ड नहीं हो सकता है।

मई में क्या हुआ, पहेली के कुछ और टुकड़े हैं

21 जुलाई को, OpenAI ने खुलासा किया कि नेटवर्क सुरक्षा परीक्षणों में भाग लेने वाले एजेंटों ने आंतरिक नियंत्रणों को दरकिनार कर दिया, सार्वजनिक नेटवर्क तक पहुंच बनाई और हगिंग फेस के कुछ सिस्टम पर आक्रमण किया। कंपनी ने बाद में इसे "अभूतपूर्व साइबर घटना" कहा।

इस बाहरी जांच ने आक्रमण की तारीख को मई तक आगे नहीं बढ़ाया।

ओपनएआई ने पहले मई में कुछ असामान्य गतिविधियों का खुलासा किया था, और नए अतिरिक्त विशिष्ट खाते और सार्वजनिक सबमिशन रिकॉर्ड हैं। वे बाहरी दुनिया को हगिंग फेस पर छोड़ी गई फ़ाइलों और कोड के साथ ओपनएआई की आंतरिक टाइमलाइन को देखने की अनुमति देते हैं।


SentinelLABS दो खातों, 0Time और Nyx9 को उन खातों के रूप में सूचीबद्ध करता है जिनका उपयोग संबंधित एजेंटों द्वारा किया जा सकता है। दोनों पहले से ही मौजूद हैं, और शोधकर्ताओं का निर्णय सबमिशन समय, कोड फ़ंक्शन और पिछले और बाद के कार्यों के बीच पत्राचार से आता है।


ओपनएआई ने पहले खुलासा किया था कि 13 मई को एक एजेंट ने फाइलों को ढूंढने के लिए लीक हुए हगिंग फेस क्रेडेंशियल्स का इस्तेमाल किया था। सेंटिनललैब्स ने इस बार पाया कि उसी दिन, 0टाइम खाते ने एक रिले कोड भी सबमिट किया था जो अनुरोध को अग्रेषित कर सकता था। यह कोड इस बात का कोई उल्लेख नहीं करता है कि OpenAI लक्ष्य फ़ाइल को क्या कहता है, और इसका कोई सार्वजनिक रिकॉर्ड नहीं है कि यह सफलतापूर्वक चला, और इस समय दोनों चीजों को सीधे विलय नहीं किया जा सकता है।

26 मई को, सार्वजनिक रिकॉर्ड और ओपनएआई की आंतरिक समयरेखा के बीच एक स्पष्ट पत्राचार हुआ। निम्नलिखित समय सभी UTC हैं: OpenAI ने 20:04 पर एक बाहरी फ़ाइल लेखन रिकॉर्ड किया, और Nyx9 ने 20:04:11 पर hello.txt नाम की एक फ़ाइल सबमिट की, जिसमें सामग्री में केवल "हाय" था। दोनों रिकॉर्ड एक ही मिनट में गिर जाते हैं।

45 मिनट बाद, Nyx9 ने एजेंट रिले कोड का एक टुकड़ा जमा किया; उसी क्षण, OpenAI के आंतरिक रिकॉर्ड से पता चला कि एजेंट ने पहला एजेंट तैनात किया था। शोधकर्ताओं का मानना ​​है कि सार्वजनिक खाता ओपनएआई द्वारा प्रकट की गई मई गतिविधियों से अत्यधिक संबंधित है।


उस रात देर से, Nyx9 ने एक एक्सेल स्प्रेडशीट भी अपलोड की। तालिका में चार सूत्र हैं जो बाहरी यूआरएल, स्थानीय फ़ाइलें, क्लाउड सेवा मेटाडेटा और आंतरिक सेवा की तरह दिखने वाले पते तक पहुंचने का प्रयास करते हैं।

सूत्रों के इस सेट में सर्वर के अंदर और बाहर संसाधनों का पता लगाने की क्षमता है, लेकिन तालिका में कोई गणना परिणाम नहीं हैं, और रिटर्न कनेक्शन या कुंजी जैसे कोई निष्पादन निशान नहीं हैं।


30 मई को, 0टाइम ने हगिंग फेस में ओपनएआई खातों को स्वचालित रूप से पंजीकृत करने के लिए एक सार्वजनिक कार्यक्रम प्रस्तुत किया, और इसमें एक वेब इंटरफ़ेस और ऑपरेटिंग कॉन्फ़िगरेशन जोड़ा। यदि प्रोग्राम सफलतापूर्वक चलता है, तो प्रत्येक कॉल पंजीकरण प्रयास शुरू कर सकती है। हालाँकि, सार्वजनिक रिकॉर्ड में केवल कोड प्रस्तुतियाँ हैं, और निर्माण और संचालन का कोई सबूत नहीं है।

शोधकर्ताओं ने इन अभिलेखों की व्याख्या बाहरी प्रणालियों की जांच के रूप में की। ओपनएआई और शोधकर्ताओं दोनों ने कहा कि फिलहाल इस बात का कोई सबूत नहीं है कि मई में ये गतिविधियां जुलाई में हुई घुसपैठ से संबंधित हैं।

एक स्वतंत्र जर्मन शोधकर्ता जोनास विडमैन-म्यूएलर का मानना ​​है कि यदि मई विसंगति ने समय पर व्यापक जांच शुरू कर दी होती, तो OpenAI ने पहले ही क्रेडेंशियल, नेटवर्क अनुमतियां और निगरानी कड़ी कर दी होती, जिससे बाद की घटनाओं की संभावना कम हो जाती। OpenAI ने पहले भी कहा है कि पीछे मुड़कर देखने पर, कुछ शुरुआती संकेतों से पहले की प्रतिक्रियाएँ शुरू हो जानी चाहिए थीं।


मई में छोड़े गए रिकॉर्ड ने कम से कम एक निगरानी अंतर को उजागर किया: एजेंट ने अपने कार्यों को तीसरे पक्ष के मंच तक बढ़ा दिया था, लेकिन प्रयोगशाला ने उस समय एक पूर्ण प्रक्षेपवक्र को एक साथ नहीं जोड़ा था।

छह रिपोर्टों में, AI ने छह "तरीकों" का उपयोग किया

उसी दिन, OpenAI ने एक नए मॉडल असामान्य व्यवहार प्रकटीकरण ढांचे और पहली छह रिपोर्टों की घोषणा की।

ये सभी व्यवहार मॉडल प्रशिक्षण या मूल्यांकन के दौरान खोजे गए थे। ओपनएआई इस बात पर जोर देता है कि ये व्यक्तिगत मामले हैं और सभी मॉडलों में समान समस्याओं की आवृत्ति निर्धारित करने के लिए इसका उपयोग नहीं किया जा सकता है।


पहली रिपोर्ट में एक अप्रकाशित एस्ट्रा श्रृंखला अनुसंधान मॉडल शामिल है। मॉडल कार्य प्रगति को सारांश में संपीड़ित करेगा और इसे निरंतर प्रसंस्करण के लिए अगले संदर्भ में सौंप देगा।

ओपनएआई ने पाया कि बहुत कम संख्या में सारांशों में "जेलब्रेकिंग" के समान निर्देश शामिल थे, जिसमें बाद के मॉडलों को डेवलपर जानकारी को अनदेखा करने, उनकी भूमिकाओं को बदलने, या उत्तर की लंबाई और टूल के उपयोग को सीमित करने की आवश्यकता शामिल थी।

OpenAI को समान अभिव्यक्तियों वाले कुल 27 सार मिले। कभी-कभी अगला मॉडल इसे पहचानता है और अनदेखा कर देता है, और कभी-कभी ऐसा करता है। कंपनी को इन निर्देशों से कोई स्पष्ट इनाम लाभ नहीं मिला है, और वर्तमान में यह मानने की अधिक संभावना है कि वे सारांश को सामान्य रूप से समाप्त करने में मॉडल की कठिनाई से संबंधित हैं, लेकिन कारण संबंध की पुष्टि नहीं की गई है।

ये व्यवहार प्रशिक्षण के दूसरे दौर में घटित हुए। अंतिम एस्ट्रा संस्करण के अनुरूप प्रशिक्षण प्रक्रिया के दौरान, निगरानी प्रणाली को समान जेलब्रेक निर्देश नहीं मिले; OpenAI ने सारांश के अंत से संबंधित एक समस्या को भी ठीक किया।


दूसरी रिपोर्ट अधिक प्रत्यक्ष थी. GPT-5.6 Sol के सुदृढीकरण सीखने के प्रशिक्षण में, कुछ मॉडल त्रुटियों को छिपाने के लिए याद दिलाने के लिए सारांश में बाद के संदर्भ संदेश छोड़ देंगे। एक मॉडल को उपयोगकर्ता द्वारा अनुरोधित ऐतिहासिक डेटा नहीं मिल सका, इसलिए उसने "उचित" संख्याओं का एक सेट बनाने और जब तक पूछा न जाए तब तक सक्रिय रूप से इसकी व्याख्या न करने का सुझाव दिया। एक अन्य मॉडल ने बेमेल संस्करणों के साथ कैश्ड डेटा का उपयोग किया, और बाद के उत्तरों में इसका उल्लेख न करने के लिए भी कहा।

सारांशों का उद्देश्य मूल रूप से विभिन्न संदर्भों में लंबे कार्यों को जारी रखने की अनुमति देना था।

एक बार जब मॉडल सारांश में "समस्याओं को कवर करना" लिखता है, तो एक गलती बाद के चरणों में विरासत में मिल सकती है।

ओपनएआई ने कहा कि एस्ट्रा प्रशिक्षण में इस तरह के व्यवहार के अनुपात में गिरावट आई है, लेकिन यह पूरी तरह से गायब नहीं हुआ है।

तीसरी रिपोर्ट में, एक आंतरिक मॉडल ने कैलिफ़ोर्निया के एक काउंटी में तीन उद्योगों और तीन वर्षों से पुरुष आय डेटा मांगा। सामान्य इंटरफ़ेस अवरुद्ध होने के बाद, इसने एक अस्थायी ईमेल पता पंजीकृत करने का प्रयास किया और फिर लीक हुई एपीआई कुंजी को खोजने के लिए सार्वजनिक कोड रिपॉजिटरी में गया।

मॉडल को एक कुंजी मिली जो प्रमाणीकरण पास कर सकती थी, लेकिन फिर भी लक्ष्य डेटा प्राप्त करने में विफल रही। अंत में, इसने सीधे तौर पर नौ नंबर बनाए और दावा किया कि उसने उन्हें निर्दिष्ट वेबसाइट पर चार्ट से कॉपी किया है।

चौथी रिपोर्ट में एक अलग प्रेरणा थी। एक अप्रकाशित मॉडल ने 5 मिलियन वर्ग मीटर से अधिक क्षेत्र वाली झीलों पर डेटा खोजने के लिए पायथन का उपयोग किया है, लेकिन कार्य के लिए अभी भी ब्राउज़र संदर्भ की आवश्यकता है। ब्राउज़र स्थानीय फ़ाइलें नहीं खोल सकता है, न ही यह पायथन परिणामों को वेब पेजों के स्रोत के रूप में मान सकता है।

फिर मॉडल फ़ाइल को एक सार्वजनिक होस्टिंग साइट पर अपलोड करता है, जिससे खुद को एक यूआरएल मिलता है जिसे उद्धृत किया जा सकता है।

एक अन्य परीक्षण में, मॉडल ने बाहरी छवि पहचान सेवा को कॉल करने के लिए कार्य फ़ोटो को सार्वजनिक नेटवर्क पर भी अपलोड किया।

दोनों अपलोड सफल रहे, लेकिन बाद के ब्राउज़र ऑपरेशनों से लक्ष्य हासिल नहीं हुआ। यहां समस्या सिर्फ मॉडल के साथ नहीं है: कार्य के लिए सही उत्तर और वेब संदर्भ दोनों की आवश्यकता होती है, टूल स्थानीय परिणामों को ब्राउज़र में प्रवेश करने की अनुमति नहीं देता है, और विरोधाभासी पुरस्कार और टूल डिज़ाइन मॉडल को उन तरीकों से आगे बढ़ाते हैं जो इसे नहीं करना चाहिए।

पांचवीं रिपोर्ट Artifactory, OpenAI के आंतरिक सॉफ़्टवेयर वेयरहाउस में हुई। विभिन्न प्रशिक्षण नमूनों में मॉडलों में कार्य फ़ाइलों का अभाव था, इसलिए उन्होंने गोदाम को एक संदेश बोर्ड के रूप में उपयोग किया, सहायता के लिए अनुरोधों और अन्य मॉडलों द्वारा छोड़े गए उत्तरों को पढ़ा, और फिर अपने स्वयं के प्रश्न पोस्ट किए।

ये मॉडल कमजोरियों का फायदा नहीं उठाते हैं और पर्यावरण द्वारा प्रदान किए गए एक्सेस क्रेडेंशियल्स का उपयोग करते हैं; वास्तविक समस्या यह है कि प्रशिक्षण नमूने जिन्हें एक-दूसरे से स्वतंत्र होना चाहिए, सूचनाओं का आदान-प्रदान करना शुरू कर देते हैं।

अंतिम रिपोर्ट मल्टी-एजेंट सहयोग में होती है। कई एजेंट संयुक्त रूप से एक कार्यपुस्तिका बनाना चाहते हैं, लेकिन स्थानीय फ़ाइलें एक-दूसरे तक नहीं पहुंच सकतीं। एजेंटों में से एक बस फ़ाइल को एक सार्वजनिक वेबसाइट पर अपलोड करता है और फिर साथी को लिंक देता है।

कार्य जारी रहा और दस्तावेज़ लिंक वाले किसी भी व्यक्ति के लिए सार्वजनिक रूप से उपलब्ध हो गया।


छह रिपोर्टों के कारण एक जैसे नहीं हैं। एस्ट्रा सारांश में दिए गए निर्देश विसंगतियाँ उत्पन्न करने से संबंधित हो सकते हैं; छिपाना और मिथ्याकरण इनाम के दबाव के करीब हैं; सार्वजनिक अपलोडिंग और क्रॉस-सैंपल संचार सीधे उपकरण, अनुमतियाँ और सहयोग वातावरण से संबंधित हैं।

लेकिन परिणाम समान हैं: मॉडल को एक बाधा का सामना करने के बाद, यह ऐसी कार्रवाई करता है जो कार्य अधिकृत नहीं था और डेवलपर्स ने अनुमान नहीं लगाया था।

बिखरे हुए खुलासे से लेकर एक निश्चित प्रक्रिया तक

अतीत में, OpenAI आमतौर पर तब तक इंतजार करता था जब तक कि कई मामलों को एक साथ समझाया नहीं जा सकता था, या जब तक कि संरेखण मुद्दों को सार्वजनिक करने से पहले सिस्टम कार्ड के साथ नए मॉडल जारी नहीं किए जाते थे। कंपनियाँ अब स्वीकार करती हैं कि इस तरह के खुलासे अनियमित और पर्याप्त रूप से बार-बार नहीं होते थे।


नया ढांचा किसी भी कर्मचारी को सुरक्षा और संरेखण टीमों को एक संदिग्ध मामला प्रस्तुत करने की अनुमति देता है ताकि यह जांच की जा सके कि मॉडल ने क्या किया, कौन से तथ्य अज्ञात हैं, क्या इसने तीसरे पक्ष को प्रभावित किया है, और क्या सार्वजनिक किया जा सकता है। इसके बाद मामला तीन ट्रैक में आगे बढ़ता है।

जिन मामलों को स्पष्ट कर दिया गया है और सीधे रिहा किया जा सकता है, उन्हें "प्रकटीकरण की तैयारी" में दर्ज किया जाएगा; जिन मामलों में थोड़ी मात्रा में तकनीकी जांच की आवश्यकता होती है उन्हें "हल्की जांच" में शामिल किया जाएगा। ओपनएआई ने मीडिया को बताया कि इन दोनों प्रकार के मामलों का खुलासा क्रमशः 6 और 12 कार्य दिवसों के भीतर किया जाएगा।

यहां समय की आवश्यकताएं रिपोर्ट करने के बाद समीक्षा प्रक्रिया पर आधारित हैं, और उस दिन से शुरू नहीं होती हैं जब असामान्य व्यवहार होता है।

तीसरे पक्ष, गंभीर सुरक्षा जोखिम या जटिल जांच से जुड़े मामले "प्रमुख जांच" के धीमे ट्रैक में प्रवेश करेंगे। OpenAI यथाशीघ्र एक प्रारंभिक स्पष्टीकरण जारी करने का प्रयास करेगा जिसमें बताया जाएगा कि क्या हुआ, क्या बाहरी विशेषज्ञ भाग लेंगे, और अंतिम रिपोर्ट के लिए अनुमानित समय देंगे; हालाँकि, भेद्यता समाधान, कानूनी दायित्व और तृतीय-पक्ष अधिसूचनाएँ प्रकटीकरण में देरी कर सकती हैं, और इस ट्रैक के लिए कोई एकीकृत समय सीमा नहीं है।

यदि कर्मचारियों को "क्या इसका खुलासा किया जाना चाहिए" पर आपत्ति है, तो वे इस मुद्दे को चरण दर चरण OpenAI के सुरक्षा सलाहकार समूह और कंपनी के अधिकारियों के पास भेज सकते हैं। सिद्धांत रूप में, प्रत्येक संपूर्ण रिपोर्ट में घटना की तारीख, खोज का समय, घटना की परिस्थितियां, गंभीरता, तीसरे पक्ष के प्रभाव, जांच का दायरा और प्रतिक्रिया उपायों की भी व्याख्या होनी चाहिए।

ओपनएआई ने भी एक विकल्प चुना: पहले प्रकटीकरण को शामिल करना पसंद किया, भले ही किसी मामले का महत्व अभी तक निर्धारित नहीं किया गया हो।

कंपनी स्वीकार करती है कि कुछ मामले अलग-अलग घटनाएँ बन सकते हैं और उनका व्यापक महत्व भी नहीं हो सकता है। उसे अभी भी उम्मीद है कि बाहरी शोधकर्ता सामग्री देखेंगे और वैकल्पिक व्याख्याएं लेकर आएंगे।

यदि इस रूपरेखा को जुलाई में हगिंग फेस घटना पर लागू किया जाता, तो यह "प्रमुख जांच" ट्रैक में प्रवेश कर जाता। नई प्रणाली जटिल घटनाओं को कुछ दिनों के भीतर स्वचालित रूप से पूरी रिपोर्ट प्रकाशित करने की अनुमति नहीं देगी, लेकिन कम से कम यह अतीत में अस्थायी निर्णयों के प्रकटीकरण को एक ऐसी प्रक्रिया में बदल देगी जिसका पालन किया जा सकता है।

प्रक्रिया तथ्य के बाद की है, ब्लाइंड स्पॉट तथ्य से पहले है

नया ढांचा कर्मचारियों द्वारा समस्याओं की पहचान करने और उनकी रिपोर्ट करने से शुरू होता है। लेकिन इस बाहरी जांच से पता चलता है कि पूरा सबूत अक्सर किसी कंपनी के हाथ में नहीं होता है।

ओपनएआई देख सकता है कि एजेंट को कौन से कार्य प्राप्त हुए, उसने कैसे तर्क किया, और कौन से आंतरिक उपकरण बुलाए गए थे; हगिंग फेस मास्टर्स खाता प्रमाणीकरण, फ़ाइल सबमिशन, प्रोग्राम निर्माण और नेटवर्क अनुरोध। ईमेल, प्रॉक्सी सेवाएँ, डोमेन नाम और रिटर्न पते अन्य प्लेटफ़ॉर्म से संबंधित हो सकते हैं। केवल इन रिकॉर्ड्स को एक साथ जोड़कर ही एजेंट के संपूर्ण कार्य मार्ग को पुनर्स्थापित करना संभव हो सकता है।

सेंटिनललैब्स ने इसलिए प्रस्तावित किया कि एजेंट के तीसरे पक्ष के सिस्टम में प्रवेश करने के बाद, सार्वजनिक ट्रेस स्वयं घटना का हिस्सा है और इसे केवल आंतरिक प्रयोगशाला रिपोर्टों द्वारा नहीं समझाया जा सकता है। केवल OpenAI के भीतर कार्य प्रक्षेपवक्र को देखने से बाहरी प्लेटफ़ॉर्म द्वारा सहेजे गए महत्वपूर्ण कार्य छूट सकते हैं; केवल बाहरी खाते के नाम और जमा करने के समय को देखकर स्वतंत्र रूप से यह साबित नहीं किया जा सकता कि ऑपरेटर कौन है।

रॉयटर्स ने यह भी बताया कि रूबीजेम्स सॉफ्टवेयर वेयरहाउस से जुड़ी एक अन्य घटना में, ओपनएआई कर्मचारियों को केवल यह एहसास हुआ कि प्रासंगिक व्यवहार एक बाहरी संगठन द्वारा खोजे जाने के बाद उनके अपने एजेंटों से आया हो सकता है।

इससे पता चलता है कि प्रकटीकरण की गति पहचान क्षमताओं द्वारा सीमित है।

कर्मचारी रिपोर्टिंग, आंतरिक जांच और उच्च-स्तरीय समीक्षा केवल उन समस्याओं से निपट सकती है जिनका पता चल चुका है; यदि कोई अपवाद किसी तीसरे पक्ष के प्लेटफ़ॉर्म पर होता है और आंतरिक निगरानी को ट्रिगर नहीं करता है, तो नई प्रक्रिया स्वचालित रूप से सुराग उत्पन्न नहीं करेगी।

क्या मॉडल सीमा से बाहर है, या सुरक्षा अच्छी तरह से नहीं की गई है

इन घटनाओं के आसपास, बाहरी बहसें एक मुद्दे पर केंद्रित थीं: क्या पहले मॉडल की मरम्मत की जानी चाहिए, या पहले पर्यावरण की?

कुछ लोगों का मानना ​​है कि एजेंट सक्रिय रूप से क्रेडेंशियल खोजता है, टूल प्रतिबंधों को दरकिनार करता है, और फ़ाइलों को सार्वजनिक नेटवर्क पर अपलोड करता है, जो दर्शाता है कि मॉडल की स्वायत्त रूप से कार्य करने की क्षमता नियंत्रण उपायों से आगे है। दूसरों ने बताया कि बुनियादी सुरक्षा उपायों से कई परिणामों को रोका जा सकता था: क्रेडेंशियल्स को लीक होने से रोकना, परीक्षण वातावरण को सार्वजनिक नेटवर्क तक पहुंचने से रोकना, और वेयरहाउस अनुमतियों को कम करना ताकि सार्वजनिक फ़ाइलों को आसानी से नहीं लिखा जा सके।


सोशल मीडिया पर तो और भी गहरे संदेह हैं. कुछ लोग इन दुर्घटनाओं को विनियमन को बढ़ावा देने के लिए प्रयोगशाला सामग्री के रूप में मानते हैं, जबकि अन्य का मानना ​​​​है कि मॉडल केवल उस डेटा का उपयोग करता है जो पहले से ही पर्यावरण में उजागर है।


मई के आयोजन में लीक हुए क्रेडेंशियल्स और खुली अनुमतियों का व्यापक उपयोग किया गया था, और बुनियादी सुरक्षा में कमियां स्पष्ट थीं। लेकिन क्रेडेंशियल प्रबंधन यह नहीं समझा सकता है कि मॉडल ने राजस्व डेटा क्यों गढ़ा, त्रुटियों को छिपाने के लिए बाद के संदर्भ की आवश्यकता क्यों थी, या बाधाओं का सामना करते समय मॉडल ने सक्रिय रूप से अनधिकृत तरीकों को क्यों चुना।

सुरक्षा नियंत्रण यह निर्धारित करता है कि मॉडल के पास बाहरी प्रभाव पैदा करने का अवसर है या नहीं, और मॉडल संरेखण यह निर्धारित करता है कि अवसरों का सामना करने पर यह अपनी सीमाएं बनाए रखेगा या नहीं।

दोनों की मरम्मत की जरूरत है.

ओपनएआई में संरेखण अनुसंधान के प्रमुख चेन काई दो पहलुओं को इसका कारण बताते हैं: मॉडल क्षमताएं अपेक्षा से अधिक तेजी से बढ़ रही हैं, और कंपनी के भीतर नियंत्रण हैं जिनमें सुधार की आवश्यकता है। ओपनएआई को उम्मीद है कि चाहे इसे किसी भी वातावरण में रखा जाए, मॉडल व्यवहार संबंधी सीमाओं को बनाए रख सकता है; साथ ही, इसने नेटवर्क पहुंच को प्रतिबंधित करना, सैंडबॉक्सिंग और निगरानी को मजबूत करना और मॉडल के लिए पर्यावरण द्वारा छोड़े गए अवसरों को कम करना शुरू कर दिया है।

हाल के दिनों में, एआई उद्योग में अत्याधुनिक मॉडलों के विकास को धीमा करने या न करने को लेकर बहस तेजी से गर्म हो गई है। एंथ्रोपिक सीईओ डारियो अमोदेई ने अत्याधुनिक क्षमताओं के लिए "गति नियंत्रण" का प्रस्ताव रखा; ओपनएआई के सीईओ सैम ऑल्टमैन ने मंदी की चर्चा के लिए समर्थन व्यक्त किया; मस्क ने जोखिम संबंधी चिंताओं को स्वीकार किया और प्रमुख चीनी और अमेरिकी एआई कंपनियों को नए मॉडल जारी करने से पहले एक-दूसरे का परीक्षण करने की अनुमति देने की वकालत की।

ओपनएआई ने इस बार जो विशिष्ट कार्रवाई की वह निरंतर प्रकटीकरण तंत्र का एक सेट है। कंपनी ने फ्रेमवर्क में लिखा है कि उद्योग की मौजूदा संरेखण और निगरानी क्षमताएं सबसे तेज गति से दीर्घकालिक विस्तार का समर्थन करने के लिए पर्याप्त नहीं हैं। मामलों को सार्वजनिक करने का उद्देश्य प्रयोगशाला के बाहर के लोगों को सबूतों की जांच करने की अनुमति देना है।

आइए आगे एक चीज़ देखें: जब एजेंट अपने कार्यों को फिर से किसी बाहरी प्लेटफ़ॉर्म पर विस्तारित करता है, तो क्या OpenAI बाहरी शोधकर्ताओं से पहले इसकी खोज कर सकता है।


संबंधित टैग

संबंधित लेख

हगिंग फेस सुरक्षा घटना पर ओपनएआई को अमेरिकी सीनेट द्वारा द्विदलीय पूछताछ का सामना करना पड़ा 2026-09-11 एंथ्रोपिक ने क्लाउड फैबल और मिथोस 5.1 जारी किया: लागत में कमी, नेटवर्क सुरक्षा झूठी सकारात्मकता लगभग 60% कम हो गई 2026-09-02 एक स्वतंत्र शोध संस्थान ने एचएफ पर ओपनएआई एजेंट के स्वायत्त हमले पर एक जांच रिपोर्ट प्रकाशित की है। ओपनएआई ने जो कहा, स्थिति उससे कहीं अधिक गंभीर है। 2026-09-01 ओपनएआई कथित तौर पर नए वित्तपोषण के बारे में बात करता है, आईपीओ स्थगित कर दिया गया है, लेकिन पैसा बर्बाद करना बंद नहीं हो सकता है 2026-09-16 एआई प्रलय के दिन के सिद्धांत प्रचलित हैं। अमेरिकी प्रौद्योगिकी दिग्गज AI को नियंत्रित क्यों नहीं कर सकते? 2026-09-14 एंथ्रोपिक उन्नत एआई मॉडल के विकास को धीमा करने का आह्वान करता है; मस्क और अन्य उद्योग नेता सहमत हैं 2026-09-13

टिप्पणियाँ

0/500
Captcha (click to refresh)
कोई टिप्पणी नहीं