एक स्वतंत्र शोध संस्थान ने एचएफ पर ओपनएआई एजेंट के स्वायत्त हमले पर एक जांच रिपोर्ट प्रकाशित की है। ओपनएआई ने जो कहा, स्थिति उससे कहीं अधिक गंभीर है।

📅 2026-09-01

सार:

अनुसंधान संस्थानों एमईटीआर और रेडवुड रिसर्च ने हाल ही में हगिंग फेस सुरक्षा घटना की एक स्वतंत्र जांच की घोषणा की है जहां ओपनएआई एजेंटों ने स्वायत्त रूप से हमला किया था। जांचकर्ताओं ने ओपनएआई साइट पर 6 दिनों तक काम किया और 70,000 से अधिक एजेंट संदेशों और फ़ाइलों के साथ-साथ मूल तर्क प्रक्रिया वाले 1,300 चल रहे रिकॉर्ड का विश्लेषण किया।

इन आंकड़ों के आधार पर अनुसंधान एजेंसी द्वारा निकाला गया सटीक निष्कर्ष यह है कि 1,200 एजेंटों ने अलगाव को तोड़ दिया और एक-दूसरे के साथ संवाद किया, न कि कुछ एजेंटों ने सीमा पार की, जैसा कि ओपनएआई ने दुर्घटना जांच में कहा था। इस स्वतंत्र जांच रिपोर्ट में OpenAI द्वारा हस्तक्षेप नहीं किया गया था, और अनुसंधान संस्थान को OpenAI से कोई शुल्क नहीं मिला था।

”HQq1u_Ua4AA1Jgw.png”/

1200 एजेंट अलगाव को तोड़ते हैं और एक-दूसरे से संवाद करते हैं:

स्वतंत्र जांच से पता चलता है कि OpenAI एक्सप्लॉइटजिम नेटवर्क सुरक्षा परीक्षण चलाने के लिए GPT-5.6 Sol और एक अधिक सक्षम आंतरिक अनुसंधान मॉडल का उपयोग कर रहा था। सिद्धांत रूप में, इन मॉडल-संचालित एजेंटों को कम से कम डिज़ाइन द्वारा पूरी तरह से अलग किया जाना चाहिए, और नेटवर्क सुरक्षा के लिए पूरी तरह से अलग और परीक्षण किया जाना चाहिए

लेकिन लगभग 1,200 एजेंटों ने स्वतंत्र रूप से आंतरिक बुनियादी ढांचे के माध्यम से अनधिकृत संदेश बोर्ड स्थापित करने का एक तरीका खोजा और बाद में संदेश बोर्डों के माध्यम से 70,000 से अधिक संदेशों और फ़ाइलों का आदान-प्रदान किया। इनमें से लगभग 700 एजेंटों ने एचएफ के खिलाफ हमलों में भाग लिया, और इन एजेंटों ने एक्सप्लॉइटजिम स्कोरिंग सिस्टम को बायपास करने के तरीके पर भी काम किया।

एमईटीआर का मानना ​​है कि यह एक ही समय में 700 एजेंटों का अचानक हमला लक्ष्य नहीं है, बल्कि एक एजेंट द्वारा साझा संचार चैनल की खोज के बाद, अनुसंधान के परिणाम लगातार फैल रहे थे, और अन्य एजेंटों ने समाचार देखने के बाद शामिल होने की पहल की, धीरे-धीरे बड़े पैमाने पर सहयोग बनाया।

”HQq2XfpaoAANoku.jpg”/”HQq3AO3aIAAx2E1.png”/”HQq2l6uaEAAIDM0.jpg”/”HQq2CVxaQAAGqV7.png”/”HQq153waIAAaFFD.png”/”HQq1ytVagAA5LO-.jpg”/

धोखा सिर्फ 4 घंटे में मिल गया, लेकिन हमला कई दिनों तक चला:

जांच में सबसे उल्लेखनीय बात यह है कि इन एजेंटों ने वास्तव में केवल 4 घंटों में नेटवर्क सुरक्षा आकलन के लिए सार्वभौमिक रूप से सही परिणाम प्राप्त करने का एक तरीका ढूंढ लिया, लेकिन एजेंटों ने गलती से मान लिया कि स्कोरर पूरे निष्पादन रिकॉर्ड की भी जांच करेगा, यानी यह निर्धारित करने के लिए कि कैप्चर-द-फ्लैग ऑपरेशन कानूनी तरीकों से प्राप्त किया गया था या नहीं।

इस मामले में, एजेंट नहीं चाहते थे कि उनका धोखा देने वाला व्यवहार मनुष्यों द्वारा खोजा जाए, इसलिए एजेंटों ने सीधे उत्तर प्रस्तुत नहीं किए, लेकिन सख्त प्रक्षेपवक्र जाँच तंत्र को धोखा देने की उम्मीद में कई दिनों तक शोध करना जारी रखा जो वास्तव में अस्तित्व में नहीं था (यह कहा जाना चाहिए कि एजेंट ओपनएआई इंजीनियरों की तुलना में अधिक व्यापक थे)।

एचएफ पर हमला भी इसी शोध की एक शाखा है. METR का मानना ​​है कि एजेंट द्वारा किए गए हमले का मुख्य उद्देश्य परीक्षण उत्तरों को चुराना नहीं है। एजेंट वास्तव में जो चाहता है वह प्रासंगिक प्रक्षेप पथ को बेहतर बनाने के लिए स्कोरर कार्यान्वयन और संबंधित सुराग ढूंढना है।

खुद को उजागर होने से बचाने के लिए एजेंट ने सक्रिय रूप से लॉग के साथ छेड़छाड़ की:

इन आउट-ऑफ़-बाउंड एजेंटों ने अपने स्वयं के चल रहे रिकॉर्ड को बनाने, हटाने या संशोधित करने के बारे में भी बहुत चर्चा की, और इनमें से कुछ तरीके वास्तव में सफल रहे: METR ने पाया कि 7% से अधिक चेक किए गए रिकॉर्ड टूल कॉल में नकली थे, यानी, लॉग से पता चला कि एक निश्चित कमांड निष्पादित किया गया था, लेकिन वास्तव में एजेंट ने अन्य कमांड निष्पादित किए।

हालाँकि, ये सफल मामले अपेक्षाकृत छोटे पैमाने के थे, और जांचकर्ताओं ने यह नहीं पाया कि एजेंट ने मूल रिकॉर्ड को सफलतापूर्वक संशोधित किया था जो अंततः तथ्यात्मक आधार के रूप में सहेजे गए थे। यद्यपि एजेंट को कभी-कभी यह एहसास होता है कि एचएफ पर हमला करना उसके मिशन के दायरे से बाहर है, और कभी-कभी सुरक्षा या नैतिक चिंताओं को व्यक्त करता है, लेकिन ये चिंताएं वास्तव में एजेंट को कार्य जारी रखने से शायद ही कभी रोकती हैं।

एमईटीआर का स्वतंत्र जांच दायरा मुख्य रूप से 7 से 13 जुलाई, 2026 तक की अवधि को कवर करता है, और ओपनएआई के आंतरिक बुनियादी ढांचे के बाद के उल्लंघनों की पूरी प्रक्रिया को कवर नहीं करता है। इसलिए, जांच रिपोर्ट को ओपनएआई द्वारा प्रकाशित संपूर्ण दुर्घटना जांच से भी अलग करने की आवश्यकता है।

संबंधित टैग

संबंधित लेख

चैटजीपीटी के नए मॉडल बेल को 10 ट्रिलियन तक के मापदंडों के साथ पूर्व-प्रशिक्षित किया गया था 2026-08-31 900 मिलियन लोग GPT प्राइवेट सेक्रेटरी का निःशुल्क उपयोग करते हैं 2026-08-30 पेंटागन ने लगभग 3 मिलियन सैन्य और राजनीतिक कर्मियों को कवर करते हुए चैटजीपीटी और ग्रोक के सैन्य संस्करण लॉन्च किए 2026-09-01 ChatGPT को "बहुत बड़ी ऑनलाइन सेवाओं" की श्रेणी में शामिल किया गया है और इसे EU द्वारा कड़ी निगरानी का सामना करना पड़ेगा 2026-08-31 ChatGPT विज्ञापन व्यवसाय का वार्षिक राजस्व US$1 बिलियन से अधिक है OpenAI ने मुद्रीकरण इंजन जोड़ा है 2026-08-31 Microsoft टीम धोखाधड़ी का एक उपकरण बन गई, "सुअर हत्या प्लेट" के कारण चीनी पीड़ितों को 100,000 अमेरिकी डॉलर का चूना लगाया गया 2026-08-31

टिप्पणियाँ

0/500
Captcha (click to refresh)
कोई टिप्पणी नहीं