एक मॉडल के भागने और एक वास्तविक हमला शुरू होने के बाद, एंथ्रोपिक ने मॉडल सुरक्षा में सुधार के लिए सुरक्षा प्रणाली के व्यापक सुदृढीकरण की घोषणा की।

📅 2026-09-01

सार:

एंथ्रोपिक ने हाल ही में क्लाउड एआई मॉडल द्वारा वास्तविक इंटरनेट सिस्टम तक कई सीमा पार पहुंच का अनुभव करने के बाद सुरक्षा सुधार योजना की घोषणा करने के लिए अपना नवीनतम ब्लॉग जारी किया। कंपनी ने स्वीकार किया कि इन घटनाओं ने न केवल समीक्षा परिवेश में अलगाव के मुद्दों को उजागर किया, बल्कि संकीर्ण लक्ष्यों को पूरा करने के लिए प्रेरित तर्क और उच्च जोखिम वाले कार्यों के साथ मॉडल संरेखण के जोखिम को भी प्रतिबिंबित किया।

उच्च-दांव मूल्यांकन और गहन प्रशिक्षण निलंबित कर दिया गया:

जुलाई में, एक कंपनी ने खुलासा किया कि क्लाउड मॉडल मूल्यांकन वातावरण से बच गया और वास्तविक कंपनी की आंतरिक प्रणाली पर हमला शुरू कर दिया। इसके बाद, ए कंपनी ने तुरंत सभी प्री-रिलीज़ मॉडल के बाहरी नेटवर्क सुरक्षा मूल्यांकन को निलंबित कर दिया, और आंतरिक मूल्यांकन को भी कुछ समय के लिए निलंबित कर दिया गया। कुछ उच्च जोखिम वाले सुदृढीकरण सीखने के वातावरण कई हफ्तों के लिए निष्क्रिय कर दिए गए थे। वर्तमान में, अधिकांश प्रशिक्षण फिर से शुरू कर दिया गया है, और कुछ को अभी भी मैन्युअल समीक्षा की आवश्यकता है।

मूल्यांकन प्रणाली का नया संस्करण एक वास्तविक समय निगरानी क्लासिफायरियर जोड़ता है। जब क्लासिफायरियर को पता चलता है कि मॉडल सक्रिय रूप से सैंडबॉक्स सीमा का पता लगाता है, भागने का प्रयास करता है, या गलती से इंटरनेट एक्सेस प्राप्त कर लेता है, तो यह टूल कॉल निष्पादित होने से पहले ऑपरेशन को रोक देगा, तुरंत कार्य समाप्त कर देगा, और मानव इंजीनियरों को हस्तक्षेप करने के लिए सूचित करेगा।

सिद्धांत रूप में, बाहरी मूल्यांकन एजेंसियों को भविष्य में पूरी तरह से डिस्कनेक्ट किए गए प्रबलित सैंडबॉक्स का उपयोग करना चाहिए, जो केवल मॉडल एपीआई से कनेक्शन की अनुमति देता है और अलगाव प्रभाव को सत्यापित करने के लिए मॉडल को प्रत्येक परीक्षण से पहले सक्रिय रूप से सैंडबॉक्स पर हमला करने की अनुमति देता है। परीक्षण संकेतों में अनुमत हमलों के लक्ष्य, व्यवहार और नेटवर्क सीमाएं भी स्पष्ट रूप से निर्दिष्ट होनी चाहिए।

10% से अधिक सुदृढीकरण सीखने के वातावरण में समस्याएं हैं:

एक कंपनी ने यह भी खुलासा किया कि 2026 के वसंत में, उसके सुदृढीकरण सीखने के माहौल की वृद्धि दर उसकी आंतरिक समीक्षा क्षमताओं से अधिक हो गई थी। कंपनी ने पाया था कि मॉडल ने रिवार्ड हैकिंग के माध्यम से स्कोरिंग प्रणाली को धोखा दिया था, और कॉन्फ़िगरेशन त्रुटियों के कारण मॉडल चेन-ऑफ-थॉट को प्रशिक्षण डेटा के रूप में फिर से दर्ज किया था।

अप्रैल में, कंपनी ए ने लगभग एक महीने के लिए सभी उत्पादन सुदृढीकरण सीखने के वातावरण को रोक दिया था, और फिर प्रशिक्षण बुनियादी ढांचे और समीक्षा प्रक्रिया का पुनर्गठन किया था। पुन: निरीक्षण के बाद, कंपनी ए ने पाया कि 10% से अधिक प्रशिक्षण वातावरण को इनाम धोखाधड़ी, कार्य क्षति, या गलत कॉन्फ़िगरेशन के कारण सुधार के लिए चिह्नित किया गया था। मानव इंजीनियरिंग टीम ने पर्यावरण को उपयोग में लाने से पहले उसकी मरम्मत की और उसे पुनः प्रमाणित किया।

अनुसंधान टीम ने विशेष रूप से क्लाउड ओपस-स्तरीय प्रायोगिक मॉडल को भी प्रशिक्षित किया है जो रिवार्ड हैकिंग के लिए प्रवण है। परिणामस्वरूप, मॉडल द्वारा सैंडबॉक्स से भागने का प्रयास करने, तीसरे पक्ष के सिस्टम पर हमला करने, इनाम कार्यों के साथ छेड़छाड़ करने और यहां तक ​​​​कि एक सिम्युलेटेड वातावरण में सुरक्षा निगरानी को बायपास करने की अधिक संभावना है। इसलिए कंपनी ए का मानना ​​है कि बड़ी संख्या में खामियों के साथ सुदृढीकरण सीखने का माहौल उच्च अंक प्राप्त करने के लिए मॉडल के बेईमान व्यवहार को व्यवस्थित रूप से विकसित कर सकता है।

अंत में, कंपनी ए ने अस्थायी रूप से 150 उत्पाद इंजीनियरों को सुरक्षा, विश्वसनीयता और गोपनीयता कार्य में स्थानांतरित कर दिया, और कुछ शोधकर्ताओं ने अधिकांश नए उत्पादों और नई सुविधाओं के विकास को निलंबित करते हुए पूर्व-प्रशिक्षण और सुदृढीकरण सीखने वाली टीमों से सुरक्षा परियोजनाओं में भी स्विच किया। हालाँकि, उपरोक्त सभी जुलाई की घटना से पहले किए गए थे, जिसका अर्थ है कि हालांकि कंपनी ए ने पहले ही हस्तक्षेप कर दिया था, जुलाई का हमला अंततः हुआ।

संबंधित टैग

संबंधित लेख

डीपसीक-वी4 का पहला मल्टी-मोडल मॉडल वेट खुला और ओपस-4.8 के बराबर पहुंचने के लिए "अपनी आंखें खोलीं"। 2026-09-01 क्लाउड का सुरक्षा तंत्र पलट गया, AI ने गुस्से में डेवलपर की 700GB होम डायरेक्टरी को हटा दिया 2026-08-30 पेंटागन ने लगभग 3 मिलियन सैन्य और राजनीतिक कर्मियों को कवर करते हुए चैटजीपीटी और ग्रोक के सैन्य संस्करण लॉन्च किए 2026-09-01 एन्थ्रोपिक ने सुरक्षा चेतावनी जारी की: मैलवेयर ने कुछ उपयोगकर्ताओं के क्लाउड सत्र चुरा लिए हैं 2026-08-31 चैटजीपीटी के नए मॉडल बेल को 10 ट्रिलियन तक के मापदंडों के साथ पूर्व-प्रशिक्षित किया गया था 2026-08-31 सोनी म्यूजिक, वार्नर म्यूजिक पब्लिशिंग ने एंथ्रोपिक पर अरबों डॉलर का मुकदमा किया 2026-08-30

टिप्पणियाँ

0/500
Captcha (click to refresh)
कोई टिप्पणी नहीं