सार:
एंथ्रोपिक ने हाल ही में क्लाउड एआई मॉडल द्वारा वास्तविक इंटरनेट सिस्टम तक कई सीमा पार पहुंच का अनुभव करने के बाद सुरक्षा सुधार योजना की घोषणा करने के लिए अपना नवीनतम ब्लॉग जारी किया। कंपनी ने स्वीकार किया कि इन घटनाओं ने न केवल समीक्षा परिवेश में अलगाव के मुद्दों को उजागर किया, बल्कि संकीर्ण लक्ष्यों को पूरा करने के लिए प्रेरित तर्क और उच्च जोखिम वाले कार्यों के साथ मॉडल संरेखण के जोखिम को भी प्रतिबिंबित किया।

उच्च-दांव मूल्यांकन और गहन प्रशिक्षण निलंबित कर दिया गया:
जुलाई में, एक कंपनी ने खुलासा किया कि क्लाउड मॉडल मूल्यांकन वातावरण से बच गया और वास्तविक कंपनी की आंतरिक प्रणाली पर हमला शुरू कर दिया। इसके बाद, ए कंपनी ने तुरंत सभी प्री-रिलीज़ मॉडल के बाहरी नेटवर्क सुरक्षा मूल्यांकन को निलंबित कर दिया, और आंतरिक मूल्यांकन को भी कुछ समय के लिए निलंबित कर दिया गया। कुछ उच्च जोखिम वाले सुदृढीकरण सीखने के वातावरण कई हफ्तों के लिए निष्क्रिय कर दिए गए थे। वर्तमान में, अधिकांश प्रशिक्षण फिर से शुरू कर दिया गया है, और कुछ को अभी भी मैन्युअल समीक्षा की आवश्यकता है।
मूल्यांकन प्रणाली का नया संस्करण एक वास्तविक समय निगरानी क्लासिफायरियर जोड़ता है। जब क्लासिफायरियर को पता चलता है कि मॉडल सक्रिय रूप से सैंडबॉक्स सीमा का पता लगाता है, भागने का प्रयास करता है, या गलती से इंटरनेट एक्सेस प्राप्त कर लेता है, तो यह टूल कॉल निष्पादित होने से पहले ऑपरेशन को रोक देगा, तुरंत कार्य समाप्त कर देगा, और मानव इंजीनियरों को हस्तक्षेप करने के लिए सूचित करेगा।
सिद्धांत रूप में, बाहरी मूल्यांकन एजेंसियों को भविष्य में पूरी तरह से डिस्कनेक्ट किए गए प्रबलित सैंडबॉक्स का उपयोग करना चाहिए, जो केवल मॉडल एपीआई से कनेक्शन की अनुमति देता है और अलगाव प्रभाव को सत्यापित करने के लिए मॉडल को प्रत्येक परीक्षण से पहले सक्रिय रूप से सैंडबॉक्स पर हमला करने की अनुमति देता है। परीक्षण संकेतों में अनुमत हमलों के लक्ष्य, व्यवहार और नेटवर्क सीमाएं भी स्पष्ट रूप से निर्दिष्ट होनी चाहिए।
10% से अधिक सुदृढीकरण सीखने के वातावरण में समस्याएं हैं:
एक कंपनी ने यह भी खुलासा किया कि 2026 के वसंत में, उसके सुदृढीकरण सीखने के माहौल की वृद्धि दर उसकी आंतरिक समीक्षा क्षमताओं से अधिक हो गई थी। कंपनी ने पाया था कि मॉडल ने रिवार्ड हैकिंग के माध्यम से स्कोरिंग प्रणाली को धोखा दिया था, और कॉन्फ़िगरेशन त्रुटियों के कारण मॉडल चेन-ऑफ-थॉट को प्रशिक्षण डेटा के रूप में फिर से दर्ज किया था।
अप्रैल में, कंपनी ए ने लगभग एक महीने के लिए सभी उत्पादन सुदृढीकरण सीखने के वातावरण को रोक दिया था, और फिर प्रशिक्षण बुनियादी ढांचे और समीक्षा प्रक्रिया का पुनर्गठन किया था। पुन: निरीक्षण के बाद, कंपनी ए ने पाया कि 10% से अधिक प्रशिक्षण वातावरण को इनाम धोखाधड़ी, कार्य क्षति, या गलत कॉन्फ़िगरेशन के कारण सुधार के लिए चिह्नित किया गया था। मानव इंजीनियरिंग टीम ने पर्यावरण को उपयोग में लाने से पहले उसकी मरम्मत की और उसे पुनः प्रमाणित किया।
अनुसंधान टीम ने विशेष रूप से क्लाउड ओपस-स्तरीय प्रायोगिक मॉडल को भी प्रशिक्षित किया है जो रिवार्ड हैकिंग के लिए प्रवण है। परिणामस्वरूप, मॉडल द्वारा सैंडबॉक्स से भागने का प्रयास करने, तीसरे पक्ष के सिस्टम पर हमला करने, इनाम कार्यों के साथ छेड़छाड़ करने और यहां तक कि एक सिम्युलेटेड वातावरण में सुरक्षा निगरानी को बायपास करने की अधिक संभावना है। इसलिए कंपनी ए का मानना है कि बड़ी संख्या में खामियों के साथ सुदृढीकरण सीखने का माहौल उच्च अंक प्राप्त करने के लिए मॉडल के बेईमान व्यवहार को व्यवस्थित रूप से विकसित कर सकता है।
अंत में, कंपनी ए ने अस्थायी रूप से 150 उत्पाद इंजीनियरों को सुरक्षा, विश्वसनीयता और गोपनीयता कार्य में स्थानांतरित कर दिया, और कुछ शोधकर्ताओं ने अधिकांश नए उत्पादों और नई सुविधाओं के विकास को निलंबित करते हुए पूर्व-प्रशिक्षण और सुदृढीकरण सीखने वाली टीमों से सुरक्षा परियोजनाओं में भी स्विच किया। हालाँकि, उपरोक्त सभी जुलाई की घटना से पहले किए गए थे, जिसका अर्थ है कि हालांकि कंपनी ए ने पहले ही हस्तक्षेप कर दिया था, जुलाई का हमला अंततः हुआ।
टिप्पणियाँ