सार:
ओपनएआई धीरे-धीरे यूरोपीय संघ में चैटजीपीटी और कोडेक्स द्वारा उत्पन्न टेक्स्ट में अदृश्य वॉटरमार्क जोड़ रहा है ताकि एआई-जनरेटेड सामग्री की सुपाठ्यता के लिए ईयू आर्टिफिशियल इंटेलिजेंस अधिनियम की आवश्यकताओं को पूरा किया जा सके। ओपनएआई ने कहा कि टेक्स्टग्रेन नामक यह टेक्स्ट वॉटरमार्किंग तकनीक लेख में छिपे हुए अक्षर, अदृश्य स्थान या विशेष विराम चिह्न नहीं जोड़ती है। इसके बजाय, जब मॉडल टेक्स्ट उत्पन्न करता है तो यह शब्द चयन विधि को समायोजित करता है, जिससे पूरे टेक्स्ट में एक सांख्यिकीय विशेषता बनती है जिसे सीधे मानव आंखों द्वारा नहीं पहचाना जा सकता है लेकिन मशीन द्वारा पहचाना जा सकता है।

ओपनएआई द्वारा जारी की गई जानकारी के अनुसार, यूरोपीय संघ के आर्टिफिशियल इंटेलिजेंस अधिनियम की प्रासंगिक पारदर्शिता आवश्यकताएं 2 अगस्त, 2026 को लागू होंगी। जेनरेटिव एआई सेवा प्रदाताओं के लिए मशीन-पहचानने योग्य चिह्नों के साथ एआई-जनरेटेड सामग्री की आवश्यकता होती है। इसलिए OpenAI अगले कुछ हफ्तों में EU में पात्र चैटजीपीटी और कोडेक्स उपयोगकर्ताओं के लिए धीरे-धीरे टेक्स्ट वॉटरमार्क पेश करने की योजना बना रहा है, और यह तैनाती केवल भुगतान करने वाले उपयोगकर्ताओं को नहीं, बल्कि सभी चैटजीपीटी पैकेजों को कवर करेगी।
इस प्रकार का वॉटरमार्क पारंपरिक अर्थ में "छिपे हुए पाठ" से भिन्न है। जब उपयोगकर्ता चैटजीपीटी द्वारा उत्पन्न सामग्री की प्रतिलिपि बनाते हैं, तो एक छिपे हुए चरित्र को उसी समय कॉपी नहीं किया जाएगा, और पाठ में कोई विशेष प्रतीक नहीं मिलेगा। कई संभावित शब्दों का सामना करने पर टेक्स्टग्रेन वास्तव में मॉडल की यादृच्छिक चयन संभावना को बदलता है। एक शब्द में परिवर्तन पूरी तरह से अज्ञात हो सकता है, लेकिन जब बड़ी संख्या में शब्द संयुक्त होते हैं, तो एक सांख्यिकीय पैटर्न बन सकता है जिसे पहचान प्रणाली पहचान सकती है।
ओपनएआई ने कहा कि इस डिज़ाइन का लाभ यह है कि यह सामान्य टेक्स्ट आउटपुट में महत्वपूर्ण बदलाव नहीं करता है। कंपनी के परीक्षणों में पाया गया कि वॉटरमार्क जोड़ने और वॉटरमार्क जोड़े बिना मॉडल के प्रदर्शन में अंतर सामान्य परीक्षण उतार-चढ़ाव सीमा के भीतर था, और पाठ पीढ़ी की गति पर प्रभाव भी बहुत छोटा था। OpenAI के ChatGPT के पिछले आंतरिक परीक्षण के दौरान, यह नहीं पाया गया कि वॉटरमार्क फ़ंक्शन के कारण नकारात्मक उपयोगकर्ता समीक्षाओं में वृद्धि हुई।
हालाँकि, OpenAI ने यह भी स्वीकार किया कि टेक्स्ट वॉटरमार्किंग AI सामग्री की पहचान करने का 100% विश्वसनीय तरीका नहीं है। वॉटरमार्क पहचान में दो संभावित त्रुटियाँ हैं। एक तो यह कि बिना वॉटरमार्क वाले टेक्स्ट को गलत तरीके से वॉटरमार्क वाला मान लिया जाता है, और दूसरा यह कि टेक्स्ट में वास्तव में वॉटरमार्क होता है, लेकिन डिटेक्शन सिस्टम इसे पहचान नहीं पाता है।
पाठ की लंबाई भी पता लगाने के परिणामों को प्रभावित करने वाला एक महत्वपूर्ण कारक है। छोटे पाठ में शब्द चयन को समायोजित करने के लिए मॉडल के लिए कम जगह होती है, जिससे स्थिर सांख्यिकीय संकेत बनाना अधिक कठिन हो जाता है। ओपनएआई द्वारा प्रकाशित नियम यह भी दिखाते हैं कि ईयू एआई पारदर्शिता विनिर्देशों के अनुसार, टेक्स्ट वॉटरमार्क जोड़ने के लिए 200 से कम टोकन, लगभग 150 अंग्रेजी शब्दों और कोड स्निपेट्स के आउटपुट की आवश्यकता नहीं है।
विभिन्न भाषाओं के बीच पता लगाने के परिणामों में भी अंतर होता है। OpenAI ने यूरोपीय संघ की सभी 24 आधिकारिक भाषाओं का परीक्षण किया। 1% की झूठी सकारात्मक दर बनाए रखते हुए, स्पेनिश की पहचान दर अधिकतम 69% तक पहुंच गई, जबकि रोमानियाई की पहचान दर केवल 42.2% थी। कमजोर पहचान प्रभाव वाली भाषाओं के लिए, ओपनएआई पहचान क्षमताओं को बढ़ाने के लिए वॉटरमार्क ताकत बढ़ा सकता है।
इसका मतलब यह है कि टेक्स्टग्रेन को ऐसी तकनीक के रूप में नहीं समझा जा सकता है जो वॉटरमार्क देखने पर 100% साबित कर सकती है कि यह ChatGPT द्वारा उत्पन्न किया गया था। ओपनएआई यह स्पष्ट करता है कि भले ही मूल पाठ को संशोधित नहीं किया गया हो, इस बात की कोई गारंटी नहीं है कि डिटेक्शन सिस्टम वॉटरमार्क का पता लगाने में सक्षम होगा, खासकर जब पाठ छोटा हो या चयन योग्य शब्दों की सीमा छोटी हो।
साथ ही, बाज़ार में वर्तमान में मौजूद टेक्स्ट वॉटरमार्क और AI टेक्स्ट डिटेक्टरों के बीच स्पष्ट अंतर हैं। पंग्राम जैसे तृतीय-पक्ष एआई पहचान उपकरण मुख्य रूप से यह निर्धारित करने के लिए क्लासिफायर का उपयोग करते हैं कि क्या शब्द चयन, वाक्य संरचना और अन्य भाषा सुविधाओं का विश्लेषण करके एआई द्वारा पाठ का एक टुकड़ा उत्पन्न होने की संभावना है। यह विधि पाठ उत्पन्न होने के बाद उसका विश्लेषण करती है, जबकि टेक्स्टग्रेन पाठ निर्माण प्रक्रिया के दौरान सीधे मशीन-पठनीय सांख्यिकीय संकेत छोड़ता है।
ओपनएआई का मानना है कि यह दृष्टिकोण "एम्बेडेड" पहचान योग्य संकेतों के लिए ईयू एआई अधिनियम की आवश्यकताओं के अनुरूप है।
OpenAI ने सीधे तौर पर Google DeepMind के SynthID या अन्य मौजूदा टेक्स्ट वॉटरमार्किंग समाधानों को नहीं अपनाया, बल्कि अपने दम पर textGrain विकसित किया। कंपनी ने कहा कि उसकी स्व-विकसित तकनीक उसे वॉटरमार्क की पहचान क्षमता और मॉडल आउटपुट की विविधता के बीच संतुलन को अधिक लचीले ढंग से समायोजित करने की अनुमति देती है। आंतरिक परीक्षण में, टेक्स्टग्रेन ने वॉटरमार्क वाले टेक्स्ट को उस दर पर पहचाना जो कंपनी द्वारा परीक्षण किए गए अन्य समाधानों के बराबर या उससे अधिक थी, जिसमें टेक्स्ट के लिए सिंथआईडी भी शामिल था।
ओपनएआई भी ओपन सोर्स टेक्स्टग्रेन तकनीक की योजना बना रहा है, उम्मीद है कि अन्य शोध संस्थान और कंपनियां इस तकनीक का उपयोग आगे के शोध और एआई टेक्स्ट स्रोत पहचान में सुधार के लिए कर सकती हैं। हालाँकि, OpenAI टेक्स्ट वॉटरमार्क डिटेक्टर को तुरंत जनता के लिए नहीं खोलेगा, बल्कि पहले अनुमोदित शोधकर्ताओं और पेशेवर संस्थानों को एप्लिकेशन चैनल प्रदान करेगा।
ये अधिकृत शोधकर्ता और संस्थान यह निर्धारित करने के लिए ओपनएआई के डिटेक्शन टूल का उपयोग कर सकते हैं कि पाठ के एक टुकड़े में ओपनएआई द्वारा उत्पन्न वॉटरमार्क है या नहीं, लेकिन पता लगाने के परिणाम उपयोगकर्ता की पहचान, शीघ्र शब्दों या उत्पन्न सामग्री के अनुरूप चैट रिकॉर्ड को प्रकट नहीं करेंगे। ओपनएआई का मानना है कि चूंकि वर्तमान तकनीक में अभी भी झूठी सकारात्मकता और झूठी नकारात्मकता का जोखिम है, इसलिए सभी के लिए सीधे पहचान उपकरण खोलने से वॉटरमार्क पहचान परिणामों की अत्यधिक व्याख्या हो सकती है।
यह ध्यान देने योग्य है कि OpenAI इस बार विश्व स्तर पर डिफ़ॉल्ट रूप से टेक्स्ट वॉटरमार्क को सक्षम करने की योजना नहीं बना रहा है। कंपनी ने कहा कि चैटजीपीटी और कोडेक्स के टेक्स्ट वॉटरमार्क को इस स्तर पर धीरे-धीरे केवल ईयू क्षेत्र के लिए जारी किया जाएगा। यह क्षेत्रीय तैनाती ओपनएआई को वास्तविक उपयोग के वातावरण में प्रदर्शन का निरीक्षण करने और वास्तविक प्रतिक्रिया के आधार पर प्रौद्योगिकी को समायोजित करने की अनुमति देगी।
एपीआई डेवलपर्स के लिए, स्थिति अलग है। ओपनएआई ने वैश्विक एपीआई ग्राहकों को कुछ मॉडलों के लिए टेक्स्ट वॉटरमार्क फ़ंक्शन को सक्रिय रूप से चालू करने की अनुमति देना शुरू कर दिया है, लेकिन यह अभी भी डिफ़ॉल्ट रूप से बंद है। इसका मतलब यह है कि कंपनियां अपनी पारदर्शिता आवश्यकताओं के आधार पर यह तय कर सकती हैं कि एपीआई के माध्यम से उत्पन्न टेक्स्ट को वॉटरमार्क करना है या नहीं।
ओपनएआई क्लाउड सेवा भागीदारों के साथ भी समन्वय कर रहा है, उम्मीद है कि अगले कुछ हफ्तों में, इन क्लाउड प्लेटफार्मों के माध्यम से ओपनएआई मॉडल को कॉल करके उत्पन्न योग्य सामग्री को भी संबंधित स्रोत सिग्नल प्राप्त होंगे।
हालाँकि, टेक्स्ट वॉटरमार्क अन्य AI सामग्री पहचान विधियों को प्रतिस्थापित नहीं करेंगे। OpenAI इस बात पर जोर देता है कि मशीन-पठनीय वॉटरमार्क और C2PA जैसी स्रोत जानकारी कानून या प्लेटफ़ॉर्म द्वारा आवश्यक दृश्यमान AI लेबल और शीघ्र बैनर जैसे सार्वजनिक बयानों को प्रतिस्थापित नहीं कर सकती है। वे विभिन्न स्तरों पर सामग्री स्रोत समस्याओं का समाधान करते हैं।
सामान्य उपयोगकर्ताओं के लिए, इस परिवर्तन के बारे में सबसे उल्लेखनीय बात यह है: यदि आप ईयू में हैं और लंबे टेक्स्ट उत्पन्न करने के लिए चैटजीपीटी का उपयोग करते हैं, तो उस समय से जब वॉटरमार्क सिस्टम आधिकारिक तौर पर आपके खाते को कवर करता है, जेनरेट की गई सामग्री में पहले से ही स्रोत सिग्नल शामिल हो सकते हैं जो नग्न आंखों के लिए अदृश्य हैं। मूल पाठ की सीधी प्रतिलिपि आम तौर पर इस सिग्नल को नष्ट नहीं करेगी, लेकिन यदि पाठ को महत्वपूर्ण रूप से दोबारा लिखा जाता है, दोबारा लिखा जाता है या अनुवाद किया जाता है, तो वॉटरमार्क की पहचान काफी कम हो सकती है।
OpenAI भी इस सीमा को स्पष्ट रूप से स्वीकार करता है। टेक्स्टग्रेन का सिग्नल मॉडल के शब्द चयन में मौजूद होता है, न कि टेक्स्ट फ़ाइल से स्वतंत्र रूप से जुड़े एक अदृश्य चरित्र के रूप में। इसलिए, पाठ का पर्याप्त पुनर्लेखन मूल सांख्यिकीय पैटर्न को नष्ट कर सकता है। यही कारण है कि ओपनएआई इस बात पर जोर देता है कि टेक्स्ट वॉटरमार्क वर्तमान में स्रोत निर्णय संकेत के रूप में अधिक उपयुक्त हैं और इन्हें बिल्कुल विश्वसनीय "एआई पहचान प्रमाणपत्र" नहीं माना जा सकता है।
आम तौर पर कहें तो, OpenAI ने इस बार मुख्य रूप से AI अधिनियम द्वारा लाई गई नई नियामक आवश्यकताओं को अनुकूलित करने के लिए EU में टेक्स्टग्रेन लॉन्च किया। यह यह भी दर्शाता है कि एआई-जनरेटेड टेक्स्ट की स्रोत पहचान पारंपरिक "घोषणात्मक टैग" से मशीन-पहचानने योग्य संकेतों तक विकसित हो रही है। यह उस पाठ को नहीं बदलेगा जो उपयोगकर्ता देखते हैं, न ही पाठ की प्रतिलिपि बनाते समय रहस्यमय अक्षर दिखाई देंगे, लेकिन यह सिस्टम को पता लगाने की अनुमति के साथ यह निर्धारित करने की अनुमति देगा कि सामग्री का एक टुकड़ा ओपनएआई मॉडल से आता है या नहीं।
हालाँकि, चूंकि टेक्स्ट वॉटरमार्क में अभी भी भाषा अंतर, टेक्स्ट लंबाई प्रतिबंध और दोबारा लिखने के बाद सिग्नल कमजोर होने जैसी समस्याएं हैं, इसलिए यह वर्तमान में एआई कंटेंट ट्रैसेबिलिटी सिस्टम में सहायक साक्ष्य के रूप में अधिक उपयुक्त है, यह निर्धारित करने के लिए अकेले उपयोग किए जाने के बजाय कि क्या कोई लेख "एआई द्वारा लिखा गया था।"
टिप्पणियाँ