सार:
जबकि बड़े मॉडल निर्माता सैकड़ों अरबों कंप्यूटिंग पावर इंफ्रास्ट्रक्चर के लिए पैसा खर्च करने की प्रतिस्पर्धा कर रहे हैं, एक अधिक गुप्त "कॉपीराइट खदान" आ रही है। अगस्त के मध्य में, खबर आई कि Apple ने समाचार कोष खरीदने के लिए करोड़ों डॉलर का भुगतान करने की योजना बनाई है, जिससे सामग्री उद्योग में हलचल मच गई। पिछले दो वर्षों में, एआई प्रशिक्षण कोष को लेकर कॉपीराइट मुकदमे दुनिया भर में फैल गए हैं। प्रेस में, न्यूयॉर्क टाइम्स ने ओपनएआई और माइक्रोसॉफ्ट पर मुकदमा दायर किया, जिसमें दोनों कंपनियों पर चैटजीपीटी जैसे बड़े मॉडल को प्रशिक्षित करने के लिए प्राधिकरण के बिना लाखों लेखों का उपयोग करने का आरोप लगाया गया।
दो बार के पुलित्जर पुरस्कार विजेता जॉन कैरीरो और छह अन्य लेखकों सहित साहित्यिक समुदाय ने एक साथ एंथ्रोपिक, ओपनएआई, गूगल, मेटा, एक्सएआई और पर्प्लेक्सिटी को अदालत में ले जाया, और उन पर "जानबूझकर चोरी" का आरोप लगाया।
पहले, मीडिया रिपोर्टों के अनुसार, एंथ्रोपिक पर एआई चैटबॉट क्लाउड को प्रशिक्षित करने के लिए अपने कार्यों का दुरुपयोग करने का आरोप लगाया गया था। समझौते के बाद भी एंथ्रोपिक को 1.5 बिलियन अमेरिकी डॉलर का मुआवज़ा देना पड़ा। यह अमेरिकी कॉपीराइट मामले में सबसे बड़ा ज्ञात समझौता भी है। घरेलू स्तर पर, पिछले साल नवंबर में, शंघाई जिनशान डिस्ट्रिक्ट पीपुल्स कोर्ट ने पहली बार में एक बड़े कृत्रिम बुद्धिमत्ता मॉडल पर शंघाई के पहले कॉपीराइट उल्लंघन मामले का फैसला सुनाया, जिसमें एनिमेशन की "फाइट्स अगेंस्ट द स्फीयर" श्रृंखला में सूचना नेटवर्क पात्रों की नकल करने का अधिकार और सूचना प्रसारित करने का अधिकार के मुद्दे शामिल थे।
बड़े मॉडलों की पुनरावृत्ति के पीछे "कॉपीराइट विवाद" को कैसे हल किया जा सकता है? विवाद की स्थिति में, कानूनी तौर पर "उचित उपयोग" और "उल्लंघन" के बीच की सीमा को कैसे परिभाषित किया जाए? रिपोर्टर ने इस बारे में संबंधित वकीलों, बौद्धिक संपदा प्रोफेसरों, प्रकाशकों और अन्य सामग्री चिकित्सकों से बात की।
क्या "पे-एज़-यू-गो" एक उचित सौदा है या मूल्य निर्धारण शक्ति का खेल है?
एप्पल के कदम ने न केवल ध्यान आकर्षित किया है क्योंकि यह समाचार अधिकार खरीदने के लिए करोड़ों डॉलर खर्च करने की योजना बना रहा है, बल्कि इसलिए भी क्योंकि यह "पे-एज़-यू-गो" फ्लोटिंग पारिश्रमिक तंत्र का प्रस्ताव करता है। अर्थात्, प्रकाशक को तब भुगतान किया जाता है जब भागीदार की सामग्री वास्तव में सिरी द्वारा उपयोग की जाती है।

कुछ लोगों का मानना है कि इस बार Apple द्वारा प्रस्तावित "भुगतान-प्रति-उपयोग" मॉडल AI युग में सामग्री लाइसेंसिंग के लिए एक नया प्रतिमान है।
कॉपीराइट सुरक्षा के कानूनी परिप्रेक्ष्य से,
"पे-एज़-यू-गो कोई नया प्रतिमान नहीं है। ऐप्पल पे अभी भी एआई द्वारा कॉपीराइट किए गए कार्यों के उपयोग से उत्पन्न एक अमेरिकी रॉयल्टी है। इसमें शामिल कार्यों के प्रकार और अधिकृत सामग्री वर्तमान अमेरिकी कॉपीराइट कानून के अनुसार निर्धारित की जाती है। पे-एज़-यू-गो स्वयं कॉपीराइट कानून में सामान्य लाइसेंस शुल्क मूल्य निर्धारण मॉडल में से एक है।"
शंघाई यूनिवर्सिटी ऑफ फाइनेंस एंड इकोनॉमिक्स के प्रतिस्पर्धा कानून और बौद्धिक संपदा अनुसंधान केंद्र के कार्यकारी निदेशक ली यानबिंग ने संवाददाताओं से कहा। साथ ही, वह शंघाई यूनिवर्सिटी ऑफ फाइनेंस एंड इकोनॉमिक्स के चीनी आधुनिकीकरण संस्थान में एक प्रतिष्ठित शोधकर्ता भी हैं। उनकी मुख्य शोध दिशाएँ बौद्धिक संपदा और प्रतिस्पर्धा कानून, डेटा और कृत्रिम बुद्धिमत्ता कानून हैं।क्या "पे-एज़-यू-गो" उल्लंघन के जोखिम से पूरी तरह बच सकता है?
बीजिंग डाचेंग (शंघाई) लॉ फर्म के वरिष्ठ साझेदार और वकील फू गैंग ने विशेष रूप से जोर दिया: कॉपीराइट कानून कंपनियों द्वारा कार्यों के वास्तविक उपयोग पर ध्यान केंद्रित करता है और क्या इन व्यवहारों को लाइसेंस दिया जाता है, बजाय इसके कि शुल्क का भुगतान एकमुश्त या किश्तों में किया जाता है।
“
भले ही सिरी समाचार प्रदर्शित करते समय अनुबंध भुगतान-प्रति-दृश्य निर्धारित करता है, यदि स्रोत के अधिकार त्रुटिपूर्ण हैं या प्राधिकरण का दायरा उपयोग परिदृश्यों को पूरी तरह से कवर नहीं करता है, तब भी उल्लंघन या अनुबंध के उल्लंघन का जोखिम हो सकता है।
"फू गैंग ने कहा.हालाँकि, बीजिंग झोंग्लुन वेंडे लॉ फर्म की शंघाई शाखा के एक भागीदार और वकील हुआंग यांगयांग ने बताया कि समझौते के ढांचे के तहत, "Apple ने मूल रूप से कॉपीराइट उल्लंघन के जोखिम से परहेज किया है, जब तक कि वह जिस खबर का हवाला देता है वह किसी तीसरे पक्ष के कॉपीराइट का उल्लंघन नहीं करता है, लेकिन आम तौर पर इसी तरह के समझौते उन शर्तों को निर्धारित करेंगे जो उपयोगकर्ता को दायित्व से छूट देते हैं।"
ली यानबिंग ने याद दिलाया कि पे-एज़-यू-गो केवल लाइसेंस शुल्क के लिए एक मूल्य निर्धारण पद्धति है और एक अनुबंध खंड है। यह केवल समय की संख्या और इकाई मूल्य पर सहमत होता है, और केवल पार्टियों को अनुबंध से बांधता है। इसमें एआई के कार्यों के उपयोग का गुणात्मक मुद्दा शामिल नहीं है।
भले ही यह एक उद्योग मानक बन जाए, यह प्रतिकृति और कटौती की परिभाषा समस्या को हल नहीं कर सकता है, और नई माप और पहचान समस्याएं भी लाता है। सार्वजनिक जानकारी से देखते हुए, ऐसे माप कैलिबर का विवरण आमतौर पर प्रकट नहीं किया जाता है।
"उदाहरण के लिए, एक क्वेरी तीन प्रकाशकों से पांच समाचार रिपोर्टों को कॉल करती है और एक सार उत्पन्न करती है। क्या इसका उपयोग पांच बार, तीन बार या एक बार किया जाता है? यदि बीच में कोई तकनीकी विफलता होती है और कॉल फिर से की जाती है, लेकिन अंत में केवल एक सार उत्पन्न होता है, तो इस उपयोग की गणना कैसे की जाती है? "उपयोग", विभिन्न लिंक और उद्देश्यों जैसे क्रॉलिंग, प्रशिक्षण, पुनर्प्राप्ति, उद्धरण, आउटपुट इत्यादि के लिए उपयोग व्यवहार को वर्गीकृत और अलग से गणना की जाती है?" भले ही यह भुगतान-जैसा-आप-जाना है, वर्तमान परिभाषा अभी भी अस्पष्ट है।
इसका मतलब यह भी है कि तकनीकी मॉडल का चुनाव सीधे लाइसेंस शुल्क के संग्रह को प्रभावित करेगा।
वास्तविक परिचालन स्तर पर, बड़ी एआई मॉडल कंपनियों और सामग्री प्रदाताओं के लिए, "सौदेबाजी की शक्ति किस पक्ष में है?" यह एक मुख्य मुद्दा है जिसके बारे में हर कोई चिंतित है।
ली यानबिंग का मानना है कि चाहे वह एक निश्चित वार्षिक शुल्क प्रणाली हो या उपयोग के आधार पर भुगतान, दोनों मूल्य निर्धारण विधियों में कोई योग्यता नहीं है।
जो चीज वास्तव में परिणाम निर्धारित करती है वह सौदेबाजी की शक्ति है: "जो कोई भी माप डेटा को नियंत्रित करता है उसे मूल्य निर्धारण की व्याख्या करने का अधिकार है।"
अंतर यह है कि निश्चित लाइसेंसिंग (जैसे कि निश्चित वार्षिक शुल्क) मॉडल के तहत, "सामग्री का उपयोग किया गया है या नहीं" का जोखिम प्लेटफ़ॉर्म द्वारा वहन किया जाता है, जबकि पे-एज़-यू-गो इस जोखिम को मीडिया या प्रकाशकों को स्थानांतरित करता है।आम तौर पर कहें तो, "माप डेटा को प्लेटफ़ॉर्म द्वारा नियंत्रित किया जाता है। सामग्री प्रकाशक यह सत्यापित नहीं कर सकते हैं कि उनकी सामग्री को कितनी बार कॉल किया गया है, न ही उन्हें पता है कि कुल राशि कैसे वितरित की गई है। सामूहिक सौदेबाजी की शक्ति कमजोर हो गई है।" ली यानबिंग ने कहा।
वकील हुआंग यांगयांग का भी मानना है कि सामग्री पक्षकारों को यह साबित करने में नुकसान होता है कि सामग्री उल्लंघनकारी है या नहीं। वर्तमान में, उच्च गुणवत्ता वाली चीनी सामग्री के कॉपीराइट बड़ी संख्या में विभिन्न अधिकार धारकों के हाथों में बिखरे हुए हैं। प्रकाशक, समाचार मीडिया और अन्य संस्थाएँ अधिकतर स्वतंत्र और बिखरी हुई हैं। कॉपीराइट धारकों की सामूहिक सौदेबाजी की शक्ति कमजोर है। एआई प्लेटफार्मों के लिए, प्राधिकरण प्रक्रिया जटिल है और लेनदेन लागत अधिक है।
एक प्रकाशन गृह के एक व्यवसायी ने खुलासा किया, "कॉर्पस प्रशिक्षण के परिप्रेक्ष्य से, प्रकाशन गृह में कई लोगों को इस समस्या के बारे में पता नहीं है। वे इस मुद्दे में बहुत रुचि नहीं रखते हैं और अपेक्षाकृत निष्क्रिय हैं। यह प्रकाशन गृह की वास्तविक प्रतिक्रिया स्थिति है।"
उन्होंने संवाददाताओं से कहा कि यदि कोई आपके कॉपीराइट को पसंद करता है और शुल्क का भुगतान करने को तैयार है, तो हर कोई लाभ और जोखिम साझा करेगा, जो प्रकाशन गृह को नुकसान पहुंचाने से अधिक अच्छा करेगा। लेकिन "क्या होना चाहिए" और "वास्तव में क्या है" दो अलग-अलग चीजें हैं, और उनके बीच एक विभाजन है।
एप्पल द्वारा समाचार कोष की खरीद से बाजार में उतार-चढ़ाव आया। इसका विश्लेषण कैसे करें?
ऐसी खबर है कि Apple समाचार सामग्री का कॉपीराइट हासिल करने के लिए करोड़ों डॉलर का निवेश करने की योजना बना रहा है, जिससे उद्योग में काफी झटका लगा है। जिस दिन खबर सामने आई, ए-शेयर "एआई कॉर्पस" क्षेत्र में तेजी से वृद्धि हुई। ड्यूक कल्चर एक बार 20 सेमी की अपनी दैनिक सीमा तक पहुंच गया, इसके बाद CITIC पब्लिशिंग, चाइना पब्लिशिंग, हाईटियन रुइशेंग, आदि थे।
西南证券传媒首席分析师苟宇睿认为,这类“海外映射”行情,具备情绪与主题资金轮动特征。
长期来看,AI正推动传媒内容产业,从“消费品"转向“数据+IP资产“双重定价。定价逻辑方面,国内正从“规模竞争“转向“价值和质量竞争“,政策在推动“以词元为基础的数据集价值体系”确权。

छवि स्रोत: ओरिएंटल फॉर्च्यून की "एआई कॉर्पस" अवधारणा
ए-शेयर मीडिया क्षेत्र के मूल्यांकन पर सबसे बड़ा प्रभाव यह है कि "बाजार 'चैनलों और जारी करने की मात्रा को देखने' से 'डेटा परिसंपत्ति गुणवत्ता को देखने' की ओर स्थानांतरित हो गया है। एआई कॉर्पस कथा एक नया, विकास-उन्मुख मूल्यांकन कथा प्रदान करती है।" गौ युरुई ने संवाददाताओं से कहा। हालाँकि, उन्होंने यह भी याद दिलाया कि अल्पावधि में टोकन मूल्य प्रणाली का कार्यान्वयन विषयगत रूप से अधिक लचीला होगा। क्या इसे दीर्घकालिक मूल्यांकन केंद्र में व्यवस्थित किया जा सकता है, अभी भी यह देखने की जरूरत है कि क्या बाद के अधिकृत लेनदेन और नीतियों को वास्तविक रूप में लागू किया जा सकता है।

छवि स्रोत: Apple का वित्तीय वर्ष 2025 10-K वार्षिक रिपोर्ट अमेरिकी प्रतिभूति और विनिमय आयोग (SEC)
ऐप्पल द्वारा समाचार कॉपीराइट खरीदने की खबर पर वापस जाएं, तो यह "सक्रिय अनुपालन" रुख इसकी 2025 की वार्षिक रिपोर्ट में भी पाया जा सकता है। अपनी 2025 की वार्षिक रिपोर्ट में, Apple ने AI को एक जोखिम कारक के रूप में सूचीबद्ध किया। ऐप्पल का मानना है कि एआई जैसी जटिल प्रौद्योगिकियां उपयोगकर्ताओं को हानिकारक या गलत सामग्री के संपर्क में ला सकती हैं, इसमें प्रशिक्षण के लिए कॉपीराइट सामग्री प्राप्त करना और उपयोग करना और मॉडल आउटपुट में कॉपीराइट सामग्री को पुन: प्रस्तुत करना भी शामिल हो सकता है, जिसके परिणामस्वरूप उत्पाद संशोधन, मुकदमेबाजी लागत, लाइसेंस शुल्क और नियामक दंड हो सकते हैं।
"इससे पता चलता है कि Apple ने AI कॉपीराइट, सामग्री सुरक्षा और उत्पाद दायित्व को फ्रंट-एंड मध्य और दीर्घकालिक परिचालन जोखिम के रूप में माना है।" वकील फू गैंग का मानना है कि बड़े घरेलू मॉडल निर्माताओं के लिए सबसे सीधा निहितार्थ यह है कि एआई कॉर्पस अनुपालन में डेटा अधिग्रहण, सफाई, प्रशिक्षण, फाइन-ट्यूनिंग, इंडेक्सिंग, पुनर्प्राप्ति, आउटपुट और शिकायत प्रबंधन की पूरी प्रक्रिया शामिल होनी चाहिए।
समाचार अधिकार खरीदने के लिए करोड़ों डॉलर खर्च करने से क्या भविष्य में सामग्री उद्योग का पुनर्मूल्यांकन होगा?
"भविष्य में जो वास्तव में दुर्लभ है वह 'अधिक डेटा' नहीं हो सकता है, लेकिन उच्च गुणवत्ता वाले डेटा संसाधन हैं जिनका उपयोग बड़े मॉडलों द्वारा लगातार, स्थिर और अनुपालनपूर्वक किया जा सकता है। बड़े मॉडल निर्माताओं की डेटा प्रतिस्पर्धा धीरे-धीरे प्रारंभिक सार्वजनिक कैप्चर से समाचार मीडिया, प्रकाशन एजेंसियों, पेशेवर डेटाबेस और लंबवत उद्योग सामग्री प्रदाताओं के साथ दीर्घकालिक अधिकृत सहयोग स्थापित करने और अधिकार मंजूरी, स्रोत अंकन, उपयोग स्कोप समझौतों और कॉल ऑडिट के माध्यम से अनुपालन जोखिमों को कम करने में स्थानांतरित हो जाएगी।" वकील फू गैंग ने साइंस एंड टेक्नोलॉजी इनोवेशन बोर्ड डेली के एक रिपोर्टर को बताया।
गौ युरुई का भी ऐसा ही मानना है. उनका मानना है कि कई लोकप्रिय ग्रंथ, सार्वजनिक पुस्तकें और खुले वेब पेज हैं और आपूर्ति पर्याप्त है। वास्तव में जो दुर्लभ है वह उच्च-गुणवत्ता, विशिष्ट, अनुपालन और पता लगाने योग्य पेशेवर वर्टिकल डेटा है, जैसे कि मेडिकल पाठ्यपुस्तकें और मामले, कानूनी मामले, अकादमिक जर्नल, गहन उद्योग रिपोर्ट, आधिकारिक समाचार और मल्टी-मोडल वास्तविक भौतिक इंटरैक्शन डेटा। उच्च-गुणवत्ता, वास्तविक समय की सामग्री एआई प्रतियोगिताओं के लिए महत्वपूर्ण संसाधनों में से एक बन रही है।
किस सामग्री परिसंपत्तियों से लाभ होने की उम्मीद है? गौ युरुई का सारांश है: "कमी + विशिष्टता + अनुपालन + पता लगाने की क्षमता + वास्तविक समय", जिसमें मुख्य रूप से पांच श्रेणियां शामिल हैं: पेशेवर ऊर्ध्वाधर ज्ञान (शैक्षणिक/संदर्भ पुस्तक/प्रकाशन कंपनी), आधिकारिक प्राचीन पुस्तकें/संदर्भ पुस्तक (प्रकाशन कंपनी), वास्तविक समय आधिकारिक समाचार (मुख्यधारा मीडिया), ऑनलाइन साहित्य/फिल्म और टेलीविजन आईपी (ऑनलाइन साहित्य मंच कंपनी), और डेटा सेवा/प्रसंस्करण कंपनी।
साथ ही, कॉर्पस-संबंधित निर्माताओं की राजस्व संरचना और मूल्यांकन प्रणाली को भी भविष्य में पुनर्निर्माण का सामना करना पड़ सकता है। उदाहरण के लिए, सामग्री पार्टियों के लिए, आदर्श मार्ग पारंपरिक प्रकाशन/वितरण राजस्व के अलावा "डेटा लाइसेंसिंग/एपीआई कॉल शेयरिंग/डेटा प्रोसेसिंग सेवाओं" की वृद्धिशील राजस्व लाइन को जोड़ना है। पारंपरिक प्रकाशन से "केवल लाभांश/पीई मूल्यांकन" से "लाभांश + डेटा/कॉपीराइट पुनर्मूल्यांकन" के दोहरे तर्क पर स्विच करने की उम्मीद है। हालाँकि, प्रत्यक्ष कॉर्पस लाइसेंसिंग राजस्व अभी तक बड़े पैमाने पर प्राप्त नहीं हुआ है।
“不过,兑现节奏或许并不会非常快,存在几个约束条件,首先权属复杂、二是工程壁垒:从版权库到"可用数据资产",中间要经历数字化、清洗、标注、脱敏,成本不低,所以“重估”更可能发生在少数专业、独家、稀缺、可溯源的垂类内容持有方,而非全行业。”苟宇睿表示。
आईडीसी डेटा से पता चलता है कि चीन का कृत्रिम बुद्धिमत्ता बुनियादी डेटा सेवा बाजार 2025 में 6.262 बिलियन युआन तक पहुंच जाएगा, जो साल-दर-साल 27.8% की वृद्धि है, और विकास दर बाजार की अपेक्षाओं से अधिक है। 2025 से 2030 तक 19.6% की चक्रवृद्धि वार्षिक वृद्धि दर के साथ 2026 में बाजार का आकार बढ़कर 7.834 बिलियन युआन होने की उम्मीद है।
उद्योग के अंदरूनी सूत्रों के अनुसार, वर्तमान में, घरेलू कॉर्पस डेटा मुख्य रूप से "डेटा स्थानीयकरण + निजी तैनाती" है, और बड़े पैमाने पर भुगतान प्राधिकरण लेनदेन का अभी तक खुलासा नहीं किया गया है। निम्नलिखित तीन प्रकार की प्रथाएँ समानांतर हैं।
1. स्व-निर्मित/सह-विकसित मालिकाना मॉडल: जैसे CITIC पब्लिशिंग का "कुआफू एआई" डिजिटल इंटेलिजेंस पब्लिशिंग प्लेटफॉर्म, चाइना पब्लिशिंग का "चीनी प्राचीन पुस्तकें बड़े मॉडल" का प्रचार, चीनी ऑनलाइन स्व-विकसित "ज़ियाओयाओ" बड़ा मॉडल, झोंगयुआन मीडिया और "यू एजुकेशन बिग मॉडल" पर टेनसेंट का सहयोग, आदि;
2. संयुक्त रूप से एक राष्ट्रीय स्तर के वास्तविक कोष का निर्माण करें: 22 संस्थानों के पहले बैच ने संयुक्त रूप से एक उच्च गुणवत्ता वाले कृत्रिम बुद्धिमत्ता कोष का निर्माण किया, जो प्रकाशन, मीडिया, कॉपीराइट, प्रौद्योगिकी और अन्य क्षेत्रों को कवर करते हुए "पहले प्राधिकरण, बाद में उपयोग करें" का पालन करता है; पीपुल्स डेली ऑनलाइन ने "मेनस्ट्रीम वैल्यू कॉर्पस इकोलॉजिकल एलायंस" की स्थापना का बीड़ा उठाया;
3. व्यावसायिक डेटा सेवा आउटसोर्सिंग।
क्या यह "उचित उपयोग" है या उल्लंघन? अनिर्णीत वैश्विक विवाद
कई वकीलों ने संवाददाताओं से कहा कि बड़े कृत्रिम बुद्धिमत्ता मॉडल प्रशिक्षण कोष का उपयोग करते समय, कॉपीराइट धारक के कार्यों का उपयोग "उचित उपयोग" या उल्लंघन है। मुख्य कानूनी विवाद यह है कि क्या कृत्रिम बुद्धिमत्ता के बड़े मॉडलों का प्रशिक्षण उपयोग कॉपीराइट कानून के अर्थ में उचित उपयोग है।
दोनों पक्ष इस बात पर भी असहमत हैं कि क्या यह उल्लंघन है।
एआई कंपनियों का मानना है कि भाषा के नियमों, ज्ञान संबंधों और अभिव्यक्ति पैटर्न को सीखने के बाद, मॉडल ने एक नया तकनीकी उपकरण और अभिव्यक्ति पद्धति बनाई है। कॉर्पस आउटपुट से टेक्स्ट आउटपुट तक एक मजबूत रूपांतरण होता है, और दोनों को बराबर नहीं किया जा सकता है।
कॉपीराइट स्वामी का मानना है कि मॉडल प्रशिक्षण आमतौर पर व्यावसायिक उद्देश्यों के लिए होता है और इसके लिए कार्य के पूर्ण और बड़े पैमाने पर पुनरुत्पादन की आवश्यकता होती है। कुछ डेटा पायरेटेड वेबसाइटों या अनधिकृत डेटा सेट से भी आ सकता है; मॉडल न केवल मूल कार्य को पुन: प्रस्तुत कर सकता है, बल्कि बड़ी मात्रा में वैकल्पिक सामग्री भी उत्पन्न कर सकता है, जिससे मूल प्रकाशन, सदस्यता और लाइसेंसिंग बाजार कमजोर हो जाएंगे। यह "उल्लंघन" है.
"बड़े मॉडल निर्माताओं के लिए, प्रशिक्षण के 'रूपांतरण' को प्राकृतिक रक्षा के रूप में उपयोग नहीं किया जा सकता है; अधिकार धारकों के लिए, उल्लंघन को केवल इसलिए नहीं माना जा सकता है क्योंकि कार्य का उपयोग प्रशिक्षण के लिए किया जाता है।" यह वकील फू गैंग का फैसला है.
हुआंग यांगयांग का भी ऐसा ही मानना है. उनका मानना है कि प्रशिक्षण चरण के दौरान प्राधिकरण के बिना कॉर्पस की प्रतिलिपि बनाने का मतलब यह नहीं है कि आउटपुट सामग्री का उल्लंघन होना चाहिए। सिर्फ इसलिए कि प्रशिक्षण कानूनी है, इसका मतलब यह नहीं है कि आउटपुट सारांश और संक्षिप्त सामग्री सटीक है।
"उचित उपयोग" और उल्लंघन की परिभाषा के संबंध में, वकील फू गैंग का मानना है कि कम से कम निम्नलिखित मुद्दों पर विचार किया जाना चाहिए: डेटा कैसे प्राप्त किया गया था, प्रशिक्षण प्रक्रिया के दौरान कौन से नकल व्यवहार लागू किए गए थे, क्या मॉडल संरक्षित अभिव्यक्ति को पुन: पेश कर सकता है, क्या अंतिम उत्पाद मूल कार्य या सही धारक के व्यवसाय के साथ प्रतिस्पर्धा करता है, और क्या कंपनी ने फ़िल्टर करने, दोहराव को हटाने, पुनरुत्पादन को रोकने और शिकायतों को संभालने के उपाय किए हैं।
जब वास्तव में यह निर्धारित करने की बात आती है कि उल्लंघन हुआ है या नहीं, तो स्थिति अधिक जटिल हो जाती है।
"एक ही एआई व्यवसाय में भी, अलग-अलग लिंक अलग-अलग निष्कर्षों तक पहुंच सकते हैं। उदाहरण के लिए, अदालत यह मान सकती है कि प्रशिक्षण मॉडल में कुछ परिवर्तनशीलता है, लेकिन साथ ही, यह मान सकता है कि पायरेटेड चैनलों से कार्यों को प्राप्त करना और दीर्घकालिक संरक्षण उचित उपयोग नहीं है; यह यह भी मान सकता है कि प्रशिक्षण चरण में उल्लंघन के साक्ष्य की कमी है, लेकिन मॉडल रिलीज, सामग्री प्रदर्शन या अंतिम आउटपुट उल्लंघन का गठन करता है।" फू गैंग ने आगे बताया।
इस साल 20 जुलाई को, लगभग दो साल तक चला "बट्स बनाम एंथ्रोपिक केस" आधिकारिक तौर पर 1.5 बिलियन अमेरिकी डॉलर के समझौते के साथ समाप्त हो गया। न्यायाधीश का मानना था कि क्लाउड के बड़े भाषा मॉडल को प्रशिक्षित करने के लिए एंथ्रोपिक द्वारा कॉपीराइट पुस्तकों का उपयोग प्रकृति में "विशिष्ट परिवर्तनकारी उपयोग" था और उचित उपयोग का गठन किया गया था। हालाँकि, प्रशिक्षण के लिए शैडो लाइब्रेरी से डाउनलोड की गई पायरेटेड पुस्तकों का उपयोग करने के एंथ्रोपिक के उचित उपयोग बचाव को अस्वीकार कर दिया गया था और इसे उल्लंघन माना गया था।
वकील फू गैंग का मानना है कि बार्ट्ज़ बनाम एंथ्रोपिक मामला संदर्भ महत्व का है क्योंकि इसने स्पष्ट किया है कि "प्रशिक्षण उद्देश्य परिवर्तनकारी है" और "डेटा स्रोत कानूनी है" दो स्वतंत्र मुद्दे हैं। सिर्फ इसलिए कि बैक-एंड उपयोग अभिनव है, यह फ्रंट-एंड द्वारा प्राप्त डेटा के उल्लंघन के जोखिम को स्वचालित रूप से समाप्त नहीं करता है।
हालाँकि, कानून के प्रोफेसर ली यानबिंग ने यह भी याद दिलाया कि बार्ट्ज़ बनाम एंथ्रोपिक मामला 1.5 बिलियन अमेरिकी डॉलर के समझौते में समाप्त हुआ, इसलिए मामले के निर्धारण में कोई बाध्यकारी मिसाल नहीं थी। वर्तमान में अपील पर एकमात्र मामला, थॉमसन रॉयटर्स बनाम रॉस, अभी भी तीसरे सर्किट कोर्ट के समक्ष लंबित है।
उन्होंने बताया कि,
अब तक, संयुक्त राज्य अमेरिका में किसी भी संघीय अपील अदालत ने इस पर कोई ठोस निर्णय नहीं दिया है कि एआई प्रशिक्षण उचित उपयोग है या नहीं। उचित उपयोग रक्षा के निर्धारण के संबंध में, अमेरिकी जिला न्यायालय के मौजूदा निर्णय भी एक-दूसरे के साथ विरोधाभासी हैं। इस बात पर भी विवाद हैं कि क्या और किस प्रकार के कॉपीराइट का उल्लंघन किया गया है। इस कानूनी अनिश्चितता को अल्पावधि में समाप्त करना कठिन है।
अनुचित कॉपीराइट सुरक्षा के साथ, क्या AI "बर्तन में कोई चावल नहीं बचेगा"?
यदि कॉपीराइट संरक्षण अनुचित है, तो कई साक्षात्कारकर्ताओं ने "झील से मछली पकड़ने" के बारे में भी पत्रकारों के सामने चिंता व्यक्त की। जितना अधिक बेईमानी से एआई कॉपीराइट सामग्री को निगलता है, उतनी ही अधिक मूल आपूर्ति सिकुड़ती है; जितनी अधिक मूल आपूर्ति सिकुड़ती है, उतना ही अधिक एआई जीवित रहने के लिए केवल "खुद की नकल करने और खुद को पुनर्चक्रित करने" पर भरोसा कर सकता है।
प्यू रिसर्च सेंटर द्वारा जारी एक अध्ययन से पता चलता है कि चैटजीपीटी के आगमन के बाद से प्रकाशित एक तिहाई से अधिक वेब पेजों में एआई पीढ़ी के निशान हो सकते हैं। निष्कर्षों से पता चलता है कि बड़ी संख्या में वेब पेज बॉट-जनित सामग्री को पढ़ने वाले बॉट का एक चक्र बना सकते हैं।
वकील हुआंग यांगयांग याद दिलाते हैं, "ज्ञान मॉडल मापदंडों के भार में ठोस होता है, और प्रशिक्षण के माध्यम से सीखे गए सांख्यिकीय नियमों के आधार पर उत्तर उत्पन्न होते हैं। ज्ञान स्वचालित रूप से अपडेट नहीं किया जाएगा, और मतिभ्रम उत्पन्न करना और गलत सामग्री आउटपुट करना आसान है।"
एक अनाम सामग्री प्रकाशन व्यवसायी ने एक अधिक छिपे हुए संकट का खुलासा किया: "कई अपस्ट्रीम लेखक निर्माण के लिए बड़ी संख्या में मानव-मशीन सहयोग का उपयोग करते हैं, और जो कार्य वे प्राप्त करते हैं वे बहुत एआई-जैसे होते हैं। उत्पादन दक्षता अधिक और तेज़ हो रही है, और उनकी मौलिकता के मुद्दे कॉपीराइट के मामले में अधिक परेशानी पैदा कर सकते हैं।"
समाचार के क्षेत्र पर ध्यान केंद्रित करते हुए, वकील हुआंग यांगयांग का यह भी मानना है कि वर्तमान बड़े पैमाने पर एआई मॉडल प्रशिक्षण समाचार रिपोर्टिंग सामग्री कॉर्पस के कॉपीराइट उल्लंघन के मुद्दे पर ज्यादा ध्यान नहीं देता है। इसके अलावा, बड़ी संख्या में समाचार रिपोर्टों, पाठ्य अभिव्यक्तियों की उच्च गुणवत्ता और इंटरनेट पर उनके व्यापक प्रकाशन के कारण, उन्हें प्राप्त करना अपेक्षाकृत आसान है और सामग्री संग्रह के कॉपीराइट उल्लंघन पर विवादों के लिए यह सबसे कठिन क्षेत्र बन गया है।
हुआंग यांगयांग का मानना है कि समाचार घटनाओं के बहुत कम सरल विवरणों को छोड़कर, अधिकांश समाचार रिपोर्ट कॉपीराइट कार्य हैं। समाचार घटनाओं के तथ्य स्वयं कॉपीराइट द्वारा संरक्षित नहीं हैं, लेकिन पत्रकारों की लिखित अभिव्यक्ति, कथा व्यवस्था और साक्षात्कार के परिणाम संरक्षित कार्य हैं। जब एआई बड़े मॉडल प्रशिक्षण समाचार रिपोर्ट सामग्री कॉर्पस का उपयोग करते हैं तब भी उल्लंघन का जोखिम होता है।
उन्होंने आगे बताया: "बड़े मॉडलों के अनुपालन के लिए आवश्यक है कि कॉपीराइट, सामग्री सुरक्षा और उत्पाद जिम्मेदारी का एक साथ मूल्यांकन किया जाए। हम केवल मॉडल के प्रभाव पर ध्यान केंद्रित नहीं कर सकते हैं और कॉपीराइट को पोस्ट-इश्यू के रूप में नहीं मान सकते हैं।"
वर्तमान वास्तविक स्थिति क्या है? "अधिकांश बड़ी मॉडल कंपनियों ने कॉपीराइट धारक को खरीदने के लिए सक्रिय रूप से प्रस्ताव नहीं दिया है, और बड़े मॉडल उत्पादों के व्यावसायीकरण से पहले प्रशिक्षण कॉर्पस डेटा के स्रोत को छुपाया है, और सुराग और निशान को उजागर होने से रोकने के लिए बड़े मॉडल आउटपुट परिणामों पर तकनीकी प्रसंस्करण किया है।" शंघाई डुआन एंड डुआन लॉ फर्म के पार्टनर और वकील लियू चुनक्वान ने संवाददाताओं से कहा। इससे वर्तमान कॉपीराइट सुरक्षा और प्रमाण में पहचान संबंधी कठिनाइयाँ भी आती हैं।
वास्तविक मामलों में, कुछ न्यायाधीशों ने इसे "नवाचार की सहनशीलता" के परिप्रेक्ष्य से नई प्रौद्योगिकियों की प्रगति को प्रोत्साहित करने के लिए उचित उपयोग के रूप में व्याख्या की है।
वकील लियू चुनक्वान का मानना है कि कृत्रिम बुद्धिमत्ता कंपनियां कार्यों को स्कैन और कॉपी करती हैं और फिर उन्हें बड़े मॉडलों को प्रशिक्षित करने के लिए डेटाबेस में लागू करना व्यावसायिक व्यवहार है और उन्हें कार्यों की प्रतिलिपि बनाने के अधिकार का उल्लंघन करते हुए पाया जाना चाहिए।
"बड़े मॉडलों का कॉर्पस प्रशिक्षण एक विशुद्ध रूप से व्यावसायिक कार्य है जो वैज्ञानिक अनुसंधान जैसे सार्वजनिक कल्याण उपक्रमों से अलग है। हालांकि बड़े मॉडलों का कॉर्पस प्रशिक्षण पाठक बिक्री से सीधे वाणिज्यिक लाभ एकत्र करने के लिए प्रकाशन या ऑनलाइन प्रसार की तरह नहीं है, बड़े मॉडलों का आउटपुट कार्य तत्वों को कॉल करने और उन्हें आउटपुट के लिए संयोजित करने के कॉर्पस प्रशिक्षण पर आधारित है। यह प्रक्रिया टोकन और अन्य तरीकों के माध्यम से वाणिज्यिक लाभ प्राप्त करने के लिए कार्यों का उपयोग करती है, और उन्हें कॉपीराइट स्वामी को वितरित नहीं करती है। यदि अदालत निर्धारित करती है कि उचित उपयोग उदारता के बराबर है बड़ी मॉडल कंपनियों को लागत बचाने में मदद करने के लिए दूसरों (लेखकों) को, इसलिए उचित उपयोग में तर्कसंगतता का अभाव है।"
हितों के संतुलन के दृष्टिकोण से, वकील लियू चुनक्वान का मानना है कि नई प्रौद्योगिकियों के विकास के लिए निश्चित रूप से कानूनी प्रणाली की सहनशीलता की आवश्यकता होती है, लेकिन कृत्रिम बुद्धिमत्ता के विकास पर भी विचार किया जाना चाहिए। बड़े मॉडलों के उपयोग ने लेखकों और अन्य लेखकों के रचनात्मक श्रम को काफी हद तक बदल दिया है, जिससे मौजूदा कार्यों की बाजार मांग कम हो गई है। हालाँकि यह एक नई तकनीक और नया व्यवसाय है, फिर भी पारंपरिक कॉपीराइट प्रणाली द्वारा मानव कार्यों की विरासत की सुरक्षा पर विचार करना आवश्यक है।
क्या नियमों का कोई सेट है जिसे कॉर्पस ट्रेडिंग के लिए लागू किया जा सकता है?
मेरे देश के वर्तमान कॉपीराइट कानून के परिप्रेक्ष्य से, उचित उपयोग मुख्य रूप से अनुच्छेद 24 में सूचीबद्ध व्यक्तिगत अध्ययन, उचित उद्धरण, समाचार रिपोर्टिंग, शिक्षण और वैज्ञानिक अनुसंधान जैसी विशिष्ट स्थितियों में निर्धारित किया गया है। इसमें यह भी आवश्यक है कि कार्य का सामान्य उपयोग प्रभावित नहीं होगा, और अधिकार धारक के वैध अधिकारों और हितों को उचित नुकसान नहीं होगा।
कई वकीलों ने संवाददाताओं से कहा कि मेरे देश के मौजूदा कानून स्पष्ट रूप से टेक्स्ट और डेटा माइनिंग के लिए अपवाद निर्धारित नहीं करते हैं जो आम तौर पर वाणिज्यिक बड़े मॉडल प्रशिक्षण पर लागू होता है, लेकिन वे अमेरिकी कानून में "परिवर्तनकारी उपयोग" की अवधारणा की नकल नहीं कर सकते हैं और मानते हैं कि जब तक काम का उपयोग मॉडल प्रशिक्षण के लिए किया जाता है, तब तक यह निश्चित रूप से उचित उपयोग होता है।
"इस बात की बहुत अधिक संभावना है कि भविष्य में प्रासंगिक निर्णय नियमों को चरणों, परिदृश्यों और जिम्मेदार संस्थाओं की दिशा में धीरे-धीरे परिष्कृत किया जाता रहेगा। निर्णय का ध्यान "क्या एआई काम सीख सकता है" की अमूर्त चर्चा से हटकर डेटा स्रोतों, प्रशिक्षण विधियों, आउटपुट परिणामों और बाजार प्रभाव की पूर्ण-प्रक्रिया समीक्षा पर केंद्रित हो गया है। न्यायपालिका को अभी भी डेटा स्रोतों, उपयोग के उद्देश्य, प्रतिकृति के पैमाने, तकनीकी आवश्यकता, आउटपुट परिणाम और बाजार प्रभाव के आधार पर विशिष्ट निर्णय लेने की आवश्यकता है।
साथ ही, घरेलू प्रबंधन उपायों और सहायक नीतियों की एक श्रृंखला भी पेश की गई है।
"जेनरेटिव आर्टिफिशियल इंटेलिजेंस सेवाओं के प्रबंधन के लिए अंतरिम उपाय" के अनुच्छेद 7 में कानूनी स्रोतों से डेटा और बुनियादी मॉडल के उपयोग की आवश्यकता है; यदि बौद्धिक संपदा अधिकार शामिल हैं, तो कानून के अनुसार दूसरों को प्राप्त बौद्धिक संपदा अधिकारों का उल्लंघन नहीं किया जाना चाहिए।


छवि स्रोत: "जेनरेटिव आर्टिफिशियल इंटेलिजेंस सेवा प्रबंधन के लिए अंतरिम उपाय"
नवंबर 2025 में, राष्ट्रीय मानक "जेनरेटिव आर्टिफिशियल इंटेलिजेंस सर्विसेज के लिए नेटवर्क सुरक्षा प्रौद्योगिकी बुनियादी सुरक्षा आवश्यकताएँ" आधिकारिक तौर पर लागू किया गया था। यह राष्ट्रीय मानक जनरेटिव कृत्रिम बुद्धिमत्ता सेवाओं की सुरक्षा के लिए मेरे देश का पहला राष्ट्रीय मानक है।

मानक के अनुच्छेद 4.1.3 में कहा गया है कि ओपन सोर्स कॉर्पोरा के पास लाइसेंस समझौता या प्राधिकरण दस्तावेज़ होना चाहिए; स्व-एकत्रित कॉर्पोरा में संग्रह रिकॉर्ड होना चाहिए, और जिस कॉर्पोरा ने स्पष्ट रूप से कहा है कि एकत्र नहीं किया जा सकता है उसे एकत्र नहीं किया जाना चाहिए; वाणिज्यिक निगम के पास कानूनी रूप से बाध्यकारी अनुबंध होना चाहिए और प्रदाता को प्रतिबद्धताएं और प्रमाणन सामग्री जारी करने की आवश्यकता होगी।

छवि स्रोत: "जेनरेटिव आर्टिफिशियल इंटेलिजेंस सेवाओं के लिए नेटवर्क सुरक्षा प्रौद्योगिकी बुनियादी सुरक्षा आवश्यकताएँ"
इस साल मई में, 22 संस्थानों द्वारा शेन्ज़ेन में लॉन्च किए गए "नेशनल जेनुइन हाई-क्वालिटी कॉर्पस" ने "पहले प्राधिकरण, बाद में उपयोग करें" के सिद्धांत को स्थापित किया और ब्लॉकचेन ट्रेस पेश किया। कॉर्पस अभी भी सह-निर्माण के प्रारंभिक चरण में है, और कॉर्पस के पैमाने, लाइसेंसिंग मूल्य और साझाकरण योजना का खुलासा नहीं किया गया है।
कानून के प्रोफेसर ली यानबिंग ने कहा कि अनुपालन दायित्वों को लागू किया गया है, लेकिन दायित्वों को पूरा करने के लिए आवश्यक बाजार के बुनियादी ढांचे और व्यापार योग्य बाजार अभी भी निर्माणाधीन हैं, और अभी भी वास्तविक संस्थागत अंतराल हैं। विशेष रूप से, कॉर्पस लेनदेन के लिए मानकीकृत प्राधिकरण टेम्पलेट, खुले और पारदर्शी मूल्य निर्धारण तंत्र, कॉपीराइट मालिकों और एआई कंपनियों के बीच सामान्यीकृत प्राधिकरण चैनल, और बड़े पैमाने पर पुन: उपयोग किए जा सकने वाले प्राधिकरण ट्रेडिंग प्लेटफॉर्म सभी अन्वेषण के प्रारंभिक चरण में हैं।
हालांकि, ली यानबिंग ने कहा कि जैसे-जैसे प्रौद्योगिकी परिपक्व होती है और मामले बढ़ते हैं, न्यायिक निर्णय धीरे-धीरे टाइपिंग और कानूनी व्याख्या विधियों के माध्यम से आम सहमति तक पहुंच जाएगा। "जहां तक कार्यों के उपयोग की एआई की पहचान का सवाल है, एआई के कारण कोई कानूनी संरचनात्मक समस्याएं नहीं हैं। आधुनिक कॉपीराइट कानून और कानूनी सिद्धांत व्याख्या विधियां इससे निपटने के लिए पर्याप्त हैं। विघटनकारी प्रौद्योगिकियों के प्रकट होने पर यह एक सामान्य घटना है, और इसके लिए सामान्य अद्यतन और अनुकूलन प्रक्रियाओं और समय की आवश्यकता होती है।"
टिप्पणियाँ