सार:
समाचार प्रकाशकों और पुस्तक लेखकों द्वारा शुरू किए गए संयुक्त कॉपीराइट उल्लंघन मुकदमे के जवाब में, माइक्रोसॉफ्ट ने अदालत में नवीनतम बचाव सामग्री प्रस्तुत की, जिसमें जोर देकर कहा गया कि इसका कृत्रिम बुद्धिमत्ता चैटबॉट कोपायलट लगभग कभी भी शब्दशः नकल नहीं करता है या न्यूयॉर्क टाइम्स और कॉपीराइट साहित्यिक कार्यों जैसे मीडिया से रिपोर्टों को पर्याप्त रूप से पुन: प्रस्तुत नहीं करता है। इस रुख का उद्देश्य माइक्रोसॉफ्ट और ओपनएआई के लिए एक ठोस "उचित उपयोग" कानूनी बचाव का निर्माण करना है, और अदालत को जल्द से जल्द सारांश निर्णय के माध्यम से संबंधित मामलों को समाप्त करने के लिए प्रेरित करना है।

मुकदमे में खोज प्रक्रिया के हिस्से के रूप में, माइक्रोसॉफ्ट ने वादी समाचार संगठनों द्वारा नियुक्त विशेषज्ञों के लिए वास्तविक कोपायलट वार्तालापों के 8.2 मिलियन प्रतिलेखों का एक डेटाबेस जारी किया। माइक्रोसॉफ्ट ने बताया कि डेटा सेट को यादृच्छिक रूप से नहीं चुना गया था, बल्कि वादी की समाचार वेबसाइट से संबंधित कीवर्ड के आधार पर विशेष रूप से जांचा गया था। सिद्धांत रूप में, यह एक नमूना सेट है जिसमें "कथित रूप से उल्लंघनकारी सामग्री होने की सबसे अधिक संभावना है।"
हालाँकि, डेटा विश्लेषण परिणामों से बेहद कम पुनरावृत्ति आवृत्तियों का पता चला। इन 8.2 मिलियन फ़िल्टर किए गए रिकॉर्डों में से, केवल 59,545 रिकॉर्ड में कम से कम 16 लगातार शब्द थे जो मॉडल प्रशिक्षण के लिए उपयोग की जाने वाली समाचार सामग्री के साथ ओवरलैप होते थे, जो कुल रिकॉर्ड के 1% से भी कम था। इसके अलावा, गैर-लाभकारी जांच रिपोर्टिंग संगठन "सेंटर फॉर इन्वेस्टिगेटिव रिपोर्टिंग" (जांच रिपोर्टिंग केंद्र) से जुड़े मुकदमे में, मूल विशेषज्ञ ने एक विशाल नमूने में केवल 51 मामलों की पहचान की, जो संगठन की सामग्री के साथ "पर्याप्त ओवरलैप" का गठन करते थे।
पुस्तक कॉपीराइट पर लेखकों के एक समूह द्वारा लाए गए एक अन्य समेकित मामले में, परीक्षण डेटा ने एक समान प्रवृत्ति दिखाई। वादी के लेखकों द्वारा नियुक्त स्वतंत्र विशेषज्ञों ने मामले में शामिल 212 पुस्तकों की समीक्षा की, और अंततः केवल 10 पुस्तकों में कम से कम 30 शब्दों के ओवरलैप के साथ उत्पन्न रिकॉर्ड पाए, जिनमें कुल मिलाकर केवल 24 ऐसे मिलान नमूने थे।
माइक्रोसॉफ्ट ने अदालत में तर्क दिया कि इन विस्तृत आंकड़ों ने इसकी मूल कानूनी रक्षा की पुष्टि की है, यानी, बड़े भाषा मॉडल को प्रशिक्षित करने के लिए कॉपीराइट सामग्री का उपयोग अमेरिकी कॉपीराइट कानून के ढांचे के तहत "उचित उपयोग" है। माइक्रोसॉफ्ट ने इस बात पर जोर दिया कि कोपायलट द्वारा कॉपीराइट सामग्री का उपयोग करने का उद्देश्य और इसके पीछे जेनेरिक एआई सिस्टम मूल प्रकाशन से मौलिक रूप से अलग है। इसका मूल तंत्र मूल कार्य के विकल्प के रूप में प्रसारित करने के बजाय नई सामग्री उत्पन्न करने के लिए भाषा पैटर्न को अवशोषित और पुनर्गठित करना है। भले ही छिटपुट पाठ के टुकड़े कभी-कभार फिर से प्रकट होते हैं, यह बड़ी भाषा मॉडल प्रशिक्षण प्रक्रिया की "परिवर्तनकारी उपयोग" विशेषताओं को मिटा नहीं सकता है।
पहले, न्यूयॉर्क टाइम्स, सेंटर फॉर इन्वेस्टिगेटिव रिपोर्टिंग और ऑथर्स गिल्ड सहित कई मीडिया संगठनों और निर्माता समूहों ने संयुक्त रूप से एक मुकदमा दायर किया था, जिसमें माइक्रोसॉफ्ट और ओपनएआई पर अपने वाणिज्यिक एआई प्लेटफार्मों को प्रशिक्षित करने के लिए प्राधिकरण के बिना लाखों मूल लेखों और पुस्तकों को अवैध रूप से हथियाने और अत्यधिक ओवरलैपिंग सामग्री तैयार करके मूल लेखकों के साथ सीधे प्रतिस्पर्धा करने का आरोप लगाया गया था, जिससे स्वतंत्र पत्रकारिता और साहित्यिक सृजन के व्यापार पारिस्थितिकी तंत्र पर गंभीर प्रभाव पड़ा। न्यायिक कार्यवाही की दक्षता में सुधार के लिए, समाचार प्रकाशकों और लेखकों से जुड़े संबंधित मुकदमों को समेकित किया गया है और एक ही संघीय न्यायाधीश को सौंप दिया गया है।
वर्तमान में, माइक्रोसॉफ्ट ने आधिकारिक तौर पर सारांश निर्णय के लिए अदालत में आवेदन किया है, यह उम्मीद करते हुए कि उपरोक्त डेटा का उपयोग यह साबित करने के लिए किया जाएगा कि वादी के वास्तविक उल्लंघन के आरोप में सार्वभौमिक तथ्यात्मक आधार का अभाव है, जिससे जेनेरिक आर्टिफिशियल इंटेलिजेंस के अंतर्निहित प्रशिक्षण की वैधता के संबंध में इस प्रमुख उद्योग मुकदमे को प्रारंभिक चरण में हल किया जा सके। अब तक, न्यूयॉर्क टाइम्स, सेंटर फॉर इन्वेस्टिगेटिव रिपोर्टिंग और राइटर्स गिल्ड ऑफ अमेरिका ने माइक्रोसॉफ्ट द्वारा प्रस्तुत नवीनतम आंकड़ों और अदालती बयानों पर सार्वजनिक रूप से टिप्पणी नहीं की है।
टिप्पणियाँ