आर्टिफिशियल इंटेलिजेंस यानी AI कंपनियां अपने बड़े भाषा मॉडल यानी Large Language Models को तैयार करने के लिए इंटरनेट से बड़ी मात्रा में डेटा जुटाती हैं। इस प्रक्रिया को लेकर लंबे समय से कॉपीराइट, अनुमति और कंटेंट बनाने वालों को मिलने वाले आर्थिक लाभ जैसे मुद्दों पर बहस चल रही है। अब Microsoft और OpenAI से जुड़े एक महत्वपूर्ण कॉपीराइट मामले में सार्वजनिक किए गए नए अदालती दस्तावेजों ने इस बहस को और तेज कर दिया है।
इन दस्तावेजों में माइक्रोसॉफ्ट के एप्लाइड साइंस डिपार्टमेंट के डायरेक्टर ब्रेंट हेच्ट Brent Hecht, Director of Microsoft's Applied Sciences Group की एक आंतरिक टिप्पणी सामने आई है। रिपोर्ट के अनुसार, उन्होंने AI Training के लिए इंटरनेट से बड़े पैमाने पर कंटेंट जुटाने की प्रक्रिया को “मानव इतिहास में श्रम की सबसे बड़ी चोरी” बताया था। यह टिप्पणी Microsoft, OpenAI और The New York Times से जुड़े कॉपीराइट विवाद की कानूनी फाइलिंग में सामने आई है।
यह मामला इस बड़े सवाल से जुड़ा है कि क्या AI कंपनियां बिना अनुमति या भुगतान के कॉपीराइट वाली सामग्री का इस्तेमाल अपने AI मॉडल को प्रशिक्षित करने के लिए कर सकती हैं। Microsoft और OpenAI का कहना है कि उनका इस्तेमाल अमेरिकी कानून में मौजूद Fair Use के दायरे में आता है। वहीं समाचार संस्थानों का तर्क है कि उनकी पत्रकारिता सामग्री का इस्तेमाल बिना अनुमति किया गया और AI उत्पाद उनके मूल कंटेंट से सीधे प्रतिस्पर्धा कर सकते हैं।
अदालती दस्तावेजों के अनुसार, Brent Hecht ने AI Training के लिए ऑनलाइन सामग्री के बड़े पैमाने पर इस्तेमाल को लेकर गंभीर चिंताएं जाहिर की थीं। उनका कहना था कि इंटरनेट पर मौजूद लाखों रचनाकारों ने कभी यह नहीं सोचा था कि उनके द्वारा तैयार की गई सामग्री भविष्य में बड़े AI मॉडल को प्रशिक्षित करने के लिए इस्तेमाल होगी।
उनकी चिंता केवल कॉपीराइट तक सीमित नहीं थी। दस्तावेजों से संकेत मिलता है कि Hecht इंटरनेट के पूरे Content Ecosystem पर इसके लंबे समय तक पड़ने वाले प्रभाव को लेकर भी चिंतित थे।
Hecht की टिप्पणी का एक महत्वपूर्ण पहलू यह था कि AI कंपनियां जिस ऑनलाइन सामग्री पर निर्भर करती हैं, वही कंपनियां ऐसे उत्पाद भी विकसित कर सकती हैं जो उस सामग्री को तैयार करने वाले प्रकाशकों की कमाई को प्रभावित करें।
उदाहरण के लिए, अगर लोग किसी खबर को पढ़ने के लिए मूल वेबसाइट पर जाने के बजाय AI चैटबॉट से उसका सारांश या जवाब प्राप्त करने लगें, तो प्रकाशकों की वेबसाइट पर आने वाला ट्रैफिक कम हो सकता है। इससे विज्ञापन, सदस्यता और अन्य आय के स्रोत प्रभावित हो सकते हैं।
Hecht ने कथित तौर पर ऐसी स्थिति को संभावित “Doom Loop” यानी एक ऐसे नकारात्मक चक्र के रूप में देखा, जिसमें AI उत्पाद उस कंटेंट इकोसिस्टम को कमजोर कर सकते हैं, जिस पर AI मॉडल खुद प्रशिक्षण के लिए निर्भर हैं।
हालांकि, Microsoft ने यह स्पष्ट किया है कि Hecht की निजी आंतरिक टिप्पणियां कंपनी की कानूनी स्थिति को नहीं दर्शातीं। कंपनी ने अदालत में यह तर्क दिया है कि उसके AI सिस्टम कॉपीराइट सामग्री का Transformative Use करते हैं।
Microsoft और OpenAI ने समाचार संगठनों द्वारा लगाए गए मुख्य कॉपीराइट आरोपों को खारिज किया है। दोनों कंपनियों का कहना है कि कॉपीराइट सामग्री से AI मॉडल को प्रशिक्षित करना कुछ परिस्थितियों में Fair Use के अंतर्गत आ सकता है।
कंपनियों का तर्क है कि AI मॉडल मूल सामग्री को केवल दोहराने के लिए नहीं बनाए जाते। Training के दौरान बड़ी मात्रा में जानकारी से पैटर्न सीखे जाते हैं और उसके बाद सिस्टम नए सवालों के जवाब तैयार करता है।
इसके विपरीत, प्रकाशकों का कहना है कि AI कंपनियों द्वारा उनकी सामग्री का इस्तेमाल उनके व्यवसाय को नुकसान पहुंचा सकता है। उनका तर्क है कि अगर AI सिस्टम सीधे उपयोगकर्ताओं को खबरों की जानकारी उपलब्ध करा देते हैं, तो लोग मूल वेबसाइट पर जाने, सदस्यता लेने या वहां विज्ञापन देखने की जरूरत कम महसूस कर सकते हैं।
इसी कारण AI Training Data और Copyright का विवाद अमेरिका में Generative AI से जुड़े सबसे महत्वपूर्ण कानूनी मुद्दों में शामिल हो गया है।
अदालती दस्तावेजों में AI प्लेटफॉर्म और पारंपरिक Search Engines के बीच बदलते संबंध को लेकर भी चर्चा की गई है।
पहले लोग किसी विषय की जानकारी पाने के लिए Search Engine में सवाल लिखते थे और फिर Search Results में दिखाई देने वाली वेबसाइट पर क्लिक करके पूरी खबर पढ़ते थे। लेकिन अब AI Chatbots सीधे सवाल का जवाब या किसी खबर का सारांश दे सकते हैं। इससे उपयोगकर्ता को मूल वेबसाइट खोलने की जरूरत कम पड़ सकती है।
Microsoft के CEO Satya Nadella ने अपनी गवाही में माना था कि Chatbot के जरिए जानकारी मिलने से कभी-कभी उस वेबसाइट पर जाने की जगह ली जा सकती है, जहां से मूल जानकारी आई है।
प्रकाशकों की ओर से अदालत में पेश किए गए आंकड़ों के अनुसार, Microsoft के AI आधारित Answer Experience के साथ कुछ New York Times और Daily News Domains पर Click-Through Rates पारंपरिक Bing Search की तुलना में काफी कम रहे। दस्तावेजों में संबंधित Domains के लिए 83% से 93% तक की गिरावट के आंकड़े बताए गए हैं।
AI मॉडल को बेहतर बनाने के लिए बड़ी मात्रा में उच्च गुणवत्ता वाले डेटा की जरूरत होती है। इस सामग्री का एक बड़ा हिस्सा पत्रकारों, लेखकों, शोधकर्ताओं और अन्य पेशेवरों द्वारा तैयार किया जाता है।
अगर AI से मिलने वाले जवाबों के कारण लोग मूल वेबसाइटों पर कम जाने लगें, तो प्रकाशकों की कमाई प्रभावित हो सकती है। कम आय का मतलब भविष्य में पत्रकारिता और अन्य गुणवत्तापूर्ण सामग्री तैयार करने के लिए कम संसाधन भी हो सकता है।
ऐसी स्थिति में इंटरनेट पर नई और विश्वसनीय सामग्री की मात्रा कम हो सकती है। इसके बाद AI कंपनियों के पास भविष्य के मॉडल को प्रशिक्षित करने के लिए उच्च गुणवत्ता वाले नए डेटा के स्रोत भी कम हो सकते हैं। यही वह संभावित चक्र है जिसे दस्तावेजों में “Doom Loop” के रूप में चर्चा में लाया गया है।
सार्वजनिक किए गए दस्तावेजों में OpenAI के अधिकारियों की टिप्पणियां भी शामिल हैं। OpenAI के सह-संस्थापक Greg Brockman ने कथित तौर पर कहा था कि AI मॉडल समाचार सामग्री से जुड़े Text Prediction और News-Related Tasks में विशेष रूप से सक्षम हैं।
प्रकाशकों द्वारा अदालत में पेश किए गए अन्य दस्तावेजों में कंपनियों के भीतर इस बात को लेकर चिंता का उल्लेख किया गया है कि AI उत्पाद पारंपरिक समाचार संस्थानों के साथ किस हद तक प्रतिस्पर्धा कर सकते हैं।
प्रकाशकों का कहना है कि ये दस्तावेज यह दिखाते हैं कि Microsoft और OpenAI अपने AI उत्पादों के पत्रकारिता क्षेत्र पर पड़ने वाले संभावित व्यावसायिक प्रभाव को समझते थे। हालांकि, इन दावों की कानूनी व्याख्या और अंतिम निष्कर्ष अदालत के फैसले पर निर्भर करेंगे।
The New York Times ने 2023 में Microsoft और OpenAI के खिलाफ मुकदमा दायर किया था। समाचार संगठन का आरोप है कि उसकी कॉपीराइट वाली पत्रकारिता सामग्री का इस्तेमाल बिना अनुमति AI सिस्टम विकसित करने के लिए किया गया।
इसके बाद The New York Daily News, The Intercept और Center for Investigative Reporting समेत अन्य समाचार संगठनों से जुड़े मामले भी सामने आए।
Microsoft और OpenAI ने अपने AI Training Practices का बचाव जारी रखा है और कहा है कि कुछ परिस्थितियों में AI Training Fair Use के तहत संरक्षित हो सकती है। वहीं प्रकाशक अपने कॉपीराइट दावों के पक्ष में कानूनी राहत की मांग कर रहे हैं।
यह विवाद केवल Microsoft, OpenAI और The New York Times तक सीमित नहीं है। इसके परिणाम का असर AI कंपनियों, समाचार संस्थानों, लेखकों, शोधकर्ताओं और अन्य Content Creators पर पड़ सकता है।
अदालत का फैसला यह तय करने में महत्वपूर्ण भूमिका निभा सकता है कि भविष्य में AI कंपनियां Training Data कैसे प्राप्त करेंगी और मूल सामग्री तैयार करने वालों को इसके लिए किस तरह का भुगतान या लाइसेंस व्यवस्था मिल सकती है।
इसके साथ ही Search Engines, AI Assistants और Original Information Sources के बीच संबंध भी बदल सकता है। जैसे-जैसे लोग जानकारी खोजने और समझने के लिए AI का इस्तेमाल बढ़ा रहे हैं, वैसे-वैसे Copyright, Licensing, Attribution और Fair Compensation से जुड़े सवाल और महत्वपूर्ण होते जा रहे हैं।
हाल ही में सार्वजनिक किए गए अदालती दस्तावेज कंपनियों के भीतर मौजूद कुछ चिंताओं की झलक देते हैं। हालांकि, किसी विशेष AI Training Practice ने अमेरिकी कॉपीराइट कानून का उल्लंघन किया है या नहीं, इसका अंतिम फैसला अदालतों को करना है।