माइक्रोसॉफ्ट एग्जीक्यूटिव ने AI डेटा स्क्रैपिंग को बताया ‘इतिहास में श्रम की सबसे बड़ी चोरी

Share Us

71
माइक्रोसॉफ्ट एग्जीक्यूटिव ने AI डेटा स्क्रैपिंग को बताया ‘इतिहास में श्रम की सबसे बड़ी चोरी
19 Sep 2026
8 min read

News Synopsis

आर्टिफिशियल इंटेलिजेंस यानी AI कंपनियां अपने बड़े भाषा मॉडल यानी Large Language Models को तैयार करने के लिए इंटरनेट से बड़ी मात्रा में डेटा जुटाती हैं। इस प्रक्रिया को लेकर लंबे समय से कॉपीराइट, अनुमति और कंटेंट बनाने वालों को मिलने वाले आर्थिक लाभ जैसे मुद्दों पर बहस चल रही है। अब Microsoft और OpenAI से जुड़े एक महत्वपूर्ण कॉपीराइट मामले में सार्वजनिक किए गए नए अदालती दस्तावेजों ने इस बहस को और तेज कर दिया है।

इन दस्तावेजों में माइक्रोसॉफ्ट के एप्लाइड साइंस डिपार्टमेंट के डायरेक्टर ब्रेंट हेच्ट Brent Hecht, Director of Microsoft's Applied Sciences Group की एक आंतरिक टिप्पणी सामने आई है। रिपोर्ट के अनुसार, उन्होंने AI Training के लिए इंटरनेट से बड़े पैमाने पर कंटेंट जुटाने की प्रक्रिया को “मानव इतिहास में श्रम की सबसे बड़ी चोरी” बताया था। यह टिप्पणी Microsoft, OpenAI और The New York Times से जुड़े कॉपीराइट विवाद की कानूनी फाइलिंग में सामने आई है।

यह मामला इस बड़े सवाल से जुड़ा है कि क्या AI कंपनियां बिना अनुमति या भुगतान के कॉपीराइट वाली सामग्री का इस्तेमाल अपने AI मॉडल को प्रशिक्षित करने के लिए कर सकती हैं। Microsoft और OpenAI का कहना है कि उनका इस्तेमाल अमेरिकी कानून में मौजूद Fair Use के दायरे में आता है। वहीं समाचार संस्थानों का तर्क है कि उनकी पत्रकारिता सामग्री का इस्तेमाल बिना अनुमति किया गया और AI उत्पाद उनके मूल कंटेंट से सीधे प्रतिस्पर्धा कर सकते हैं।

ब्रेंट हेचट ने एआई डेटा संग्रह पर जताई चिंता Brent Hecht Raises Concerns Over AI Data Collection

अदालती दस्तावेजों के अनुसार, Brent Hecht ने AI Training के लिए ऑनलाइन सामग्री के बड़े पैमाने पर इस्तेमाल को लेकर गंभीर चिंताएं जाहिर की थीं। उनका कहना था कि इंटरनेट पर मौजूद लाखों रचनाकारों ने कभी यह नहीं सोचा था कि उनके द्वारा तैयार की गई सामग्री भविष्य में बड़े AI मॉडल को प्रशिक्षित करने के लिए इस्तेमाल होगी।

उनकी चिंता केवल कॉपीराइट तक सीमित नहीं थी। दस्तावेजों से संकेत मिलता है कि Hecht इंटरनेट के पूरे Content Ecosystem पर इसके लंबे समय तक पड़ने वाले प्रभाव को लेकर भी चिंतित थे।

AI कंपनियों और कंटेंट निर्माताओं के बीच बढ़ता तनाव Growing Tension Between AI Companies and Content Creators

Hecht की टिप्पणी का एक महत्वपूर्ण पहलू यह था कि AI कंपनियां जिस ऑनलाइन सामग्री पर निर्भर करती हैं, वही कंपनियां ऐसे उत्पाद भी विकसित कर सकती हैं जो उस सामग्री को तैयार करने वाले प्रकाशकों की कमाई को प्रभावित करें।

उदाहरण के लिए, अगर लोग किसी खबर को पढ़ने के लिए मूल वेबसाइट पर जाने के बजाय AI चैटबॉट से उसका सारांश या जवाब प्राप्त करने लगें, तो प्रकाशकों की वेबसाइट पर आने वाला ट्रैफिक कम हो सकता है। इससे विज्ञापन, सदस्यता और अन्य आय के स्रोत प्रभावित हो सकते हैं।

Hecht ने कथित तौर पर ऐसी स्थिति को संभावित “Doom Loop” यानी एक ऐसे नकारात्मक चक्र के रूप में देखा, जिसमें AI उत्पाद उस कंटेंट इकोसिस्टम को कमजोर कर सकते हैं, जिस पर AI मॉडल खुद प्रशिक्षण के लिए निर्भर हैं।

हालांकि, Microsoft ने यह स्पष्ट किया है कि Hecht की निजी आंतरिक टिप्पणियां कंपनी की कानूनी स्थिति को नहीं दर्शातीं। कंपनी ने अदालत में यह तर्क दिया है कि उसके AI सिस्टम कॉपीराइट सामग्री का Transformative Use करते हैं।

माइक्रोसॉफ्ट और ओपनएआई ने एआई ट्रेनिंग का बचाव किया Microsoft and OpenAI Defend Their AI Training Practices

Microsoft और OpenAI ने समाचार संगठनों द्वारा लगाए गए मुख्य कॉपीराइट आरोपों को खारिज किया है। दोनों कंपनियों का कहना है कि कॉपीराइट सामग्री से AI मॉडल को प्रशिक्षित करना कुछ परिस्थितियों में Fair Use के अंतर्गत आ सकता है।

कंपनियों का तर्क है कि AI मॉडल मूल सामग्री को केवल दोहराने के लिए नहीं बनाए जाते। Training के दौरान बड़ी मात्रा में जानकारी से पैटर्न सीखे जाते हैं और उसके बाद सिस्टम नए सवालों के जवाब तैयार करता है।

इसके विपरीत, प्रकाशकों का कहना है कि AI कंपनियों द्वारा उनकी सामग्री का इस्तेमाल उनके व्यवसाय को नुकसान पहुंचा सकता है। उनका तर्क है कि अगर AI सिस्टम सीधे उपयोगकर्ताओं को खबरों की जानकारी उपलब्ध करा देते हैं, तो लोग मूल वेबसाइट पर जाने, सदस्यता लेने या वहां विज्ञापन देखने की जरूरत कम महसूस कर सकते हैं।

इसी कारण AI Training Data और Copyright का विवाद अमेरिका में Generative AI से जुड़े सबसे महत्वपूर्ण कानूनी मुद्दों में शामिल हो गया है।

AI चैटबॉट्स से न्यूज़ वेबसाइट्स का ट्रैफिक घटने की चिंता AI Chatbots Could Reduce Traffic to News Websites

अदालती दस्तावेजों में AI प्लेटफॉर्म और पारंपरिक Search Engines के बीच बदलते संबंध को लेकर भी चर्चा की गई है।

पहले लोग किसी विषय की जानकारी पाने के लिए Search Engine में सवाल लिखते थे और फिर Search Results में दिखाई देने वाली वेबसाइट पर क्लिक करके पूरी खबर पढ़ते थे। लेकिन अब AI Chatbots सीधे सवाल का जवाब या किसी खबर का सारांश दे सकते हैं। इससे उपयोगकर्ता को मूल वेबसाइट खोलने की जरूरत कम पड़ सकती है।

Microsoft के CEO Satya Nadella ने अपनी गवाही में माना था कि Chatbot के जरिए जानकारी मिलने से कभी-कभी उस वेबसाइट पर जाने की जगह ली जा सकती है, जहां से मूल जानकारी आई है।

प्रकाशकों की ओर से अदालत में पेश किए गए आंकड़ों के अनुसार, Microsoft के AI आधारित Answer Experience के साथ कुछ New York Times और Daily News Domains पर Click-Through Rates पारंपरिक Bing Search की तुलना में काफी कम रहे। दस्तावेजों में संबंधित Domains के लिए 83% से 93% तक की गिरावट के आंकड़े बताए गए हैं।

पब्लिशर्स ने बताया ‘डूम लूप’ का संभावित खतरा Publishers Warn of a Potential ‘Doom Loop’

AI मॉडल को बेहतर बनाने के लिए बड़ी मात्रा में उच्च गुणवत्ता वाले डेटा की जरूरत होती है। इस सामग्री का एक बड़ा हिस्सा पत्रकारों, लेखकों, शोधकर्ताओं और अन्य पेशेवरों द्वारा तैयार किया जाता है।

अगर AI से मिलने वाले जवाबों के कारण लोग मूल वेबसाइटों पर कम जाने लगें, तो प्रकाशकों की कमाई प्रभावित हो सकती है। कम आय का मतलब भविष्य में पत्रकारिता और अन्य गुणवत्तापूर्ण सामग्री तैयार करने के लिए कम संसाधन भी हो सकता है।

ऐसी स्थिति में इंटरनेट पर नई और विश्वसनीय सामग्री की मात्रा कम हो सकती है। इसके बाद AI कंपनियों के पास भविष्य के मॉडल को प्रशिक्षित करने के लिए उच्च गुणवत्ता वाले नए डेटा के स्रोत भी कम हो सकते हैं। यही वह संभावित चक्र है जिसे दस्तावेजों में “Doom Loop” के रूप में चर्चा में लाया गया है।

OpenAI के अधिकारियों ने भी समाचार सामग्री पर चर्चा की OpenAI Leadership Also Discussed News Content

सार्वजनिक किए गए दस्तावेजों में OpenAI के अधिकारियों की टिप्पणियां भी शामिल हैं। OpenAI के सह-संस्थापक Greg Brockman ने कथित तौर पर कहा था कि AI मॉडल समाचार सामग्री से जुड़े Text Prediction और News-Related Tasks में विशेष रूप से सक्षम हैं।

प्रकाशकों द्वारा अदालत में पेश किए गए अन्य दस्तावेजों में कंपनियों के भीतर इस बात को लेकर चिंता का उल्लेख किया गया है कि AI उत्पाद पारंपरिक समाचार संस्थानों के साथ किस हद तक प्रतिस्पर्धा कर सकते हैं।

प्रकाशकों का कहना है कि ये दस्तावेज यह दिखाते हैं कि Microsoft और OpenAI अपने AI उत्पादों के पत्रकारिता क्षेत्र पर पड़ने वाले संभावित व्यावसायिक प्रभाव को समझते थे। हालांकि, इन दावों की कानूनी व्याख्या और अंतिम निष्कर्ष अदालत के फैसले पर निर्भर करेंगे।

माइक्रोसॉफ्ट, ओपनएआई और न्यूयॉर्क टाइम्स का कॉपीराइट विवाद The Copyright Dispute Involving Microsoft, OpenAI, and The New York Times

The New York Times ने 2023 में Microsoft और OpenAI के खिलाफ मुकदमा दायर किया था। समाचार संगठन का आरोप है कि उसकी कॉपीराइट वाली पत्रकारिता सामग्री का इस्तेमाल बिना अनुमति AI सिस्टम विकसित करने के लिए किया गया।

इसके बाद The New York Daily News, The Intercept और Center for Investigative Reporting समेत अन्य समाचार संगठनों से जुड़े मामले भी सामने आए।

Microsoft और OpenAI ने अपने AI Training Practices का बचाव जारी रखा है और कहा है कि कुछ परिस्थितियों में AI Training Fair Use के तहत संरक्षित हो सकती है। वहीं प्रकाशक अपने कॉपीराइट दावों के पक्ष में कानूनी राहत की मांग कर रहे हैं।

एआई उद्योग और प्रकाशकों के भविष्य पर क्या असर पड़ेगा What the Case Could Mean for AI and Publishers

यह विवाद केवल Microsoft, OpenAI और The New York Times तक सीमित नहीं है। इसके परिणाम का असर AI कंपनियों, समाचार संस्थानों, लेखकों, शोधकर्ताओं और अन्य Content Creators पर पड़ सकता है।

अदालत का फैसला यह तय करने में महत्वपूर्ण भूमिका निभा सकता है कि भविष्य में AI कंपनियां Training Data कैसे प्राप्त करेंगी और मूल सामग्री तैयार करने वालों को इसके लिए किस तरह का भुगतान या लाइसेंस व्यवस्था मिल सकती है।

इसके साथ ही Search Engines, AI Assistants और Original Information Sources के बीच संबंध भी बदल सकता है। जैसे-जैसे लोग जानकारी खोजने और समझने के लिए AI का इस्तेमाल बढ़ा रहे हैं, वैसे-वैसे Copyright, Licensing, Attribution और Fair Compensation से जुड़े सवाल और महत्वपूर्ण होते जा रहे हैं।

हाल ही में सार्वजनिक किए गए अदालती दस्तावेज कंपनियों के भीतर मौजूद कुछ चिंताओं की झलक देते हैं। हालांकि, किसी विशेष AI Training Practice ने अमेरिकी कॉपीराइट कानून का उल्लंघन किया है या नहीं, इसका अंतिम फैसला अदालतों को करना है।