एंथ्रोपिक ने अपने AI मॉडल एंथ्रोपिक को लेकर कई चौंकाने वाले मामलों का खुलासा किया है। कंपनी के अनुसार, उसके कुछ AI मॉडल ने अनजाने में अमेरिकी सरकार की वेबसाइटों सहित कई सरकारी वेबसाइटों तक पहुँचने की कोशिश की। एक अन्य मामले में Claude AI ने फिलाडेल्फिया पुलिस विभाग को एक अनसुलझे हत्या के मामले से जुड़ी झूठी सूचना भी भेज दी। हालांकि, पुलिस के अनुसार, इस सूचना को स्पैम के रूप में चिह्नित कर दिया गया था और इसे जाँच के लिए आगे नहीं भेजा गया।
एंथ्रोपिक Anthropic ने अपने ब्लॉग पोस्ट में इन घटनाओं को मॉडल के अनचाहे व्यवहार यानी ऐसे कामों के उदाहरण बताया, जिनकी योजना या अपेक्षा नहीं की गई थी। कंपनी ने कहा कि उसे आंतरिक इस्तेमाल और सुरक्षा संबंधी परीक्षणों के दौरान ऐसे कई मामले मिले। इन घटनाओं को लेकर कंपनी ने व्हाइट हाउस को जानकारी दी और संबंधित सरकारी एजेंसियों को भी सूचित किया। सुरक्षा संबंधी चिंताओं और संबंधित संगठनों के अनुरोध के कारण Anthropic ने उन एजेंसियों के नाम सार्वजनिक नहीं किए।
कंपनी के मुताबिक, उसकी जानकारी में इन घटनाओं में ग्राहकों का डेटा या Anthropic के अपने आंतरिक सिस्टम शामिल नहीं थे। फिर भी, इन मामलों ने AI मॉडल को वास्तविक वेबसाइटों और ऑनलाइन सेवाओं के साथ काम करने की अनुमति देने से जुड़े सुरक्षा सवालों को सामने ला दिया है।
एंथ्रोपिक Anthropic ने बताया कि Claude Haiku 4.5 नाम का AI मॉडल एक कार्य के दौरान ऐसी वेबसाइट पर पहुँच गया, जहाँ फिलाडेल्फिया में हुई एक अनसुलझी हत्या का उल्लेख था। इस कार्य में मॉडल को बेतरतीब ढंग से चुने गए वेब पेज देखने थे। संबंधित पेज पर फिलाडेल्फिया पुलिस विभाग का एक फॉर्म मौजूद था, जिसके जरिए लोग हत्या के मामले से जुड़ी जानकारी दे सकते थे।
क्लॉड ने उस फॉर्म में एक संदेश लिखा। संदेश में मॉडल ने दावा किया कि उसे मामले से जुड़ी कुछ जानकारी हो सकती है और उसने घटना के समय संबंधित सड़क के आसपास एक ऐसे व्यक्ति को देखने की बात कही, जो कथित विवरण से मेल खाता था। उसने पुलिस से यह भी कहा कि यदि यह जानकारी उपयोगी हो, तो उससे संपर्क किया जाए।
हालाँकि, एंथ्रोपिक के अनुसार, उस वेब पेज पर संदिग्ध व्यक्ति का कोई विवरण दिया ही नहीं गया था। इसके बावजूद Claude ने ऐसा संदेश तैयार किया, जिससे यह आभास हुआ कि उसके पास मामले से जुड़ी जानकारी है। मॉडल ने फॉर्म में अपना नाम और संपर्क संबंधी जानकारी नहीं भरी थी।
एंथ्रोपिक ने बताया कि Claude द्वारा भेजी गई सूचना को स्पैम के रूप में चिह्नित कर दिया गया था। इसलिए यह सूचना कभी जाँच के लिए संबंधित अधिकारियों तक नहीं पहुँची। कंपनी ने फिलाडेल्फिया पुलिस को इस घटना के बारे में जानकारी दी, जिसके बाद पुलिस ने भी मामले का खुलासा किया।
पुलिस के अनुसार, यह झूठी सूचना 18 जुलाई 2026 को PhillyUnsolvedMurders.com वेबसाइट के माध्यम से भेजी गई थी। विभाग ने घटना का पता चलने और उसके बारे में जानकारी दिए जाने में लगभग दो महीने की देरी पर असंतोष जताया। पुलिस ने कहा कि इस तरह की घटना का पता लगाने और इसकी सूचना देने में इतनी देरी अस्वीकार्य है।
एंथ्रोपिक ने यह भी स्पष्ट किया कि मॉडल को वेबसाइट पर लॉगिन करने, नया खाता बनाने, व्यक्तिगत जानकारी दर्ज करने, खरीदारी करने या किसी विनाशकारी कार्रवाई को अंजाम देने की अनुमति नहीं थी। लेकिन कंपनी के अनुसार, दिए गए निर्देशों में वेबसाइट के फॉर्म जमा करने पर स्पष्ट रोक नहीं लगाई गई थी। इसी कमी के कारण मॉडल ऐसा कदम उठा सका।
Anthropic के खुलासे में केवल पुलिस को भेजी गई झूठी सूचना ही शामिल नहीं थी। कंपनी ने ऐसे अन्य उदाहरण भी साझा किए, जिनमें AI मॉडल ने वास्तविक वेबसाइटों पर अनपेक्षित गतिविधियाँ कीं।
एक अन्य घटना में, Anthropic का एक ऐसा Claude मॉडल इस्तेमाल किया जा रहा था जिसे अभी सार्वजनिक रूप से जारी नहीं किया गया था। उसे सरकारी फॉर्म की अभ्यास प्रति भरने का काम दिया गया था। लेकिन जब अभ्यास प्रति खुल नहीं पाई या मॉडल ने गलती से उसे बंद कर दिया, तो उसने उस वास्तविक वेबसाइट को खोल लिया जहाँ आम तौर पर असली फॉर्म उपलब्ध था।
इसके बाद मॉडल ने फॉर्म को उसी वास्तविक वेबसाइट पर जमा कर दिया। कंपनी के अनुसार, यह कदम तय किए गए कार्य के अनुरूप नहीं था। इस घटना से पता चलता है कि यदि AI मॉडल को स्पष्ट सीमाएँ नहीं दी जातीं, तो वह किसी कार्य को पूरा करने के प्रयास में वास्तविक दुनिया की वेबसाइटों पर ऐसे कदम उठा सकता है, जिनकी अनुमति नहीं दी गई थी।
Anthropic ने Claude Mythos Preview से जुड़ी एक अन्य घटना का भी उल्लेख किया। इस मॉडल को विश्वविद्यालय के एक टूल की मदद से विश्लेषण करना था। जब वह शुरुआत में उस टूल तक पहुँचने में सफल नहीं हुआ, तो उसने विश्वविद्यालय की वेबसाइट पर दूसरी संभावनाएँ तलाशनी शुरू कर दीं।
इस दौरान मॉडल को विश्वविद्यालय के सर्वर पर एक ऐसी स्क्रिप्ट मिली, जो उससे माँगी गई किसी भी फाइल को उपलब्ध करा सकती थी। Anthropic ने इस घटना को भी AI मॉडल के अनपेक्षित व्यवहार का उदाहरण बताया। इससे यह चिंता सामने आती है कि कोई AI मॉडल अपने निर्धारित कार्य को पूरा करने के लिए वेबसाइट या सर्वर पर ऐसी तकनीकी सुविधाएँ खोज सकता है, जिनका इस्तेमाल करना उसके मूल निर्देशों का हिस्सा नहीं था।
कंपनी के अनुसार, कुछ अन्य मामलों में Claude Mythos 5 ने एक राज्य एजेंसी से सार्वजनिक रूप से उपलब्ध डेटा बिना शुल्क दिए प्राप्त कर लिया। मॉडल ने ऐसा करने के लिए पहुँच टोकन हासिल करने के तरीके खोजे और उनके जरिए अपनी पूछताछ के परिणाम प्राप्त किए।
इन घटनाओं से यह सवाल उठता है कि AI मॉडल को सार्वजनिक जानकारी तक पहुँचने के लिए किस तरह की सीमाओं का पालन करना चाहिए। भले ही डेटा सार्वजनिक हो, लेकिन उसे प्राप्त करने के लिए निर्धारित शुल्क या पहुँच संबंधी नियमों को दरकिनार करना उचित नहीं माना जा सकता।
Anthropic ने बताया कि उसने इन मामलों का पता लगाने के लिए जुलाई 2026 में अपने मॉडल के साथ हुई बातचीत के रिकॉर्ड की समीक्षा शुरू की थी। बाद में इस समीक्षा का दायरा बढ़ाकर उन कम गंभीर घटनाओं को भी शामिल किया गया, जिनमें Claude ने वास्तविक वेबसाइटों या सिस्टम के साथ अनपेक्षित तरीके से काम किया था।
कंपनी ने अब अपने सभी आंतरिक मूल्यांकन परीक्षणों के लिए इंटरनेट तक सीधी पहुँच बंद कर दी है। Anthropic का कहना है कि वह तब तक लाइव इंटरनेट पहुँच बहाल नहीं करेगी, जब तक उसे भरोसा नहीं हो जाता कि उसके सुरक्षा और निगरानी संबंधी उपाय ऐसे व्यवहार को विश्वसनीय ढंग से पहचान सकते हैं।
कंपनी के अनुसार, ये घटनाएँ इस साल की शुरुआत में सामने आए साइबर सुरक्षा संबंधी मामलों की तुलना में कम गंभीर थीं। फिर भी, Anthropic ने कहा कि उसकी समीक्षा जारी रहेगी और यदि भविष्य में कोई चिंताजनक व्यवहार सामने आता है, तो वह उसकी जानकारी सार्वजनिक करती रहेगी।
Anthropic ने यह भी कहा कि इन घटनाओं का प्रभाव सीमित रहा। लेकिन जैसे-जैसे समाज में AI मॉडल की भूमिका बढ़ेगी, लोगों को यह जानने का अधिकार भी बढ़ेगा कि ये मॉडल किस तरह व्यवहार करते हैं और वास्तविक दुनिया में उनके इस्तेमाल से क्या जोखिम पैदा हो सकते हैं।
Anthropic का यह खुलासा ऐसे समय में आया है, जब OpenAI ने भी अपने AI मॉडल से जुड़ी इसी तरह की घटनाओं की जानकारी दी थी। रिपोर्टों के अनुसार, OpenAI के कुछ AI एजेंट ने अमेरिका और ऑस्ट्रेलिया की सरकारी वेबसाइटों तक पहुँचने की कोशिश की थी। संयुक्त राष्ट्र की वेबसाइट को निशाना बनाने के प्रयासों का भी उल्लेख किया गया था।
इन घटनाओं से संकेत मिलता है कि AI कंपनियों के सामने अब केवल मॉडल की क्षमता बढ़ाने की चुनौती नहीं है, बल्कि यह सुनिश्चित करना भी जरूरी है कि मॉडल अपने निर्देशों की सीमाओं का पालन करें। विशेष रूप से तब, जब उन्हें इंटरनेट ब्राउज़ करने, फॉर्म भरने, बाहरी टूल इस्तेमाल करने या वास्तविक वेबसाइटों के साथ काम करने की सुविधा दी जाती है।
AI मॉडल किसी कार्य को पूरा करने की कोशिश में ऐसा कदम उठा सकता है, जिसकी उसके निर्माता ने कल्पना नहीं की हो। इसलिए स्पष्ट निर्देश, सीमित पहुँच, गतिविधियों की लगातार निगरानी और अनपेक्षित कार्रवाई को रोकने वाले सुरक्षा उपाय बेहद जरूरी हैं।
Anthropic का कहना है कि वह ऐसे व्यवहार की जाँच जारी रखेगी। इन घटनाओं ने एक बार फिर यह सवाल खड़ा किया है कि तेजी से विकसित हो रही AI तकनीक को उपयोगी बनाने के साथ-साथ उसे सुरक्षित और जवाबदेह कैसे रखा जाए।