भारतीय AI स्टार्टअप Sarvam AI ने अपने विजन-लैंग्वेज मॉडल का नया संस्करण Sarvam Vision 2.1 लॉन्च किया है। यह मॉडल खास तौर पर दस्तावेजों को समझने, उनमें मौजूद जानकारी को पढ़ने और उसे व्यवस्थित डिजिटल डेटा में बदलने की क्षमता को बेहतर बनाने पर केंद्रित है। कंपनी के अनुसार, नया मॉडल जटिल दस्तावेजों, कई पन्नों वाली तालिकाओं, अलग-अलग तरह के फॉर्म और भारतीय भाषाओं में लिखी हस्तलिखित सामग्री को समझने के लिए तैयार किया गया है।
Vision 2.1 का उद्देश्य केवल किसी दस्तावेज में लिखे शब्दों को पढ़ना नहीं है। यह दस्तावेज में मौजूद अलग-अलग जानकारियों के बीच संबंध को समझकर उन्हें संरचित जानकारी में बदलने पर भी ध्यान देता है। इससे ऐसी जानकारी को सीधे कारोबारी और डिजिटल कार्यप्रवाह में इस्तेमाल किया जा सकता है। नया संस्करण पिछले मॉडल में सामने आई कुछ सीमाओं, खासकर घने लेआउट और असामान्य दस्तावेज संरचनाओं से जुड़ी समस्याओं को दूर करने की दिशा में विकसित किया गया है।
सर्वम विजन 2.1 Sarvam Vision 2.1 में सबसे महत्वपूर्ण सुधार जटिल तालिकाओं को समझने की क्षमता से जुड़ा है। सामान्य दस्तावेज पढ़ने वाली प्रणालियों के लिए ऐसी तालिकाओं को सही तरीके से समझना मुश्किल हो सकता है, खासकर तब जब एक तालिका कई पन्नों में फैली हो या उसके अंदर दूसरी तालिकाएं मौजूद हों।
Vision 2.1 को Nested Tables, Multi-Page Tables और Complex Table Structures को समझने के लिए तैयार किया गया है। इसका मतलब है कि मॉडल तालिका में मौजूद अलग-अलग पंक्तियों, कॉलम और उनके बीच के संबंध को बनाए रखते हुए जानकारी निकालने की कोशिश करता है।
यह सुविधा उन संगठनों के लिए उपयोगी हो सकती है जिन्हें बड़ी संख्या में वित्तीय रिपोर्ट, रिकॉर्ड, आवेदन और अन्य दस्तावेजों से जानकारी निकालनी पड़ती है।
नया मॉडल फॉर्म में मौजूद Key-Value Information को भी पहचान सकता है। इसमें नाम, तारीख, वित्तीय आंकड़े और अन्य महत्वपूर्ण जानकारी शामिल हो सकती है।
इससे कागजी या स्कैन किए गए फॉर्म में मौजूद जानकारी को डिजिटल और संरचित डेटा में बदलने की प्रक्रिया आसान हो सकती है।
Vision 2.1 का एक और महत्वपूर्ण पहलू भारतीय भाषाओं में लिखी हस्तलिखित सामग्री को पहचानने की बेहतर क्षमता है। भारत में कई सरकारी रिकॉर्ड, पुराने दस्तावेज, आवेदन और स्थानीय भाषा से जुड़े रिकॉर्ड ऐसे होते हैं जिनमें हाथ से लिखी गई जानकारी मौजूद रहती है।
कंपनी ने मॉडल को भारतीय भाषाओं की हस्तलिपि में मौजूद अलग-अलग तरह की लिखावट और दस्तावेज प्रारूपों को समझने के लिए प्रशिक्षित किया है। इससे हाथ से लिखे नोट, टिप्पणियां और क्षेत्रीय भाषाओं में मौजूद जानकारी को मशीन द्वारा पढ़ने की क्षमता बेहतर हो सकती है।
यह सुविधा उन संस्थानों के लिए विशेष रूप से उपयोगी हो सकती है जो बड़ी संख्या में पुराने रिकॉर्ड या क्षेत्रीय भाषाओं में मौजूद दस्तावेजों को डिजिटल रूप देना चाहते हैं।
Sarvam ने Vision 2.1 को विकसित करते समय दस्तावेजों से जुड़े AI सिस्टम की दो आम समस्याओं पर भी ध्यान दिया है। इनमें Hallucination और Spatial Inconsistency शामिल हैं।
Hallucination की स्थिति में AI ऐसी जानकारी उत्पन्न कर सकता है जो दस्तावेज में मौजूद नहीं है या किसी जानकारी को गलत तरीके से समझ सकता है। वहीं Spatial Inconsistency की वजह से मॉडल दस्तावेज में लिखी जानकारी को गलत स्थान या गलत हिस्से से जोड़ सकता है।
जटिल फॉर्म, कई तालिकाओं और असामान्य लेआउट वाले दस्तावेजों में ऐसी गलतियां विशेष रूप से महत्वपूर्ण हो सकती हैं। Sarvam का कहना है कि Vision 2.1 को ऐसे मामलों में अधिक विश्वसनीय टेक्स्ट और संरचनात्मक परिणाम देने के उद्देश्य से विकसित किया गया है।
Vision 2.1 के साथ Sarvam ने एक नया Sarvam Indic OCR Benchmark भी पेश किया है। इसका उद्देश्य भारत की 22 आधिकारिक रूप से मान्यता प्राप्त भाषाओं में OCR यानी Optical Character Recognition की क्षमता को जांचना है।
इस बेंचमार्क में कुल 6,909 नमूने शामिल हैं। इनमें 6,609 नमूने 22 भारतीय भाषाओं से संबंधित हैं, जबकि 300 नमूने अंग्रेजी भाषा के आधार के रूप में रखे गए हैं।
डेटासेट में समाचार पत्रों, पुस्तिकाओं, पाठ्यपुस्तकों और ऐतिहासिक अभिलेखों से लिए गए दस्तावेज शामिल किए गए हैं। इनमें 1800 से लेकर वर्तमान समय तक के दस्तावेजों को शामिल किया गया है।
इस तरह बेंचमार्क का उद्देश्य केवल एक भाषा या एक प्रकार की लिखावट की जांच करना नहीं है, बल्कि भारत में इस्तेमाल होने वाली अलग-अलग लिपियों, भाषाओं और दस्तावेज प्रारूपों की विविधता के बीच AI की क्षमता का आकलन करना है।
कंपनी के अनुसार, Sarvam Vision 2.1 ने अपने Indic OCR Benchmark पर 87.39% का Overall Word Accuracy Score हासिल किया है। मॉडल ने वैश्विक olmOCR-Bench पर भी 87.30 का स्कोर दर्ज किया।
ये परिणाम बताते हैं कि मॉडल को भारतीय भाषाओं से जुड़े दस्तावेजों के साथ-साथ सामान्य दस्तावेज समझने की जरूरतों को ध्यान में रखकर तैयार किया गया है।
हालांकि, बेंचमार्क में प्राप्त परिणामों को किसी भी वास्तविक कारोबारी या प्रशासनिक परिस्थिति में समान स्तर की सटीकता की गारंटी के रूप में नहीं देखा जाना चाहिए। वास्तविक प्रदर्शन दस्तावेज की गुणवत्ता, भाषा, लिखावट और लेआउट जैसे कई कारकों पर निर्भर कर सकता है।
Sarvam ने Vision 2.1 की ट्रेनिंग के लिए Synthetic और Real-World Document Scans दोनों का इस्तेमाल किया। प्रशिक्षण के दौरान भारतीय भाषाओं की अलग-अलग लिखावट, फॉर्म से जानकारी निकालने और विविध दस्तावेज प्रारूपों से जुड़े उदाहरणों पर विशेष ध्यान दिया गया।
इसका उद्देश्य मॉडल को वास्तविक दुनिया में मिलने वाले अलग-अलग प्रकार के दस्तावेजों और परिस्थितियों के लिए तैयार करना था। शुरुआती प्रशिक्षण के बाद मॉडल को Supervised Learning तकनीकों के माध्यम से और बेहतर बनाया गया।
Vision 2.1 के विकास में Reinforcement Learning with Verifiable Rewards (RLVR) का भी इस्तेमाल किया गया। इस तरीके का उद्देश्य मॉडल को ऐसे परिणाम देने के लिए प्रोत्साहित करना है जो केवल देखने में सही न लगें, बल्कि उनके टेक्स्ट और ढांचे में भी अधिक सटीकता हो।
दस्तावेजों से जानकारी निकालते समय केवल सही शब्द पढ़ना पर्याप्त नहीं होता। यह भी जरूरी है कि मॉडल यह समझे कि कौन-सी जानकारी किस फॉर्म, तालिका या क्षेत्र से संबंधित है। इसलिए Supervised Fine-Tuning और Reinforcement Learning को मिलाकर मॉडल के दस्तावेज प्रसंस्करण परिणामों की विश्वसनीयता बढ़ाने का प्रयास किया गया है।
Sarvam Vision 2.1 को कंपनी के Document Intelligence APIs के माध्यम से उपलब्ध कराया गया है। डेवलपर्स इन API की मदद से कई पन्नों वाले दस्तावेजों को प्रोसेस कर सकते हैं और उनमें मौजूद जानकारी को संरचित टेक्स्ट में बदल सकते हैं।
फॉर्म और तालिकाओं से जानकारी निकालने की सुविधाओं को भी डिजिटल सिस्टम में जोड़ा जा सकता है। इसका फायदा उन कंपनियों और डेवलपर्स को मिल सकता है जो अपने मौजूदा सॉफ्टवेयर या कारोबारी कार्यप्रवाह में दस्तावेज समझने की क्षमता जोड़ना चाहते हैं।
Vision 2.1 की क्षमताओं का इस्तेमाल कई तरह के दस्तावेज आधारित कार्यों में किया जा सकता है। इनमें पुराने रिकॉर्ड को डिजिटल बनाना, फॉर्म से जानकारी निकालना, वित्तीय दस्तावेजों को प्रोसेस करना, तालिकाओं का विश्लेषण करना और भारतीय भाषाओं में लिखे हस्तलिखित दस्तावेजों को मशीन-पठनीय डेटा में बदलना शामिल हो सकता है।
OCR, दस्तावेज समझ, तालिका प्रसंस्करण और हस्तलिखित सामग्री पहचान को एक साथ लाकर Sarvam इसे केवल सामान्य टेक्स्ट पढ़ने वाले सिस्टम के बजाय व्यापक Document Intelligence समाधान के रूप में पेश कर रहा है।
Sarvam AI का Vision 2.1 जटिल और बहुभाषी दस्तावेजों को समझने की क्षमता को बेहतर बनाने पर केंद्रित नया विजन-लैंग्वेज मॉडल है। इसमें कई पन्नों वाली तालिकाओं, जटिल फॉर्म, भारतीय भाषाओं की हस्तलिखित सामग्री और दस्तावेज के अलग-अलग हिस्सों के बीच संबंध समझने पर विशेष ध्यान दिया गया है।
कंपनी द्वारा पेश किए गए Indic OCR Benchmark और उसमें दर्ज परिणाम भारतीय भाषाओं में दस्तावेज प्रसंस्करण की क्षमता को मापने का एक अलग आधार उपलब्ध कराते हैं। साथ ही, Document Intelligence APIs के जरिए डेवलपर्स इन क्षमताओं को अपने डिजिटल और कारोबारी कार्यप्रवाह में जोड़ सकते हैं। हालांकि, किसी भी AI मॉडल की तरह इसका वास्तविक प्रदर्शन दस्तावेजों की प्रकृति और उपयोग की परिस्थितियों पर निर्भर करेगा।