सर्वम एआई विजन 2.1 लॉन्च: जानें नए एआई मॉडल की खासियत और उपयोग

Share Us

50
सर्वम एआई विजन 2.1 लॉन्च: जानें नए एआई मॉडल की खासियत और उपयोग
26 Sep 2026
7 min read

News Synopsis

भारतीय AI स्टार्टअप Sarvam AI ने अपने विजन-लैंग्वेज मॉडल का नया संस्करण Sarvam Vision 2.1 लॉन्च किया है। यह मॉडल खास तौर पर दस्तावेजों को समझने, उनमें मौजूद जानकारी को पढ़ने और उसे व्यवस्थित डिजिटल डेटा में बदलने की क्षमता को बेहतर बनाने पर केंद्रित है। कंपनी के अनुसार, नया मॉडल जटिल दस्तावेजों, कई पन्नों वाली तालिकाओं, अलग-अलग तरह के फॉर्म और भारतीय भाषाओं में लिखी हस्तलिखित सामग्री को समझने के लिए तैयार किया गया है।

Vision 2.1 का उद्देश्य केवल किसी दस्तावेज में लिखे शब्दों को पढ़ना नहीं है। यह दस्तावेज में मौजूद अलग-अलग जानकारियों के बीच संबंध को समझकर उन्हें संरचित जानकारी में बदलने पर भी ध्यान देता है। इससे ऐसी जानकारी को सीधे कारोबारी और डिजिटल कार्यप्रवाह में इस्तेमाल किया जा सकता है। नया संस्करण पिछले मॉडल में सामने आई कुछ सीमाओं, खासकर घने लेआउट और असामान्य दस्तावेज संरचनाओं से जुड़ी समस्याओं को दूर करने की दिशा में विकसित किया गया है।

जटिल तालिकाओं और फॉर्म को समझने में सुधार Better Understanding of Complex Tables and Forms

सर्वम विजन 2.1 Sarvam Vision 2.1 में सबसे महत्वपूर्ण सुधार जटिल तालिकाओं को समझने की क्षमता से जुड़ा है। सामान्य दस्तावेज पढ़ने वाली प्रणालियों के लिए ऐसी तालिकाओं को सही तरीके से समझना मुश्किल हो सकता है, खासकर तब जब एक तालिका कई पन्नों में फैली हो या उसके अंदर दूसरी तालिकाएं मौजूद हों।

कई पन्नों वाली तालिकाओं से जानकारी निकालना Extracting Information From Multi-Page Tables

Vision 2.1 को Nested Tables, Multi-Page Tables और Complex Table Structures को समझने के लिए तैयार किया गया है। इसका मतलब है कि मॉडल तालिका में मौजूद अलग-अलग पंक्तियों, कॉलम और उनके बीच के संबंध को बनाए रखते हुए जानकारी निकालने की कोशिश करता है।

यह सुविधा उन संगठनों के लिए उपयोगी हो सकती है जिन्हें बड़ी संख्या में वित्तीय रिपोर्ट, रिकॉर्ड, आवेदन और अन्य दस्तावेजों से जानकारी निकालनी पड़ती है।

फॉर्म से जरूरी जानकारी निकालना Extracting Key Information From Forms

नया मॉडल फॉर्म में मौजूद Key-Value Information को भी पहचान सकता है। इसमें नाम, तारीख, वित्तीय आंकड़े और अन्य महत्वपूर्ण जानकारी शामिल हो सकती है।

इससे कागजी या स्कैन किए गए फॉर्म में मौजूद जानकारी को डिजिटल और संरचित डेटा में बदलने की प्रक्रिया आसान हो सकती है।

भारतीय भाषाओं की हस्तलिखित सामग्री पहचानने में सुधार Improved Recognition of Indic Handwriting

Vision 2.1 का एक और महत्वपूर्ण पहलू भारतीय भाषाओं में लिखी हस्तलिखित सामग्री को पहचानने की बेहतर क्षमता है। भारत में कई सरकारी रिकॉर्ड, पुराने दस्तावेज, आवेदन और स्थानीय भाषा से जुड़े रिकॉर्ड ऐसे होते हैं जिनमें हाथ से लिखी गई जानकारी मौजूद रहती है।

अलग-अलग लिखावट को समझने पर जोर Focus on Different Handwriting Styles

कंपनी ने मॉडल को भारतीय भाषाओं की हस्तलिपि में मौजूद अलग-अलग तरह की लिखावट और दस्तावेज प्रारूपों को समझने के लिए प्रशिक्षित किया है। इससे हाथ से लिखे नोट, टिप्पणियां और क्षेत्रीय भाषाओं में मौजूद जानकारी को मशीन द्वारा पढ़ने की क्षमता बेहतर हो सकती है।

यह सुविधा उन संस्थानों के लिए विशेष रूप से उपयोगी हो सकती है जो बड़ी संख्या में पुराने रिकॉर्ड या क्षेत्रीय भाषाओं में मौजूद दस्तावेजों को डिजिटल रूप देना चाहते हैं।

AI की गलतियों को कम करने पर विशेष ध्यान Focus on Reducing AI Errors

Sarvam ने Vision 2.1 को विकसित करते समय दस्तावेजों से जुड़े AI सिस्टम की दो आम समस्याओं पर भी ध्यान दिया है। इनमें Hallucination और Spatial Inconsistency शामिल हैं।

Hallucination की स्थिति में AI ऐसी जानकारी उत्पन्न कर सकता है जो दस्तावेज में मौजूद नहीं है या किसी जानकारी को गलत तरीके से समझ सकता है। वहीं Spatial Inconsistency की वजह से मॉडल दस्तावेज में लिखी जानकारी को गलत स्थान या गलत हिस्से से जोड़ सकता है।

जटिल फॉर्म, कई तालिकाओं और असामान्य लेआउट वाले दस्तावेजों में ऐसी गलतियां विशेष रूप से महत्वपूर्ण हो सकती हैं। Sarvam का कहना है कि Vision 2.1 को ऐसे मामलों में अधिक विश्वसनीय टेक्स्ट और संरचनात्मक परिणाम देने के उद्देश्य से विकसित किया गया है।

सर्वम ने इंडिक ओसीआर बेंचमार्क भी पेश किया Sarvam Introduces Indic OCR Benchmark

Vision 2.1 के साथ Sarvam ने एक नया Sarvam Indic OCR Benchmark भी पेश किया है। इसका उद्देश्य भारत की 22 आधिकारिक रूप से मान्यता प्राप्त भाषाओं में OCR यानी Optical Character Recognition की क्षमता को जांचना है।

इस बेंचमार्क में कुल 6,909 नमूने शामिल हैं। इनमें 6,609 नमूने 22 भारतीय भाषाओं से संबंधित हैं, जबकि 300 नमूने अंग्रेजी भाषा के आधार के रूप में रखे गए हैं।

पुराने और आधुनिक दस्तावेज भी शामिल Benchmark Covers Historical and Modern Documents

डेटासेट में समाचार पत्रों, पुस्तिकाओं, पाठ्यपुस्तकों और ऐतिहासिक अभिलेखों से लिए गए दस्तावेज शामिल किए गए हैं। इनमें 1800 से लेकर वर्तमान समय तक के दस्तावेजों को शामिल किया गया है।

इस तरह बेंचमार्क का उद्देश्य केवल एक भाषा या एक प्रकार की लिखावट की जांच करना नहीं है, बल्कि भारत में इस्तेमाल होने वाली अलग-अलग लिपियों, भाषाओं और दस्तावेज प्रारूपों की विविधता के बीच AI की क्षमता का आकलन करना है।

Vision 2.1 ने बेंचमार्क में दर्ज किए मजबूत परिणाम Vision 2.1 Records Strong Benchmark Results

कंपनी के अनुसार, Sarvam Vision 2.1 ने अपने Indic OCR Benchmark पर 87.39% का Overall Word Accuracy Score हासिल किया है। मॉडल ने वैश्विक olmOCR-Bench पर भी 87.30 का स्कोर दर्ज किया।

ये परिणाम बताते हैं कि मॉडल को भारतीय भाषाओं से जुड़े दस्तावेजों के साथ-साथ सामान्य दस्तावेज समझने की जरूरतों को ध्यान में रखकर तैयार किया गया है।

हालांकि, बेंचमार्क में प्राप्त परिणामों को किसी भी वास्तविक कारोबारी या प्रशासनिक परिस्थिति में समान स्तर की सटीकता की गारंटी के रूप में नहीं देखा जाना चाहिए। वास्तविक प्रदर्शन दस्तावेज की गुणवत्ता, भाषा, लिखावट और लेआउट जैसे कई कारकों पर निर्भर कर सकता है।

मॉडल की ट्रेनिंग में वास्तविक और कृत्रिम दस्तावेजों का इस्तेमाल Training Uses Real and Synthetic Documents

Sarvam ने Vision 2.1 की ट्रेनिंग के लिए Synthetic और Real-World Document Scans दोनों का इस्तेमाल किया। प्रशिक्षण के दौरान भारतीय भाषाओं की अलग-अलग लिखावट, फॉर्म से जानकारी निकालने और विविध दस्तावेज प्रारूपों से जुड़े उदाहरणों पर विशेष ध्यान दिया गया।

इसका उद्देश्य मॉडल को वास्तविक दुनिया में मिलने वाले अलग-अलग प्रकार के दस्तावेजों और परिस्थितियों के लिए तैयार करना था। शुरुआती प्रशिक्षण के बाद मॉडल को Supervised Learning तकनीकों के माध्यम से और बेहतर बनाया गया।

रीइन्फोर्समेंट लर्निंग से सटीकता बढ़ाने की कोशिश Reinforcement Learning Used to Improve Accuracy

Vision 2.1 के विकास में Reinforcement Learning with Verifiable Rewards (RLVR) का भी इस्तेमाल किया गया। इस तरीके का उद्देश्य मॉडल को ऐसे परिणाम देने के लिए प्रोत्साहित करना है जो केवल देखने में सही न लगें, बल्कि उनके टेक्स्ट और ढांचे में भी अधिक सटीकता हो।

दस्तावेजों से जानकारी निकालते समय केवल सही शब्द पढ़ना पर्याप्त नहीं होता। यह भी जरूरी है कि मॉडल यह समझे कि कौन-सी जानकारी किस फॉर्म, तालिका या क्षेत्र से संबंधित है। इसलिए Supervised Fine-Tuning और Reinforcement Learning को मिलाकर मॉडल के दस्तावेज प्रसंस्करण परिणामों की विश्वसनीयता बढ़ाने का प्रयास किया गया है।

डेवलपर्स के लिए डॉक्यूमेंट इंटेलिजेंस एपीआई उपलब्ध हैं Document Intelligence APIs Available for Developers

Sarvam Vision 2.1 को कंपनी के Document Intelligence APIs के माध्यम से उपलब्ध कराया गया है। डेवलपर्स इन API की मदद से कई पन्नों वाले दस्तावेजों को प्रोसेस कर सकते हैं और उनमें मौजूद जानकारी को संरचित टेक्स्ट में बदल सकते हैं।

फॉर्म और तालिकाओं से जानकारी निकालने की सुविधाओं को भी डिजिटल सिस्टम में जोड़ा जा सकता है। इसका फायदा उन कंपनियों और डेवलपर्स को मिल सकता है जो अपने मौजूदा सॉफ्टवेयर या कारोबारी कार्यप्रवाह में दस्तावेज समझने की क्षमता जोड़ना चाहते हैं।

कई क्षेत्रों में हो सकता है इस्तेमाल Potential Applications Across Different Sectors

Vision 2.1 की क्षमताओं का इस्तेमाल कई तरह के दस्तावेज आधारित कार्यों में किया जा सकता है। इनमें पुराने रिकॉर्ड को डिजिटल बनाना, फॉर्म से जानकारी निकालना, वित्तीय दस्तावेजों को प्रोसेस करना, तालिकाओं का विश्लेषण करना और भारतीय भाषाओं में लिखे हस्तलिखित दस्तावेजों को मशीन-पठनीय डेटा में बदलना शामिल हो सकता है।

OCR, दस्तावेज समझ, तालिका प्रसंस्करण और हस्तलिखित सामग्री पहचान को एक साथ लाकर Sarvam इसे केवल सामान्य टेक्स्ट पढ़ने वाले सिस्टम के बजाय व्यापक Document Intelligence समाधान के रूप में पेश कर रहा है।

निष्कर्ष Conclusion

Sarvam AI का Vision 2.1 जटिल और बहुभाषी दस्तावेजों को समझने की क्षमता को बेहतर बनाने पर केंद्रित नया विजन-लैंग्वेज मॉडल है। इसमें कई पन्नों वाली तालिकाओं, जटिल फॉर्म, भारतीय भाषाओं की हस्तलिखित सामग्री और दस्तावेज के अलग-अलग हिस्सों के बीच संबंध समझने पर विशेष ध्यान दिया गया है।

कंपनी द्वारा पेश किए गए Indic OCR Benchmark और उसमें दर्ज परिणाम भारतीय भाषाओं में दस्तावेज प्रसंस्करण की क्षमता को मापने का एक अलग आधार उपलब्ध कराते हैं। साथ ही, Document Intelligence APIs के जरिए डेवलपर्स इन क्षमताओं को अपने डिजिटल और कारोबारी कार्यप्रवाह में जोड़ सकते हैं। हालांकि, किसी भी AI मॉडल की तरह इसका वास्तविक प्रदर्शन दस्तावेजों की प्रकृति और उपयोग की परिस्थितियों पर निर्भर करेगा।