माइक्रोसॉफ्ट ने लॉन्च किया MAI-ट्रांसक्राइब-2-स्ट्रीमिंग, 60 भाषाओं में रियल-टाइम स्पीच-टू-टेक्स्ट

Share Us

41
माइक्रोसॉफ्ट ने लॉन्च किया MAI-ट्रांसक्राइब-2-स्ट्रीमिंग, 60 भाषाओं में रियल-टाइम स्पीच-टू-टेक्स्ट
03 Oct 2026
6 min read

News Synopsis

माइक्रोसॉफ्ट ने आर्टिफिशियल इंटेलिजेंस यानी AI के क्षेत्र में अपनी क्षमताओं का विस्तार करते हुए एक नया Real-Time Speech-to-Text Model लॉन्च किया है। कंपनी ने इसका नाम MAI-Transcribe-2-Streaming रखा है। यह मॉडल बातचीत के दौरान बोले जा रहे शब्दों को तेजी से Text में बदलने के लिए तैयार किया गया है और इसका मुख्य फोकस तेज गति, कम देरी और बेहतर Transcription Accuracy पर है।

इस नए ट्रांसक्रिप्शन मॉडल के साथ माइक्रोसॉफ्ट ने दो स्पीच जेनरेशन मॉडल भी पेश किए हैं।इनके नाम MAI-Voice-2.1 और MAI-Voice-2.1-Flash हैं। इन तीनों मॉडलों को खास तौर पर डेवलपर्स और बिजनेस के लिए तैयार किया गया है, ताकि वे ऐसे बातचीत करने वाले वॉइस एजेंट Conversational Voice Agents बना सकें जो तेजी से जवाब दें, कई भाषाओं में बातचीत कर सकें और बड़े स्तर पर AI सेवाएं चलाने की लागत को नियंत्रित रख सकें।

MAI-ट्रांसक्राइब-2-स्ट्रीमिंग का मुख्य फोकस रियल-टाइम सटीकता MAI-Transcribe-2-Streaming Focuses on Real-Time Accuracy

60 भाषाओं में Speech-to-Text की सुविधा Speech-to-Text Support for 60 Languages

माइक्रोसॉफ्ट का MAI-Transcribe-2-Streaming लगातार बोले जा रहे शब्दों को Text में बदलने के लिए बनाया गया है। इसका उद्देश्य Audio मिलने के बाद बहुत कम समय में उसका Text तैयार करना है, जिससे Voice-based बातचीत अधिक स्वाभाविक तरीके से चल सके।

यह मॉडल 60 भाषाओं को Support करता है। इसमें Automatic Language Detection की सुविधा भी दी गई है। यानी उपयोगकर्ता को पहले से यह बताने की जरूरत नहीं होती कि वह किस भाषा में बोल रहा है। सिस्टम खुद बोले जा रहे शब्दों के आधार पर भाषा की पहचान कर सकता है।

माइक्रोसॉफ्ट एआई के सीईओ मुस्तफा सुलेमान Microsoft AI CEO Mustafa Suleyman ने इस मॉडल को दुनिया का सबसे सटीक Real-Time Audio Transcription System बताया है। कंपनी के अनुसार, स्वतंत्र Artificial Analysis Benchmark पर भी इस मॉडल ने Transcription Accuracy के मामले में बेहतर प्रदर्शन किया है।

Speech-to-Text में कम होगी देरी Speech-to-Text Responses Will Have Lower Latency

वाक्य पूरा होने से पहले Text तैयार करना Text Generation Can Begin Before a Sentence Ends

MAI-Transcribe-2-Streaming की सबसे महत्वपूर्ण विशेषताओं में से एक इसकी कम Latency है। Microsoft के अनुसार, मॉडल वक्ता का पूरा वाक्य समाप्त होने का इंतजार किए बिना Text तैयार करना शुरू कर सकता है।

कंपनी का कहना है कि Audio Input मिलने के लगभग 100 मिलीसेकंड बाद मॉडल शुरुआती Text Hypotheses तैयार करना शुरू कर सकता है। इससे Voice बातचीत के दौरान प्रतिक्रिया देने में होने वाली देरी कम हो सकती है।

पारंपरिक Transcription Systems अक्सर किसी Phrase या पूरे Sentence के समाप्त होने का इंतजार करते हैं। इसके बाद वे बोले गए शब्दों को Text में बदलकर वापस भेजते हैं। इसके विपरीत Microsoft का नया मॉडल लगातार आने वाले Audio को Process करने के लिए बनाया गया है।

नेचुरल वॉइस कन्वर्सेशन के लिए उपयोगी Useful for More Natural Voice Conversations

कम Latency वाली यह तकनीक उन Applications के लिए महत्वपूर्ण हो सकती है जहां उपयोगकर्ता और AI के बीच बातचीत लगातार चलती है। Customer Support, Virtual Assistants और अन्य Voice-based सेवाओं में लंबे इंतजार से बातचीत अस्वाभाविक महसूस हो सकती है। ऐसे में तेज Transcription AI को जल्दी प्रतिक्रिया तैयार करने में मदद कर सकता है।

MAI-Voice-2.1 कई भाषाओं में आवाज तैयार करेगा MAI-Voice-2.1 Brings Multilingual Speech Generation

23 भाषाओं और 26 Regional Locales का Support Support for 23 Languages and 26 Regional Locales

Microsoft ने Speech Recognition के साथ काम करने के लिए MAI-Voice-2.1 भी पेश किया है। यह एक Multilingual Text-to-Speech Model है, जिसका इस्तेमाल लिखे हुए Text को प्राकृतिक आवाज में बदलने के लिए किया जा सकता है।

यह मॉडल 23 भाषाओं और 26 Regional Locales को Support करता है। इससे Developers ऐसे AI Systems तैयार कर सकते हैं जो अलग-अलग देशों और क्षेत्रों के उपयोगकर्ताओं के साथ उनकी पसंदीदा भाषाओं में बातचीत कर सकें।

इस मॉडल की एक खास विशेषता Cross-Lingual Voice Identity Preservation है। इसका अर्थ है कि AI की आवाज भाषा बदलने के बाद भी अपनी पहचान और एक जैसी आवाज की विशेषता को बनाए रख सकती है।

अलग-अलग भाषाओं में एक जैसी AI Voice One Consistent AI Voice Across Multiple Languages

भाषा बदलने पर भी Voice Identity बनी रहेगी Voice Identity Remains Consistent Across Languages

MAI-Voice-2.1 को इस तरह तैयार किया गया है कि एक ही Synthetic Voice अलग-अलग भाषाओं में बातचीत कर सके। भाषा बदलने पर AI Voice में किसी एक भाषा का Accent दूसरी भाषा में अनावश्यक रूप से आने की संभावना को कम करने पर ध्यान दिया गया है।

Businesses के लिए यह सुविधा उपयोगी हो सकती है। उदाहरण के लिए, कोई कंपनी अलग-अलग देशों में अपने Virtual Representative के लिए एक जैसी AI Voice का इस्तेमाल कर सकती है।

Customer Service Systems में भी इसका इस्तेमाल किया जा सकता है, जहां ग्राहक अपनी पसंद की भाषा में बात कर सके और AI एक समान Voice Identity के साथ जवाब दे।

Microsoft ने MAI-Voice-2.1-Flash भी किया लॉन्च Microsoft Also Launches MAI-Voice-2.1-Flash

तेज प्रतिक्रिया के लिए तैयार किया गया Model Model Designed for Faster Responses

Microsoft ने MAI-Voice-2.1-Flash नाम से Speech Generation Model का तेज Version भी पेश किया है। इसे खास तौर पर उन Applications के लिए बनाया गया है जहां AI को बहुत कम समय में आवाज के रूप में जवाब देना होता है।

कंपनी के अनुसार, Flash Version में MAI-Voice-2.1 की Multilingual Voice Consistency सुविधाएं बरकरार रहती हैं, लेकिन इसे High-Throughput Enterprise Workloads के लिए अधिक तेज और बेहतर तरीके से तैयार किया गया है।

इसका मतलब है कि बड़ी संख्या में एक साथ होने वाली Voice Interactions को संभालने वाले Enterprise Applications में इसका इस्तेमाल किया जा सकता है।

150 मिलीसेकंड में ऑडियो जनरेशन लेटेंसी 150-Millisecond Audio Generation Latency

45 सेकंड का Synthetic Audio तेजी से तैयार 45 Seconds of Synthetic Audio Generated Quickly

Microsoft के अनुसार, MAI-Voice-2.1-Flash लगभग 150 मिलीसेकंड की End-to-End Latency में 45 सेकंड का Synthetic Audio तैयार कर सकता है।

इतनी कम प्रतिक्रिया अवधि Voice-based AI Agents के लिए महत्वपूर्ण हो सकती है। जब कोई उपयोगकर्ता सवाल पूछता है, तो AI को पहले उस आवाज को समझना, फिर जवाब तैयार करना और अंत में उसे बोलकर सुनाना होता है। इन सभी चरणों में देरी कम होने से बातचीत अधिक सहज महसूस हो सकती है।

कन्वर्सेशनल वॉयस एजेंट्स के लिए बनाए गए तीनों मॉडल All Three Models Are Designed for Conversational Voice Agents

सुनने, समझने और जवाब देने की क्षमता Capabilities to Listen, Understand and Respond

Microsoft के तीनों नए Models को एक साथ देखा जाए तो वे Voice-based AI Applications के अलग-अलग हिस्सों को पूरा करते हैं।

MAI-Transcribe-2-Streaming उपयोगकर्ता की आवाज को Text में बदलता है, जबकि MAI-Voice-2.1 और MAI-Voice-2.1-Flash AI के जवाब को आवाज में बदलने पर ध्यान देते हैं।

इन तकनीकों को मिलाकर Developers ऐसे AI Systems बना सकते हैं जो उपयोगकर्ता की बात सुनें, उसे समझने के लिए Text में बदलें और फिर Voice के माध्यम से जवाब दें।

इनका संभावित इस्तेमाल Customer Support, Virtual Assistants, Multilingual Services और Enterprise Communication Tools में किया जा सकता है।

माइक्रोसॉफ्ट का फोकस स्पीड, भाषा और कीमत पर Microsoft Focuses on Speed, Language Support and Cost

बड़े स्तर पर AI Voice Services की संभावना Potential for Scalable AI Voice Services

AI Voice Technology के क्षेत्र में कंपनियों के बीच प्रतिस्पर्धा लगातार बढ़ रही है। Developers ऐसे Models की मांग कर रहे हैं जो एक साथ बेहतर Accuracy, कम Response Time और कई भाषाओं का Support दे सकें।

एक ही AI System में दर्जनों भाषाओं का Support होने से Businesses को अलग-अलग बाजारों के लिए अलग Voice Systems तैयार करने की आवश्यकता कम हो सकती है।

Microsoft इन नए Models को ऐसे Tools के रूप में पेश कर रहा है जो Voice Agents को विकसित करने की प्रक्रिया को आसान बना सकते हैं और बड़े स्तर पर काम करने वाले Enterprise Applications की जरूरतों को पूरा कर सकते हैं।

माइक्रोसॉफ्ट के एआई मॉडल पोर्टफोलियो का विस्तार Microsoft Expands Its AI Model Portfolio

Proprietary AI Technology पर बढ़ता जोर Growing Focus on Proprietary AI Technology

MAI-Transcribe-2-Streaming, MAI-Voice-2.1 और MAI-Voice-2.1-Flash का लॉन्च Microsoft के तेजी से बढ़ते AI Model Portfolio में नई क्षमताएं जोड़ता है।

Microsoft जहां दूसरी AI कंपनियों के साथ साझेदारी करके भी AI Technology का इस्तेमाल कर रहा है, वहीं उसके MAI-branded Models कंपनी की अपनी AI Technology विकसित करने की दिशा को भी दिखाते हैं।

नए Speech-focused Models ऐसे समय में आए हैं जब Voice AI में तेज प्रतिक्रिया, भाषा की सटीकता और Natural Interaction का महत्व लगातार बढ़ रहा है। आने वाले समय में ऐसे Models Customer Service, Virtual Assistants और अन्य Voice-based Applications को विकसित करने के तरीके में महत्वपूर्ण भूमिका निभा सकते हैं।

TWN Exclusive