माइक्रोसॉफ्ट ने आर्टिफिशियल इंटेलिजेंस यानी AI के क्षेत्र में अपनी क्षमताओं का विस्तार करते हुए एक नया Real-Time Speech-to-Text Model लॉन्च किया है। कंपनी ने इसका नाम MAI-Transcribe-2-Streaming रखा है। यह मॉडल बातचीत के दौरान बोले जा रहे शब्दों को तेजी से Text में बदलने के लिए तैयार किया गया है और इसका मुख्य फोकस तेज गति, कम देरी और बेहतर Transcription Accuracy पर है।
इस नए ट्रांसक्रिप्शन मॉडल के साथ माइक्रोसॉफ्ट ने दो स्पीच जेनरेशन मॉडल भी पेश किए हैं।इनके नाम MAI-Voice-2.1 और MAI-Voice-2.1-Flash हैं। इन तीनों मॉडलों को खास तौर पर डेवलपर्स और बिजनेस के लिए तैयार किया गया है, ताकि वे ऐसे बातचीत करने वाले वॉइस एजेंट Conversational Voice Agents बना सकें जो तेजी से जवाब दें, कई भाषाओं में बातचीत कर सकें और बड़े स्तर पर AI सेवाएं चलाने की लागत को नियंत्रित रख सकें।
माइक्रोसॉफ्ट का MAI-Transcribe-2-Streaming लगातार बोले जा रहे शब्दों को Text में बदलने के लिए बनाया गया है। इसका उद्देश्य Audio मिलने के बाद बहुत कम समय में उसका Text तैयार करना है, जिससे Voice-based बातचीत अधिक स्वाभाविक तरीके से चल सके।
यह मॉडल 60 भाषाओं को Support करता है। इसमें Automatic Language Detection की सुविधा भी दी गई है। यानी उपयोगकर्ता को पहले से यह बताने की जरूरत नहीं होती कि वह किस भाषा में बोल रहा है। सिस्टम खुद बोले जा रहे शब्दों के आधार पर भाषा की पहचान कर सकता है।
माइक्रोसॉफ्ट एआई के सीईओ मुस्तफा सुलेमान Microsoft AI CEO Mustafa Suleyman ने इस मॉडल को दुनिया का सबसे सटीक Real-Time Audio Transcription System बताया है। कंपनी के अनुसार, स्वतंत्र Artificial Analysis Benchmark पर भी इस मॉडल ने Transcription Accuracy के मामले में बेहतर प्रदर्शन किया है।
MAI-Transcribe-2-Streaming की सबसे महत्वपूर्ण विशेषताओं में से एक इसकी कम Latency है। Microsoft के अनुसार, मॉडल वक्ता का पूरा वाक्य समाप्त होने का इंतजार किए बिना Text तैयार करना शुरू कर सकता है।
कंपनी का कहना है कि Audio Input मिलने के लगभग 100 मिलीसेकंड बाद मॉडल शुरुआती Text Hypotheses तैयार करना शुरू कर सकता है। इससे Voice बातचीत के दौरान प्रतिक्रिया देने में होने वाली देरी कम हो सकती है।
पारंपरिक Transcription Systems अक्सर किसी Phrase या पूरे Sentence के समाप्त होने का इंतजार करते हैं। इसके बाद वे बोले गए शब्दों को Text में बदलकर वापस भेजते हैं। इसके विपरीत Microsoft का नया मॉडल लगातार आने वाले Audio को Process करने के लिए बनाया गया है।
कम Latency वाली यह तकनीक उन Applications के लिए महत्वपूर्ण हो सकती है जहां उपयोगकर्ता और AI के बीच बातचीत लगातार चलती है। Customer Support, Virtual Assistants और अन्य Voice-based सेवाओं में लंबे इंतजार से बातचीत अस्वाभाविक महसूस हो सकती है। ऐसे में तेज Transcription AI को जल्दी प्रतिक्रिया तैयार करने में मदद कर सकता है।
Microsoft ने Speech Recognition के साथ काम करने के लिए MAI-Voice-2.1 भी पेश किया है। यह एक Multilingual Text-to-Speech Model है, जिसका इस्तेमाल लिखे हुए Text को प्राकृतिक आवाज में बदलने के लिए किया जा सकता है।
यह मॉडल 23 भाषाओं और 26 Regional Locales को Support करता है। इससे Developers ऐसे AI Systems तैयार कर सकते हैं जो अलग-अलग देशों और क्षेत्रों के उपयोगकर्ताओं के साथ उनकी पसंदीदा भाषाओं में बातचीत कर सकें।
इस मॉडल की एक खास विशेषता Cross-Lingual Voice Identity Preservation है। इसका अर्थ है कि AI की आवाज भाषा बदलने के बाद भी अपनी पहचान और एक जैसी आवाज की विशेषता को बनाए रख सकती है।
MAI-Voice-2.1 को इस तरह तैयार किया गया है कि एक ही Synthetic Voice अलग-अलग भाषाओं में बातचीत कर सके। भाषा बदलने पर AI Voice में किसी एक भाषा का Accent दूसरी भाषा में अनावश्यक रूप से आने की संभावना को कम करने पर ध्यान दिया गया है।
Businesses के लिए यह सुविधा उपयोगी हो सकती है। उदाहरण के लिए, कोई कंपनी अलग-अलग देशों में अपने Virtual Representative के लिए एक जैसी AI Voice का इस्तेमाल कर सकती है।
Customer Service Systems में भी इसका इस्तेमाल किया जा सकता है, जहां ग्राहक अपनी पसंद की भाषा में बात कर सके और AI एक समान Voice Identity के साथ जवाब दे।
Microsoft ने MAI-Voice-2.1-Flash नाम से Speech Generation Model का तेज Version भी पेश किया है। इसे खास तौर पर उन Applications के लिए बनाया गया है जहां AI को बहुत कम समय में आवाज के रूप में जवाब देना होता है।
कंपनी के अनुसार, Flash Version में MAI-Voice-2.1 की Multilingual Voice Consistency सुविधाएं बरकरार रहती हैं, लेकिन इसे High-Throughput Enterprise Workloads के लिए अधिक तेज और बेहतर तरीके से तैयार किया गया है।
इसका मतलब है कि बड़ी संख्या में एक साथ होने वाली Voice Interactions को संभालने वाले Enterprise Applications में इसका इस्तेमाल किया जा सकता है।
Microsoft के अनुसार, MAI-Voice-2.1-Flash लगभग 150 मिलीसेकंड की End-to-End Latency में 45 सेकंड का Synthetic Audio तैयार कर सकता है।
इतनी कम प्रतिक्रिया अवधि Voice-based AI Agents के लिए महत्वपूर्ण हो सकती है। जब कोई उपयोगकर्ता सवाल पूछता है, तो AI को पहले उस आवाज को समझना, फिर जवाब तैयार करना और अंत में उसे बोलकर सुनाना होता है। इन सभी चरणों में देरी कम होने से बातचीत अधिक सहज महसूस हो सकती है।
Microsoft के तीनों नए Models को एक साथ देखा जाए तो वे Voice-based AI Applications के अलग-अलग हिस्सों को पूरा करते हैं।
MAI-Transcribe-2-Streaming उपयोगकर्ता की आवाज को Text में बदलता है, जबकि MAI-Voice-2.1 और MAI-Voice-2.1-Flash AI के जवाब को आवाज में बदलने पर ध्यान देते हैं।
इन तकनीकों को मिलाकर Developers ऐसे AI Systems बना सकते हैं जो उपयोगकर्ता की बात सुनें, उसे समझने के लिए Text में बदलें और फिर Voice के माध्यम से जवाब दें।
इनका संभावित इस्तेमाल Customer Support, Virtual Assistants, Multilingual Services और Enterprise Communication Tools में किया जा सकता है।
AI Voice Technology के क्षेत्र में कंपनियों के बीच प्रतिस्पर्धा लगातार बढ़ रही है। Developers ऐसे Models की मांग कर रहे हैं जो एक साथ बेहतर Accuracy, कम Response Time और कई भाषाओं का Support दे सकें।
एक ही AI System में दर्जनों भाषाओं का Support होने से Businesses को अलग-अलग बाजारों के लिए अलग Voice Systems तैयार करने की आवश्यकता कम हो सकती है।
Microsoft इन नए Models को ऐसे Tools के रूप में पेश कर रहा है जो Voice Agents को विकसित करने की प्रक्रिया को आसान बना सकते हैं और बड़े स्तर पर काम करने वाले Enterprise Applications की जरूरतों को पूरा कर सकते हैं।
MAI-Transcribe-2-Streaming, MAI-Voice-2.1 और MAI-Voice-2.1-Flash का लॉन्च Microsoft के तेजी से बढ़ते AI Model Portfolio में नई क्षमताएं जोड़ता है।
Microsoft जहां दूसरी AI कंपनियों के साथ साझेदारी करके भी AI Technology का इस्तेमाल कर रहा है, वहीं उसके MAI-branded Models कंपनी की अपनी AI Technology विकसित करने की दिशा को भी दिखाते हैं।
नए Speech-focused Models ऐसे समय में आए हैं जब Voice AI में तेज प्रतिक्रिया, भाषा की सटीकता और Natural Interaction का महत्व लगातार बढ़ रहा है। आने वाले समय में ऐसे Models Customer Service, Virtual Assistants और अन्य Voice-based Applications को विकसित करने के तरीके में महत्वपूर्ण भूमिका निभा सकते हैं।