सार:
Microsoft ने रीयल-टाइम वॉयस इंटरैक्शन के लिए तीन नए मॉडल लॉन्च किए हैं, अर्थात् स्पीच-टू-टेक्स्ट मॉडल MAI-Transcribe-2-स्ट्रीमिंग, और टेक्स्ट-टू-स्पीच मॉडल MAI-वॉयस-2.1 और MAI-वॉयस-2.1-फ्लैश। माइक्रोसॉफ्ट को उम्मीद है कि डेवलपर्स उन्हें आवाज सहायक और संवादी एजेंट बनाने के लिए संयोजित करेंगे जो सुनने के दौरान प्रक्रिया कर सकते हैं और प्राकृतिक भाषण के साथ तुरंत प्रतिक्रिया दे सकते हैं।

MAI-Transcribe-2-स्ट्रीमिंग पिछले MAI-Transcribe-2 से अलग है जो केवल रिकॉर्डिंग फ़ाइलों को संसाधित कर सकता है। यह निरंतर इनपुट ऑडियो स्ट्रीम प्राप्त कर सकता है और स्पीकर के बोलने से पहले चरणबद्ध पाठ उत्पन्न करना शुरू कर सकता है। अधिक संदर्भ आने पर इसे संशोधित किया जाता रहेगा और अंततः स्थिर परिणाम प्रस्तुत होंगे। माइक्रोसॉफ्ट ने कहा कि मॉडल 60 भाषाओं का समर्थन करता है और लगातार और स्वचालित रूप से भाषाओं को पहचान सकता है; माना जाता है कि मान्यता का पहला बैच ऑडियो प्राप्त करने के बाद 100 मिलीसेकंड से थोड़ा अधिक दिखाई देता है, और यह वॉयस एजेंट, ग्राहक सेवा, सम्मेलन और कक्षा उपशीर्षक और वॉयस इनपुट जैसे परिदृश्यों के लिए उपयुक्त है। माइक्रोसॉफ्ट के श्रुतलेख और उपशीर्षक के आंतरिक परीक्षण से पता चलता है कि पाठ निकटतम प्रतिद्वंद्वी की तुलना में लगभग दोगुना तेजी से दिखाई देता है, यह तुलना कंपनी की अपनी समीक्षाओं पर आधारित है।
कृत्रिम विश्लेषण' स्ट्रीमिंग ट्रांसक्रिप्शन बेंचमार्क अंतिम और चरणबद्ध पाठ सटीकता के लिए मॉडल को पहले स्थान पर रखता है। प्रकाशित परीक्षण के परिणाम यह थे कि अंतिम लिखित शब्द त्रुटि दर लगभग 2.5% थी, और अंतिम पाठ भाषण के अंत का पता चलने के लगभग 0.13 सेकंड बाद दिया गया था। सूची में उस समय के 38 मॉडलों की तुलना की गई, लगभग 8 घंटे के ऑडियो का परीक्षण किया गया, और तीन प्रकार के कॉर्पस को कवर किया गया: एए-एजेंटटॉक, वोक्सपॉपुली और अर्निंग्स22, जो क्रमशः व्यापक वजन का 50%, 25% और 25% था। शब्द त्रुटि दर जितनी कम होगी, उतना बेहतर होगा। यह परिणाम बेंचमार्क के इस सेट पर मॉडल के प्रदर्शन को दर्शाता है और इसका मतलब यह नहीं है कि सभी भाषाओं, शोर वाले वातावरण और वास्तविक दुनिया के अनुप्रयोगों में समान सटीकता प्राप्त की जा सकती है।
MAI-Transcribe-2-स्ट्रीमिंग वर्तमान में $0.54 प्रति घंटे के ऑडियो के लिए बिक्री पर है, और यह ऑफर 2026 के अंत तक चलता है; इसकी तुलना में, गैर-स्ट्रीमिंग MAI-Transcribe-2 को पहले $0.10 प्रति घंटे पर विज्ञापित किया गया था। वास्तविक समय संस्करण निरंतर बातचीत के लिए अधिक उपयुक्त है, जबकि बैच संस्करण ऑडियो ट्रांसक्रिप्शन रिकॉर्ड करने के लिए है। दोनों की कीमतों को एक ही उपयोग पद्धति के तहत सीधी तुलना नहीं माना जा सकता है।
नया भाषण संश्लेषण मॉडल MAI-वॉयस-2.1 23 भाषाओं और 26 क्षेत्रीय वेरिएंट का समर्थन करता है, जो वक्ता की पहचान बनाए रखते हुए और संबंधित भाषा के स्थानीय उच्चारण को अपनाते हुए एक ही संश्लेषित आवाज को विभिन्न भाषाओं के बीच स्विच करने की अनुमति देता है। इसकी कीमत प्रति 1 मिलियन कैरेक्टर पर 22 अमेरिकी डॉलर है। कम-विलंबता और बड़े पैमाने के अनुरोधों के लिए एमएआई-वॉयस-2.1-फ्लैश एक ही भाषा का समर्थन करता है। माइक्रोसॉफ्ट का कहना है कि यह लगभग 150 मिलीसेकंड की एंड-टू-एंड देरी के साथ 45 सेकंड का ऑडियो उत्पन्न कर सकता है। मॉडल अनुमान की गति 55% बढ़ गई है और कीमत तुलनीय मॉडलों की तुलना में लगभग 60% कम है। इसकी कीमत 15 डॉलर प्रति 1 मिलियन कैरेक्टर है। गति और मूल्य लाभ का बाद वाला सेट माइक्रोसॉफ्ट द्वारा प्रकाशित तुलनाओं में से एक है।
दोनों वॉयस मॉडल क्रॉस-लैंग्वेज रीयल-टाइम वॉयस क्लोनिंग का समर्थन करते हैं, लेकिन केवल अधिकृत और सहमति वाली संदर्भ आवाजों के उपयोग के साथ। Microsoft दस्तावेज़ीकरण में इस सुविधा को 5 से 60 सेकंड के संदर्भ ऑडियो अनुशंसा और दुरुपयोग के विरुद्ध सुरक्षा के साथ प्रतिबंधित पहुंच के रूप में सूचीबद्ध किया गया है। एमएआई-वॉयस-2.1 लंबी सामग्री, कथन और ऑडियोबुक के लिए उपयुक्त है, जबकि फ्लैश वॉयस एजेंटों, सहायकों और ग्राहक सेवा जैसे वास्तविक समय परिदृश्यों के लिए अधिक उपयुक्त है।
सभी तीन मॉडलों का उपयोग माइक्रोसॉफ्ट फाउंड्री, एमएआई प्लेग्राउंड और वर्सेल के माध्यम से किया जा सकता है; दो वॉयस मॉडल को ओपनराउटर से भी जोड़ा गया है और इन्हें एज़्योर वॉयस लाइव के माध्यम से कॉल किया जा सकता है। LiveKit समर्थन बाद में लॉन्च होने की उम्मीद है। Microsoft Azure दस्तावेज़ीकरण वर्तमान में इन मॉडलों को सार्वजनिक पूर्वावलोकन के रूप में लेबल करता है, जिसमें कहा गया है कि कोई सेवा स्तर समझौता नहीं है और उन्हें उत्पादन कार्यभार में सीधे उपयोग के लिए अनुशंसित नहीं किया गया है।
और जानें:
https://microsoft.ai/news/our-first-streaming-transscription-model/
टिप्पणियाँ