सार:
Google ने हाल ही में जेमिनी श्रृंखला में नवीनतम स्पीच-टू-टेक्स्ट मॉडल जेमिनी 3.5 ट्रांसक्राइब जारी किया है, इसे श्रृंखला में सबसे सटीक वाक् पहचान मॉडल कहा गया है। यह मॉडल डेवलपर्स, उद्यमों और आम उपयोगकर्ताओं के लिए खुला है, और शोर वाले वातावरण, जटिल व्यावसायिक शब्दों और प्राकृतिक बोली जाने वाली अभिव्यक्तियों में लिप्यंतरण क्षमताओं में सुधार करने पर केंद्रित है।

रिपोर्ट के मुताबिक, जेमिनी 3.5 ट्रांसक्राइब पेशेवर क्षेत्रों में पृष्ठभूमि के शोर और जटिल शब्दावली को बेहतर ढंग से संभाल सकता है। Google ने कहा कि नए मॉडल ने macOS प्लेटफॉर्म पर जेमिनी ऐप और एंड्रॉइड प्लेटफॉर्म पर Gboard कीबोर्ड के रैम्बलर फ़ंक्शन में प्रदर्शन में सुधार लाया है। डेवलपर्स इस मॉडल का उपयोग वॉयस एजेंट, रीयल-टाइम उपशीर्षक टूल और पोस्ट-कॉल विश्लेषण प्रक्रियाओं जैसे एप्लिकेशन बनाने के लिए कर सकते हैं।
Google ने कहा कि जेमिनी 3.5 ट्रांसक्राइब को उपयोगकर्ताओं के प्राकृतिक बोलने के पैटर्न को कैप्चर करने, अर्थ संबंधी इरादे को अधिक सटीक रूप से समझने, कस्टम शब्दावली की पहचान करने और उपयोगकर्ताओं को आवाज के माध्यम से कार्यों को पूरा करने में मदद करने के लिए डिज़ाइन किया गया है।
कार्यात्मक स्तर पर, नया मॉडल कई अनुकूलन क्षमताओं को जोड़ता है, जिसमें स्वचालित स्व-सुधार, "उम" और "आह" जैसे बोले गए फिलर शब्दों को हटाना और आउटपुट टेक्स्ट का स्वचालित स्वरूपण शामिल है। साथ ही, यह अधिक संपूर्ण मल्टी-मॉडल सहयोग अनुभव बनाने के लिए फ़ाइल विश्लेषण और छवि निर्माण जैसे अधिक जटिल कार्यों को अन्य जेमिनी मॉडलों को भी सौंप सकता है।
सटीकता के संदर्भ में, Google ने बताया कि जेमिनी 3.5 ट्रांसक्राइब की औसत शब्द त्रुटि दर स्ट्रीमिंग वाक् पहचान परिदृश्यों में 4.0% है, और गैर-स्ट्रीमिंग परिदृश्यों में इसे 2.6% तक कम किया जा सकता है। मॉडल में शोर वाले वातावरण में बेहतर ट्रांसक्रिप्शन प्रदर्शन होता है और यह ऑर्डर नंबर और पोस्टल कोड जैसे अक्षरों और संख्याओं से बनी महत्वपूर्ण जानकारी को अधिक सटीक रूप से पहचान सकता है।

भाषा समर्थन के संदर्भ में, जेमिनी 3.5 ट्रांसक्राइब वर्तमान में 85 भाषाओं को कवर करता है और क्षेत्रीय लहजे और विभिन्न बोलियों का समर्थन करता है। पहले से रिकॉर्ड किए गए ऑडियो के लिए, यह अधिकतम तीन स्पीकरों के लिए टाइम-स्टैम्प्ड स्पीच एट्रिब्यूशन पहचान कर सकता है; इसके अलावा, मॉडल पेशेवर शब्दों, विशेष वर्तनी और उद्योग नामों की पहचान करने के लिए उपयोगकर्ता द्वारा परिभाषित शब्दावलियों को अनुकूलित कर सकता है।
जेमिनी 3.5 ट्रांसक्राइब वर्तमान में Google AI स्टूडियो और Google एंटीग्रेविटी में जेमिनी एपीआई के माध्यम से सार्वजनिक पूर्वावलोकन में उपलब्ध है। सामान्य उपयोगकर्ता एंड्रॉइड और मैकओएस प्लेटफॉर्म पर संबंधित कार्यों का अनुभव कर सकते हैं। Google इसे क्रोम ब्राउज़र में पेश करने की भी योजना बना रहा है, जहां उपयोगकर्ता किसी भी वेब पेज के इनपुट बॉक्स में आवाज के माध्यम से सीधे टेक्स्ट दर्ज कर सकते हैं।
हाल ही में, Google ने जेमिनी उत्पाद श्रृंखला की प्रगति में तेजी जारी रखी है। कंपनी ने पहले एआई मॉडलों के लिए तेजी से बढ़ती कीमत प्रतिस्पर्धा में शामिल होने के लिए जेमिनी 3.7 फ्लैश लॉन्च किया था; एंड्रॉइड के लिए क्रोम में जेमिनी को संयुक्त राज्य अमेरिका में सभी उपयोगकर्ताओं के लिए भी खोल दिया गया है, और जेमिनी असिस्टेंट ने वेमो की नई पीढ़ी की सेल्फ-ड्राइविंग टैक्सियों में भी प्रवेश किया है।
टिप्पणियाँ