सार:
अलीबाबा की क्वेन टीम ने हाल ही में देशी पूर्ण-मोडल मॉडल क्वेन3.8-ओमनी-फ्लैश की एक नई पीढ़ी जारी की है, जो एआई एजेंट क्षमताओं के साथ ऑडियो और वीडियो समझ को जोड़ती है।
मॉडल चार इनपुट फॉर्मों का समर्थन करता है: टेक्स्ट, छवि, ऑडियो और वीडियो, और 1 मिलियन टोकन की एक संदर्भ विंडो प्रदान करता है। पिछली पीढ़ी के Qwen3.5-ओमनी-प्लस की तुलना में, Qwen के अधिकारियों का दावा है कि 29 बेंचमार्क परीक्षणों में इसका औसत स्कोर 25% से अधिक बढ़ गया है, जबकि ऑडियो और ऑडियो और वीडियो प्रसंस्करण लागत में काफी कमी आई है।

Qwen3.8-Omni-Flash में सबसे बड़े बदलावों में से एक यह है कि यह केवल वाक् पहचान, छवि पहचान और अन्य क्षमताओं को एक साथ नहीं जोड़ता है, बल्कि इसके बजाय मॉडल स्तर से विभिन्न प्रकार की सूचनाओं को मूल रूप से संसाधित करता है। अलीबाबा को उम्मीद है कि इसका उपयोग मॉडल को न केवल ऑडियो और वीडियो सामग्री को "समझने" या "समझने" में सक्षम बनाने के लिए किया जाएगा, बल्कि इस जानकारी को समझने के बाद कार्यों की आगे की योजना बनाने, टूल को कॉल करने और वास्तविक कार्य को पूरा करने में भी सक्षम बनाया जाएगा।
ऑडियो क्षमताओं के संदर्भ में, Qwen3.8-ओमनी-फ्लैश का प्रदर्शन विशेष रूप से उत्कृष्ट है। क्वेन द्वारा जारी आंकड़ों के मुताबिक, इस मॉडल ने कुछ ऑडियो बेंचमार्क परीक्षणों में जेमिनी 3.8 फ्लैश को पीछे छोड़ दिया है। उदाहरण के लिए, WildClawBench-MM मल्टी-मोडल टूल कॉल टेस्ट में, Qwen3.8-Omni-Flash ने 71.0 अंक हासिल किए, जबकि जेमिनी 3.8 फ़्लैश ने 58.9 अंक हासिल किए; डेलीओमनी टेस्ट में, क्वेन ने 85.1 अंक और जेमिनी ने 84.0 अंक बनाए; स्पॉटसाउंडबेंच में, दोनों ने क्रमशः 67.2 अंक और 39.7 अंक बनाए; एमएमएयू टेस्ट में उन्होंने 81.8 अंक और 76.9 अंक हासिल किए।
मल्टी-स्पीकर कॉन्फ़्रेंस वाक् पहचान भी इस अपग्रेड का फोकस है। Qwen द्वारा जारी AliMeeting परीक्षण डेटा से पता चलता है कि Qwen3.8-Omni-Flash की स्पीकर त्रुटि दर DER 3.35 है, और स्पीकर एट्रिब्यूशन के साथ शब्द त्रुटि दर cpWER 17.18 है, जबकि पिछली पीढ़ी Qwen3.5-Omni-Plus क्रमशः 88.11 और 89.61 है। इसका मतलब है कि नया मॉडल इस परीक्षण में महत्वपूर्ण रूप से बदलता है।
हालाँकि, Qwen3.8-Omni-Flash सभी परियोजनाओं में जेमिनी 3.8 फ़्लैश से आगे नहीं है। उदाहरण के लिए, एजेंटिकवीबेंच परीक्षण में, जेमिनी 3.8 फ्लैश ने 45.0 अंक और क्वेन ने 36.8 अंक बनाए; ओमनीजीएआईए में, उन्होंने क्रमशः 78.6 और 74.0 अंक बनाए। कुछ वीडियो समझ परीक्षणों में, जेमिनी ने भी अपनी बढ़त बनाए रखी। इसलिए, "मिथुन के करीब पहुंचने" पर क्वेन का जोर समग्र ऑडियो और ऑडियो और वीडियो क्षमताओं में अधिक परिलक्षित होता है, और इसका मतलब सभी मल्टी-मोडल परियोजनाओं में समग्र नेतृत्व नहीं है।
Qwen3.8-Omni-Flash में एक और महत्वपूर्ण बदलाव कीमत है। क्वेन का कहना है कि ऑडियो इनपुट के लिए प्रति घंटे की अनुमानित लागत में 98% से अधिक की गिरावट आई है और ऑडियो प्लस वीडियो इनपुट के लिए प्रति घंटे की लागत में पिछले मॉडल की तुलना में 93% से अधिक की गिरावट आई है। आधिकारिक गणना पद्धति के अनुसार, तथाकथित "प्रति घंटा" लागत की गणना दो मिनट की सामग्री के प्रसंस्करण मूल्य को 30 से गुणा करके की जाती है, जिसमें वीडियो 720p और 1 फ्रेम प्रति सेकंड की इनपुट स्थिति को अपनाता है।
अलीबाबा क्लाउड द्वारा घोषित वर्तमान अंतरराष्ट्रीय क्षेत्रीय कीमत यूएस$0.15 प्रति मिलियन टोकन इनपुट है, कैश को हिट करने वाला इनपुट टोकन यूएस$0.016 है, और आउटपुट टोकन प्रति मिलियन यूएस$0.47 है। मुख्य भूमि चीन और कुछ अन्य क्षेत्रों में कीमतें अलग-अलग होंगी। चूंकि ऑडियो और वीडियो को सीधे मॉडल इनपुट के रूप में उपयोग किया जा सकता है, इसलिए यह मूल्य निर्धारण संरचना मीटिंग रिकॉर्डिंग, लंबे ऑडियो विश्लेषण, वीडियो समीक्षा, उपशीर्षक निर्माण और बड़ी मात्रा में मीडिया सामग्री के प्रसंस्करण जैसे परिदृश्यों के लिए विशेष रूप से उपयुक्त है।
1 मिलियन टोकन संदर्भ विंडो इस लाभ को और बढ़ाती है। Qwen3.8-ओमनी-फ्लैश की अधिकतम इनपुट लंबाई 992,000 टोकन के करीब है, थिंकिंग मोड में अधिकतम इनपुट लंबाई लगभग 984,000 टोकन है, और अधिकतम आउटपुट लंबाई 131,000 टोकन तक पहुंचती है। इसका मतलब यह है कि डेवलपर्स बहुत बड़े पैमाने पर ऑडियो या वीडियो सामग्री को प्रसंस्करण के लिए मॉडल को सीधे सौंप सकते हैं, पहले की तरह फ्रेम को बार-बार काटने और निकालने की आवश्यकता के बिना, और फिर क्रमशः भाषण पहचान, दृश्य समझ और पाठ तर्क को पूरा करने के लिए कई मॉडल का उपयोग कर सकते हैं।
अलीबाबा क्लाउड की आधिकारिक जानकारी से पता चलता है कि Qwen3.8-ओमनी-फ्लैश 113 भाषाओं और बोलियों में ऑडियो इनपुट को संभाल सकता है और स्थानिक ऑडियो विश्लेषण का समर्थन करता है। प्रासंगिक मापदंडों के माध्यम से, मॉडल दो-चैनल स्टीरियो और चार-चैनल स्थानिक ऑडियो को संभाल सकता है। साथ ही, मॉडल फ़ंक्शन कॉलिंग, नेटवर्क खोज, संदर्भ कैशिंग और अन्य क्षमताओं का समर्थन करता है, और इसे सीधे अधिक जटिल एजेंट वर्कफ़्लो में उपयोग किया जा सकता है।
आवेदन दिशा के दृष्टिकोण से, क्वेन टीम इस बार "बुद्धिमान वितरण" पर ध्यान केंद्रित करती है। उदाहरण के लिए, मॉडल लंबे वीडियो का विश्लेषण कर सकता है, मुख्य सामग्री का पता लगा सकता है, और वीडियो संपादन, सामग्री संगठन, मीटिंग सारांश और उपशीर्षक निर्माण जैसे कार्यों को पूरा करने के लिए टूल को कॉल कर सकता है। क्वेन ने मल्टी-मोडल एजेंट विकास के लिए क्वेन-एमएम-प्लगइन्स की भी घोषणा की, और डेवलपर्स को ऑडियो और वीडियो इनपुट के आधार पर बुद्धिमान एजेंट एप्लिकेशन बनाने में मदद करने के लिए क्वेन-लाइव-हार्नेस लॉन्च करने की योजना बनाई है।
पिछली पीढ़ी के Qwen3.5-Omni की तुलना में, इस अपग्रेड का फोकस केवल पारंपरिक अर्थों में पहचान सटीकता में सुधार करना नहीं है, बल्कि ऑडियो और वीडियो AI के उपयोग के तरीके को बदलने का प्रयास करना है। अतीत में, मल्टी-मोडल अनुप्रयोगों को आमतौर पर वीडियो फ्रेम निकालने और ऑडियो ट्रांसक्रिप्ट करने की आवश्यकता होती थी, और फिर प्रसंस्करण के लिए भाषा मॉडल को अलग-अलग परिणाम सौंपने की आवश्यकता होती थी; Qwen3.8-ओमनी-फ्लैश इन लिंक्स को यथासंभव एक मूल पूर्ण-मोडल मॉडल में एकीकृत करने का प्रयास करता है, और लंबी मूल सामग्री को सीधे संसाधित करने के लिए 1 मिलियन टोकन संदर्भों का उपयोग करता है।
Qwen3.8-Omni-Flash वर्तमान में अलीबाबा क्लाउड बाइलियन के माध्यम से बीजिंग, सिंगापुर, हांगकांग, चीन, टोक्यो, जापान, फ्रैंकफर्ट, जर्मनी और वर्जीनिया, संयुक्त राज्य अमेरिका जैसे क्षेत्रों में सेवाएं प्रदान करता है। मॉडल स्वयं कुछ क्वेन पिछले मॉडलों की तरह वजन को सीधे नहीं खोलता है। अलीबाबा इस बार मुख्य रूप से सहायक मल्टी-मॉडल प्लग-इन और संबंधित विकास उपकरण खोलता है।
कुल मिलाकर, इस Qwen3.8-ओमनी-फ्लैश अपडेट का मूल केवल मॉडल रनिंग स्कोर में सुधार करना नहीं है, बल्कि साथ ही बास वीडियो प्रोसेसिंग लागत को कम करना, संदर्भ पैमाने का विस्तार करना और टूल इनवोकेशन के साथ ऑडियो और वीडियो समझ को संयोजित करना है। विशेष रूप से, ऑडियो इनपुट लागत में 98% से अधिक की कमी की गई है। यदि वास्तविक उपयोग लागत आधिकारिक गणना स्तर तक पहुंच सकती है, तो यह दीर्घकालिक बैठक रिकॉर्डिंग, पॉडकास्ट, लाइव प्रसारण और वीडियो सामग्री के बड़े पैमाने पर स्वचालित विश्लेषण को आसान बना देगा, और क्वेन और Google जेमिनी जैसे मल्टी-मोडल मॉडल के बीच प्रतिस्पर्धा को और तेज कर देगा।
टिप्पणियाँ