डीपसीक-वी4 का पहला मल्टी-मोडल मॉडल वेट खुला और ओपस-4.8 के बराबर पहुंचने के लिए "अपनी आंखें खोलीं"।

📅 2026-09-01

सार:

तर्क, कोड और एजेंट क्षमताओं को लगातार मजबूत करने के बाद, डीपसीक ने अंततः V4 में विज़ुअल इनपुट जोड़ा। 31 अगस्त की सुबह डीपसीक हगिंग में था फेस ने डीपसीक-वी4-फ्लैश-विज़न-एक्सपी मॉडल वेट खोला है, और डेवलपर्स सीधे मॉडल वेट डाउनलोड कर सकते हैं और उन्हें स्वयं तैनात कर सकते हैं। मॉडल फ़ाइलों के अलावा, आधिकारिक वेयरहाउस में विज़ुअल एनकोडर और एलाइनर जैसे घटकों के संदर्भ अनुमान कार्यान्वयन भी शामिल हैं, और DFlash को कवर किया गया है ध्यान दें, MoE, हाइपर-कनेक्शन और DSpark और अन्य भाग।


सिर्फ 10 दिन पहले, डीपसीक ने आधिकारिक तौर पर लगभग 305 बिलियन मापदंडों के पैमाने के साथ वी4-फ्लैश-विज़न-एक्सप मॉडल की घोषणा की। नाम में "एक्सप" से यह बताना आसान है कि यह V4 श्रृंखला में पहला प्रयोगात्मक मल्टी-मोडल मॉडल है। इसे V4-Flash आर्किटेक्चर पर बनाया गया है। एक विज़ुअल मॉड्यूल जोड़कर और निरंतर प्रशिक्षण से, मॉडल छवियों को संसाधित करने की क्षमता प्राप्त करता है।

सादे पाठ कार्यों के संदर्भ में, अधिकारी ने कहा कि V4-Flash-Vision-Exp और V4-Flash आम तौर पर समान स्तर पर हैं। मुख्य अंतर यह है कि नया मॉडल फ़ोटो की सामग्री को पहचान सकता है, स्क्रीनशॉट में टेक्स्ट पढ़ सकता है, चार्ट का विश्लेषण कर सकता है, और केवल टेक्स्ट विवरण पर निर्भर रहने के बजाय, एजेंट वर्कफ़्लो के हिस्से के रूप में चित्रों का उपयोग भी कर सकता है।

डीपसीक द्वारा प्रदर्शित मामलों में आवश्यकताओं के अनुसार पीपीटी बनाना, वेब पेजों को पढ़ना और संशोधित करना और गतिशील प्रभावों के साथ फ्रंट-एंड पेज तैयार करना शामिल है।


इन कार्यों में जो समानता है वह पारंपरिक अर्थों में छवि पहचान नहीं है, बल्कि मॉडल को पहले दृश्य सामग्री को समझने की आवश्यकता है, और फिर बाद के संचालन को पूरा करने के लिए कोड, तर्क और टूल कॉल को संयोजित करना होगा। डीपसीक द्वारा प्रकाशित बेंचमार्क परीक्षण से देखते हुए, दृश्य क्षमताओं को जोड़ने के बाद, वी4 पहले से ही एंथ्रोपिक मल्टी-मोडल बड़े मॉडल क्लाउड ओपस 4.8 के करीब है जिसे उसने कुछ मल्टी-मोडल एजेंट कार्यों में तुलना के लिए चुना था।

विशेष रूप से, एपेक्सबेंच परीक्षण में, V4-Flash-Vision-Exp का पास@1 स्कोर 36.5 था, जो ओपस-4.8 के 39.4 से कम था। चार्टोग्राफी क्रमशः 64.3 और 65.0 है, अंतर छोटा है। एजेंटों की अंतिम परीक्षा में, डीपसीक ने 27.3 अंक हासिल किए, जो ओपस-4.8 के 25.7 से अधिक है। ज़ीरोबेंच का पास@5 स्कोर 35.0 है, जो ओपस-4.8 के 34.0 से भी अधिक है।


चार मल्टी-मोडल परीक्षण डेटा में से, दो ओपस-4.8 से आगे निकल गए

यह ध्यान देने योग्य है कि नया जोड़ा गया विज़ुअल मॉड्यूल V4-फ़्लैश की मूल टेक्स्ट एजेंट क्षमताओं का महत्वपूर्ण रूप से त्याग नहीं करता है।

उदाहरण के लिए, टर्मिनल बेंच 2.1 में, विज़न संस्करण ने 83.9 स्कोर किया, जबकि वी4-फ्लैश-0731 ने पहले 82.7 स्कोर किया था; डीपएसडब्ल्यूई 54.4 से बढ़कर 59.3 हो गया, जो आधिकारिक तौर पर सूचीबद्ध ओपस-4.8 स्कोर 58.0 से अधिक है। हालाँकि, NL2Repo केवल 57.7 है, जो Opus-4.8 के 69.7 से काफी कम है, और साइबरजिम पिछले 76.7 से गिरकर 75.3 पर आ गया है। इसलिए, डीपसीक अपनी सादे पाठ क्षमताओं को V4-फ्लैश के साथ "बराबर" के रूप में सारांशित करता है।

दूसरी ओर, दृश्य क्षमता की अपनी सीमाएँ होती हैं। यह एक दृश्य प्रणाली नहीं है जो उच्च-परिभाषा विवरणों को असीमित रूप से पढ़ सकती है।

डीपसीक एपीआई दस्तावेज़ के अनुसार, मॉडल जेपीईजी, पीएनजी, जीआईएफ और वेबपी छवियों का समर्थन करता है, और एकल या एकाधिक छवियां प्राप्त कर सकता है। हालाँकि, मॉडल में प्रवेश करने से पहले छवि को आकार के अनुसार स्केल किया जाएगा। बड़ी छवियों को अंततः लगभग 800×800 के बराबर कुल पिक्सेल वॉल्यूम में संपीड़ित किया जाएगा, और प्रत्येक छवि 384 टोकन तक लेगी।

इस दृष्टिकोण को चुनने का कारण दृश्य इनपुट के कारण होने वाली कम्प्यूटेशनल लागत को नियंत्रित करना है। हालाँकि, छवि स्केलिंग उन कार्यों पर भी एक सीमा हो सकती है जो विशेष रूप से छोटे पाठ, स्थानीय बनावट या मूल रिज़ॉल्यूशन पर निर्भर करते हैं।

लेकिन चाहे कुछ भी हो, डीपसीक ने आखिरकार V4 की आंखों की भरपाई कर दी।

संबंधित टैग

संबंधित लेख

टिप्पणियाँ

0/500
Captcha (click to refresh)
कोई टिप्पणी नहीं