जेमिनी 4 प्रो के लीक होने का संदेह है, और "एआई स्लोडाउन" फिर से खोखली बात है

📅 2026-09-19

सार:

पिछले कुछ महीनों में, OpenAI और Anthropic ने बारी-बारी से अपने प्रमुख मॉडलों को आगे बढ़ाया, लेकिन Google असामान्य रूप से शांत लग रहा था। फ़्लैश को लगभग हर तीन सप्ताह में अपडेट किया जाता है, जिसमें 3.6, 3.7 और 3.8 लगातार आगे बढ़ रहे हैं, लेकिन प्रो के लिए कोई हलचल नहीं हुई है, जो उच्चतम क्षमता सीमा का प्रतिनिधित्व करता है। इन दो दिनों तक, जेमिनी-3.8-फ्लैश नाम का एक मॉडल अचानक बड़े मॉडल ब्लाइंड टेस्ट एरेना में दिखाई दिया।


जैसे ही डेवलपर्स ने शुरुआत की, उन्हें पता चला कि कुछ गड़बड़ है। असली जेमिनी 3.8 फ्लैश जारी कर दिया गया है। हर कोई जानता है कि यह किस स्तर का होना चाहिए. लेकिन इस "3.8 फ्लैश" के साथ, कोड लिखने, एसवीजी बनाने और एजेंट चलाने का प्रदर्शन स्पष्ट रूप से एक पायदान ऊपर पहुंच गया है।



वास्तविक परीक्षण के कई दौर के बाद, एक अनुमान तेजी से फैल गया:

यह मॉडल लेबल के पीछे छिपा हुआ Google का अगली पीढ़ी का फ्लैगशिप होने की संभावना है - जेमिनी 4 प्रो।

इसके तुरंत बाद, एक और भी अधिक अतिरंजित बेंचमार्क तुलना तस्वीर वायरल होने लगी। कोडिंग, एजेंट, रीज़निंग, कई अंकों के आधार पर जीपीटी-6 एस्ट्रा और क्लाउड फैबल को नीचे स्थान दिया गया।


अभी कुछ दिन पहले, कई सबसे महत्वपूर्ण एआई कंपनियां खुले तौर पर चर्चा कर रही थीं कि क्या यह धीमा होने का समय है। अभी मंदी की आहट ज़मीन तक पहुंची भी नहीं है और प्रतिस्पर्धा का नया दौर शुरू हो गया है.

जेमिनी 4 प्रो के इस संदिग्ध "ईश्वर-स्तरीय मॉडल" के पीछे, एक अधिक खतरनाक कीवर्ड है:

आरएसआई.


जेमिनी 4 प्रो के लीक होने की आशंका

2 सितंबर को, Google ने आधिकारिक तौर पर जेमिनी 3.8 फ़्लैश जारी किया है। अधिकारियों के अनुसार, यह जेमिनी 3 श्रृंखला में फ्लैश की नवीनतम पीढ़ी है, जिसने सॉफ्टवेयर इंजीनियरिंग, एजेंट कार्यों और जटिल बहु-चरण तर्क में काफी सुधार किया है; 3.7 फ़्लैश से 3.8 फ़्लैश तक, केवल तीन सप्ताह बीते।

इसलिए, जब इसी नाम के जेमिनी-3.8-फ़्लैश वाला एक और मॉडल एरिना में दिखाई दिया, तो डेवलपर्स ने तुरंत विसंगति पर ध्यान दिया।

वास्तविक 3.8 फ़्लैश पहले से ही मौजूद है, और हर किसी के पास एक तैयार संदर्भ है। और यह मॉडल स्पष्ट रूप से मजबूत दिखता है, और यह स्पष्ट रूप से वह ताकत है जो केवल प्रो मॉडल में ही पाई जा सकती है।


वास्तविक परीक्षणों का पहला बैच जिसने प्रसार को गति दी वह एसवीजी, वेब पेजों और 3डी दृश्यों पर केंद्रित था।

डेवलपर हर्षिथ ने उन्हें एसवीजी का उपयोग करके एक बग़ल में घर की बिल्ली बनाने के लिए कहा, और परिणामों को जीपीटी -6 एस्ट्रा मैक्स और जेमिनी 3.8 फ्लैश के आधिकारिक संस्करण के साथ रखा। एरिना में इस संस्करण में रूपरेखा, अनुपात और विवरण की पूर्णता के मामले में आधिकारिक 3.8 फ्लैश के साथ एक स्पष्ट अंतर है।


बाएं से दाएं: "4 प्रो", एस्ट्रा, 3.8 फ्लैश

X नेटिज़न @thtbee_ ने लगातार इस संदिग्ध जेमिनी 4 प्रो मॉडल का कई कोणों से परीक्षण किया।

वोक्सेल शैली का पैगोडा, मॉडल 8 मिनट तक चला और सीधे इंटरैक्टिव 3डी दृश्यों का एक पूरा सेट तैयार किया।



एक एयरबस H145 हेलीकॉप्टर, एक संपूर्ण 3डी डिस्प्ले पेज बनाने में केवल 10 मिनट का समय लगा, जो बहुत विस्तृत है। हालाँकि, इस नेटिज़न ने कहा कि पृष्ठ के निचले भाग में यूआई तत्व "थोड़ा खराब दिखते हैं।"



वेब डिज़ाइन के संदर्भ में, एक मोनोक्रोम थीम वेबसाइट बनाने में मॉडल को लगभग 14 मिनट लगे, जो कुल मिलाकर बहुत साफ और संपूर्ण थी। डिज़ाइन स्वाद संबंधी समस्याएं जिनके बारे में जेमिनी को अक्सर अतीत में शिकायत की जाती थी, इस बार अंततः ठीक हो गई लगती है।



एक अन्य नेटिज़न @Mr_Salio ने गेम बनाने के लिए सीधे तौर पर इस संदिग्ध जेमिनी 4 प्रो मॉडल का उपयोग किया। तैयार ग्राफ़िक्स काफी सहज हैं, और विश्व पीढ़ी और गेम डिज़ाइन भी बहुत पूर्ण हैं।



एक अधिक महत्वपूर्ण सुराग डेवलपर क्विनाह से मिला है।

उन्होंने दावा किया कि उन्होंने जेमिनी 4 प्रो के बैकएंड पर सफलतापूर्वक "घोस्ट रूटिंग" की और संदिग्ध आंतरिक टर्मिनल जानकारी का स्क्रीनशॉट पोस्ट किया।

उनके अनुसार, G4P-ARGON और VIA_3.8_FLASH सीधे इस मॉडल के आंतरिक लोगो में दिखाई देते हैं। अधिकतम आउटपुट 256K तक पहुंचता है, संदर्भ विंडो 10 मिलियन टोकन से अधिक है, और इसमें क्रॉस-सेशन स्थायी मेमोरी, एपीआई के बिना नेटवर्किंग, बैक-एंड स्वचालित संकलन और रनिंग स्क्रिप्ट और यहां तक ​​कि भौतिक रोबोट नियंत्रण क्षमताएं भी हैं।


यदि यह जानकारी सत्य है, तो यह स्पष्ट रूप से अब कोई सामान्य फ़्लैश अपग्रेड नहीं है।

उसी समय, जेमिनी 4 प्रो बेंचमार्क तुलना तालिका भी समुदाय में प्रसारित होने लगी।


तस्वीर में मौजूद आंकड़ों के मुताबिक, जेमिनी 4 प्रो ने डीपएसडब्ल्यूई वी1.1 सॉफ्टवेयर इंजीनियरिंग टेस्ट में 88.7%, टर्मिनल एजेंट पर टर्मिनल-बेंच 2.1 टेस्ट में 95.3%, विशेषज्ञ-स्तरीय ज्ञान तर्क परीक्षण एचएलई-सत्यापित में 72.1% और कंप्यूटर ऑपरेशन एजेंट टेस्ट ओएसवर्ल्ड 2.0 में 86.8% स्कोर किया।

इससे भी अधिक अतिरंजित बात यह है कि जीडीपीवल-एए वी2 पर, जो वास्तविक ज्ञान कार्य को मापता है, इसे 2064 एलो के रूप में लिखा गया है, जो सीधे 2000 के निशान को तोड़ता है।

यदि ये आंकड़े सच हैं, तो जेमिनी 4 प्रो बस "फ़ेबल को पंच और एस्ट्रा को किक" कर सकता है, एक झटके में अत्याधुनिक मॉडलों के शीर्ष पर खड़ा हो सकता है।

लेकिन जितना अधिक अतिरंजित होगा, आपको उतना ही अधिक सावधान रहने की आवश्यकता होगी।

यह ध्यान देने योग्य है कि यह बेंचमार्क तालिका क्विनाह द्वारा "खोदे गए" संदिग्ध बैकएंड स्क्रीनशॉट के साथ पूरी तरह से सुसंगत नहीं है; एस्ट्रा का स्कोर, जिसे बेंचमार्क तालिका में तुलना आइटम के रूप में उपयोग किया जाता है, आधिकारिक डेटा के अनुरूप नहीं है; दोनों सामग्रियां आधिकारिक तौर पर Google, Arena या संबंधित बेंचमार्क द्वारा समर्थित नहीं हैं, और अभी भी समुदाय में प्रसारित की जाने वाली जानकारी मात्र हैं।

जिस एकमात्र मॉडल की पुष्टि की जा सकती है वह जेमिनी-3.8-फ़्लैश नाम का मॉडल है, जो जेमिनी 3.8 फ़्लैश के प्रदर्शन के साथ पूरी तरह से असंगत है।

लेकिन एक और बहुत महत्वपूर्ण कारण है कि हर कोई जेमिनी 4 प्रो की ओर तेजी से इशारा करता है: Google का प्रो मॉडल बहुत लंबे समय से खाली है।

जेमिनी 3.5 प्रो को अभी तक आधिकारिक तौर पर लॉन्च नहीं किया गया है, और जेमिनी 4 के प्रशिक्षण में प्रवेश की पुष्टि पहले ही हो चुकी है। पिछले कुछ महीनों में, फ्लैश को पीढ़ी दर पीढ़ी आगे बढ़ाया गया है, और प्रो लाइन में कभी भी कोई नया मॉडल नहीं आया है जो वास्तव में क्षमताओं की ऊपरी सीमा का प्रतिनिधित्व करता हो।

अब, स्पष्ट रूप से असामान्य क्षमताओं वाला एक "3.8 फ्लैश" अचानक मैदान से उभरा।

नतीजतन, अटकलें स्वाभाविक रूप से अधिक से अधिक उचित होती जा रही हैं - Google का वास्तविक बड़े अपग्रेड को 3.5 प्रो पर छोड़ने का कोई इरादा नहीं हो सकता है, लेकिन सीधे जेमिनी 4 प्रो पर।


जेमिनी 4 प्रो के पीछे,

बड़ा कीवर्ड RSI है

यदि जेमिनी 4 प्रो अभी भी एक सामुदायिक अफवाह है, तो अधिक उल्लेखनीय बात यह है कि

Google मॉडल विकास में एआई भागीदारी की गति को काफी तेज कर रहा है।

इस जेमिनी 4 प्रो अफवाह में, कीवर्ड आरएसआई का बार-बार उल्लेख किया गया है।



आरएसआई का मतलब रिकर्सिव सेल्फ-इंप्रूवमेंट है, जिसका मतलब है रिकर्सिव सेल्फ-इंप्रूवमेंट। सीधे शब्दों में कहें तो AI मजबूत AI बनाने में भाग लेना शुरू कर देता है, और मजबूत AI अगली पीढ़ी के मॉडल के विकास को और तेज कर देता है।

एक बार जब यह चक्र चल जाता है, तो केवल मॉडल की क्षमता ही तेज नहीं होती है।

यहां तक ​​कि मॉडल के विकास की गति भी मॉडल द्वारा ही तेज होनी शुरू हो जाएगी।

रॉयटर्स ने इस साल अगस्त में खुलासा किया था कि Google के सह-संस्थापक सर्गेई ब्रिन हाल के महीनों में जेमिनी को तेजी लाने के लिए प्रेरित कर रहे हैं और उन्होंने पुनरावर्ती आत्म-सुधार को प्रमुख दिशाओं में से एक के रूप में सूचीबद्ध किया है।

हालांकि Google ने सार्वजनिक रूप से घोषणा नहीं की है कि उसने इस बंद लूप को हासिल कर लिया है, लेकिन यह अधिक से अधिक कार्य जो मूल रूप से शोधकर्ताओं के थे, उन्हें एजेंटों को सौंप रहा है, जिसमें मॉडल का मूल्यांकन करना, सुधार के लिए दिशा-निर्देश ढूंढना, प्रयोग चलाना और फिर परिणामों को मॉडल विकास प्रक्रिया में वापस भेजना शामिल है।

जब जेमिनी 3.8 फ्लैश 2 सितंबर को जारी किया गया था, तो Google ने आधिकारिक विवरण में यह भी उल्लेख किया था कि एक लंबे समय तक चलने वाला एजेंट लूप "अंतर्निहित मॉडल का पुनरावर्ती मूल्यांकन और सुधार कर रहा है।"


Google डीपमाइंड के शोधकर्ता याओ शुन्यू (टेनसेंट के याओ शुन्यू नहीं) ने 3.8 फ़्लैश के रिलीज़ होने के बाद इस अपडेट का वर्णन करने के लिए चंद्रमा पर उतरने पर आर्मस्ट्रांग के शब्दों का इस्तेमाल किया:

"यह मॉडल के लिए एक छोटा कदम है, आरएसआई के लिए एक बड़ा कदम है।"


अभी हाल ही में, Google ने एक नए पेपर के शीर्षक में "RSI" को भी शामिल किया है।

14 सितंबर को, Google, GDM और अन्य टीमों ने ड्रीम-आरएसआई जारी किया, जो विशेष रूप से अध्ययन करता है कि एजेंटों को अन्वेषण रणनीतियों के निरंतर सुधार के माध्यम से पुनरावर्ती आत्म-सुधार प्राप्त करने में कैसे सक्षम बनाया जाए। एल्गोरिदम इंजीनियरिंग, गणितीय अनुकूलन और जीपीयू कर्नेल कार्यों में, यह विधि उच्च अन्वेषण दक्षता और कम खोज लागत दिखाती है।

यह ठीक इसी वजह से है कि जेमिनी 4 प्रो की अफवाहें तुरंत आरएसआई से जुड़ गईं।

समुदाय में अटकलें "मिथुन 4 प्रो बहुत मजबूत है" पर नहीं रुकती हैं, बल्कि यह भी पूछती हैं कि Google ने आंतरिक रूप से किस हद तक आरएसआई हासिल किया है।

स्पष्ट रूप से Google RSI का यह मार्ग अपनाने वाला एकमात्र व्यक्ति नहीं है।

17 सितंबर को, अमेरिकी समयानुसार, एंथ्रोपिक ने आंतरिक एआई आर एंड डी ऑटोमेशन डेटा के एक सेट का खुलासा किया।

एंथ्रोपिक अधिकारियों ने कहा कि इन संकेतकों का खुलासा करने का कारण यह है कि उनका मानना ​​है कि बाहरी दुनिया को यह जानने की जरूरत है कि अत्याधुनिक प्रयोगशालाओं में एआई अनुसंधान और विकास का कितना हिस्सा एआई द्वारा ही पूरा किया जाना शुरू हो गया है।


डेटा से पता चलता है कि इस साल अगस्त तक, क्लाउड 26% एंथ्रोपिक एआई अनुसंधान और विकास कार्यों का नेतृत्व करने में सक्षम है - अर्थात, मनुष्यों को केवल उच्च-स्तरीय लक्ष्य देने और पर्यवेक्षण करने की आवश्यकता है, और क्लाउड मूल रूप से कार्यों को शुरू से अंत तक पूरा कर सकता है। इस साल फरवरी और मार्च में यह अनुपात 1% से भी कम था।

साथ ही, एंथ्रोपिक के भीतर 90% से अधिक एआई आर एंड डी कार्य कम से कम एआई सहयोग के चरण में प्रवेश कर चुके हैं।

चीन में, झिपु के संस्थापक और मुख्य वैज्ञानिक, तांग जी ने भी हाल ही में कहा था: "हम अभी भी पुनरावर्ती आत्म-सुधार तक पहुंचने से बहुत दूर हैं, लेकिन सबसे छोटा चक्र सामने आया है: मॉडल अनुकूलन प्रणाली, सिस्टम सेवा मॉडल।"


एक्स पर टैंग जी का लंबा लेख, केवल शुरुआत को छोटा किया गया है

झिपू द्वारा बताए गए इंजीनियरिंग अभ्यास में, जीएलएम-5.3 द्वारा संचालित एक इंफ्रा एजेंट ने जीएलएम-5.3-फ्लैश अनुमान बुनियादी ढांचे के डिजाइन, डिबगिंग और अनुकूलन में भाग लिया। यह सिस्टम 100,000 से अधिक घरेलू AI चिप्स के क्लस्टर पर चलता है। पहले रन-थ्रू से लेकर सभी उत्पादन ट्रैफ़िक को संभालने में केवल दो सप्ताह लगे, जिससे एंड-टू-एंड थ्रूपुट शुरुआती स्तर से 3.2 गुना बढ़ गया।


"धीरे करो" अंततः केवल एक चेतावनी छोड़ता है

अभी कुछ दिन पहले, अमोदेई ने अत्याधुनिक एआई कंपनियों से "धीमा करने" में हाथ मिलाने का आह्वान किया था।

सतर्क रहने के लिए उन्होंने जो पहली शर्त सूचीबद्ध की वह आरएसआई थी।

मॉडल की प्रगति अपने आप में निश्चित रूप से एक अच्छी बात है, लेकिन समस्या यह है कि यदि एआई अगली पीढ़ी के एआई के निर्माण में भाग लेना शुरू कर देता है, तो मॉडल की प्रगति की गति तेज और तेज हो सकती है, लेकिन मानव की समझ, मूल्यांकन और नियंत्रण की गति एक ही समय में तेज नहीं हो सकती है।

इसलिए अमोदेई ने बार-बार इस बात पर जोर दिया है कि क्षमताओं को कुछ सीमाओं को पार करने से पहले तीसरे पक्ष के मूल्यांकन, सामान्य सुरक्षा मानकों और मंदी तंत्र को पहले से स्थापित किया जाना चाहिए।

क्योंकि एक बार जब आरएसआई वास्तव में सकारात्मक प्रतिक्रिया बनाता है, तो मॉडल ब्रेकिंग की "सुरक्षित दूरी" को पार कर सकता है।

जोखिम के संदर्भ में, कई अत्याधुनिक प्रयोगशालाएँ वास्तव में आम सहमति पर पहुँच गई हैं।

ऑल्टमैन ने सार्वजनिक रूप से "अत्याधुनिक एआई के विकास की गति को धीमा करने" पर सहमति व्यक्त की और वादा किया कि ओपनएआई समान कर्मचारी अधिकारों के साथ स्वतंत्र समीक्षकों को भी पेश करेगा; मस्क ने कहा कि "डारियो सही है"; हसबिस ने यह भी कहा कि यह सही दिशा है, लेकिन इसे कैसे किया जाए, इस पर चर्चा जारी रहने की जरूरत है।

लेकिन पहल में यह भी बताया गया कि अकेले धीमे पड़ने का कोई मतलब नहीं है। यदि एआई अनुसंधान और विकास को एआई द्वारा गति देना जारी रखा जाता है, तो भविष्य में वास्तव में प्रभावी मंदी या निलंबन के लिए सामान्य नियमों के एक सेट की स्थापना की आवश्यकता होती है: जैसे कि स्वतंत्र मूल्यांकनकर्ताओं की शुरूआत, और अत्याधुनिक प्रयोगशालाओं को संयुक्त रूप से क्षमता सीमा और सुरक्षा उपाय निर्धारित करने की अनुमति देना, और आवश्यक होने पर अनुसंधान और विकास की गति को धीमा करने के लिए समन्वय करना।

लेकिन अब तक, विभिन्न प्रतिस्पर्धी कारणों से, सामान्य नियम स्थापित नहीं किए गए हैं।

हर कोई पहले से ही एक साथ कह सकता है कि "हमें सतर्क रहना चाहिए", लेकिन जब "विशेष रूप से कैसे धीमा करना है, किसे पहले धीमा करना चाहिए, और क्या अन्य देशों को धीमा करना चाहिए" की बात आती है, तो सर्वसम्मति तुरंत गायब हो जाती है।

प्रयोगशालाओं के बीच सबसे सीधी मॉडल प्रतिस्पर्धा है, और देशों के बीच अधिक एआई प्रतिस्पर्धा है। यदि कोई भी देश अकेले धीमा पड़ता है, तो उसे अपने विरोधियों के लिए अग्रणी खिड़की छोड़ने का जोखिम उठाना पड़ेगा; यदि कोई भी देश अकेले प्रतिबंध लगाता है, तो उसे चिंता रहेगी कि दूसरा पक्ष तेजी जारी रखेगा।

इसलिए, कई अत्याधुनिक एआई प्रयोगशालाएं अपने शब्दों और कार्यों में कुछ हद तक असंगत व्यवहार करती हैं।

Google की ओर से, ऊपर उल्लिखित जेमिनी 4 प्रो है जिसके बारे में संदेह है कि इसका एरिना में गुमनाम रूप से परीक्षण किया गया है।

एंथ्रोपिक पक्ष पर, ओपस 5.2 के ग्रेस्केल निशान भी हाल ही में समुदाय में दिखाई देने लगे हैं। कुछ क्लाउड कोड उपयोगकर्ताओं ने कहा कि उन्होंने रनिंग स्टेटस और अनुरोध रूटिंग जानकारी के माध्यम से नए क्लाउड-ओपस-5-2 मॉडल लोगो को देखा, और संदेह किया कि कुछ अनुरोधों को अगली पीढ़ी के ओपस में ग्रेस्केल कर दिया गया है।


ओपनएआई के लिए, कुछ लोगों ने कहा कि उन्होंने पृष्ठभूमि मॉडल सूची में जीपीटी-6-सोल का मॉडल नाम देखा, और कुछ लोगों ने कहा कि उन्हें संदेह है कि उन्हें एक नए मॉडल में ग्रेस्केल किया गया है। व्यापक रूप से प्रसारित समाचार के अनुसार, GPT 6 Sol अगले सप्ताह रिलीज़ हो सकता है, या यह अमेरिकी समयानुसार 29 सितंबर को देव दिवस पर हो सकता है... संक्षेप में, यह अधिक दूर नहीं है।


तीन अत्याधुनिक एआई प्रयोगशालाओं के मॉडल के अगले दौर ने समुदाय में परीक्षण के निशान दिखाना शुरू कर दिया है।

"मंदी पहल" के इस दौर का अब तक का सबसे निश्चित परिणाम यह नहीं है कि कोई भी कंपनी वास्तव में धीमी हो गई है, बल्कि यह है कि सबसे महत्वपूर्ण एआई कंपनियों ने सार्वजनिक रूप से जोखिमों के बारे में पहले से बात की है।

मॉडल धीमा नहीं हो रहा है.

लेकिन कम से कम, अगर किसी दिन कुछ होता है, तो वे कह सकते हैं: हमने उन्हें चेतावनी दी है।

संबंधित टैग

संबंधित लेख

संयुक्त राष्ट्र ने वैश्विक सांख्यिकीय डेटाबेस को एआई टूल और प्राकृतिक भाषा इंटरैक्शन वातावरण के लिए अधिक अनुकूल बनाने के लिए Google के साथ हाथ मिलाया है। 2026-09-18 एआई उत्तर देता है कि मानवता को कैसे नष्ट किया जाए, हत्यारे रोबोट अंतिम स्थान पर हैं 2026-09-11 बड़े पैमाने पर भाषा मॉडल प्रशिक्षण के लिए कॉपीराइट सामग्री का उपयोग करने की वैधता विवादास्पद बनी हुई है। अमेरिकी सरकार सार्वजनिक रूप से OpenAI का समर्थन करती है 2026-09-03 ऐसी अफवाह है कि एंथ्रोपिक पूंजी बाजार का विश्वास बढ़ाने के लिए अपने आईपीओ की पूर्व संध्या पर एआई मॉडल की एक नई पीढ़ी लॉन्च करने की योजना बना रहा है। 2026-09-19 एंथ्रोपिक क्लाउड ओपनएआई के मार्कडाउन निर्देश विनिर्देश के साथ संगत होगा 2026-09-19 मेटा एआई सहायक म्यूज़ मैक पर लॉग इन करता है और उपयोगकर्ताओं की ओर से सीधे कार्य कर सकता है 2026-09-18

टिप्पणियाँ

0/500
Captcha (click to refresh)
कोई टिप्पणी नहीं