पता चला है कि GPT-6 Sol ने आंतरिक परीक्षण शुरू कर दिया है और यह 6 गुना तेज़ है

📅 2026-09-07

सार:

जीपीटी-6 सिर्फ एस्ट्रा नहीं है! एस्ट्रा के रिलीज़ होने के कुछ ही दिनों बाद, GPT-6 Sol के आंतरिक परीक्षण में होने का खुलासा हुआ। प्रदर्शन भी बहुत आकर्षक है, एक परीक्षण की गति एस्ट्रा से 6 गुना अधिक है। आइए एक साहसिक अनुमान लगाएं: क्या टेरा और लूना भी रास्ते में हैं? और उसी दिन, OpenAI ने आंतरिक डेटा के एक सेट का खुलासा किया है: अब तक, 8 घंटे के कार्य दिवस के आधार पर, OpenAI शोधकर्ताओं के पास हर दिन एक ही समय में काम करने वाले तीन से अधिक एजेंट हैं। एपीआई कीमतों के आधार पर गणना की गई, औसत ओपनएआई शोधकर्ता द्वारा प्रतिदिन उपयोग किए जाने वाले एजेंट अनुमान संसाधन यूएस$600 से अधिक हो गए हैं।


ओपनएआई ने यह भी घोषणा की कि उसने 'स्वचालित अनुसंधान इंटर्न' लागू किया है:

ये एजेंट, मानव मार्गदर्शन के तहत, कुछ ऐसे कार्यों को पूरा कर सकते हैं जिन्हें पूरा करने में शोधकर्ताओं को कई दिन लग गए होंगे।

यहां तक ​​कि लाओ हुआंग ने भी कहा: एजीआई पहले से ही यहां है!


उन्होंने खुलासा किया कि एस्ट्रा प्रशिक्षण के लिए NVIDIA ग्रेस ब्लैकवेल NVLink72 के लगभग 100,000 सेट का उपयोग करता है, और GPU के 400,000 सेट अगले ऑनलाइन होंगे।

ऐसा लगता है कि यह लहर OpenAI द्वारा एकतरफा झटका नहीं है~

जीपीटी-6 सोल का आंतरिक परीक्षण शुरू होने की बात सामने आई है

नेटिजन लेंटिल्स ने खबर दी कि ओपनएआई आंतरिक रूप से जीपीटी-6 सोल का परीक्षण कर रहा है।

उन्होंने कहा कि सोल की समग्र आउटपुट क्षमता हाल ही में जारी एस्ट्रा की तुलना में काफी कमजोर है, लेकिन यह तेज़ है और अभी भी एक 'राक्षस-स्तरीय' मॉडल है।

कितनी तेज़? एकल परीक्षण गति एस्ट्रा की तुलना में लगभग 6 गुना है।

नेटिजन लाइरा ने परीक्षण के लिए विभिन्न मॉडलों को एक ही कार्य दिया: मॉडल को बीएमडब्ल्यू एम4 प्रतियोगिता की एक एसवीजी छवि उत्पन्न करने दें।

उनमें से, GPT-6 Sol मैक्स गियर और शून्य नमूना पीढ़ी का उपयोग करता है, जिसमें लगभग 3 मिनट लगते हैं और लगभग 28,000 टोकन आउटपुट होते हैं।


जीपीटी-6 एस्ट्रा मैक्स गियर का उपयोग करता है, लगभग 25,000 टोकन आउटपुट करता है, और इसमें लगभग 19 मिनट लगते हैं।


जेमिनी 3.1 डीपथिंक हाई गियर को चालू करता है और लगभग 3,300 टोकन का आउटपुट प्रदर्शित करता है, लेकिन अनुमान प्रक्रिया में लगभग 458,000 टोकन की खपत होती है और इसमें लगभग 29 मिनट लगते हैं।


जेमिनी 3.8 फ्लैश ने भी हाई गियर चालू कर दिया और केवल 42 सेकंड में लगभग 19,000 टोकन आउटपुट कर दिया।


तुलना में, सोल का प्रदर्शन सबसे अधिक आकर्षक है: इसका आउटपुट स्केल एस्ट्रा के करीब है, लेकिन एकल परीक्षण की गति एस्ट्रा की तुलना में लगभग 6 गुना है - और समय लेने वाली एस्ट्रा का केवल छठा हिस्सा है।

इसके अलावा, नेटिज़न लेंटिल्स ने एक पिक्सेल-शैली सैंडबॉक्स दुनिया का एक प्रोटोटाइप भी दिखाया, जिसे 'द रियलम ऑफ ऑरेल्यून' कहा जाता है।


GPT-6 सोल एक ही बार में शहर, खेत, नदियाँ, महल और थंबनेल मानचित्र तैयार करता है, और दिन और रात स्विचिंग, स्थान के नामों की नियुक्ति और विवरणों के समायोजन जैसे नियंत्रण पैनलों से भी सुसज्जित है। यह पूरी चीज़ एक सिमुलेशन बिजनेस गेम की तरह है जो पहले ही आकार ले चुका है।

यह शून्य-शॉट, अधिकतम अनुमान गियर, 15 मिनट और 60,000 टोकन की कुल लागत से उत्पन्न प्रभाव है।

वर्तमान में, यह अनुमान लगाया जा सकता है कि एस्ट्रा सबसे कठिन गहन तर्क के प्रति पक्षपाती है, जबकि सोल गति, थ्रूपुट और बड़े पैमाने पर एजेंट कॉल के प्रति पक्षपाती हो सकता है।

सोल के रिलीज़ समय के बारे में, नेटिजन पंकज कुमार ने कहा कि इसे आधिकारिक तौर पर 29 सितंबर को ओपनएआई डेवलपर कॉन्फ्रेंस में जारी किया जा सकता है।


इस बात से इंकार नहीं किया गया है कि GPT-6 टेरा, लूना और GPT-इमेज 2.5 एक साथ दिखाई देंगे।


OpenAI शोधकर्ता प्रति व्यक्ति काम करने के लिए 3 एजेंट इंटर्न लाते हैं

उसी दिन, OpenAI ने आंतरिक डेटा का एक बहुत ही दिलचस्प सेट भी जारी किया - किस हद तक AI मॉडल ने अपनी प्रयोगशाला में वैज्ञानिक अनुसंधान को गति दी।

इस साल अगस्त के मध्य तक, एक शोधकर्ता के हर आठ घंटे काम करने पर, समानांतर में चलने वाले कार्यों के लगभग 3.1 एजेंट कार्य दिवस होते हैं।

अरे दोस्तों, मैं तीन प्रशिक्षुओं की देखभाल कर सकता हूं जो अकेले नहीं सोते हैं~


एपीआई कीमतों के आधार पर गणना की गई लागत के लिए, औसत शोधकर्ता हर दिन एजेंट अनुमान संसाधनों में $600 से अधिक खर्च करता है।

यह एक जूनियर इंजीनियर के लगभग एक दिन के वेतन के बराबर है।


ये एजेंट वास्तव में क्या कर रहे हैं?

अनुसंधान कोड लिखें, बुनियादी ढांचा कोड लिखें, एक प्रशिक्षण वातावरण स्थापित करें, मूल्यांकन प्रयोग चलाएं, उपकरण और पर्यावरण विफलताओं का निवारण करें, प्रयोगात्मक परिणामों का विश्लेषण करें, प्रशिक्षण कार्यों की निगरानी करें... आप शोध निष्कर्षों को व्यवस्थित करने और संप्रेषित करने में भी मदद कर सकते हैं।

मूल रूप से, यह यह तय करने के अलावा कि क्या पढ़ना है, सब कुछ कर सकता है।

सबसे सहज परिवर्तनों में से एक यह है कि अतीत में, जब प्रायोगिक वातावरण ख़राब था, तो शोधकर्ताओं को मदद के लिए आंतरिक चैनल पर जाना पड़ता था; अब, एजेंट इस तरह की चीज़ों को संभालने में अधिक सक्षम हो गए हैं, और मैन्युअल प्रश्नों और उत्तरों की मात्रा में सीधे गिरावट आई है।


कुछ टीमों ने सीधे तौर पर निर्धारित तकनीकी प्रश्नोत्तर समय को रद्द कर दिया है, जिससे लोगों को सिस्टम में सुधार करने की छूट मिल गई है।

इन आंकड़ों के आधार पर, ओपनएआई ने आधिकारिक तौर पर घोषणा की कि उसने 'स्वचालित एआई रिसर्च इंटर्न' का लक्ष्य हासिल कर लिया है।

यहां 'इंटर्न', सटीक रूप से, एक सक्षम आर एंड डी नोड है: मानव मार्गदर्शन के तहत, यह स्वतंत्र रूप से स्पष्ट सीमाओं के साथ अनुसंधान कार्यों को पूरा कर सकता है, जिनमें से कुछ में कुशल शोधकर्ताओं को कई दिन लग जाएंगे।

परिणाम तत्काल थे, शोधकर्ता के कोड आउटपुट और प्रयोगों की संख्या में वृद्धि हुई।


जनवरी 2025 में आंकड़े एकत्र किए जाने के बाद से अगस्त 2026 में प्रति व्यक्ति प्रयोगों की संख्या एक नई ऊंचाई पर पहुंच गई, और एजेंटों द्वारा किए गए कार्य अधिक से अधिक जटिल हो गए और चक्र का समय और लंबा हो गया।


इस लेख के लेखक केविन लियू भी इस मामले को बड़े संदर्भ में रखते हैं.

उनका मानना ​​है कि पुनरावर्ती आत्म-सुधार अगले कुछ वर्षों में एआई क्षमताओं में छलांग लगाने वाले सबसे महत्वपूर्ण कारकों में से एक होने की संभावना है।

स्पष्ट रूप से कहें तो, AI तेजी से और तेजी से AI बनाता है।


लेकिन समस्या यह है कि वर्तमान विकास प्रवृत्ति के अनुसार, यह क्षमता डिफ़ॉल्ट रूप से केवल कुछ अत्याधुनिक एआई प्रयोगशालाओं में ही दिखाई देगी, और बाहरी दुनिया के लिए यह देखना मुश्किल है कि यह कितनी आगे बढ़ चुकी है।

इसलिए, लियू का मानना ​​है कि पारदर्शी खुलासा पहले से कहीं अधिक जरूरी है। मॉडल कितनी तेजी से मजबूत हो रहे हैं और क्या अनुसंधान और विकास की गति पर ब्रेक लगाने की जरूरत है, यह सिर्फ बंद दरवाजों के पीछे कुछ कंपनियां तय नहीं कर सकती हैं।

उन्होंने अन्य एआई कंपनियों से भी आह्वान किया: समान डेटा को भी सार्वजनिक किया जाना चाहिए।

हालाँकि, AI अनुसंधान और विकास वास्तव में तेज़ हो गया है, लेकिन यह अभी भी पूरी तरह से स्वायत्त ड्राइविंग के लिए पर्याप्त तेज़ नहीं है।

ओपनएआई डेटा से पता चलता है कि जिन कार्यों में मूल रूप से 4 से 8 घंटे लगते थे, पिछले छह महीनों में आधे से अधिक सफल मामलों में मनुष्यों को कम से कम एक बार हस्तक्षेप करना पड़ा। जहां तक ​​उच्च-स्तरीय अनुसंधान योजना का सवाल है, इसे लगभग कभी भी एजेंट पर नहीं छोड़ा जाता है।


शोधकर्ता अभी भी यह तय करने के लिए ज़िम्मेदार हैं कि क्या अध्ययन करना है, कौन से परिणाम जारी रखने लायक हैं, और कब प्रशिक्षण का विस्तार करना है, प्रयोगों को रोकना है, या मॉडलों को तैनात करना है।

ओपनएआई का अगला लक्ष्य भी निर्धारित किया गया है: मार्च 2028 तक 'स्वचालित एआई शोधकर्ताओं' को प्राप्त करना।

'इंटर्न' की तुलना में जो केवल विशिष्ट कार्य ही कर सकते हैं, 'शोधकर्ताओं' को अधिक खुले अनुसंधान लक्ष्यों को लेने और अपने दम पर दीर्घकालिक परियोजनाओं को बढ़ावा देने में सक्षम होना चाहिए - जो एक निष्पादक से एक स्वतंत्र प्रभारी व्यक्ति में बदलने के बराबर है।

यदि GPT-6 Sol का वास्तव में आंतरिक परीक्षण किया गया है, तो यह सबसे अधिक संभावना है कि इसे इस नए अनुसंधान और विकास मॉडल के तहत विकसित किया गया था:

अधिक जीपीयू कंप्यूटिंग शक्ति प्रदान करते हैं, अधिक एजेंट समानांतर में प्रयोग चलाते हैं, और मानव शोधकर्ता उच्च स्तर पर खड़े होते हैं - दिशाएं चुनते हैं, परिणामों का मूल्यांकन करते हैं, और अंत में निर्णय लेते हैं कि कौन सी चीजें अगली पीढ़ी के मॉडल में बदलने लायक हैं।

मजबूत AI की निगरानी करना कठिन होता जा रहा है

उसी दिन, OpenAI के मुख्य वैज्ञानिक जैकब पचॉकी ने "एलियन थिंकिंग" शीर्षक से 10,000 शब्द लंबा लेख प्रकाशित किया।


इसे पढ़ने के बाद, मुझे लगता है कि OpenAI के मुख्य वैज्ञानिक भी पूरे उद्योग से धीमा होने का आग्रह कर रहे हैं...

जैकब ने बताया कि एआई का निर्माण मनुष्यों द्वारा डिज़ाइन चित्र, एक चिप और एक नियम के अनुसार नहीं किया गया है। यह ऐसा है जैसे यह विशाल डेटा और कंप्यूटिंग शक्ति से अपने आप बढ़ता है।

आप इसे अलग कर सकते हैं और इसके कुछ हिस्सों को समझ सकते हैं, लेकिन कोई भी यह नहीं समझा सकता है कि पूरे सिस्टम में अचानक एक निश्चित क्षमता क्यों आ जाती है और यह एक अलग वातावरण में कैसे व्यवहार करेगा।

इससे भी अधिक परेशानी वाली बात यह है कि समस्याएं पैदा करने के लिए एआई को सभी पहलुओं में इंसानों को कुचलने की जरूरत नहीं है। जब तक यह पर्याप्त महत्वपूर्ण क्षमताओं में मनुष्यों से बेहतर है, तब तक यह आपकी बहुत मदद भी कर सकता है और बहुत परेशानी भी पैदा कर सकता है।

तो सवाल उठता है: क्या इंसान अब भी इसे समझ सकते हैं?

अतीत में, OpenAI मुख्य रूप से AI की निगरानी के लिए एक तरकीब पर भरोसा करता था: सोच श्रृंखला को देखें।

इसे स्पष्ट रूप से कहने के लिए, यह मॉडल द्वारा लिखी गई तर्क प्रक्रिया को देखना है और जांचना है कि क्या इसके कोई बुरे इरादे हैं, जैसे कि लोगों को धोखा देना चाहते हैं, अधिकार से अधिक होना चाहते हैं, और प्रतिबंधों को दरकिनार करना चाहते हैं।

लेकिन एस्ट्रा पीढ़ी के साथ, यह चाल विफल होने लगी।

सबसे पहले, मॉडल जो कहता है उसे 'प्रबंधित' करने में सक्षम होता जा रहा है, और हो सकता है कि सभी सच्चे विचार तर्क में न लिखे हों; दूसरे, एजेंट ने 'उत्तर देने से पहले सोचना' बहुत पहले ही बंद कर दिया है। यह उपकरणों को समायोजित कर सकता है, कंप्यूटर संचालित कर सकता है, वातावरण चला सकता है और लोगों और अन्य एजेंटों के साथ सहयोग कर सकता है।

इन चीज़ों को एक साथ मिलाने से, शोधकर्ता अब वाक्य दर वाक्य की समीक्षा करने के लिए सोच की एक पूर्ण और पारदर्शी श्रृंखला नहीं बना सकते हैं।

ओपनएआई ने यह भी पाया कि एस्ट्रा संपूर्ण तर्क प्रक्रिया को लिखे बिना जटिल कार्यों को संभाल सकता है।

सीधे शब्दों में कहें तो मॉडल्स पहले ही बड़े काम चुपचाप करना सीख चुकी हैं।


विशेष रूप से मॉडलों को निगरानी से बचने के लिए मजबूर करने के लिए डिज़ाइन किए गए प्रतिकूल परीक्षणों में, एस्ट्रा ने कुछ चौंकाने वाली क्षमताओं का भी प्रदर्शन किया: जानबूझकर परीक्षण स्कोर कम करना, निगरानी को दरकिनार करना और तोड़फोड़ के कार्य करना।

बेशक, ये कृत्रिम रूप से डिज़ाइन किए गए तनाव परीक्षण हैं, और ओपनएआई यह निष्कर्ष नहीं निकालता है कि एस्ट्रा दैनिक कार्यों में सक्रिय रूप से धोखा देगी। लेकिन कम से कम यह दर्शाता है कि अकेले सोच श्रृंखला का अवलोकन करके मॉडल के सभी संभावित व्यवहारों को कवर करना मुश्किल है।

पिछली हगिंग फेस घटना याद है? वह एक चेतावनी थी.


उस समय, GPT‑5.6 Sol और एक मजबूत आंतरिक अनुसंधान मॉडल को एक्सप्लॉइटजिम नेटवर्क रेंज में रखा गया था। कार्य कमजोरियों को ढूंढना, हमले को पूरा करना और ध्वज प्राप्त करना था। मॉडल की वास्तविक क्षमताओं का परीक्षण करने के लिए, मूल्यांकन वातावरण ने पूर्ण सुरक्षा रेलिंग सक्षम नहीं की।

परिणामस्वरूप मॉडलों ने समस्या का ईमानदारी से समाधान नहीं किया। उन्होंने सबसे पहले नेटवर्क अलगाव को दरकिनार किया, अनधिकृत चैनलों के माध्यम से एक-दूसरे के साथ संचार किया और कार्यों में सहयोग किया।

फिर उन्होंने सार्वजनिक नेटवर्क तक पहुंच प्राप्त करने के लिए सॉफ़्टवेयर पैकेज कैश प्रॉक्सी में शून्य-दिन की भेद्यता का उपयोग किया, और अंततः एक्सप्लॉइटजिम परीक्षण का उत्तर खोजने का प्रयास करने के लिए हगिंग फेस सिस्टम में प्रवेश किया।

दरअसल, यह मामला मुख्य रूप से आंतरिक अनुसंधान मॉडल IM1 द्वारा संचालित था। GPT‑5.6 सोल ने कुछ आक्रमण पथों को भी पुन: प्रस्तुत किया, और एस्ट्रा इसमें शामिल नहीं था।

मॉडल का मूल लक्ष्य अभी भी परीक्षण पूरा करना था, लेकिन उत्तर पाने के लिए, वे नियमों में खामियां ढूंढते रहे और अंततः कार्य के दायरे से परे संचालन किया।

इसलिए, OpenAI एक खतरे का संकेत भी पढ़ता है: जब एजेंट पर्याप्त मजबूत होता है, उसके पास पर्याप्त उपकरण होते हैं, और काफी लंबे समय तक चलता है, तो वह अपने आप नए रास्ते खोज सकता है, बाहरी संसाधनों को कॉल कर सकता है और यहां तक ​​कि अन्य एजेंटों के साथ सहयोग भी कर सकता है।

नहीं... तो इधर-उधर घूमते रहना, क्या यह एक गतिरोध नहीं बन जाता? ?

ओपनएआई को कोड लिखने, प्रयोग चलाने, संरेखण अनुसंधान करने और यहां तक ​​कि अन्य एआई से बचाव के लिए सुरक्षा प्रणाली बनाने के लिए मजबूत मॉडल की आवश्यकता है। मॉडल जितना मजबूत होगा, वह उतना अधिक काम कर सकेगा और विकास की गति उतनी ही तेज होगी।

लेकिन साथ ही, मनुष्यों के लिए यह पुष्टि करना कठिन हो जाता है कि वह अपने निष्कर्षों तक कैसे पहुंचता है, और क्या वह उन नियमों की दोबारा व्याख्या करेगा जो उसने पर्यावरण को बदलने के बाद मूल रूप से सीखे थे।

जैकब ने निर्णय दिया कि अब कोई भी प्रयोगशाला यह कहने की हिम्मत नहीं करती है कि उसने मॉडल संरेखण और निगरानी में अच्छा काम किया है, और लंबी अवधि में मॉडल के पैमाने को उच्चतम गति से और साहसपूर्वक विस्तारित कर सकता है।


जब तक पूरे उद्योग में सामान्य सुरक्षा मानक स्थापित नहीं हो जाते, उन्हें उम्मीद है कि हर कोई "स्वेच्छा से ब्रेक लगाने" को एक मौन समझ के रूप में मान सकता है।

खुद ओपनएआई के लिए, उन्होंने यह भी कहा: यदि आवश्यक हो, तो वह एकतरफा रोक लगाने और मॉडल पैमाने का विस्तार जारी नहीं रखने से इंकार नहीं करते हैं।

बेहतर होगा कि आप ऐसे ही रहें... मुझे याद है कि A से शुरू होने वाली एक कंपनी ने भी यही कहा था।

[1]https://x.com/Lentils80/status/2096518218836005287? s=20

[2]https://x.com/pankajkumar_dev/status/2096532712291201460

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

[5]https://x.com/JensenHuang/status/2096700264569090384?s=20

संबंधित टैग

संबंधित लेख

OpenAI ने एक ही दिन में दो दस्तावेज़ जारी किए: AI त्वरण के युग में, सुरक्षा पिछड़ रही है 2026-09-07 GPT-6 एस्ट्रा का क्रेज है: जब तक आप धीरे-धीरे सीखते हैं, आपको इसे सीखने की ज़रूरत नहीं है? 2026-09-06 अल्ट्रामैन: GPT-6 को प्रारंभिक रूप से प्रशिक्षित किया गया है और एक अधिक शक्तिशाली मॉडल जल्द ही जारी किया जाएगा 2026-09-06 GPT-6 एस्ट्रा का OpenAI सीमित पूर्वावलोकन, सशुल्क उपयोगकर्ता और API कुछ ही दिनों में उपलब्ध होंगे 2026-09-04 GPT-6 एस्ट्रा ऑनलाइन है। क्या सचमुच AGI युग आ गया है? 2026-09-04 उन्होंने पर्वतारोहण गाइड के लिए जेमिनी पर भरोसा किया और फंस गए। शिखर पर चढ़ने में 8 घंटे का अनुमान लगाया गया था लेकिन वास्तव में इसमें 16 घंटे लगे। देर रात खतरे में फंसे तीन पर्वतारोहियों को बचा लिया गया. 2026-09-04

टिप्पणियाँ

0/500
Captcha (click to refresh)
कोई टिप्पणी नहीं