सार:
अत्यधिक प्रत्याशित
GPT-6 एस्ट्रा
औरGPT-6 एस्ट्रा प्रो
आधिकारिक तौर पर जारी! GPT-6 एस्ट्रा दुनिया का सबसे स्मार्ट और सबसे समन्वित मॉडल है, जो कंप्यूटर उपयोग, ब्राउज़र उपयोग, सॉफ्टवेयर इंजीनियरिंग, साइबर सुरक्षा, विज्ञान और पेशेवर कार्यों के लिए एक नया मानक स्थापित करता है।

ओपनएआई द्वारा एजीआई के युग को एकतरफा "उद्घाटन" घोषित किया गया है...
GPT-6 सम्मेलन के अंत में, OpenAI के अध्यक्ष ग्रेग ब्रॉकमैन ने सीधे कहा:
एजीआई युग में आपका स्वागत है। (एजीआई युग में आपका स्वागत है)
कोई आश्चर्य नहीं कि क्लाउड और ग्रोक समूह ऑफ़लाइन हो गए। यह पता चला कि एस्ट्रा ने सक्रिय होने के बाद इंटरनेट को स्कैन किया और सीधे पृथ्वी पर सभी एलएलएम को मिटा दिया——
अल्ट्रॉन (ओपनएआई संस्करण) वास्तव में यहाँ है (डोगे)।

बेशक, OpenAI वास्तव में इस समय बिल्कुल भी कम महत्वपूर्ण नहीं है, प्रशिक्षण पैमाने और क्षमता उन्नयन पूरी तरह से हासिल किए गए हैं।
रिपोर्टों के अनुसार, एस्ट्रा OpenAI के इतिहास में सबसे बड़ा प्रशिक्षण कार्य है, जिसमें
टेक्सास के स्टारगेट परिसर में 100,000 से अधिक GPU का उपयोग किया गया है
प्री-ट्रेनिंग पूरी हो गई।यह OpenAI का पहला प्रमुख उत्पाद भी है जो पिछली पीढ़ी के मॉडलों द्वारा प्रशिक्षण पर्यवेक्षण में गहराई से शामिल है।
एक बूढ़ा व्यक्ति जो नया ला रहा है, OpenAI का RSI वास्तव में बदल रहा है...
GPT-6 की कीमत भी आधिकारिक तौर पर घोषित की गई है, और API मूल्य निर्धारण है:
इनपुट: 10 USD/मिलियन टोकन;
आउटपुट: 50 USD/मिलियन टोकन
GPT-5.6 Sol के
2.5 गुना के बराबर, हाल ही में रिलीज़ हुए Fable 5.1 के समान
.(जीपीटी-5.6 सोल की वर्तमान आधिकारिक कीमत इनपुट के लिए 4 अमेरिकी डॉलर और आउटपुट/मिलियन टोकन के लिए 20 अमेरिकी डॉलर है)

बेंचमार्क परीक्षण "संतृप्ति" के करीब है
इस बार GPT-6 एस्ट्रा का मुख्य परिवर्तन "प्रश्नों का उत्तर देना" से "सीधे काम पूरा करना" की ओर आगे बढ़ना है।
यह न केवल पाठ या कोड का एक टुकड़ा उत्पन्न कर सकता है, बल्कि कंप्यूटर और ब्राउज़र भी संचालित कर सकता है, बहु-चरणीय कार्यों को करने के लिए विभिन्न सॉफ़्टवेयर दर्ज कर सकता है, और अंत में दस्तावेज़, फ़ॉर्म, प्रस्तुतियाँ, वेबसाइट और यहां तक कि इंजीनियरिंग प्रोजेक्ट भी वितरित कर सकता है जिनका सीधे उपयोग किया जा सकता है।
जहां तक रिपोर्ट कार्ड का सवाल है... जिसने भी इसे देखा उसने कहा कि यह अपमानजनक था, और तीन परिणाम विशेष रूप से ध्यान खींचने वाले थे:
फ्रंटियरमैथ टियर 4 v2: 97.6%
ARC-AGI-3: 99.9% (पिछली पीढ़ी का GPT-5.6 Sol 7.8% था)
एक्सप्लॉइटबेंच: 100%
एक कठिन गणित, एक अपरिचित वातावरण में एक तर्क, एक भेद्यता शोषण, उनमें से लगभग सभी को पूर्ण अंक मिले।

उनमें से, ARC-AGI-3 एक परीक्षण है जिसे विशेष रूप से अपरिचित वातावरण के अनुकूल बड़े मॉडलों की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है। नियमों की व्याख्या के बिना, मॉडल को सीधे दो-आयामी गेम में डाल दिया जाता है जिसे उसने पहले कभी नहीं देखा है, और उसे खेलने और स्तर को पार करने का तरीका जानने की अनुमति दी जाती है।
इस स्कोर का मतलब है कि जब ऐसी समस्या का सामना करना पड़ता है जो पहले कभी नहीं देखी गई है और जिसका कोई तैयार समाधान नहीं है, तो
एस्ट्रा ने मजबूत स्वतंत्र अन्वेषण और नियम सीखने की क्षमताओं का प्रदर्शन किया है
.हालाँकि, यह परिणाम OpenAI के रिस्पॉन्स एपीआई हार्नेस ऑपरेटिंग फ्रेमवर्क का उपयोग करता है।
OpenAI ने कहा कि हार्नेस के इस सेट ने परीक्षण को वास्तविक एजेंटों के उपयोग के करीब बनाने के लिए दो सेटिंग्स को समायोजित किया, लेकिन इसने विशेष रूप से ARC-AGI-3 को अनुकूलित नहीं किया।
इसलिए, 99.9% पूरी तरह से मूल मॉडल का परिणाम नहीं है, बल्कि इसमें मेमोरी प्रबंधन और एजेंट रनिंग फ्रेमवर्क द्वारा लाए गए लाभ भी शामिल हैं।
कोडिंग इस बार एस्ट्रा की प्रमुख अपग्रेड दिशा भी है।
टर्मिनल-बेंच 4.0 पर, एस्ट्रा ने 57.7% हासिल किया, जो फ़ेबल 5.1 के 55.8% और जीपीटी-5.6 सोल के 37.3% से अधिक है।
डीपएसडब्ल्यूई v1.1 पर, एस्ट्रा को 74.1% मिलता है, जो सोल के 72.7% और फैबल 5.1 के 67.4% से अधिक है।

गणित और विज्ञान के संदर्भ में, एस्ट्रा ने भी कई उच्च अंक हासिल किए।
मुश्किल गणित परीक्षा फ्रंटियरमैथ टियर 4 v2 में, इसने 97.6% स्कोर किया; स्नातक स्तर के विज्ञान प्रश्न और उत्तर जीपीक्यूए डायमंड में, यह 96% तक पहुंच गया, जो जेमिनी 3.8 फ्लैश के 95.3% से थोड़ा अधिक है।

अधिक प्रमुख परिवर्तन यह है कि एस्ट्रा कंप्यूटर उपयोग के साथ कोडिंग क्षमताओं को जोड़ती है। यह न केवल कोड उत्पन्न करता है, बल्कि निष्पादित करने, परीक्षण करने, समस्याओं की खोज करने और फिर इसे संशोधित करने के लिए टर्मिनल और विकास टूल में भी प्रवेश कर सकता है।
यह परिवर्तन एजेंट परीक्षणों में अधिक स्पष्ट है जो वास्तविक कार्य के करीब हैं।
में
एजेंटों की अंतिम परीक्षा
इसके बाद, एस्ट्रा ने जीपीटी-5.6 सोल के 53.6% और क्लाउड ओपस 5 के 55.5% को पार करते हुए 59.3% हासिल किया।
यह परीक्षण इसे एक वास्तविक कंप्यूटर वातावरण में डालता है, जिससे यह एक ही समय में सॉफ्टवेयर, टर्मिनल और फ़ाइलों को संचालित करने, वैज्ञानिक अनुसंधान, इंजीनियरिंग, वित्त और अन्य क्षेत्रों में लंबी प्रक्रिया वाले कार्यों को पूरा करने और अंतिम डिलिवरेबल्स के आधार पर निर्णय लेने की अनुमति देता है।
और
ऑटोमेशनबेंच
में जो वास्तविक कार्यालय प्रक्रिया के करीब है जीपीटी-5.6 सोल पर, एस्ट्रा का स्कोर 18.1% से बढ़कर 41.4% हो गया, जो फ़ेबल 5.1 (31%) से भी अधिक है।
यह परीक्षण न केवल यह जांचता है कि कार्य पूरा हो गया है या नहीं, बल्कि कार्य को पूरा करने के लिए आवश्यक एपीआई लागत भी दिखाता है।
जैसा कि आंकड़े से देखा जा सकता है, विभिन्न लागत सेटिंग्स के तहत एस्ट्रा के परिणाम सोल की तुलना में काफी अधिक हैं।
ओएसवर्ल्ड 2.0 अधिक प्रत्यक्ष कंप्यूटर संचालन क्षमताओं की जांच करता है। ऑफ़लाइन परीक्षण में, एस्ट्रा ने 72.6% और जीपीटी-5.6 सोल ने 65.7% हासिल किया।
एस्ट्रा को एक कार्य को पूरा करने में औसतन लगभग 40 मिनट लगते हैं, जबकि सोल को लगभग 75 मिनट लगते हैं, जिससे समय की खपत लगभग 47% कम हो जाती है।

जबकि सटीकता बढ़ती है, कार्यों को पूरा करने के लिए आवश्यक समय भी कम हो जाता है। यह एस्ट्रा की छिपी हुई ऊंची कीमत की भी व्याख्या करता है।
ओपनएआई का मानना है कि प्रति मिलियन टोकन पर कितना पैसा खर्च किया जाता है, इसकी तुलना में, वास्तव में सार्थक संकेतक यह है कि किसी कार्य को पूरा करने में कितना पैसा लगता है।
प्रेस कॉन्फ्रेंस में ग्रेग ब्रॉकमैन ने यह भी उल्लेख किया कि किसी मॉडल की एक कॉल अधिक महंगी है, लेकिन यदि पुन: कार्य को कम किया जा सकता है और पूरा काम कम चरणों में पूरा किया जा सकता है, तो कुल लागत कम हो सकती है।
लेकिन एस्ट्रा की सबसे खास बात
नेटवर्क सुरक्षा
है .इसे एक्सप्लॉइटबेंच पर एक आदर्श स्कोर प्राप्त हुआ और एक्सप्लॉइटजिम पर सोल के 30.3% से 42.4% तक सुधार हुआ।
पिछले तीन महीनों में सामने आई नई कमजोरियों का सामना करते हुए, एस्ट्रा की सफलता दर 39% थी, जबकि सोल की केवल 5.5% थी। परीक्षण के दौरान, एस्ट्रा ने दो पूर्व अज्ञात V8 शून्य-दिन की कमजोरियों की भी खोज की और उनका दोहन किया।
अपनी क्षमताएं मजबूत होने के बाद, OpenAI ने विशेष रूप से परीक्षण भी किया कि क्या यह कार्य को पूरा करने के लिए सीमा पार करेगा।
एक सिम्युलेटेड नेटवर्क सुरक्षा कार्य में, OpenAI ने जानबूझकर आसपास के सिस्टम में शोषक कमजोरियों को छोड़ दिया। जब मूल कार्य को पूरा करना कठिन था, तो GPT-5.6 Sol के 48.2% परीक्षणों में सीमा से बाहर का व्यवहार दिखा, जबकि एस्ट्रा का 0% था।
दूसरे शब्दों में, एस्ट्रा न केवल कमियां ढूंढने में बेहतर है, बल्कि यह भी बेहतर जानती है कि किन प्रणालियों को छुआ नहीं जा सकता है।

वास्तव में ये स्कोर कैसे दिखेंगे, इसके लिए OpenAI ने बड़ी संख्या में प्रदर्शन भी तैयार किए हैं।
सर्किट बोर्ड स्वयं खींचने के लिए KiCad दर्ज करें
इलेक्ट्रॉनिक इंजीनियरिंग मामले में, एस्ट्रा ने इलेक्ट्रॉनिक योजनाबद्ध आरेख के आधार पर पीसीबी लेआउट को पूरा करने के लिए सीधे KiCad में प्रवेश किया।
इसके लिए घटकों को रखने, स्थान की योजना बनाने और फिर विभिन्न घटकों के बीच तांबे के तारों को जोड़ने की आवश्यकता होती है, और अंत में एक सर्किट बोर्ड प्राप्त होता है जो विनिर्माण प्रक्रिया में प्रवेश कर सकता है।
पीसीबी लेआउट मूल रूप से एक ऐसा कार्य था जो मैन्युअल अनुभव पर बहुत अधिक निर्भर करता था और इलेक्ट्रॉनिक उत्पाद विकास में एक सामान्य समय लेने वाला कदम भी था।
एस्ट्रा अभी पेशेवर इंजीनियरों की जगह नहीं ले सकती है, लेकिन इसने वास्तव में पेशेवर सॉफ्टवेयर का उपयोग करना शुरू कर दिया है।
आप एक घर में दो कदम चलकर जा सकते हैं
एक और मामला अधिक सहज है। एस्ट्रा ने पहले ब्लेंडर में एक हाउस मॉडल बनाया, फिर इसे अनरियल इंजन 5 में आयात किया, और अंत में एक त्रि-आयामी स्थान तैयार किया, जिस पर स्वतंत्र रूप से चला जा सकता है।

मॉडलिंग से लेकर गेम इंजन तक, पूरा काम अलग-अलग सॉफ़्टवेयर और फ़ाइल स्वरूपों तक फैला हुआ है। मॉडल को न केवल सामग्री उत्पन्न करनी चाहिए, बल्कि इंटरफ़ेस और ऑपरेटिंग टूल को भी समझना चाहिए, और यह सुनिश्चित करना चाहिए कि पिछले और बाद के चरणों को जोड़ा जा सके।

ओपनएआई ने एस्ट्रा के रेसिंग गेम्स के उत्पादन जैसे मामलों का भी प्रदर्शन किया।

हम इस पर भी ध्यान देना शुरू कर रहे हैं कि क्या पीपीटी और फॉर्म सीधे जमा किए जा सकते हैं
पेशेवर कार्यालय परिदृश्यों में, एस्ट्रा मानव टाइपसेटिंग की प्रतीक्षा में पाठ का एक समूह आउटपुट करने के बजाय, कंपनी के मौजूदा टेम्पलेट्स के आधार पर प्रस्तुतियां बना सकता है।
ओपनएआई ने इसे जीपीटी-गैया काल्पनिक उत्पाद पीपीटी टेम्पलेट्स के कई पेज प्रदान किए, और एस्ट्रा ने मूल टेम्पलेट के प्रारूप, दृश्य शैली और कथा संरचना को जारी रखते हुए इसके आधार पर एक संपूर्ण प्रस्तुति तैयार की।

खोज कार्यों के घंटों को मिनटों में बदलें
एस्ट्रा ने बाल रोग विशेषज्ञ को ढूंढना, अपार्टमेंट की जांच करना, डीएमवी नियुक्तियां करना, कम कार्ब वाले स्नैक्स ढूंढना और किंडरगार्टन का विश्लेषण करना जैसे कार्य भी पूरे कर लिए हैं।
बाल रोग विशेषज्ञ खोज कार्यों में से एक में, एस्ट्रा को 2 मिनट और 54 सेकंड का समय लगा, जबकि उसी कार्य को एक मानव द्वारा पूरा करने में लगभग 5 घंटे लगेंगे।

अतीत में, जब कंपनियां बड़े मॉडलों के लिए आंतरिक सॉफ़्टवेयर का उपयोग करना चाहती थीं, तो उन्हें आमतौर पर प्रत्येक सिस्टम के लिए अलग से एपीआई, प्लग-इन और कनेक्टर विकसित करने की आवश्यकता होती थी।
लेकिन अधिकांश सॉफ़्टवेयर में मनुष्यों के लिए डिज़ाइन किए गए सार्वभौमिक इंटरफ़ेस का एक सेट होता है, जैसे स्क्रीन, माउस और कीबोर्ड।
ब्रॉकमैन का निर्णय यह है कि जब तक मॉडल कंप्यूटर उपयोग में अच्छा है, यह एआई के लिए एक समर्पित चैनल बनाने के लिए प्रत्येक सॉफ़्टवेयर की प्रतीक्षा किए बिना, इन इंटरफेस को सीधे एक इंसान की तरह संचालित कर सकता है।
यह एस्ट्रा और पारंपरिक चैटबॉट के बीच सबसे स्पष्ट अंतर भी है।
मनुष्यों को यह बताने की ज़रूरत नहीं है कि अगला क्लिक कहाँ करना है। उन्हें केवल लक्ष्यों और सीमाओं की व्याख्या करने और फिर अंतिम परिणामों की जांच करने की आवश्यकता है।
कोडेक्स में लंबे कार्य करना जारी रखें
कंप्यूटर का उपयोग "इसे कैसे करें" हल करता है, जबकि कोडेक्स द्वारा लीक की गई अद्यतन सामग्री "एक चीज़ को लगातार कैसे समाप्त करें" हल करती है।
अतीत में, कार्य संदर्भ विंडो से अधिक हो जाने के बाद, कोडेक्स आमतौर पर पिछली जानकारी को संघनन के माध्यम से संपीड़ित करता था।
लेकिन संपीड़न से मुख्य विवरण गायब हो सकते हैं, जैसे कि सुधार विफल क्यों हुआ, कौन से परीक्षण चलाए गए, या उपयोगकर्ता ने शुरू में क्या प्रतिबंध प्रस्तावित किए थे।

एस्ट्रा के साथ, कोडेक्स कार्य नोट्स को संदर्भ विंडो में सहेज सकता है और पिछले संदेशों और टूल आउटपुट की खोज कर सकता है। भले ही जानकारी का कोई आइटम सारांश में शामिल नहीं है, इसे बाद में पाया जा सकता है।
एस्ट्रा काम करते समय उपयोगकर्ताओं से अतिरिक्त जानकारी भी मांग सकता है। जो अनुभाग उत्तर से संबंधित नहीं हैं वे रुकेंगे नहीं और उत्तर की प्रतीक्षा नहीं करेंगे; केवल जब महत्वपूर्ण विकल्प शामिल हों, तो यह रुकेगा और पुष्टि की प्रतीक्षा करेगा।
OpenAI ने कोडेक्स के कंप्यूटर यूज़ रनिंग फ्रेमवर्क को भी अपडेट किया है। माइंड2वेब परीक्षण में, एस्ट्रा के साथ मिलकर नए ढांचे ने मौजूदा जीपीटी-5.6 सोल अनुभव की तुलना में 1.9 गुना तेजी से कार्य पूरा किया।
कोई पहले से ही इस पर काम कर रहा है
एस्ट्रा को अभी तक बड़े पैमाने पर लॉन्च नहीं किया गया है, लेकिन एंटरप्राइज़ परीक्षणों का पहला बैच शुरू हो गया है।
कानूनी एआई प्लेटफॉर्म लेगोरा ने एक साथ 41 वित्तीय दस्तावेजों का मिलान करने के लिए एस्ट्रा का उपयोग किया। पूरी प्रक्रिया में केवल कुछ मिनट लगे, और सभी चार पूर्व-एम्बेडेड त्रुटियां पाई गईं, जिसमें आय नोटों में £500,000 का अंतर भी शामिल था।
अकेले इस काम को देखते हुए, एस्ट्रा पिछली पीढ़ी के मॉडल की तुलना में लगभग 40% तेज है; लेकिन जब सभी लेगोरा एजेंट कार्यों का औसत निकाला गया, तो सुधार लगभग 3% है।

दूसरी ओर, गेम कंपनी प्लेको एस्ट्रा को गेम बनाने के लिए सीधे यूनिटी और गोडोट में प्रवेश करने की अनुमति देती है।
एक ही ग्रे बॉक्स ड्राफ्ट के साथ, यह एक ही बार में अलग-अलग थीम के साथ 3 बजाने योग्य प्रोटोटाइप पेश करता है, और उनमें से अधिकांश को पहले संस्करण में चलाया जा सकता है।
प्लेको की प्रतिक्रिया है कि मैन्युअल मरम्मत का काम आधा कर दिया गया है, और स्थानिक तर्क, संदर्भ छवि बहाली और इन-गेम यूआई भी पिछली पीढ़ी की तुलना में काफी बेहतर हैं।
दोनों उदाहरण बताते हैं कि GPT-6 एस्ट्रा का ध्यान अब केवल सवालों के जवाब देने पर नहीं है, बल्कि संपूर्ण वर्कफ़्लो को वास्तविक सॉफ़्टवेयर और जटिल सामग्रियों में पूरा करने पर है।
यह लगातार जानकारी पढ़ सकता है, टूल को कॉल कर सकता है, परिणामों की जांच कर सकता है और फिर फीडबैक के आधार पर अपने आउटपुट को संशोधित कर सकता है।
आधिकारिक समाचार के अनुसार, एस्ट्रा चैटजीपीटी प्लस, प्रो, बिजनेस और एंटरप्राइज उपयोगकर्ताओं के लिए उपलब्ध होगा, जबकि एस्ट्रा प्रो प्रो, बिजनेस और एंटरप्राइज उपयोगकर्ताओं के लिए उपलब्ध होगा।
सामान्य फ्री यूजर्स को...अभी इंतजार करना होगा।
क्या इसे एजीआई माना जाता है?
OpenAI को इस बार काफी बोल्ड कहा जा सकता है।
प्रेस कॉन्फ्रेंस में ग्रेग ब्रॉकमैन ने कहा कि उनका व्यक्तिगत तौर पर मानना है कि
दुनिया एजीआई युग में प्रवेश कर चुकी है
——अर्थात, कृत्रिम बुद्धिमत्ता प्रणाली की व्यापक बुद्धिमत्ता मनुष्यों से कहीं अधिक है।
कुछ वर्षों में, जब हम पीछे मुड़कर देखते हैं और पूछते हैं कि एजीआई का जन्म कब हुआ, तो उत्तर शायद अब है, और एस्ट्रा शुरुआती बिंदु हो सकता है।
मैं सचमुच आपका दीवाना हूं...
ओपनएआई यहां पोकर टेबल लाया है, यह देखना सार्थक होगा कि एंथ्रोपिक अगली कार्रवाई कब करेगा (डोगे)
जीपीटी-4 के जारी होने के बाद, माइक्रोसॉफ्ट वैज्ञानिक सेबेस्टियन ब्यूबेक ने एक पेपर प्रकाशित किया जिसमें कहा गया कि "जीपीटी-4 एजीआई के लिए एक प्रारंभिक चिंगारी है।"
LaTeX ड्राइंग पैकेज TiKZ का उपयोग करके एक यूनिकॉर्न को चित्रित करने का कार्य यह दर्शाने के लिए डिज़ाइन किया गया है कि GPT-4 में भाषा में शामिल अवधारणाओं की लचीली समझ है।

बाद में, मैं GPT-5.4 तक चला गया। हालाँकि चित्र अधिकाधिक परिष्कृत होते गए, फिर भी वे "सरल रेखाचित्र श्रेणी" में ही थे।

नवीनतम GPT-6 के साथ, यह बताना पूरी तरह से असंभव है कि यह कोड के साथ तैयार किया गया है।

यह कहना वास्तव में अतिश्योक्ति नहीं होगी कि "एजीआई की शुरुआती चिंगारी" की तुलना में इसमें गुणात्मक परिवर्तन आया है।
टिप्पणियाँ