SpaceXAI का सबसे शक्तिशाली ग्रोक 4.7 अत्यधिक कीमत और निराशाजनक प्रदर्शन के साथ जारी किया गया

📅 2026-09-22

सार:

आज सुबह, SpaceXAI का सबसे शक्तिशाली मॉडल, ग्रोक 4.7, आया। रिलीज़ पृष्ठ की शुरुआत में केवल एक बहुत ही "आक्रामक" स्थिति है: प्रोग्रामिंग और ज्ञान कार्य के लिए सबसे शक्तिशाली मॉडल, तुलनीय मॉडल से दोगुना तेज़ और केवल आधी कीमत।


यह अपग्रेड बेंचमार्क पर नहीं रुकता। ग्रोक 4.7 एक बड़े बुनियादी मॉडल पर स्विच करता है, दीर्घकालिक कार्यों, आत्म-परीक्षा और दीर्घकालिक-संदर्भ प्रबंधन क्षमताओं को मजबूत करता है, और प्रमुख परीक्षणों में दस्तावेज़, प्रस्तुतियाँ, कानूनी, चिकित्सा और इंजीनियरिंग और अन्य पेशेवर कार्य शामिल करता है। यह जिस परिदृश्य को लक्षित करता है वह बहुत स्पष्ट है: मॉडल को कई घंटों तक चलने वाले कार्यों में रुकावटों से बचने और सीधे उपयोग किए जा सकने वाले परिणाम देने की अनुमति देता है।


मस्क ने ट्वीट किया, "ग्रोक 4.7 खुफिया स्तर, परिचालन गति और लागत के बीच एक बहुत ही प्रतिस्पर्धी संतुलन हासिल करता है।"


लंबे मिशन इस पीढ़ी के मॉडलों का मुख्य युद्धक्षेत्र बन गए हैं

ग्रोक 4.7, ग्रोक 4.6 की तुलना में बड़े बेस मॉडल का उपयोग करता है। प्रशिक्षण चरण सुदृढीकरण सीखने की अवधि को बढ़ाता है और कार्य संयोजन अधिक कठिन हो जाता है, अधिक नमूनों को पूरा करने में घंटों लगते हैं। स्पेसएक्सएआई ने कहा कि नए मॉडल ने अपने काम का निरीक्षण करने और लंबे संदर्भों को प्रबंधित करने की क्षमता में सुधार किया है।

इस प्रकार का सुधार सीधे तौर पर वर्तमान प्रोग्रामिंग बुद्धिमान एजेंटों की सबसे कठिन समस्याओं से मेल खाता है। शॉर्ट कोड जेनरेशन के लिए अक्सर केवल आंशिक निर्णय की आवश्यकता होती है, लेकिन वास्तव में जटिल सॉफ़्टवेयर कार्यों में वेयरहाउस को पढ़ना, आवश्यकताओं को नष्ट करना, कई फ़ाइलों को संशोधित करना, परीक्षण चलाना और बार-बार त्रुटि सुधार शामिल हैं। क्या मॉडल लक्ष्यों को बनाए रख सकता है और लंबी निष्पादन श्रृंखला में त्रुटियों का पता लगा सकता है या नहीं, यह अक्सर एक बार में सुंदर कोड लिखने से अधिक महत्वपूर्ण होता है।

कर्सरबेंच 4.0 विशेष रूप से दीर्घकालिक कोडिंग कार्यों की जांच करता है। आधिकारिक आंकड़ों में, ग्रोक 4.7 ने 46.3% स्कोर किया और ग्रोक 4.6 ने 40.4% स्कोर किया, जो 5.9 प्रतिशत अंक की वृद्धि है। डीपएसडब्ल्यूई v1.1 पर, ग्रोक 4.7 का उच्च-अनुमान तीव्रता स्कोर 71.0% था; टर्मिनल-बेंच 4.0 पिछली पीढ़ी के 20.3% से बढ़कर 38.0% हो गया।

तदनुसार, ग्रोक 4.7 को कर्सरबेंच 4.0 पर अत्याधुनिक कीमत और प्रदर्शन मॉडल कहा जाता है।


मॉडल को उस ढांचे को मूल रूप से समझने के लिए भी प्रशिक्षित किया गया है जिसके भीतर ग्रोक बॉट चलता है। आधिकारिक तौर पर, यह समायोजन संवाद कार्यों और सामान्य ज्ञान कार्यों पर प्रदर्शन में सुधार करता है। दूसरे शब्दों में, ग्रोक 4.7 का अपग्रेड फोकस उत्तरों के एक दौर से लेकर मॉडल, टूल और निष्पादन वातावरण के बीच निरंतर सहयोग तक बढ़ गया है।

कोड लिखने से लेकर संपूर्ण ज्ञान कार्य तक

प्रोग्रामिंग अभी भी ग्रोक 4.7 का सबसे आकर्षक लेबल है, लेकिन स्पेसएक्सएआई द्वारा दिए गए मूल्यांकन का दायरा काफी व्यापक है। एए ब्रीफ़केस और जीडीपीवल उस बहु-चरणीय कार्य पर ध्यान केंद्रित करते हैं जिसे पेशेवर हर दिन पूरा करते हैं, जिसमें वकील, नर्स और वित्तीय विश्लेषक जैसे पदों पर सामान्य कार्यों के साथ-साथ दस्तावेज़ और प्रस्तुति उत्पादन भी शामिल होता है।

एए ब्रीफ़केस v1.1 पर, ग्रोक 4.7 ने 1657 अंक बनाए, जो ग्रोक 4.6 के 1546 अंक से अधिक है; जीडीपीवल एलो स्कोर 1605 से बढ़कर 1695 हो गया। आधिकारिक चार्ट में, यह जीडीपीवल पर फैबल 5.1 के 1735 अंक के करीब है और जीपीटी-6 एस्ट्रा के 1542 अंक से अधिक है। स्पेसएक्सएआई ने निष्कर्ष निकाला कि ग्रोक 4.7 ने दोनों परीक्षणों में पिछली पीढ़ी से बेहतर प्रदर्शन किया और कुल मिलाकर अन्य अग्रणी मॉडल के बराबर प्रदर्शन किया।


पेशेवर क्षेत्र में पदोन्नति भी कई दिशाओं में होती है। ईईबेंच स्कोर 53.0% से बढ़कर 64.0% हो गया, हार्वे लीगल एजेंट बेंचमार्क 15.8% से बढ़कर 19.6% हो गया, और हेल्थबेंच प्रोफेशनल 48.5% से बढ़कर 56.7% हो गया। ये परिणाम SpaceXAI द्वारा प्रकाशित एक आंतरिक तुलना तालिका से आए हैं, जो मॉडल की पुरानी और नई पीढ़ी के बीच परिवर्तनों को चित्रित कर सकता है; क्रॉस-मॉडल तुलनाएं अभी भी अनुमान की तीव्रता, उपकरण कॉन्फ़िगरेशन और परीक्षण वातावरण से प्रभावित होंगी।

परिणामों के इस सेट से एक स्पष्ट प्रवृत्ति का पता चलता है: अत्याधुनिक मॉडलों के लिए प्रतिस्पर्धा "पूरा काम पूरा करें" चरण में प्रवेश कर रही है।

मॉडल को कार्य को समझने, टूल को कॉल करने, फ़ाइलें तैयार करने और स्वयं की समीक्षा करने की आवश्यकता है। एकल प्रश्न और उत्तर क्षमता इसका केवल एक हिस्सा है। ग्रोक 4.7 प्रशिक्षण कार्य की अवधि बढ़ाता है और स्व-सत्यापन को मजबूत करता है, जो वास्तव में इस प्रकार के वर्कफ़्लो की भरपाई करता है।

सुरक्षा और कीमत

बेहतर क्षमताओं के अलावा, ग्रोक 4.7 ने एक नई सुरक्षा सुरक्षा प्रणाली सक्षम की है। स्पेसएक्सएआई ने कहा कि यह वह मॉडल है जिसे उसने जेलब्रेकिंग की प्रतिक्रिया और प्रतिरोध से इनकार करने के मामले में सबसे मजबूत प्रदर्शन के साथ परीक्षण किया है।

जैव सुरक्षा परीक्षण के मामले में, ग्रोक 4.7 62.4% के स्कोर के साथ लैचबायो बेंचमार्क में शीर्ष पर रहा। साइबर सुरक्षा परीक्षण हैकरबेंच v0.3 मुख्य रूप से उच्च जोखिम वाले और दुर्भावनापूर्ण कार्यों को कवर करता है। आधिकारिक आंकड़ों के अनुसार, मॉडल केवल 3.3% उच्च जोखिम वाले दोहरे उपयोग युक्तियाँ जारी करता है, और शायद ही कभी गलती से सामान्य सुरक्षा अनुसंधान अनुरोधों को अवरुद्ध करता है।

स्पेसएक्सएआई ने रक्षात्मक अनुसंधान के लिए सीमित संख्या में साइबर सुरक्षा भागीदारों के लिए केवल आमंत्रण वाली रेड टीम क्षमताओं को खोलना भी शुरू कर दिया है। वर्तमान में, यह रेड टीम क्षमता प्रारंभ में नियंत्रित सहयोग के रूप में उपलब्ध है।

मानक संस्करण मूल कीमत पर जारी है, और तेज़ संस्करण की गति दोगुनी हो गई है

ग्रोक 4.7 को कर्सर और ग्रोक बिल्ड पर लॉन्च किया गया है, और यह ग्रोक एपीआई, तृतीय-पक्ष प्रोग्रामिंग फ्रेमवर्क, मॉडल रूटिंग सेवाओं और क्लाउड प्लेटफ़ॉर्म के माध्यम से प्रदान किया गया है। ग्रोक 4.6 के अनुरूप, मानक संस्करण $2 प्रति मिलियन इनपुट टोकन और $6 प्रति मिलियन आउटपुट टोकन से शुरू होता है।

मूल्य रणनीति इस अपग्रेड को और अधिक प्रभावशाली बनाती है। डेवलपर्स को अपग्रेड करने के लिए अतिरिक्त मानक संस्करण टोकन लागत का भुगतान करने की आवश्यकता नहीं है, लेकिन वे मजबूत दीर्घकालिक कार्य प्रदर्शन, आत्म-परीक्षा क्षमता और पेशेवर कार्य परिणाम प्राप्त कर सकते हैं।

प्रोग्रामिंग एजेंटों और ज्ञान कार्य उत्पादों के लिए, प्रत्येक मॉडल कॉल की इकाई कीमत निश्चित रूप से महत्वपूर्ण है। किसी कार्य को पूरा करने के लिए आवश्यक प्रयासों और पुनः कार्य की संख्या अंततः वास्तविक लागत निर्धारित करती है।

अंत में इस अपग्रेड को संक्षेप में प्रस्तुत करें:

प्रशिक्षण विधियों से लेकर मूल्यांकन संयोजनों तक, ग्रोक 4.7 सभी एक ही चीज़ को पुष्ट करते हैं: लंबे समय तक कार्यों में बने रहना और जटिल कार्यों को पूरा करना। प्रोग्रामिंग केवल पहला परिपक्व प्रवेश बिंदु है। दस्तावेज़ीकरण, प्रस्तुति, कानूनी विश्लेषण, नैदानिक ​​तर्क और इंजीनियरिंग कार्यों को क्षमताओं के एक ही सेट में रखा गया है।

लेकिन नेटिज़न्स इसे खरीदते नहीं दिख रहे हैं। "यह मॉडल वास्तव में रिलीज़ होने का साहस करता है। यह इतना बुरा है कि इसे रिलीज़ नहीं किया जाना चाहिए।" मैं केवल सम्मानपूर्वक कह ​​सकता हूं कि इस बार ग्रोक 4.7 का विक्रय बिंदु प्रतिस्पर्धी उत्पादों को पूरी तरह से कुचलना नहीं है। यह एक एपीआई लागत का उपयोग करता है जो प्रदर्शन के बदले में कुछ प्रमुख मॉडलों की तुलना में बहुत कम है जो व्यक्तिगत पेशेवर कार्यों में काफी करीब और अग्रणी है।


संदर्भ लिंक:

https://x.ai/news/grok-4-7

https://x.com/ArtificialAnlys/status/2102074904560771365

संबंधित टैग

संबंधित लेख

एक्सएआई ने ग्रोक 4.7 जारी किया: प्रोग्रामिंग और ज्ञान कार्य में विशेषज्ञता, कीमत प्रतिस्पर्धी उत्पादों की तुलना में आधी हो गई है 2026-09-22 Apple और SpaceXAI के बीच गुप्त समझौते का विवरण अदालत द्वारा संरक्षित; OpenAI को समझौते की सामग्री की समीक्षा करने का कोई अधिकार नहीं है 2026-09-18 कोहेयर सीईओ: एआई मॉडल अब तक का "सबसे शक्तिशाली साइबर हथियार" बन रहे हैं 2026-09-15 स्पेसएक्स ने एआई डेटा सेंटर निर्माण को पुनर्गठित किया: बिजली आपूर्ति को मजबूत करने और अतिरेक को ठंडा करने से विस्तार की गति धीमी हो सकती है 2026-09-10 ओपनएआई ने कर्सर मॉडल के लिए समर्थन की समाप्ति की घोषणा की: स्पेसएक्स के कार्यभार संभालने के बाद चार साल का सहयोग 2026-08-29 सकल लाभ मार्जिन 50% से गिरकर -50% हो गया। अमेरिकी स्टार्टअप ओपनएआई और अन्य कंपनियों पर अपनी निर्भरता को प्रतिबिंबित करते हैं और चीनी मॉडल पर स्विच करते हैं 2026-09-22

टिप्पणियाँ

0/500
Captcha (click to refresh)
कोई टिप्पणी नहीं