सार:
आज सुबह, SpaceXAI का सबसे शक्तिशाली मॉडल, ग्रोक 4.7, आया। रिलीज़ पृष्ठ की शुरुआत में केवल एक बहुत ही "आक्रामक" स्थिति है: प्रोग्रामिंग और ज्ञान कार्य के लिए सबसे शक्तिशाली मॉडल, तुलनीय मॉडल से दोगुना तेज़ और केवल आधी कीमत।

यह अपग्रेड बेंचमार्क पर नहीं रुकता। ग्रोक 4.7 एक बड़े बुनियादी मॉडल पर स्विच करता है, दीर्घकालिक कार्यों, आत्म-परीक्षा और दीर्घकालिक-संदर्भ प्रबंधन क्षमताओं को मजबूत करता है, और प्रमुख परीक्षणों में दस्तावेज़, प्रस्तुतियाँ, कानूनी, चिकित्सा और इंजीनियरिंग और अन्य पेशेवर कार्य शामिल करता है। यह जिस परिदृश्य को लक्षित करता है वह बहुत स्पष्ट है: मॉडल को कई घंटों तक चलने वाले कार्यों में रुकावटों से बचने और सीधे उपयोग किए जा सकने वाले परिणाम देने की अनुमति देता है।

मस्क ने ट्वीट किया, "ग्रोक 4.7 खुफिया स्तर, परिचालन गति और लागत के बीच एक बहुत ही प्रतिस्पर्धी संतुलन हासिल करता है।"

लंबे मिशन इस पीढ़ी के मॉडलों का मुख्य युद्धक्षेत्र बन गए हैं
ग्रोक 4.7, ग्रोक 4.6 की तुलना में बड़े बेस मॉडल का उपयोग करता है। प्रशिक्षण चरण सुदृढीकरण सीखने की अवधि को बढ़ाता है और कार्य संयोजन अधिक कठिन हो जाता है, अधिक नमूनों को पूरा करने में घंटों लगते हैं। स्पेसएक्सएआई ने कहा कि नए मॉडल ने अपने काम का निरीक्षण करने और लंबे संदर्भों को प्रबंधित करने की क्षमता में सुधार किया है।
इस प्रकार का सुधार सीधे तौर पर वर्तमान प्रोग्रामिंग बुद्धिमान एजेंटों की सबसे कठिन समस्याओं से मेल खाता है। शॉर्ट कोड जेनरेशन के लिए अक्सर केवल आंशिक निर्णय की आवश्यकता होती है, लेकिन वास्तव में जटिल सॉफ़्टवेयर कार्यों में वेयरहाउस को पढ़ना, आवश्यकताओं को नष्ट करना, कई फ़ाइलों को संशोधित करना, परीक्षण चलाना और बार-बार त्रुटि सुधार शामिल हैं। क्या मॉडल लक्ष्यों को बनाए रख सकता है और लंबी निष्पादन श्रृंखला में त्रुटियों का पता लगा सकता है या नहीं, यह अक्सर एक बार में सुंदर कोड लिखने से अधिक महत्वपूर्ण होता है।
कर्सरबेंच 4.0 विशेष रूप से दीर्घकालिक कोडिंग कार्यों की जांच करता है। आधिकारिक आंकड़ों में, ग्रोक 4.7 ने 46.3% स्कोर किया और ग्रोक 4.6 ने 40.4% स्कोर किया, जो 5.9 प्रतिशत अंक की वृद्धि है। डीपएसडब्ल्यूई v1.1 पर, ग्रोक 4.7 का उच्च-अनुमान तीव्रता स्कोर 71.0% था; टर्मिनल-बेंच 4.0 पिछली पीढ़ी के 20.3% से बढ़कर 38.0% हो गया।
तदनुसार, ग्रोक 4.7 को कर्सरबेंच 4.0 पर अत्याधुनिक कीमत और प्रदर्शन मॉडल कहा जाता है।

मॉडल को उस ढांचे को मूल रूप से समझने के लिए भी प्रशिक्षित किया गया है जिसके भीतर ग्रोक बॉट चलता है। आधिकारिक तौर पर, यह समायोजन संवाद कार्यों और सामान्य ज्ञान कार्यों पर प्रदर्शन में सुधार करता है। दूसरे शब्दों में, ग्रोक 4.7 का अपग्रेड फोकस उत्तरों के एक दौर से लेकर मॉडल, टूल और निष्पादन वातावरण के बीच निरंतर सहयोग तक बढ़ गया है।
कोड लिखने से लेकर संपूर्ण ज्ञान कार्य तक
प्रोग्रामिंग अभी भी ग्रोक 4.7 का सबसे आकर्षक लेबल है, लेकिन स्पेसएक्सएआई द्वारा दिए गए मूल्यांकन का दायरा काफी व्यापक है। एए ब्रीफ़केस और जीडीपीवल उस बहु-चरणीय कार्य पर ध्यान केंद्रित करते हैं जिसे पेशेवर हर दिन पूरा करते हैं, जिसमें वकील, नर्स और वित्तीय विश्लेषक जैसे पदों पर सामान्य कार्यों के साथ-साथ दस्तावेज़ और प्रस्तुति उत्पादन भी शामिल होता है।
एए ब्रीफ़केस v1.1 पर, ग्रोक 4.7 ने 1657 अंक बनाए, जो ग्रोक 4.6 के 1546 अंक से अधिक है; जीडीपीवल एलो स्कोर 1605 से बढ़कर 1695 हो गया। आधिकारिक चार्ट में, यह जीडीपीवल पर फैबल 5.1 के 1735 अंक के करीब है और जीपीटी-6 एस्ट्रा के 1542 अंक से अधिक है। स्पेसएक्सएआई ने निष्कर्ष निकाला कि ग्रोक 4.7 ने दोनों परीक्षणों में पिछली पीढ़ी से बेहतर प्रदर्शन किया और कुल मिलाकर अन्य अग्रणी मॉडल के बराबर प्रदर्शन किया।

पेशेवर क्षेत्र में पदोन्नति भी कई दिशाओं में होती है। ईईबेंच स्कोर 53.0% से बढ़कर 64.0% हो गया, हार्वे लीगल एजेंट बेंचमार्क 15.8% से बढ़कर 19.6% हो गया, और हेल्थबेंच प्रोफेशनल 48.5% से बढ़कर 56.7% हो गया। ये परिणाम SpaceXAI द्वारा प्रकाशित एक आंतरिक तुलना तालिका से आए हैं, जो मॉडल की पुरानी और नई पीढ़ी के बीच परिवर्तनों को चित्रित कर सकता है; क्रॉस-मॉडल तुलनाएं अभी भी अनुमान की तीव्रता, उपकरण कॉन्फ़िगरेशन और परीक्षण वातावरण से प्रभावित होंगी।
परिणामों के इस सेट से एक स्पष्ट प्रवृत्ति का पता चलता है: अत्याधुनिक मॉडलों के लिए प्रतिस्पर्धा "पूरा काम पूरा करें" चरण में प्रवेश कर रही है।
मॉडल को कार्य को समझने, टूल को कॉल करने, फ़ाइलें तैयार करने और स्वयं की समीक्षा करने की आवश्यकता है। एकल प्रश्न और उत्तर क्षमता इसका केवल एक हिस्सा है। ग्रोक 4.7 प्रशिक्षण कार्य की अवधि बढ़ाता है और स्व-सत्यापन को मजबूत करता है, जो वास्तव में इस प्रकार के वर्कफ़्लो की भरपाई करता है।
सुरक्षा और कीमत
बेहतर क्षमताओं के अलावा, ग्रोक 4.7 ने एक नई सुरक्षा सुरक्षा प्रणाली सक्षम की है। स्पेसएक्सएआई ने कहा कि यह वह मॉडल है जिसे उसने जेलब्रेकिंग की प्रतिक्रिया और प्रतिरोध से इनकार करने के मामले में सबसे मजबूत प्रदर्शन के साथ परीक्षण किया है।
जैव सुरक्षा परीक्षण के मामले में, ग्रोक 4.7 62.4% के स्कोर के साथ लैचबायो बेंचमार्क में शीर्ष पर रहा। साइबर सुरक्षा परीक्षण हैकरबेंच v0.3 मुख्य रूप से उच्च जोखिम वाले और दुर्भावनापूर्ण कार्यों को कवर करता है। आधिकारिक आंकड़ों के अनुसार, मॉडल केवल 3.3% उच्च जोखिम वाले दोहरे उपयोग युक्तियाँ जारी करता है, और शायद ही कभी गलती से सामान्य सुरक्षा अनुसंधान अनुरोधों को अवरुद्ध करता है।
स्पेसएक्सएआई ने रक्षात्मक अनुसंधान के लिए सीमित संख्या में साइबर सुरक्षा भागीदारों के लिए केवल आमंत्रण वाली रेड टीम क्षमताओं को खोलना भी शुरू कर दिया है। वर्तमान में, यह रेड टीम क्षमता प्रारंभ में नियंत्रित सहयोग के रूप में उपलब्ध है।
मानक संस्करण मूल कीमत पर जारी है, और तेज़ संस्करण की गति दोगुनी हो गई है
ग्रोक 4.7 को कर्सर और ग्रोक बिल्ड पर लॉन्च किया गया है, और यह ग्रोक एपीआई, तृतीय-पक्ष प्रोग्रामिंग फ्रेमवर्क, मॉडल रूटिंग सेवाओं और क्लाउड प्लेटफ़ॉर्म के माध्यम से प्रदान किया गया है। ग्रोक 4.6 के अनुरूप, मानक संस्करण $2 प्रति मिलियन इनपुट टोकन और $6 प्रति मिलियन आउटपुट टोकन से शुरू होता है।
मूल्य रणनीति इस अपग्रेड को और अधिक प्रभावशाली बनाती है। डेवलपर्स को अपग्रेड करने के लिए अतिरिक्त मानक संस्करण टोकन लागत का भुगतान करने की आवश्यकता नहीं है, लेकिन वे मजबूत दीर्घकालिक कार्य प्रदर्शन, आत्म-परीक्षा क्षमता और पेशेवर कार्य परिणाम प्राप्त कर सकते हैं।
प्रोग्रामिंग एजेंटों और ज्ञान कार्य उत्पादों के लिए, प्रत्येक मॉडल कॉल की इकाई कीमत निश्चित रूप से महत्वपूर्ण है। किसी कार्य को पूरा करने के लिए आवश्यक प्रयासों और पुनः कार्य की संख्या अंततः वास्तविक लागत निर्धारित करती है।
अंत में इस अपग्रेड को संक्षेप में प्रस्तुत करें:
प्रशिक्षण विधियों से लेकर मूल्यांकन संयोजनों तक, ग्रोक 4.7 सभी एक ही चीज़ को पुष्ट करते हैं: लंबे समय तक कार्यों में बने रहना और जटिल कार्यों को पूरा करना। प्रोग्रामिंग केवल पहला परिपक्व प्रवेश बिंदु है। दस्तावेज़ीकरण, प्रस्तुति, कानूनी विश्लेषण, नैदानिक तर्क और इंजीनियरिंग कार्यों को क्षमताओं के एक ही सेट में रखा गया है।
लेकिन नेटिज़न्स इसे खरीदते नहीं दिख रहे हैं। "यह मॉडल वास्तव में रिलीज़ होने का साहस करता है। यह इतना बुरा है कि इसे रिलीज़ नहीं किया जाना चाहिए।" मैं केवल सम्मानपूर्वक कह सकता हूं कि इस बार ग्रोक 4.7 का विक्रय बिंदु प्रतिस्पर्धी उत्पादों को पूरी तरह से कुचलना नहीं है। यह एक एपीआई लागत का उपयोग करता है जो प्रदर्शन के बदले में कुछ प्रमुख मॉडलों की तुलना में बहुत कम है जो व्यक्तिगत पेशेवर कार्यों में काफी करीब और अग्रणी है।

संदर्भ लिंक:
https://x.ai/news/grok-4-7
https://x.com/ArtificialAnlys/status/2102074904560771365
टिप्पणियाँ