सार:
यह पागलपन है. सिर्फ दो दिनों में सामने आए 4 नए मॉडल! फ्रंटफुट पर, लाओ मा के xAI ने अभी-अभी ग्रोक 4.7 जारी करना समाप्त किया है। इसके तुरंत बाद, OpenAI ने अचानक GPT-6 Sol और Luna को हटा दिया, और कीमत आधी कर दी गई। उसी दिन, एंथ्रोपिक ने क्लाउड ओपस 5.5 को भी मेज पर रखा, जो पिछली पीढ़ी की तुलना में 40% सस्ता है। 22 सितंबर को, एक एनिमेटेड तस्वीर एक्स पर वायरल हो गई, जिसे लगभग दस लाख बार देखा गया।

2023 में, बड़े मॉडल हर 73 दिनों में अपडेट किए जाएंगे, और 2026 में, उन्हें हर 18 दिनों में अपडेट किया जाएगा।
चैटजीपीटी लॉन्च होने के बाद से, ओपनएआई और एंथ्रोपिक ने 42 ब्लॉकबस्टर मॉडल पेश किए हैं (उस दिन जारी जीपीटी-6 सोल और लूना सहित 44)।
कुछ घंटों बाद, स्टेबिलिटी एआई के संस्थापक इमाद मोस्ताक ने तस्वीर को रीट्वीट किया और एक भविष्यवाणी जोड़ी।
"जैसा कि एलेक्स ने कहा, इस दर पर, अगले साल की शुरुआत में एक दिन होगा।"

दो दिग्गज कंपनियों ने "अर्धमासिक अपडेट" जारी किया
वास्तव में, "हर 18 दिन में अपडेट" की संख्या काफी रूढ़िवादी है, क्योंकि यह केवल ओपनएआई और एंथ्रोपिक की गणना करती है।
इस साल की शुरुआत से 22 सितंबर तक, एंथ्रोपिक ने 8 फ्लैगशिप मॉडल जारी किए, और ओपनएआई ने 6 जारी किए। 14 मॉडल 265 दिनों में फैले हुए थे, प्रति मॉडल औसतन 19 दिन।
इसी अवधि के दौरान, दस प्रमुख घरेलू बड़े मॉडल निर्माताओं ने कम से कम 28 और प्रमुख मॉडल जारी किए, जो औसतन हर 9 दिन में एक से अधिक है।
कई बार ऐसा हुआ जब उन्होंने एक साथ लॉन्च किया। वसंत महोत्सव से पहले सप्ताह में, चार कंपनियों ने एक के बाद एक नए फ्लैगशिप लॉन्च किए; 20 अप्रैल से 24 अप्रैल तक, पांच दिनों में चार और कंपनियों ने कारोबार किया।
दोनों पक्षों को एक साथ लेने पर, एक नया फ्लैगशिप औसतन 6 दिनों से अधिक समय में सामने आता है, जो इमाद द्वारा उल्लिखित "एक दिन में एक" से बहुत दूर नहीं है।

एंथ्रोपिक की गति में वृद्धि नग्न आंखों से दिखाई देती है।
साल की पहली छमाही में, एक मॉडल को रिलीज़ करने में औसतन 46 दिन लगते थे, और साल की दूसरी छमाही में, इसमें 26 दिन लगते थे। ओपस 4.8 28 मई को है, ओपस 5 24 जुलाई को है, और ओपस 5.5 22 सितंबर को है।
ओपनएआई "अंतिम कदम को रोकने और फिर उसे दूर ले जाने" का मार्ग अपनाता है।
जीपीटी-6 एस्ट्रा ने 3 सितंबर को पूरे नेटवर्क को उड़ा दिया, और केवल 19 दिन बाद, सोल और लूना ने भी ऐसा ही किया।
अगले सप्ताह देवडे सम्मेलन होगा। ऑल्टमैन ने अफसोस जताया कि यह उनकी स्मृति में पहली बार है कि ओपनएआई ने एक प्रेस कॉन्फ्रेंस की तैयारी करते समय चिल्लाया "जारी करने के लिए बहुत सारी चीजें हैं"।

प्रकाशन अधिक से अधिक सघन क्यों होता जा रहा है? इसका जवाब एंथ्रोपिक ने एक रिपोर्ट में दिया. AI पहले से ही AI की अगली पीढ़ी बनाने में मदद कर रहा है।
इस साल फरवरी में, क्लाउड स्वतंत्र रूप से AI R&D कार्य के 1% से भी कम का नेतृत्व कर सका। उसके बाद, लगभग हर महीने इसमें सुधार हुआ, मई में 12%, जुलाई में 22% और अगस्त में 26% तक पहुंच गया।

ओपनएआई में, अगस्त के मध्य तक, एआई एजेंटों द्वारा निवेश किए गए कार्य दिवसों की संख्या मानव शोधकर्ताओं की तुलना में 3.1 गुना अधिक है (प्रति दिन 8 घंटे के आधार पर)।
एंथ्रोपिक में मॉडल बनाने का एक चौथाई काम क्लाउड को ही सौंपा गया है। अगले मॉडल एक के बाद एक आते रहेंगे।
कतार पहले ही दरवाजे तक पहुंच चुकी है। एंथ्रोपिक के माइक क्राइगर ने खुलासा किया है कि सॉनेट 5.5 और हाइकू 5.5 अगले कुछ हफ्तों में आएंगे।

Google के जेमिनी 4 ने जुलाई की शुरुआत में "अब तक का सबसे महत्वाकांक्षी प्री-ट्रेनिंग" शुरू कर दी थी, और बाहरी दुनिया आम तौर पर शर्त लगा रही है कि इसे साल के अंत के आसपास पेश किया जाएगा। कम से कम दो घरेलू कंपनियों ने आधिकारिक तौर पर अपनी अगली पीढ़ी के फ्लैगशिप की घोषणा की है, केवल एक रिलीज की तारीख गायब है।
कड़ी मेहनत से अर्जित "तत्वमीमांसा"
दो महीने बाद इसे तुरंत खत्म कर दिया जाएगा
बड़ा मॉडल जितना तेज़ चलता है, डाउनस्ट्रीम में कोड लिखने वाले लोगों के लिए यह उतना ही अधिक शर्मनाक हो जाता है।
आप जुलाई के अंत में पूरी रात जागते रहे और एप्लिकेशन को ओपस 5 में स्थानांतरित कर दिया। प्रत्येक पैरामीटर को रेशम की तरह आसानी से समायोजित किया गया है। दो महीने बाद, ओपस 5.5 सामने आया, और आपने ख़ुशी से इंटरफ़ेस बदल दिया - क्लिक करें, और कुछ अनुरोधों ने सीधे त्रुटियों की सूचना दी।
इन दोनों कंपनियों के हालिया आधिकारिक प्रॉम्प्ट वर्ड गाइड को देखने पर आप पाएंगे कि वे एक ही तथ्य बता रहे हैं। पिछली पीढ़ी के मॉडल के लिए आपके द्वारा लिखे गए कई पैतृक संकेत बेकार कागज बन गए हैं।
पहला काम है घटाव करना.
ओपनएआई ने एस्ट्रा गाइड में स्पष्ट रूप से कहा है कि प्रक्रिया निर्देश जो अतीत में बहुत विस्तृत थे, अब बाधा बनेंगे। "कोड बदलने से पहले दस्तावेज़ को अच्छी तरह से पढ़ें" और "परीक्षण चलाना याद रखें" जैसे शब्द हटाए जा सकते हैं।

एंथ्रोपिक गाइड का मतलब भी यही है.
अतीत में, शीघ्र शब्दों में अक्सर "पूरा होने के बाद इसे जांचें" वाक्य जोड़ना पड़ता था, लेकिन ओपस 5 पहले से ही इसे स्वयं जांच सकता है। यदि इस वाक्य को नहीं हटाया गया तो यह ओवर-चेक हो जाएगा।
ओपस 5.5 में, चैट दृश्य में पीयूए वाक्यांश "उत्तर देने से पहले सावधानी से सोचें" को हटाने की सिफारिश की गई है। इसे हटाने के बाद, उत्तर तेज़ है और गुणवत्ता में कोई खास गिरावट नहीं आई है।
पुराने को हटाने के बाद आपको नए जोड़ने होंगे, क्योंकि हर पीढ़ी का एक नया स्वभाव होता है।
ओपस 5.5 हमेशा पीछे जाकर उन प्रश्नों के बारे में सोचना पसंद करता है जिनका उत्तर कई दौर की बातचीत के दौरान पहले ही दिया जा चुका है, जो कंप्यूटिंग शक्ति की बर्बादी है। आधिकारिक पैच दिया गया है, "जिसका उत्तर दिया गया वह अतीत है।"

पैरामीटर और डिफ़ॉल्ट मान भी चुपचाप बदल रहे हैं।
ओपस 5.5 पर, थिंकिंग मोड को बंद करने से सीधे त्रुटि 400 की सूचना मिलती है; प्रयास पैरामीटर लिखे बिना, डिफ़ॉल्ट गियर को उच्च से मध्यम तक कम कर दिया जाता है, और लागत और प्रभाव को तदनुसार बदल दिया जाता है।
इस संबंध में, आधिकारिक सुझाव प्रयास परीक्षण को फिर से चलाने और ओपस 5 से पुरानी सेटिंग्स को सीधे स्थानांतरित नहीं करने का है।
संकेत शब्दों का एक सेट और मापदंडों का एक सेट, प्रत्येक पीढ़ी को त्वचा की परतों को छीलना पड़ता है। यदि समायोजन नहीं किया गया है, तो बिल में काफी भिन्नता हो सकती है।
एंथ्रोपिक के लांस मार्टिन ने वीडियो में प्रदर्शित किया कि ओपस 4.8 के लिए लिखे गए एक पुराने प्रॉम्प्ट की लागत प्रति कार्य ऑर्डर 2.45 सेंट है, और इसे सीधे ओपस 5.5 के साथ बदलने में 2.02 सेंट की लागत आती है। आधिकारिक उपकरणों से इसे दोबारा धोने के बाद, सटीकता दर बढ़कर 92.0% हो गई और लागत घटकर 1.83 सेंट हो गई।

इनके अलावा, मॉडल का जीवनकाल भी छोटा हो जाता है।
OpenAI ने इस वर्ष 9 अवमूल्यन घोषणाएँ जारी की हैं, जिनमें 40 से अधिक मॉडल और फ़ंक्शन शामिल हैं।
उनमें से, GPT-5.5, जो अभी 23 अप्रैल को जारी किया गया था, 14 अक्टूबर को ChatGPT और कोडेक्स से हटा दिया जाएगा, और आधे साल से भी कम समय तक जीवित रहेगा।
यहां तक कि OpenAI का अपना Evals मूल्यांकन प्लेटफ़ॉर्म भी नवंबर के अंत में बंद हो जाएगा।

सूची को ब्रश करें? आधे साल में परीक्षण प्रश्नों का एक नया सेट तैयार किया गया
इससे कोई फर्क नहीं पड़ता कि लोग साथ नहीं रख सकते, अब "परीक्षा पत्र" भी पर्याप्त नहीं हैं।
इस साल मार्च में, ARC-AGI-3 लॉन्च किया गया, जो AI में विशेषज्ञता और सवालों को याद किए बिना IQ का परीक्षण करने का दावा करता है। जेमिनी 3.1 प्रो, जो उस समय पहले स्थान पर था, को केवल 0.37% मिला, जबकि मनुष्यों को 100% मिला।
3 सितंबर को, जीपीटी-6 एस्ट्रा ने मानक परीक्षण में 62.7% स्कोर करते हुए परीक्षा कक्ष में प्रवेश किया, और एक विशिष्ट ढांचे का उपयोग करने पर सीधे 99.9% तक पहुंच गया। 96% स्तरों पर इसने मनुष्य की तुलना में कम कदम उठाए।

परीक्षण प्रश्नों का एक नया सेट आधे साल में टूट गया था, और एआरसी अधिकारियों ने इस बारे में सोचना शुरू कर दिया है कि अगली पीढ़ी के मूल्यांकन कैसे तैयार किए जाएं।
कोडिंग सूची (नेक्स्ट.जेएस) पर, सोल, ओपस 5.5 और फैबल 5.1 सभी ने 97% स्कोर किया, पहले स्थान पर रहे; लेखन सूची में, ओपस 5.5 फॉल्ट 307 अंकों से दूसरे स्थान पर है।
यह स्कोर सूची के इतिहास में सबसे बड़ी एकल छलांग है। ब्लॉगर ने इसे पढ़ने के बाद कहा कि यह अपमानजनक था, और लगभग उसे लगा कि उसके अपने बेंचमार्क में ही कोई बग है!

हर बार जब कोई नया मॉडल आता है, तो डेवलपर्स को सिसिफ़स की तरह परीक्षण प्रक्रिया फिर से शुरू करनी पड़ती है।
मौजूदा गति के अनुसार, यदि अगले वर्ष यह वास्तव में "दिन में एक अपडेट" के बिंदु तक पहुंचता है, तो आपके द्वारा आज समायोजित किए गए त्वरित शब्द और एजेंट लिंक एक सप्ताह से अधिक नहीं चल सकते हैं।
पहली बार, मॉडल प्रतिस्थापन की गति इसे अपनाने वाले मनुष्यों की गति से पूरी तरह से अधिक हो गई है।
आजकल के सबसे धीमे धावक वास्तव में एआई का उपयोग करने वाले लोग हैं।
टिप्पणियाँ