मेटा के एक कार्यकारी ने सोमवार को उन अफवाहों का खंडन किया कि कंपनी ने मॉडल की कमजोरियों को छिपाते हुए अपने नए एआई मॉडल को विशिष्ट बेंचमार्क पर अच्छा प्रदर्शन करने के लिए प्रशिक्षित किया है। मेटा के जेनेरिक एआई के उपाध्यक्ष अहमद अल-दहले ने एक्स पर एक लेख में कहा, मेटा अपने Llama4Maverick और Llama4Scout मॉडल को "परीक्षण सेट" पर प्रशिक्षित करता है"यह बिल्कुल सच नहीं है।"

एआई बेंचमार्किंग में, एक परीक्षण सेट डेटा का एक संग्रह है जिसका उपयोग प्रशिक्षण के बाद किसी मॉडल के प्रदर्शन का मूल्यांकन करने के लिए किया जाता है। परीक्षण सेट पर प्रशिक्षण किसी मॉडल के बेंचमार्क स्कोर को भ्रामक रूप से बढ़ा सकता है, जिससे मॉडल वास्तव में जितना है उससे अधिक शक्तिशाली दिखाई देता है।

सप्ताहांत में, एक्स और रेडिट पर एक अपुष्ट अफवाह फैलने लगी कि मेटा अपने नए मॉडल के बेंचमार्क परिणामों को कृत्रिम रूप से बढ़ा रहा है। ऐसा प्रतीत होता है कि यह अफवाह चीनी सोशल मीडिया साइट पर एक उपयोगकर्ता द्वारा लिखी गई पोस्ट से उत्पन्न हुई है, जिसने कंपनी की बेंचमार्किंग प्रथाओं के विरोध में मेटा से इस्तीफा देने का दावा किया था।

रिपोर्ट में कहा गया है कि मेवरिक और स्काउट ने कुछ कार्यों में खराब प्रदर्शन किया, जिससे अफवाहों को हवा मिली, साथ ही बेंचमार्क एलएमएरेना पर बेहतर स्कोर हासिल करने के लिए मेवरिक के एक अप्रकाशित प्रयोगात्मक संस्करण का उपयोग करने के मेटा के निर्णय ने भी अफवाहों को हवा दी। एक्स पर शोधकर्ताओं ने सार्वजनिक रूप से डाउनलोड करने योग्य मावेरिक और एलएमएरेना पर होस्ट किए गए मॉडलों के व्यवहार के बीच स्पष्ट अंतर देखा। 

अल-दहले ने स्वीकार किया कि कुछ उपयोगकर्ताओं ने मेवरिक और स्काउट की गुणवत्ता को होस्टिंग मॉडल के विभिन्न क्लाउड प्रदाताओं के बीच "भिन्न" पाया है।

अल-दहले ने कहा, "चूंकि हम मॉडल तैयार होते ही उन्हें हटा देते हैं, इसलिए हम उम्मीद करते हैं कि सभी सार्वजनिक कार्यान्वयन को पूरा होने में कई दिन लगेंगे।" "हम बग्स को ठीक करने और साझेदारों को शामिल करने के लिए कड़ी मेहनत करना जारी रखेंगे।"

संबंधित आलेख:

Llama4 ने 36 घंटे की नकारात्मक समीक्षाओं की बाढ़ जारी की। अज्ञात कर्मचारियों ने इस खबर को तोड़ दिया और तकनीकी रिपोर्ट पर हस्ताक्षर करने से इनकार कर दिया।क्या Llama4 ओपन सोर्स मॉडल का पूर्ण प्रतिगमन है?