सार:
OpenAI ने हाल ही में घोषणा की है कि GPT-Live-1, जो वर्तमान में ChatGPT वॉयस फ़ंक्शन के लिए उपयोग किया जाता है, आधिकारिक तौर पर डेवलपर्स के लिए खोला जाएगा। डेवलपर्स अब फुल-डुप्लेक्स वॉयस असिस्टेंट बनाने के लिए एपीआई के माध्यम से इस वॉयस मॉडल को अपने स्वयं के एप्लिकेशन और व्यावसायिक प्रक्रियाओं में एकीकृत कर सकते हैं जो वास्तविक समय में उपयोगकर्ताओं को सुन सकते हैं और उसी समय प्रतिक्रिया दे सकते हैं। इस मॉडल का वॉयस फ्रंट-एंड मूल्य US$0.05 प्रति मिनट है, और जटिल तर्क के लिए पृष्ठभूमि में उपयोग किए जाने वाले मॉडल को संबंधित मॉडल मूल्य के अनुसार अलग से बिल करने की आवश्यकता है।

GPT-Live-1 इस साल OpenAI द्वारा लॉन्च किया गया रीयल-टाइम स्पीच मॉडल की एक नई पीढ़ी है। इसकी सबसे बड़ी खासियत इसका फुल-डुप्लेक्स आर्किटेक्चर है। पारंपरिक आवाज एआई को आमतौर पर वाक् पहचान, भाषा मॉडल अनुमान और वाक् संश्लेषण के तीन चरणों को क्रम से पूरा करने की आवश्यकता होती है। उपयोगकर्ता के बोलने के बाद ही सिस्टम प्रोसेसिंग शुरू कर सकता है और उत्तर उत्पन्न कर सकता है। दूसरी ओर, जीपीटी-लाइव-1, उपयोगकर्ता की बात सुनते समय भाषण आउटपुट उत्पन्न कर सकता है, इसलिए यह रुकावट, ठहराव, गूँज और तेजी से आगे-पीछे की बातचीत को अधिक स्वाभाविक रूप से संभाल सकता है।
इसका मतलब है कि उपयोगकर्ताओं को बोलना जारी रखने से पहले एआई के पूरी तरह से बोलने के खत्म होने का इंतजार नहीं करना पड़ेगा। यदि उपयोगकर्ता अपना मन बदलता है, जानकारी जोड़ता है, या सीधे हस्तक्षेप करता है, तो GPT-Live-1 चल रही बातचीत के अनुसार समय पर अपने व्यवहार को समायोजित कर सकता है। मॉडल यह भी बता सकता है कि कब बात करते रहना है, कब रुकना है, कब सुनना है और कब टूल पर कॉल करना है।
ओपनएआई ने कहा कि यह आर्किटेक्चर वॉयस इंटरेक्शन में देरी को काफी हद तक कम कर सकता है और पारंपरिक "स्पीच रिकग्निशन + बड़े भाषा मॉडल + स्पीच सिंथेसिस" पाइपलाइन में वास्तविक बातचीत में होने वाली कनेक्शन समस्याओं को हल कर सकता है। चूंकि GPT-Live-1 स्वयं इनपुट और आउटपुट ऑडियो दोनों को संभालता है, डेवलपर्स को अब कई स्वतंत्र मॉडलों के बीच जटिल स्विचिंग को समन्वयित करने की आवश्यकता नहीं है।
ओपनएआई द्वारा प्रकाशित परीक्षण में, फुल डुप्लेक्स बेंच परीक्षण में जीपीटी-लाइव-1 का प्रदर्शन जीपीटी-रियलटाइम-2.1 की तुलना में 30 प्रतिशत अंक अधिक था, विशेष रूप से टर्न-टेकिंग देरी और इंटरैक्टिव व्यवहार के मामले में। जब मध्यम अनुमान तीव्रता पर GPT-6 एस्ट्रा के साथ जोड़ा गया, तो GPT-Live-1 ने भी Tau3 परीक्षण में पहला स्थान हासिल किया। Tau3 का उपयोग मुख्य रूप से एंड-टू-एंड कार्यों को पूरा करने के लिए वॉयस एजेंटों की क्षमता का मूल्यांकन करने के लिए किया जाता है।
GPT-Live-1 की एक और महत्वपूर्ण विशेषता यह है कि यह सभी जटिल तर्क कार्यों के लिए ज़िम्मेदार नहीं है। ओपनएआई वास्तविक समय में सुनने, बोलने और बातचीत के लिए जिम्मेदार भाषण मॉडल को गहन तर्क के लिए जिम्मेदार पृष्ठभूमि मॉडल से अलग करता है। जब उपयोगकर्ता ऐसे प्रश्न पूछते हैं जिनके लिए खोज, जटिल विश्लेषण या लंबे कार्यों की आवश्यकता होती है, तो GPT-Live-1 उपयोगकर्ता के साथ प्राकृतिक ध्वनि संचार बनाए रखते हुए इन कार्यों को पृष्ठभूमि मॉडल को सौंप सकता है।
इसलिए डेवलपर्स विशिष्ट व्यावसायिक आवश्यकताओं के आधार पर बैकएंड मॉडल चुनने के लिए स्वतंत्र हैं। उदाहरण के लिए, आरक्षण और ऑर्डर अपडेट जैसे बड़ी संख्या में सरल कार्यों के लिए, तेज़ और कम लागत वाले मॉडल का उपयोग किया जा सकता है; जटिल ग्राहक समस्याओं के लिए, उन्हें मजबूत अनुमान मॉडल द्वारा नियंत्रित किया जा सकता है। यह आर्किटेक्चर डेवलपर्स को प्रतिक्रिया, तर्क क्षमताओं और उपयोग की लागत के बीच संतुलन खोजने की अनुमति देता है।
OpenAI ने कहा कि यह डिकौपल्ड डिज़ाइन GPT-Live-1 को पृष्ठभूमि में कार्य करते समय उपयोगकर्ताओं के साथ संचार जारी रखने की अनुमति देता है, बजाय इसके कि उपयोगकर्ताओं को लंबे समय तक मौन प्रतीक्षा का सामना करना पड़े। मॉडल पृष्ठभूमि में अधिक जटिल कार्य पूरा करते हुए स्वाभाविक बातचीत जारी रख सकता है, फिर कार्य पूरा होने पर परिणामों को वर्तमान बातचीत में वापस ला सकता है।
व्यावहारिक अनुप्रयोग पहले से ही उभरने लगे हैं। ओपनएआई द्वारा प्रदर्शित शुरुआती उदाहरणों में येल्प होस्ट और हैच जैसी आवाज सेवाएं और भाषा सीखने का प्लेटफॉर्म स्पीक शामिल हैं। शुरुआती मूल्यांकन में स्पीक ने पाया कि पिछले टर्न-आधारित स्पीच सिस्टम की तुलना में, GPT-Live-1 भाषा सीखने वालों को सोचने के लिए अधिक समय दे सकता है, जिससे उपयोगकर्ताओं के लिए सिस्टम प्रोएक्टिव रुकावटों की संख्या लगभग 80% कम हो जाती है।
उद्यमों के लिए, यह क्षमता विशेष रूप से ग्राहक सेवा, टेलीफोन ग्राहक सेवा, आरक्षण और अन्य परिदृश्यों के लिए उपयुक्त है जिनके लिए निरंतर ध्वनि इंटरैक्शन की आवश्यकता होती है। GPT-Live-1 मूल रूप से फोन परिदृश्यों का समर्थन करता है, इसलिए डेवलपर्स इसका उपयोग पूर्ण-डुप्लेक्स वॉयस एजेंट बनाने के लिए कर सकते हैं जो फोन कॉल का जवाब दे सकते हैं और उन्हें संभाल सकते हैं, जैसे कि रेस्तरां आरक्षण, ग्राहक सहायता और अन्य व्यवसाय जिन्हें वास्तविक समय संचार की आवश्यकता होती है।
जीपीटी-लाइव-1 देशी स्वचालित वाक् पहचान लिखित पाठ और मॉडल प्रतिक्रिया पाठ भी प्रदान करता है, और कीवर्ड पूर्वाग्रह कार्यों का समर्थन करते हुए अल्फ़ान्यूमेरिक संयोजनों की समझ को बढ़ाता है। हालाँकि यह पारंपरिक अर्थों में टर्न-आधारित मॉडल नहीं है, फिर भी यह मूल रूप से टर्न डिटेक्शन का समर्थन करता है। इसलिए, यदि डेवलपर्स को स्पष्ट रूप से नियंत्रित करने की आवश्यकता है कि उपयोगकर्ता कब बोलना समाप्त करता है और सिस्टम कब उत्तर देना शुरू करता है, तब भी वे अपने एप्लिकेशन को स्पष्ट संवाद मोड़ के आसपास डिज़ाइन कर सकते हैं।
जीपीटी-लाइव-1 को शोर वाले पृष्ठभूमि वातावरण वाले दृश्यों के लिए भी अनुकूलित किया गया है। मॉडल उपयोगकर्ता के भाषण, पृष्ठभूमि शोर और मौन के बीच बेहतर अंतर कर सकता है। यह आस-पास के वातावरण में ध्वनियों के कारण बार-बार बातचीत में बाधा नहीं डालेगा, न ही यह उपयोगकर्ताओं को लगातार याद दिलाएगा कि वे कब संक्षेप में सोच रहे हैं। यह क्षमता वास्तविक दुनिया के वातावरण में फोन कॉल, ग्राहक सेवा और मोबाइल वॉयस सहायकों के लिए विशेष रूप से महत्वपूर्ण है।
OpenAI ने GPT-Live-1 के लिए उपलब्ध ध्वनि चयन का भी विस्तार किया है। पहले से उपलब्ध वास्तविक समय की अपेक्षाकृत सीमित संख्या की तुलना में, नया संस्करण अधिक विविध आवाजें प्रदान करता है और उच्चारण, बोलियों और भाषाओं की एक समृद्ध श्रृंखला को कवर करता है। OpenAI का कहना है कि वह आने वाले महीनों में उपलब्ध आवाज़ों और भाषाओं को जोड़ना जारी रखेगा।
मॉडल परिनियोजन के संदर्भ में, डेवलपर्स को सभी कार्यों को GPT-Live-1 को सौंपने की आवश्यकता नहीं है। ओपनएआई को पृष्ठभूमि मॉडल और एजेंट फ्रेमवर्क के माध्यम से अधिक जटिल काम करते हुए वास्तविक समय की आवाज बातचीत के लिए जिम्मेदार फ्रंट-एंड के रूप में उपयोग करने की उम्मीद है। यह दृष्टिकोण डेवलपर्स को विभिन्न कार्यों की वास्तविक आवश्यकताओं के अनुसार विभिन्न मॉडलों को संयोजित करने की भी अनुमति देता है।
उदाहरण के लिए, डेवलपर्स GPT-Live-1 को उपयोगकर्ता के वॉयस अनुरोध प्राप्त करने, स्वाभाविक बातचीत बनाए रखने और रुकावटों को संभालने के लिए जिम्मेदार बना सकते हैं, और फिर उन प्रश्नों को पृष्ठभूमि मॉडल पर सौंप सकते हैं जिनके लिए जटिल तर्क की आवश्यकता होती है; बैकग्राउंड मॉडल का काम पूरा होने के बाद, GPT-Live-1 परिणामों को प्राकृतिक ध्वनि उत्तरों में बदल देता है। यह तंत्र उन अनुप्रयोगों पर भी लागू होता है जिन्हें बाहरी टूल को कॉल करने की आवश्यकता होती है।
OpenAI ने यह भी प्रदर्शित किया कि GPT-Live-1 को कोडेक्स जैसे टूल के साथ कैसे संयोजित किया जाए। डेवलपर्स स्पीच मॉडल को उपयोगकर्ता द्वारा प्रस्तावित कार्यों को प्राप्त करने दे सकते हैं, फिर प्रसंस्करण के लिए प्रासंगिक संदर्भ को कोडेक्स जैसे पृष्ठभूमि टूल में स्थानांतरित कर सकते हैं, और फिर प्रसंस्करण परिणामों को जीपीटी-लाइव-1 पर लौटा सकते हैं, जो आवाज के माध्यम से उपयोगकर्ता के साथ संचार करना जारी रखेगा।
कीमत के संदर्भ में, GPT-Live-1 अब आधिकारिक तौर पर OpenAI API के माध्यम से उपलब्ध है, और वॉयस फ्रंट-एंड शुल्क $0.05 प्रति मिनट है। यह ध्यान रखना महत्वपूर्ण है कि यह केवल वास्तविक समय वॉयस टियर की लागत है। यदि डेवलपर GPT-Live-1 को पृष्ठभूमि अनुमान मॉडल से लैस करता है, तो पृष्ठभूमि मॉडल को कॉल करने की लागत की गणना संबंधित मॉडल मूल्य निर्धारण के आधार पर अलग से की जानी चाहिए।
इसका मतलब है कि उन व्यावसायिक अनुप्रयोगों के लिए जिन्हें बड़ी संख्या में वॉयस कॉल की आवश्यकता होती है, वास्तविक लागत केवल $0.05 प्रति मिनट नहीं है, बल्कि वॉयस कनेक्शन समय और पृष्ठभूमि मॉडल की अनुमान खपत से बनी है। हालाँकि, डेवलपर्स अलग-अलग बैक-एंड मॉडल चुनकर कार्य की जटिलता के अनुसार समग्र लागत को नियंत्रित कर सकते हैं।
GPT-Live-1 के खुलने का मतलब यह भी है कि OpenAI उपभोक्ता उत्पादों से लेकर डेवलपर इकोसिस्टम तक ChatGPT वॉयस मोड के पीछे की मुख्य तकनीक का विस्तार कर रहा है। पहले, GPT-Live-1 मुख्य रूप से ChatGPT की वॉयस इंटरेक्शन क्षमता के रूप में मौजूद था। अब डेवलपर्स अपने स्वयं के वॉयस एप्लिकेशन और एजेंट बनाने के लिए सीधे समान तकनीकों का उपयोग कर सकते हैं।
तकनीकी दृष्टिकोण से, ओपनएआई को उम्मीद है कि जीपीटी-लाइव-1 न केवल "एआई को बोलने में सक्षम बनाने" का समाधान करेगा, बल्कि एआई को वास्तव में निरंतर, वास्तविक समय और रुकावट वाली प्राकृतिक बातचीत में भाग लेने में सक्षम करेगा। सुनने, बोलने, वास्तविक समय की बातचीत और गहन तर्क को विभाजित करके, ओपनएआई एक ही समय में कम आवाज विलंबता, अधिक प्राकृतिक वार्तालाप अनुभव और मजबूत पृष्ठभूमि कार्य प्रसंस्करण क्षमताओं को प्राप्त करने का प्रयास करता है।
जैसे-जैसे वॉयस एजेंट धीरे-धीरे सरल वॉयस प्रश्न और उत्तर से जटिल कार्यों जैसे टेलीफोन ग्राहक सेवा, आरक्षण, भाषा शिक्षा, व्यवसाय प्रसंस्करण और कार्यों को पूरा करने के लिए स्वायत्त रूप से कॉल टूल की क्षमता की ओर स्थानांतरित हो रहे हैं, वास्तविक समय के भाषण मॉडल का महत्व भी बढ़ रहा है। GPT-Live-1 के ओपन एपीआई का मतलब है कि डेवलपर्स अब ChatGPT द्वारा उपयोग की जाने वाली वास्तविक समय की वॉयस तकनीक की वर्तमान पीढ़ी को सीधे अपने उत्पादों में एम्बेड कर सकते हैं, और US$0.05 प्रति मिनट की वॉयस लेयर कीमत भी इस क्षमता को आधिकारिक तौर पर वाणिज्यिक अनुप्रयोग चरण में प्रवेश करने की अनुमति देती है।
टिप्पणियाँ