कृत्रिम बुद्धिमत्ता
Apple का दावा है कि उसका ReALM क्षमताओं में GPT-4 से बेहतर है

Claude 3 Opus recently GPT 4 को पदच्युत किया as the most advanced LLM. Meanwhile, researchers at Apple (AAPL ) unveiled ReALM, shortly after the समाचार that Google’s Gemini is powering the iPhone made headlines. The research paper, titled “ReALM: Reference Resolution As Language Modeling,” touts it as a cutting-edge AI system that promises to redefine how voice assistants understand and respond to user queries.
ReALM और अन्य प्रणालियों के बीच अंतर इसका संदर्भ समाधान को भाषा समझ के ताने-बाने में सहजता से बुनने में निहित है। यह वर्तमान बड़े भाषा मॉडल-आधारित प्रणालियों के डिजाइन को देखते हुए एक नवाचारी दृष्टिकोण है, और यह मॉडल की संदर्भ समझ को बढ़ाने में मदद करता है जबकि AI और ग्राफिकल यूज़र इंटरफ़ेस के बीच इंटरैक्शन के लिए एक नया मानक स्थापित करता है।
शोध परिणामों के आधार पर, यह LLM इंजीनियरों और AI टूल प्रोडक्ट मैनेजर्स को अधिक सहज और संदर्भ-सचेत उपयोगकर्ता इंटरैक्शन हासिल करने में मदद करने के लिए तैयार है। ReALM टेक्स्टुअल इनपुट को विज़ुअल कॉन्टेक्स्ट के साथ एकीकृत करने को भी सुगम बनाता है, जिससे कई अनुप्रयोगों में डिजिटल असिस्टेंट कौशल को सुधारने की संभावनाएं बढ़ती हैं।
ReALM का नवाचारी दृष्टिकोण NLP रेफ़रेंस रिज़ॉल्यूशन में
सभी NLP प्रणालियां “रेफ़रेंस रिज़ॉल्यूशन” पर निर्भर करती हैं, जो एक प्रक्रिया है जिससे अस्पष्ट लेकिन संदर्भित रेफ़रेंसेज़ जैसे सर्वनाम या अप्रत्यक्ष वर्णन, जैसे “they” या “that”, को बातचीत या विज़ुअल कॉन्टेक्स्ट में सही इकाइयों से जोड़ा जाता है ताकि सुसंगत उपयोगकर्ता इंटरैक्शन बनाए रखा जा सके।
परम्परागत AI प्रणालियां रेफ़रेंस रिज़ॉल्यूशन के लिए नियम-आधारित विधियों या हीयूरिस्टिक्स पर निर्भर करती हैं, जो प्राकृतिक भाषा की पूरी जटिलता को पकड़ने में वांछित परिणाम नहीं देतीं। परिणामस्वरूप, विज़ुअल कॉन्टेक्स्ट, जैसे स्क्रीन पर मौजूद इकाइयाँ, इन विधियों से रिज़ॉल्यूशन में एकीकृत करना कठिन रहा है। वॉयस असिस्टेंट्स जैसे Siri भी वही सीमाओं के शिकार होते हैं, जिन्हें ReALM भाषा मॉडलिंग समस्या के रूप में मानकर संबोधित करता है।
ReALM LLMs का उपयोग करके बातचीत के व्यापक संदर्भ में अस्पष्ट रेफ़रेंसेज़ को समझता और हल करता है, बजाय नियमों या हीयूरिस्टिक्स के। जब विज़ुअल कॉन्टेक्स्ट शामिल होता है, तो यह डिवाइस की स्क्रीन को टेक्स्टुअल प्रतिनिधित्वों के माध्यम से पुनर्निर्मित करता है और स्क्रीन पर मौजूद घटकों के बीच स्थानिक कनेक्शन को रिकॉर्ड करता है।
जोएल रूबेन एंटोनी मोनिज़ के नेतृत्व में, शोधकर्ताओं की टीम कहती है:
“हमारी जानकारी के अनुसार, यह स्क्रीन से संदर्भ को एन्कोड करने का लक्ष्य रखने वाले बड़े भाषा मॉडल का उपयोग करने वाला पहला कार्य है।”
परिणाम? ReALM-संचालित वॉयस असिस्टेंट्स ऐसे प्रश्नों को समझ सकते हैं जैसे “ऊपरी-दाएँ कोने में बटन को टैप करें” और “सूची में दूसरा लेख खोलें”, जिनसे मानक AI प्रणालियां जूझती हैं।
यह ReALM की रेफ़रेंस रिज़ॉल्यूशन विधि को अधिक कुशल और ऑन-डिवाइस प्रोसेसिंग के लिए आदर्श बनाता है क्योंकि यह क्लाउड-आधारित AI प्रणालियों के विपरीत, जो निरंतर डेटा ट्रांसमिशन की आवश्यकता रखते हैं, डिवाइस पर स्थानीय रूप से रेफ़रेंसेज़ को हल कर सकता है। इससे यह Siri के लिए बेहतर उपयुक्त बनता है, क्योंकि यह गोपनीयता, लेटेंसी और ऑफ़लाइन कार्यक्षमता में सुधार करता है।
पाँच सर्वश्रेष्ठ ChatGPT एक्सटेंशन की सूची के लिए यहाँ क्लिक करें।
डेटासेट संग्रह और मूल्यांकन
Apple की शोध टीम ने एक विविध डेटासेट तैयार किया जिसमें वार्तालापीय, ऑन-स्क्रीन, और सिंथेटिक डेटा शामिल था, ताकि ReALM की वास्तविक दुनिया के उपयोगकर्ता इंटरैक्शन की जटिलताओं को नेविगेट करने की क्षमता को उसके विकल्पों की तुलना में पूरी तरह से आंका जा सके। ऐसा करने के लिए, टीम ने वार्तालापीय, ऑन-स्क्रीन, और सिंथेटिक डेटा वाला एक विविध डेटासेट तैयार किया।
वार्तालापीय डेटा को क्राउड वर्कर्स को सिंथेटिक सूचियों वाली तस्वीरें दिखाकर और उनसे उन सूचियों के विशिष्ट तत्वों से संबंधित स्पष्ट प्रश्न जमा करने को कहा गया। ऑन-स्क्रीन डेटासेट को दो-चरणीय एनोटेशन प्रक्रिया से गुजराया गया जिससे यह सुनिश्चित हुआ कि मॉडल वास्तविक वेब पेजों की जटिलता को संभाल सके। इस प्रक्रिया में दृश्यमान वस्तुओं का वर्गीकरण, प्रश्न बनाना, और प्रश्नों और उनसे संबंधित इकाइयों के बीच कनेक्शन स्थापित करना शामिल था।
प्रभावशाली प्रदर्शन परिणाम
मूल्यांकन परिणाम सभी डेटासेट्स में ReALM के उल्लेखनीय प्रदर्शन को दर्शाते हैं। पहले के स्टेट-ऑफ़-द-आर्ट रेफ़रेंस रिज़ॉल्यूशन सिस्टम MARRS की तुलना में, ReALM सटीकता में महत्वपूर्ण सुधार हासिल करता है। विशेष रूप से, सबसे छोटा ReALM मॉडल भी चुनौतीपूर्ण ऑन-स्क्रीन डेटासेट पर 5% से अधिक की निरपेक्ष वृद्धि प्राप्त करता है, जो जटिल विज़ुअल कॉन्टेक्स्ट में रेफ़रेंसेज़ को प्रभावी ढंग से समझने और हल करने की उसकी क्षमता को दर्शाता है।
ReALM की क्षमताओं का आगे मूल्यांकन करने के लिए, शोधकर्ताओं ने इसे OpenAI के GPT-3.5 और GPT-4 मॉडलों के खिलाफ बेंचमार्क किया। प्रभावशाली रूप से, ReALM का सबसे छोटा मॉडल कम पैरामीटर होने के बावजूद GPT-4 के बराबर प्रदर्शन करता है। जैसे-जैसे मॉडल का आकार बढ़ता है, ReALM का प्रदर्शन लगातार सुधारता है, और बड़े मॉडल मूल्यांकन किए गए डेटासेट्स पर GPT-4 से काफी बेहतर प्रदर्शन करते हैं।
नीचे दिया गया तालिका प्रदर्शन परिणामों का सारांश प्रस्तुत करती है, जो मौजूदा दृष्टिकोणों पर ReALM की श्रेष्ठता और स्टेट-ऑफ़-द-आर्ट भाषा मॉडलों के साथ उसकी प्रतिस्पर्धात्मकता को उजागर करती है।

सफलता की कुंजी: अनुकूलित स्क्रीन एन्कोडिंग
जैसा कि स्पष्ट है, ReALM की अनुकूलित स्क्रीन एन्कोडिंग पद्धति उसके प्रभावशाली प्रदर्शन में योगदान देने वाला एक महत्वपूर्ण कारक है। यह तथ्य भी जोड़ता है कि शोधकर्ताओं ने अंतिम एल्गोरिद्म तक पहुंचने से पहले कई रणनीतियों का अन्वेषण किया, जो सबसे प्रभावी साबित हुई।
प्रारंभिक प्रयासों में से एक में स्क्रीन तत्वों को क्लस्टर करना और प्रत्येक इकाई के संदर्भ में सभी अन्य तत्वों को शामिल करना शामिल था। हालांकि, इससे ऑन-स्क्रीन इकाइयों की संख्या बढ़ने पर प्रॉम्प्ट की लंबाई तेज़ी से बढ़ गई, जिससे यह वास्तविक अनुप्रयोगों के लिए काफी अव्यावहारिक हो गया।
एक अन्य दृष्टिकोण में टेक्स्टुअल स्क्रीन पार्स में इकाइयों को टैग करना शामिल था, लेकिन उन्हें मुख्य संदर्भ से अलग प्रदान किया गया। जबकि यह विधि आशाजनक लगती है, शोधकर्ताओं ने पाया कि टैग को सीधे पार्स में इंजेक्ट करने से सबसे अच्छे परिणाम मिले।
पेपर में वर्णित अंतिम “इंजेक्टेड ऑन-स्क्रीन एन्कोडिंग” दृष्टिकोण स्क्रीन तत्वों के केंद्रों को ऊपर से नीचे और फिर बाएँ से दाएँ क्रम में सॉर्ट करके काम करता है। निर्दिष्ट वर्टिकल मार्जिन के भीतर के तत्वों को टेक्स्टुअल प्रतिनिधित्व में एक ही “लाइन” में समूहित किया जाता है, और एक ही लाइन के तत्वों को टैब द्वारा अलग किया जाता है। यह चतुर एन्कोडिंग योजना ReALM को 2D स्क्रीन लेआउट को 1D टेक्स्टुअल फॉर्मेट में अनुमानित करने की अनुमति देती है, जिससे मॉडल इकाइयों के बीच स्थानिक संबंधों को प्रभावी रूप से समझ सकता है।
शोधकर्ताओं द्वारा किए गए एब्लेशन प्रयोगों ने इस अनुकूलित एन्कोडिंग पद्धति की श्रेष्ठता की पुष्टि की, जैसा कि नीचे चित्र में दिखाया गया है:

जटिल उपयोग मामलों को संभालना
पेपर कई गुणात्मक उदाहरण प्रस्तुत करता है जो विभिन्न प्रकार के तर्क, जैसे सेमांटिक समझ, सारांशण, विश्व ज्ञान, और सामान्य समझ तर्क की आवश्यकता वाले जटिल उपयोग मामलों को संभालने में ReALM की क्षमता को दर्शाते हैं।
टीम द्वारा साझा किए गए एक रोचक उदाहरण में, जब स्क्रीन पर सुबह और शाम दोनों की संपर्क जानकारी दिखायी गई, तो ReALM ने “शाम का नंबर कॉल करें” प्रश्न को “5 PM – 9 PM” के तहत सूचीबद्ध फोन नंबर तक सही ढंग से हल किया। यह तर्कसंगत परिणाम जैसा सुनाई देता है, लेकिन यह क्षमताओं का प्रभावशाली प्रदर्शन है क्योंकि ReALM ने “शाम” का अर्थ समझकर उसे उपयुक्त समय सीमा में मैप किया, जो अन्य AI प्रणालियों में अभी तक नहीं दिखा है।
एक अन्य इनपुट नमूने में टैक्स डेडलाइन दिखाने वाली स्क्रीन शामिल थी, और मोड ने अप्रैल फाइलिंग तिथि को संबंधित डेडलाइन के रूप में सफलतापूर्वक पहचाना जब टैक्स ड्यू डेट से पहले दस्तावेज़ प्रिंट करने के लिए रिमाइंडर सेट करने को कहा गया।
ये गुणात्मक उदाहरण ReALM की बहुमुखी प्रतिभा और गहरी भाषा समझ और तर्क क्षमताओं की आवश्यकता वाले वास्तविक दुनिया के विभिन्न परिदृश्यों को संभालने की संभावनाओं पर किए गए अवलोकनों को सुदृढ़ करते हैं।
एंड-टू-एंड दृष्टिकोणों पर लाभ
जबकि केवल बड़े LLMs पर निर्भर एंड-टू-एंड दृष्टिकोण विभिन्न भाषा समझ कार्यों में आशाजनक परिणाम दिखा चुके हैं, शोधकर्ता ReALM की आर्किटेक्चर के कई लाभों को उजागर करते हैं:
वर्तमान मॉडलों की गणनात्मक और मेमोरी सीमाओं के कारण लेटेंसी और गोपनीयता कारणों से पूर्ण एंड-टू-एंड मॉडल को ऑन-डिवाइस चलाना असंभव होगा। रेफ़रेंस रिज़ॉल्यूशन के लिए विशेष रूप से डिजाइन किए गए छोटे, फाइन-ट्यून किए गए मॉडल का उपयोग करके, ReALM इन समस्याओं से बचता है और कुशल ऑन-डिवाइस प्रोसेसिंग को सक्षम करता है।
इसके अलावा, ReALM की मॉड्यूलर आर्किटेक्चर मौजूदा एंटिटी डिटेक्शन और टास्क कंप्लीशन घटकों के साथ सहज एकीकरण की अनुमति देती है। इसके विपरीत, एक एंड-टू-एंड मॉडल को पूरे पाइपलाइन में महत्वपूर्ण परिवर्तन की आवश्यकता होगी, जिससे इसे वास्तविक सिस्टम में अपनाना अधिक चुनौतीपूर्ण हो जाता है।
नई एंटिटी प्रकारों के लिए स्केलेबिलिटी
ReALM की मुख्य ताकतों में से एक उसकी नई एंटिटी प्रकारों के लिए स्केलेबिलिटी है। MARRS जैसे पूर्ववर्ती पाइपलाइन दृष्टिकोणों के विपरीत, जो मैन्युअल रूप से परिभाषित प्रकार-विशिष्ट लॉजिक पर निर्भर थे, ReALM का LLM-आधारित दृष्टिकोण आसानी से अनदेखे डोमेनों में सामान्यीकरण कर सकता है।
शोधकर्ताओं ने इस लाभ को एक अनदेखे “alarm” एंटिटी प्रकार पर ReALM का मूल्यांकन करके प्रदर्शित किया। प्रभावशाली रूप से, ReALM GPT-4 की ज़ीरो-शॉट प्रदर्शन के बराबर है, जैसे “मुझे दादी को लेने की याद दिलाने वाले अलार्म को बंद करो” जैसे प्रश्नों को सही एंटिटी तक हल करता है। यह मॉडल की भाषा समझ क्षमताओं का उपयोग करके नई एंटिटी प्रकारों को स्पष्ट प्रशिक्षण डेटा के बिना संभालने की क्षमता को दर्शाता है।
नीचे दिया गया तालिका अनदेखे “alarm” डेटासेट पर ReALM और GPT-4 के बीच प्रदर्शन तुलना प्रस्तुत करता है, जो ReALM की मजबूत ज़ीरो-शॉट जनरलाइज़ेशन क्षमताओं को उजागर करता है:

भविष्य की संभावनाएं और सीमाएं
हालांकि ReALM वार्तालापीय AI के लिए रेफ़रेंस रिज़ॉल्यूशन जैसे महत्वपूर्ण पहलुओं में उल्लेखनीय प्रगति प्रदान करता है, शोध टीम ने कुछ सीमाओं को नोट किया है जो समझने योग्य हैं।
हालांकि, इस सिस्टम की एक बड़ी कमी यह है कि 2D स्क्रीन लेआउट को 1D टेक्स्टुअल प्रतिनिधित्व में बदलने से जटिल स्थानिक विवरण खो जाता है। टीम ने अधिक उन्नत एन्कोडिंग रणनीतियों, जैसे स्क्रीन घटकों को ग्रिड-समरूप तरीके से दर्शाने, का उपयोग करने का प्रस्ताव रखा है ताकि अधिक सटीक सापेक्ष स्थान बनाए रखे जा सकें।
भविष्य के लिए एक और संभावित सुधार यह है कि ReALM की क्षमता को और अधिक जटिल और विविध रेफ़रेंसेज़ को संभालने के लिए बढ़ाया जाए, जिसमें इकाइयों के बीच समयीय या पदानुक्रमित संबंध शामिल हों।
इन सीमाओं के बावजूद, ReALM का प्रभावशाली प्रदर्शन और स्केलेबल डिजाइन इसे वार्तालापीय AI के क्षेत्र में आगे के अध्ययन और विकास के लिए एक बहुत ही आशाजनक आधार बनाते हैं।
समापन विचार
ReALM की टेक्स्टुअल इनपुट और विज़ुअल कॉन्टेक्स्ट के बीच अंतर को पाटने की क्षमता अधिक सहज और संदर्भ-सचेत उपयोगकर्ता इंटरफ़ेस का मार्ग प्रशस्त करेगी। LLM इंजीनियर और डेवलपर्स ऐसे AI सिस्टम बना सकेंगे जो उपयोगकर्ताओं की मंशा को वास्तव में समझें और उसका जवाब दें, यहां तक कि जटिल ऑन-स्क्रीन तत्वों से निपटते समय भी।
शुद्ध तकनीकी दृष्टिकोण से, ReALM की मॉड्यूलर आर्किटेक्चर और ऑन-डिवाइस प्रोसेसिंग क्षमताएं विशेष रूप से मूल्यवान हैं क्योंकि वे न केवल उपयोगकर्ता गोपनीयता और लेटेंसी समस्याओं को हल करती हैं बल्कि अधिक स्केलेबल, कुशल, एकीकृत AI सिस्टम के लिए एक मानक स्थापित करती हैं।
साधारण शब्दों में, जटिल उपयोग मामलों को संभालने में ReALM की सफलता और नई एंटिटी प्रकारों में सामान्यीकरण करने की उसकी क्षमता इस तथ्य को संकेत देती है कि वार्तालापीय AI के साथ वर्तमान में क्या संभव है, हमारी समझ पूरी तरह बदल गई है। यह ग्राहक सेवा और ई-कॉमर्स से लेकर स्वास्थ्य देखभाल और शिक्षा तक विभिन्न उद्योगों में AI अपनाने की धीमी गति को तेज़ कर सकता है।
कृत्रिम बुद्धिमत्ता में निवेश के बारे में सब कुछ जानने के लिए यहाँ क्लिक करें।












