रोबोटिक्स

एआई-संचालित रोबोट मानव होंठ की गति सीखते हैं

mm
Securities.io को Google पर अपने पसंदीदा स्रोतों में जोड़ें
Uncanny Robots that Sing and Speak Like Humans 1

कोलंबिया के इंजीनियरों ने ऐसा रोबोट बनाया है जो बोलते समय मानव होंठों की गतिविधियों की नकल कर सकता है और उनसे सीख सकता है। उन्नत डिज़ाइन में आधुनिक रोबोटिक्स और एआई को जोड़ा गया है, जिससे Emo नामक यह उपकरण मानवीय भाव-भंगिमाओं को देखकर सीखता है और उपयुक्त समय पर भावनाओं की नकल करता है। आइए इसके बारे में विस्तार से जानें।

सारांश: कोलंबिया इंजीनियरों ने एक एआई-चालित मानवाकार रोबोट विकसित किया है जो अवलोकन के माध्यम से वास्तविक मानव होंठ की गति सीख सकता है, जिससे भाषण समकालिकता और भावनात्मक अभिव्यक्ति में उल्लेखनीय सुधार होता है।

मानवाकार रोबोट असहज घाटी को क्यों ट्रिगर करते हैं

रोबोटिक्स के शुरुआती दौर से ही मानवाकार रोबोट बनाने का प्रयास जारी है। यह काम कहने जितना आसान नहीं है। रोबोटिक्स इंजीनियर लगातार प्रगति करते रहे हैं, लेकिन वास्तविक इंसान जैसा दिखने और महसूस होने वाला उपकरण बनाने का लक्ष्य अब तक पूरी तरह हासिल नहीं हुआ।

साधारण मानवाकार रोबोट के आसपास रहने वाला व्यक्ति भी बता सकता है कि इंसानों जैसा दिखने की उनकी कोशिश अक्सर असहजता पैदा करती है। आँखों की अप्राकृतिक गति या चेहरे के भावों जैसी छोटी-सी त्रुटि भी देखने वाले में यह भावना उत्पन्न कर सकती है।

असहज घाटी

जापानी रोबोट वैज्ञानिक मासाहिरो मोरी ने 1970 के दशक में इस घटना को पहचाना था। अपने प्रसिद्ध निबंध “Bukimi no Tani Gensho” (असहजता की घाटी) में उन्होंने इस अवधारणा को विस्तार से समझाया। निबंध बताता है कि सूक्ष्म खामियों के कारण मानवाकार रोबोट एक ऐसे बिंदु पर पहुँच जाते हैं जहाँ दर्शक उनसे तीखा भावनात्मक विच्छेद महसूस करते हैं।

1978 में यह शब्द यासिया राइखार्ट की पुस्तक “Robots: Fact, Fiction, and Prediction” के माध्यम से पश्चिमी वैज्ञानिक जगत में पहुँचा, जहाँ इसका आज प्रचलित अनुवाद “अनकैनी वैली” किया गया। इस पुस्तक ने मोरी की चर्चा को आगे बढ़ाते हुए बताया कि बहुत छोटे अंतर भी दर्शक की भावनात्मक प्रतिक्रिया को नकारात्मक बना सकते हैं।

मानव चेहरे समीकरण का सबसे कठिन भाग हैं

पिछले कुछ दशकों में मानवाकार रोबोट बनाने की दिशा में कई महत्वपूर्ण उपलब्धियाँ हासिल हुई हैं। बड़े भाषा मॉडल (LLM) जैसी नई तकनीक इन उपकरणों को स्वाभाविक भाषा में संवाद करने देती है और अंतर को कम करती है। फिर भी मानव चेहरा उन सबसे बड़े क्षेत्रों में है जिन पर अभी बहुत काम बाकी है।

Uncanny Robots that Sing and Speak Like Humans

मानव चेहरा ऊतक, नसों और मांसपेशियों का एक जटिल मिश्रण है जो हजारों विभिन्न अभिव्यक्तियों को प्रदर्शित करने में सक्षम है, जिनमें से कई दूसरों को भावनाएँ संप्रेषित करने में मदद करती हैं। इस प्रकार, चेहरा अंतिम संचार उपकरण माना जाता है।

रोबोटिक इंजीनियरों ने लंबे समय से रोबोटिक चेहरों को मानवों की तरह काम करने में कठिनाई और महत्व को पहचाना है। वर्षों की मेहनत के बाद, रोबोटों ने मानव-समान चेहरे, त्वचा और अभिव्यक्तियों को प्राप्त किया है। फिर भी, अरबों की शोध के बावजूद, कनेक्शन अभी भी कमी है।

Swipe to scroll →

विशेषता मानव चेहरा पारंपरिक मानवाकार रोबोट कोलंबिया एआई लिप सिस्टम
मांसपेशी जटिलता 30+ चेहरे की मांसपेशियां निरंतर गति के साथ सीमित मोटर्स कठोर प्रतिबंधों के साथ 26 मोटर्स सॉफ्ट सिलिकॉन आर्टिकुलेशन के साथ
होंठ-ऑडियो समकालिकता भाषण के दौरान स्वाभाविक रूप से समकालिक पूर्वनिर्धारित, अक्सर विलंबित गति विज़न-टू-एक्शन एआई के माध्यम से गतिशील रूप से सीखा गया
भावनात्मक अभिव्यक्ति सूक्ष्म, संदर्भ-जानकारी माइक्रो‑एक्सप्रेशन न्यूनतम या अतिरंजित अभिव्यक्तियां भावनात्मक रूप से सुसंगत होंठ और चेहरे के संकेत
अनुकूलनशीलता इंटरैक्शन के माध्यम से निरंतर सीखता है स्थिर गति लाइब्रेरी अवलोकनात्मक सीखने के माध्यम से स्वयं सुधार
असहज घाटी प्रभाव कोई नहीं उच्च दर्शक असुविधा असहज प्रतिक्रिया में उल्लेखनीय कमी

संचार में होंठों का महत्व

मानवाकार उपकरण बनाते समय रोबोट वैज्ञानिक लगातार एक बड़ी समस्या से जूझते हैं—होंठों की गतिविधि को वास्तविक रूप से दोहराना लगभग असंभव है। होंठ केवल आवाज़ को दिशा देने और शब्दों के उच्चारण में सहायता करने से कहीं अधिक काम करते हैं।

होंठ सूक्ष्म स्तर पर भावनाएँ भी व्यक्त करते हैं और हजारों वर्षों के विकासक्रम में यह मानव संचार के लिए अत्यंत महत्वपूर्ण बन गया है। बातचीत के दौरान लोग चेहरे की अन्य विशेषताओं की तुलना में होंठों की गति पर अधिक ध्यान देते हैं। इसी कारण मस्तिष्क माथा सिकोड़ने या पलक झपकाने जैसी क्रियाओं की अपेक्षा होंठों के संकेतों को समझने में अधिक क्षमता लगाता है।

रोबोटों के होंठ अस्वाभाविक दिखते हैं

रोबोट लगभग इंसानों जैसे दिखने लगे हैं, लेकिन होंठों के भाव अब भी विश्वसनीय नहीं हैं। दशकों के शोध से स्पष्ट हुआ है कि यथार्थ व्यवहार के लिए आवश्यक सटीक होंठ-ध्वनि समन्वय अब तक उपलब्ध नहीं था। इसलिए रोबोट की बातचीत स्वाभाविक बोलने के बजाय डब की हुई लगती है, जिससे वे भद्दे और निर्जीव दिखाई देते हैं।

मानव चेहरा भावनात्मक प्रतिक्रियाएँ बनाने के लिए दर्जनों मांसपेशियों पर निर्भर करता है, जबकि रोबोटिक होंठों में अभी इतनी जटिलता नहीं है। इसे हासिल करने के लिए नए प्रकार के डिज़ाइन की आवश्यकता होगी। इसके अलावा, अधिकांश रोबोटिक होंठ-गतियाँ शब्दों को स्वाभाविक रूप से बनाने के बजाय पहले से तय होती हैं और किसी रिकॉर्ड की गई आवाज़ से मिलाई जाती हैं। चूँकि रोबोट वास्तव में होंठों से ध्वनि उत्पन्न नहीं करते, उनकी गतिविधियाँ अप्राकृतिक और असहज लगती हैं।

कोलंबिया अध्ययन: रोबोटों को वास्तविक होंठ गति सिखाना

कोलंबिया के इंजीनियरों की एक टीम ने संभवतः अनकैनी वैली को पार करने का तरीका खोज लिया है। “Learning realistic lip motions for humanoid face robots¹” अध्ययन ने ऐसा नया रोबोटिक चेहरा प्रस्तुत किया है जिसका मुख्य ध्यान होंठों की गति और समन्वय पर है।

विशेषीकृत हार्डवेयर

टीम के सामने प्रमुख बाधाओं में से एक आज के रोबोटिक चेहरों की कठोरता थी। मोटर से चलने वाली चेहरे की प्रतिक्रियाएँ देने वाले कई नए डिज़ाइन बने हैं, लेकिन कोई भी यथार्थ होंठ-गतियों के लिए आवश्यक जटिलता प्रदान नहीं करता।

इस सीमा को दूर करने के लिए इंजीनियरों ने अधिकतम अभिव्यक्ति देने हेतु विशेष रूप से बनाए गए सिलिकॉन होंठ इस्तेमाल किए। इसके बाद उन्होंने 26 चेहरे की मोटरें, एक फेशियल एक्शन ट्रांसफॉर्मर और एक वैरिएशनल ऑटोएन्कोडर (VAE) लगाया।

विज़न-टू-एक्शन (VLA)

इस तकनीकी उपलब्धि के केंद्र में विज़न-टू-एक्शन एआई मॉडल है। इसकी मदद से रोबोटिक चेहरा पहले से तय यांत्रिक गतिविधियों पर निर्भर हुए बिना स्वायत्त रूप से यथार्थ होंठ-गतियाँ बना सकता है।

मॉडल बनाने के लिए टीम ने प्रेक्षणात्मक शिक्षण विधियों का उपयोग किया। इस प्रकार की प्रोग्रामिंग उपकरण को बोलते समय होंठों की सटीक गतिशीलता वास्तविक समय में समझने देती है। पहला कदम एल्गोरिदम को स्व-पर्यवेक्षित शिक्षण पाइपलाइन में डालना था।

Source - Columbia

इस चरण में इंजीनियरों ने रोबोट का चेहरा दर्पण के सामने रखा और उसे हजारों भाव बनाने का निर्देश दिया। इससे एल्गोरिदम ने उसके चेहरे की अभिव्यक्ति क्षमताएँ दर्ज कीं। इसके बाद रोबोट ने कई घंटों की YouTube सामग्री देखी।

ध्वनि और होंठों की गति के मेल को सावधानी से दर्ज करके रोबोट के चेहरे और होंठों वाले एआई एल्गोरिदम को प्रशिक्षित किया गया। कुछ ही दिनों में उसने इनपुट मानों के बजाय मानवीय अभिव्यक्तियों से सीख लिया कि उसका चेहरा कैसा दिखना चाहिए। इसके बाद इंजीनियरों ने ध्वनि जोड़ी और परीक्षण शुरू किया।

विभिन्न भाषाओं में लिप‑सिंक एआई का परीक्षण कैसे किया गया

टीम ने अपने सिद्धांत को 10 अलग-अलग भाषाओं और भाषायी संदर्भों में परखा। परीक्षण में मॉडल के लिए बिल्कुल नई भाषाएँ इस्तेमाल की गईं, ताकि वह पहले सीखे शब्दों को याद करने के बजाय उचित चेहरे के भाव और होंठों की गति की गणना करे। परीक्षण में प्रसंग और गीत भी शामिल किए गए।

असहज रोबोट परीक्षण परिणाम

परीक्षण के परिणामों में हर मामले में दृष्टिगत रूप से सुसंगत होंठ-ध्वनि समन्वय दिखाई दिया। एल्गोरिदम संचालित रोबोट ने कई ऑडियो क्लिप से सटीक मेल खाने वाली यथार्थ होंठ-गतियाँ प्रस्तुत कीं। उसने 10 भाषाओं में सफलतापूर्वक होंठ मिलाए और अपने एआई-निर्मित पहले एल्बम hello world_ का एक गीत भी गाया।

टीम को तकनीक की कुछ सीमाएँ भी मिलीं। रोबोट “पॉप” जैसे शब्दों से जुड़ी कठिन होंठ-गतियों को लगातार दोहरा नहीं सका और “व्हिसल” जैसे गोल होंठों वाले शब्दों में भी उसे परेशानी हुई। इंजीनियरों के अनुसार एल्गोरिदम के समय के साथ बेहतर होने पर ये छोटी कमियाँ दूर हो जाएँगी। स्वयं सीखने की यह क्षमता एल्गोरिदम की सबसे बड़ी विशेषता है। मानवों से अधिक डेटा मिलने के साथ यह लगातार सुधरेगा और भविष्य में अधिक सार्थक मानव-मशीन संवाद का मार्ग खोलेगा।

वास्तविक मानवाकार रोबोटिक्स के प्रमुख लाभ

यह तकनीक बाजार के लिए कई लाभ लाती है। सबसे पहले, इससे लोग मशीनों के साथ अधिक गहरा संबंध बना सकेंगे। अधिकांश लोगों को एहसास नहीं होता कि अवचेतन रूप से चेहरे के भावों के माध्यम से कितना संवाद होता है।

यह अध्ययन होंठ-समन्वय तकनीक और संवादात्मक एआई को इंसान जैसा अनुभव बनाने का रास्ता देता है, जो अकेलेपन की बढ़ती समस्या से निपटने सहित कई क्षेत्रों में मदद कर सकता है। इस तकनीक से मानवाकार रोबोट अनकैनी वैली को पार करने और रोबोटिक्स को नए स्तर पर ले जाने के एक कदम और करीब पहुँचेंगे।

वास्तविक दुनिया में अनुप्रयोग और समयरेखा

इस तकनीक के उपयोग कई उद्योगों तक फैले हैं। इसका स्पष्ट उपयोग मानवाकार रोबोट तकनीक को आगे बढ़ाना है। ठंडी मशीनों पर कोमल और आत्मीय चेहरे दिखाने की क्षमता अपनाने की दर बढ़ा सकती है। इसके कुछ अन्य उपयोग भी विचारणीय हैं।

वृद्ध देखभाल

वरिष्ठ नागरिकों को सामान्यतः तकनीक का सबसे जानकार वर्ग नहीं माना जाता, फिर भी उन्होंने रोबोटिक्स को नए स्तर पर अपनाना शुरू कर दिया है। बुजुर्गों की देखभाल में सहायक रोबोट का बाजार बढ़ रहा है और आँकड़ों के अनुसार 2025 में यह 3.38 अरब डॉलर तक पहुँच गया। यही रिपोर्टें 2033 तक इसके 9.85 अरब डॉलर से अधिक होने का अनुमान लगाती हैं।

यदि रोबोट तकनीकी रूप से जटिल न लगें तो वरिष्ठ नागरिक उनसे संवाद करने और उन्हें स्वीकार करने के लिए अधिक तैयार होंगे। यथार्थ चेहरे की गतिविधियों के साथ बोलकर संवाद करने वाला रोबोटिक सहायक उनके लिए उपयुक्त हो सकता है। बुजुर्ग मरीजों को आवश्यक सहायता के साथ भावनात्मक जुड़ाव भी मिल सकता है।

मनोरंजन

मनोरंजन उद्योग इस तकनीक को सबसे पहले अपनाने वालों में हो सकता है। आज फिल्म निर्माता रोबोटिक्स पर काफी निर्भर हैं। Disney जैसे थीम पार्कों में इस्तेमाल होने वाले एनिमेट्रॉनिक्स से लेकर बड़ी फिल्मों के मोशन-कैप्चर रोबोट तक, इन उपकरणों ने मनोरंजन उद्योग को आगे बढ़ाया है।

आज मनोरंजन रोबोट क्षेत्र का मूल्य 4.72 अरब डॉलर से अधिक है। यथार्थ CGI पात्रों की बढ़ती माँग के कारण 2034 तक इसके 26.94 अरब डॉलर होने का अनुमान है। निकट भविष्य में यह तकनीक उस आवश्यकता को पूरा कर सकती है और कलाकारों को नए तथा अधिक प्रत्यक्ष तरीकों से पात्रों को अपना चेहरा देने में सक्षम बना सकती है।

शिक्षा

शिक्षा एक और क्षेत्र है जहाँ यह तकनीक फल-फूल सकती है। इन उपकरणों को व्यक्तिगत शिक्षक के रूप में तैयार किया जा सकता है। कुछ रिपोर्टों में रोबोट-अनुकूलित पाठों से विद्यार्थियों की गणितीय समझ में 30% सुधार पाया गया है।

स्वीकार समयरेखा

अगले 5–10 वर्षों में यह तकनीक रोजमर्रा के जीवन में दिखाई देने लगेगी। रोबोट पहले से ही कई कारखानों और कार्यस्थलों में मौजूद हैं और उनका एकीकरण बढ़ने का अनुमान है। रोबोट वैज्ञानिक समझते हैं कि ऐसी तकनीक उपकरणों को लोगों के लिए अधिक सहज और अपनाने योग्य बना सकती है।

कोलंबिया के प्रमुख शोधकर्ता

अध्ययन को Columbia की Creative Machines Lab ने आयोजित किया। शोधपत्र में Yuhang Hu, Jiong Lin, Judah Allen Goldfeder, Philippe M. Wyder, Yifeng Cao, Steven Tian, Yunzhe Wang, Jingran Wang, Mengmeng Wang, Jie Zeng, Cameron Mehlman, Yingke Wang, Delin Zeng, Boyuan Chen और Hod Lipson को योगदानकर्ता बताया गया है।

मानव-समान रोबोटों के लिए आगे क्या है

अब टीम एल्गोरिदम को और बेहतर बनाने पर ध्यान देगी। इसमें मनुष्यों के साथ अधिक संवाद शामिल होगा और यह कई ऐसी इकाइयों तक विकसित हो सकता है जो वास्तविक समय में सीखें और डेटा को एक केंद्रीकृत मॉडल के साथ साझा करें।

रोबोटिक्स नवाचार में निवेश

रोबोटिक्स एक तेज़ी से बदलने वाला उद्योग है जिसने पिछले पाँच वर्षों में मजबूत वृद्धि देखी है। LLM और 3D प्रिंटर जैसी नई तकनीकों ने नवाचार को नए स्तर तक पहुँचाया है। व्यापक बाजार अवसरों की विस्तृत जानकारी के लिए 2026 में फिजिकल एआई और मानवाकार रोबोट में निवेश पर हमारी मार्गदर्शिका पढ़ें।

यह एक ऐसी कंपनी है जो इस क्रांति में सबसे आगे रही है।

Teradyne ($36B)

Teradyne, Inc. (TER ) “कोबोट” यानी सहयोगी रोबोट के बाजार की अग्रणी कंपनी Universal Robots (UR) की मूल कंपनी है। Teradyne मानवाकार चेहरे नहीं बनाती, लेकिन Columbia अध्ययन में वर्णित “देखो और सीखो” एआई को कारखानों तक पहुँचाने में फिलहाल अग्रणी है।

महत्वपूर्ण रूप से, Teradyne ने “Isaac Manipulator” प्लेटफॉर्म को एकीकृत करने के लिए Nvidia (NVDA ) के साथ रणनीतिक साझेदारी की है। इससे Teradyne के रोबोट एआई कैमरों से अपने वातावरण को “देख” सकते हैं और कठोर, पहले से लिखे कोड पर निर्भर रहने के बजाय अपना मार्ग बदल सकते हैं—ठीक वैसे ही जैसे Emo रोबोट अपने होंठों को समायोजित करना सीखता है।

TER मूल्य चार्ट

निवेशक चेतावनी: गति मजबूत है, लेकिन विश्लेषकों के अनुसार TER अभी ऊँचे मूल्यांकन प्रीमियम पर कारोबार कर रहा है, जिसका P/E अनुपात 70 गुना से अधिक है। यह शेयर इस उम्मीद पर आधारित है कि एआई एकीकरण विनिर्माण में बड़े हार्डवेयर उन्नयन चक्र को जन्म देगा, परंतु Deere या Caterpillar जैसे पारंपरिक औद्योगिक शेयरों की तुलना में इसमें काफी अधिक अस्थिरता का जोखिम है।

नवीनतम Teradyne (TER) समाचार और प्रदर्शन

निष्कर्ष

यथार्थ रोबोटिक चेहरों का विकास स्वाभाविक अगला कदम है। LLM अब मानव भाषण की नकल कर सकते हैं और यथार्थ चेहरे के भावों के साथ मिलकर ये उपकरण प्रशिक्षण, शिक्षा, स्वास्थ्य सेवा और अन्य क्षेत्रों में नया स्तर प्रदान करेंगे। फिलहाल टीम कमियों को दूर करने तथा रणनीतिक साझेदार और वित्तपोषण खोजने पर ध्यान देगी।

रोबोटिक्स की अन्य रोचक उपलब्धियों के बारे में यहाँ जानें।

संदर्भ

1. Yuhang Hu et al., Learning realistic lip motions for humanoid face robots. Science Robotics 11, eadx3017 (2026). DOI:10.1126/scirobotics.adx3017 हिंदी में।

डेविड हैमिल्टन एक पूर्णकालिक पत्रकार और एक लंबे समय से बिटकॉइनिस्ट हैं। वह ब्लॉकचेन पर लेख लिखने में माहिर हैं। उनके लेख कई बिटकॉइन प्रकाशनों में प्रकाशित हुए हैं, जिनमें Bitcoinlightning.com शामिल है।