किसी रोबोट को कैसे सीखना चाहिए, इस बारे में दो अलग दांव
क्लासिकल रोबोटिक्स किसी कार्य को हाथ से बनाती है: परसेप्शन-मॉड्यूल, एक प्लानर, एक इनवर्स-किनेमेटिक्स सॉल्वर, एक स्टेट-मशीन, और एक रोबोट, एक ग्रिपर, वस्तुओं के एक संकुचित सेट के लिए ट्यून किए गए नियंत्रण-कोड की हज़ारों पंक्तियां। यह कुछ मूल्यवान देती है — इस बारे में औपचारिक गारंटी कि सिस्टम क्या करेगा और क्या नहीं करेगा — लेकिन यह स्थानांतरित नहीं होती। कोई नया कार्य, या कोई नया रोबोट-भुजा, आमतौर पर मतलब है स्टैक के ज़्यादातर हिस्से को फिर से लिखना।
2023 से इस क्षेत्र को नया आकार दे रहा दांव अलग है: वही नुस्खा जिसने बड़े भाषा मॉडल पैदा किए — विशाल डेटासेट, एक ट्रांसफ़ॉर्मर, और स्केल — भौतिक कौशल के लिए भी एक सामान्य “मैनिफ़ोल्ड” खोजते हुए, रोबोट-नियंत्रण के लिए भी काम करना चाहिए, वैसे ही जैसे इसने पाठ और छवियों के लिए एक खोजा था। यह एक परिकल्पना है, कोई तय तथ्य नहीं, और अब तक का सबूत वाकई मिला-जुला है। यह पन्ना बताता है कि वास्तव में क्या प्रदर्शित किया गया है, किसके द्वारा, और इन सिस्टम को बनाने वाले लोग किन खुली समस्याओं की बात करते हैं।
पहला सबूत: एक्शन-टोकन और क्रॉस-रोबोट स्थानांतरण
Google DeepMind का RT-2, जुलाई 2023 में प्रकाशित, इस विचार का एक शुरुआती, ठोस परीक्षण था। एक अलग एक्शन-भविष्यवाणी मॉड्यूल बनाने के बजाय, DeepMind ने रोबोट-एक्शन टोकन को सीधे एक विज़न-लैंग्वेज मॉडल की अपनी आउटपुट-शब्दावली में प्रशिक्षित किया, ताकि वही नेटवर्क जो किसी छवि को शब्दों में वर्णित करता है, एक मोटर-कमांड भी दे सके (arXiv:2307.15818)। 6,000 मूल्यांकन-परीक्षणों में, इसने अपरिचित वस्तुओं और सेटिंग्स के लिए पिछले कार्य-विशिष्ट आधार-रेखाओं से लगभग तीन गुना बेहतर सामान्यीकरण किया — यह सबूत कि वेब-स्केल दृश्य और भाषा ज्ञान वाकई हेरफेर के लिए उपयोगी कुछ जानकारी साथ लाता है।
तीन महीने बाद, 34 संस्थाओं के एक सहयोग ने RT-X और Open X-Embodiment डेटासेट के साथ इसे और आगे बढ़ाया, दर्जनों अलग-अलग रोबोट-प्रकारों से डेटा जमा करते हुए और उन सभी में एक 55-अरब-पैरामीटर मॉडल को प्रशिक्षित करते हुए (arXiv:2310.08864)। इसने उसी आर्किटेक्चर के 5-अरब-पैरामीटर संस्करण से काफ़ी ज़्यादा उभरती-कौशल सफलता दिखाई — यह एक शुरुआती संकेत है कि स्केल विशेष रूप से अलग-अलग रोबोट-शरीरों में स्थानांतरण को चलाता है, न कि केवल एक के भीतर।
शरीरों के लिए फ़ाउंडेशन मॉडलों से भरा एक क्षेत्र
उस परिणाम ने कंपनी-निर्मित “रोबोट फ़ाउंडेशन मॉडल” की एक लहर शुरू कर दी, हर एक अलग आर्किटेक्चर के साथ और हर एक ऐसे दावे करते हुए जिन्हें स्वतंत्र रूप से सत्यापित तथ्य के बजाय कंपनी के दावे के रूप में पढ़ा जाना चाहिए।
Physical Intelligence के π0 (अक्टूबर 2024) ने PaliGemma विज़न-लैंग्वेज मॉडल को एक फ़्लो-मैचिंग एक्शन-हेड के साथ जोड़ा, आठ रोबोट-अवतारों में प्रशिक्षित किया, और कपड़े तह करने, मेज़ साफ़ करने, और किराने का सामान बैग करने जैसे कार्य प्रदर्शित किए। इस क्षेत्र के लिए असामान्य रूप से, Physical Intelligence ने “openpi” के रूप में भार और कोड ओपन-सोर्स किए, जिससे परिणाम केवल विश्वास पर लेने के बजाय स्वतंत्र रूप से पुनरुत्पादनीय बन गया। फिर भी, कंपनी का अपना आकलन साफ़ था: “सामान्यवादी रोबोट-नीतियां अभी भी अपने शैशवकाल में हैं, और हमें बहुत आगे जाना है” (Physical Intelligence ब्लॉग, 31 अक्टूबर, 2024)। एक नया संस्करण, π0.7, रोबोट-अवतारों में ज़ीरो-शॉट सामान्यीकरण का दावा करता है (arXiv:2604.15483), लेकिन इस लेखन के समय यह दावा एक ऐसे प्रीप्रिंट पर टिका है जो स्वतंत्र रूप से दोहराया नहीं गया।
NVIDIA ने मार्च 2025 में पहले खुले मानवाकार फ़ाउंडेशन मॉडल के रूप में GR00T N1 जारी किया, फिर अप्रैल 2026 में GR00T N1.7: एक 3-अरब-पैरामीटर मॉडल जो मानवीय अहं-केंद्रित वीडियो के 20,854 घंटों पर प्रशिक्षित है और तीन अलग-अलग रोबोट-प्लेटफ़ॉर्म पर सत्यापित है, Hugging Face पर खुले भार के साथ। NVIDIA ने रिपोर्ट किया कि उस अहं-केंद्रित प्रशिक्षण-डेटा को लगभग बीस गुना स्केल करने से निपुण कार्यों पर “औसत कार्य-पूर्णता दोगुने से भी ज़्यादा हो जाती है” — यह दावा NVIDIA का अपना बताए जाने लायक है, क्योंकि इसके साथ कोई स्वतंत्र बेंचमार्क नहीं है (Hugging Face ब्लॉग, 17 अप्रैल, 2026)। एक उत्तराधिकारी, GR00T N2, को मार्च 2026 में GTC में एक “विश्व-एक्शन मॉडल” के रूप में पूर्वावलोकन किया गया जो कार्रवाई से पहले भविष्य की स्थितियों की भविष्यवाणी करता है; NVIDIA के मुख्य-भाषण का यह दावा कि यह नए कार्यों में अग्रणी आधार-रेखाओं से “दोगुने से भी ज़्यादा बार” सफल होता है, सितंबर 2026 तक, एक परखा हुआ दावा नहीं बल्कि एक अप्रकाशित उत्पाद-दावा बना हुआ है।
Google DeepMind का RT-2 का उत्तराधिकारी, Gemini Robotics 2 (जिसे ER 2 भी कहा जाता है), ऊपरी-शरीर के प्रदर्शनों से Apptronik के Apollo 2 पर पूरे-शरीर के मानवाकार नियंत्रण की ओर बढ़ा, जिसमें गांठ बांधने और बैग सील करने जैसे कार्यों के लिए 22-डिग्री-स्वतंत्रता वाले पांच-उंगली हाथ का कमांड शामिल है। DeepMind के अपने उजागर किए गए आंकड़े इस क्षेत्र में सबसे स्पष्ट हैं: पूरे-शरीर हेरफेर पर 45.7–76.3% सफलता और बहु-उंगली निपुणता पर अत्यधिक परिवर्तनशील 32–92%, DeepMind ने साफ़ तौर पर कहा कि “बहु-उंगली निपुण हेरफेर अभी भी चुनौतीपूर्ण बना हुआ है” (DeepMind ब्लॉग, 30 जुलाई, 2026)। इस रिलीज़ पर Bloomberg की अपनी सुर्खी और भी स्पष्ट थी: Google के रोबोट “निपुणता से जूझ रहे हैं” (Bloomberg)।
सबसे स्पष्ट पहले-और-बाद: Figure का Helix 02
इस दृष्टिकोण के तहत क्या बदलता है इसका सबसे स्पष्ट एकल उदाहरण Figure से आता है। इसके मूल Helix सिस्टम (फरवरी 2025) ने एक दो-भाग वाला “System 1 / System 2” आर्किटेक्चर इस्तेमाल किया: एक 7-अरब-पैरामीटर विज़न-लैंग्वेज मॉडल जो 7–9 Hz पर तर्क करता है, जो एक 80-मिलियन-पैरामीटर ट्रांसफ़ॉर्मर को खिलाता है जो 200 Hz पर सूक्ष्म मोटर नियंत्रण चलाता है, केवल लगभग 500 घंटों के डेटा पर प्रशिक्षित — Figure कहता है कि यह पिछले VLA डेटासेट के आकार का 5% से भी कम है (Figure ब्लॉग, 20 फरवरी, 2025)।
Helix 02, जनवरी 2026 में जारी, ने एक तीसरी परत जोड़ी जिसे Figure “System 0” कहता है: एक 10-मिलियन-पैरामीटर, 1kHz पूरे-शरीर संतुलन-नियंत्रक जो 200,000 से ज़्यादा वातावरणों में पूरी तरह सिमुलेशन में प्रशिक्षित है साथ ही 1,000 से ज़्यादा घंटों की पुनः-लक्षित मानवीय गति के साथ। Figure का इसने क्या बदला इसका अपना विवरण इस क्षेत्र में कहीं भी उपलब्ध सबसे तीखी पुराना-बनाम-नया तुलना है: System 0 “स्थिर, स्वाभाविक गति के लिए हाथ से इंजीनियर की गई C++ की 109,504 पंक्तियों को एक ही न्यूरल प्रायर से बदल देता है” (Figure ब्लॉग, 27 जनवरी, 2026)। एक कंपनी के अपने हिसाब से, यही है क्लासिकल-रोबोटिक्स प्रतिमान — गिनाई गई, हाथ से ट्यून की गई नियंत्रण-तर्क — जिसे थोक में एक सीखे हुए मॉडल से बदला जा रहा है। Figure ने बिना किसी मानवीय रीसेट के चार-मिनट, 61-एक्शन वाला डिशवॉशर-लोडिंग कार्य प्रदर्शित किया, वहीं उसी रिलीज़ में यह चेतावनी भी दी कि “परिणाम शुरुआती हैं।”
Boston Dynamics और Toyota Research Institute Atlas मानवाकार पर “Large Behavior Model” काम से एक संबंधित लेकिन ज़्यादा नपी-तुली खोज रिपोर्ट करते हैं: वे क्षमताएं जिन्हें कभी हाथ-प्रोग्रामिंग चाहिए होती थी अब बिना नए कोड के जोड़ी जा सकती हैं, क्योंकि एक ही मॉडल के पास पूरे रोबोट का सीधा नियंत्रण है (Boston Dynamics ब्लॉग, अगस्त 2025)। एक फ़ॉलो-अप 2026 अध्ययन में पाया गया कि कार्य-विशिष्ट फ़ाइन-ट्यूनिंग के बाद, एक पूर्व-प्रशिक्षित बिहेवियर-मॉडल को शुरू से प्रशिक्षण की तुलना में लगभग 3–5 गुना कम कार्य-विशिष्ट डेटा चाहिए था और यह बदलती परिस्थितियों के प्रति ज़्यादा मज़बूत था (TRI) — एक असली, सीमित दक्षता-लाभ, खुले-सिरे वाली सामान्यता का सबूत नहीं।
Tesla का Optimus कार्यक्रम इस क्षेत्र में पारदर्शिता के मामले में सबसे स्पष्ट अपवाद है। Elon Musk और Ashok Elluswamy, जिन्होंने जून 2025 में Optimus की कमान संभाली, वही “फ़ोटॉन अंदर, नियंत्रण बाहर” वाला छोर-से-छोर आर्किटेक्चर बताते हैं जिसे Tesla अपने ड्राइवर-सहायता सॉफ़्टवेयर के लिए इस्तेमाल करता है। DeepMind, NVIDIA, Physical Intelligence, या Figure के विपरीत, Tesla ने इस आर्किटेक्चर पर कोई तकनीकी पेपर प्रकाशित नहीं किया है — केवल सम्मेलन-टिप्पणियां और आय-कॉल पर टिप्पणी (Not a Tesla App, Tesla के 2026 Q2 आय-कॉल का सारांश देते हुए, अगस्त 2026)।
संकुचित रिकॉर्ड सामान्य दक्षता नहीं हैं
बीजिंग में World Humanoid Robot Games (22–26 अगस्त, 2026) संकुचित और सामान्य क्षमता के बीच के अंतर को ठोस बनाते हैं। 666 टीमों के 2,056 रोबोटों में से, एक मशीन, Tiangong Ultra, ने 100 मीटर 8.64 सेकंड में दौड़ी — Usain Bolt के 9.58-सेकंड के मानवीय विश्व-रिकॉर्ड से तेज़। उसी टूर्नामेंट में, फ़ुटबॉल, बॉक्सिंग, और वेटलिफ़्टिंग स्पर्धाओं की कवरेज ने रोबोटों को असंरचित, संपर्क-भारी परिस्थितियों में जूझते हुए बताया (Al Jazeera)। एक दोहराने-योग्य, इंजीनियर की गई दौड़ किसी अप्रत्याशित वातावरण में लचीली दक्षता के बराबर उपलब्धि नहीं है, और Games उस अंतर को अमूर्त रूप में नहीं बल्कि उसी हफ़्ते दिखाते हैं।
ज़मीन से जुड़ा नज़रिया
Vincent Vanhoucke, जो Google DeepMind में रोबोटिक्स का नेतृत्व करते हैं, इस पूरे रुझान पर उपलब्ध सबसे तीखी वास्तविकता-जांच पेश करते हैं: “ज़्यादातर — अगर सभी नहीं — रोबोट-लर्निंग दृष्टिकोणों को किसी भी व्यावहारिक कार्य के लिए तैनात नहीं किया जा सकता,” क्योंकि असली तैनाती के लिए “99.X प्रतिशत या उससे ज़्यादा सटीकता और विश्वसनीयता” चाहिए जहां शैक्षणिक प्रदर्शन लगभग 80% सफलता रिपोर्ट करते हैं — उनके शब्दों में, “एक बुनियादी रूप से अलग जानवर,” कोई स्केलिंग-समस्या नहीं जिसे ज़्यादा डेटा से हल किया जाए (IEEE Spectrum, 28 मई, 2024)।
Rodney Brooks, MIT के रोबोटिसिस्ट जिन्होंने iRobot और Rethink Robotics की सह-स्थापना की, इस बात पर और दबाव डालते हैं कि वीडियो-नकल प्रशिक्षण विशेष रूप से ग़लत आधार-सामग्री क्यों हो सकता है: स्पर्श में एक ऐसा चैनल शामिल है जिसे मौजूदा पाइपलाइन कभी नहीं पकड़ती, जिसमें वे जिस न्यूरोसाइंस-शोध का हवाला देते हैं वह मानवीय त्वचा में स्पर्श-संवेदी न्यूरॉन के कम से कम पंद्रह अलग परिवारों की पहचान करता है। वे आज के हेरफेर-प्रदर्शनों को शुरुआती और सीमित कहते हैं, और इन दावों को खारिज करते हैं कि मानवाकार दशकों के भीतर मानव-स्तरीय सामान्य निपुणता तक पहुंच जाएंगे, इन्हें “शुद्ध कल्पना-सोच” बताते हुए (TechCrunch, 26 सितंबर, 2025)।
दोनों बातें एक साथ सच हैं। फ़ाउंडेशन-मॉडल दृष्टिकोण ने असली, मापा गया क्रॉस-रोबोट स्थानांतरण पैदा किया है जो हाथ-कोडित नियंत्रण ने कभी हासिल नहीं किया, और हर विश्वसनीय लैब जो आंकड़े प्रकाशित करती है — केवल संशयवादी नहीं — औद्योगिक और घरेलू विश्वसनीयता को वास्तव में जो चाहिए उससे कहीं कम सफलता-दर रिपोर्ट करती है।