Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI मानव अस्तित्व पर रिपोर्ट
HI

How AGI-era foundation models are changing what a robot body can do

How the foundation-model methods driving AGI progress are applied to robot bodies, replacing hand-coded control with broader, still-limited generalization.

Written by
Dwight Ringdahl
Status
स्रोत-जाँचा
Revised
Sources
16 cited
Reading
8 min

किसी रोबोट को कैसे सीखना चाहिए, इस बारे में दो अलग दांव

क्लासिकल रोबोटिक्स किसी कार्य को हाथ से बनाती है: परसेप्शन-मॉड्यूल, एक प्लानर, एक इनवर्स-किनेमेटिक्स सॉल्वर, एक स्टेट-मशीन, और एक रोबोट, एक ग्रिपर, वस्तुओं के एक संकुचित सेट के लिए ट्यून किए गए नियंत्रण-कोड की हज़ारों पंक्तियां। यह कुछ मूल्यवान देती है — इस बारे में औपचारिक गारंटी कि सिस्टम क्या करेगा और क्या नहीं करेगा — लेकिन यह स्थानांतरित नहीं होती। कोई नया कार्य, या कोई नया रोबोट-भुजा, आमतौर पर मतलब है स्टैक के ज़्यादातर हिस्से को फिर से लिखना।

2023 से इस क्षेत्र को नया आकार दे रहा दांव अलग है: वही नुस्खा जिसने बड़े भाषा मॉडल पैदा किए — विशाल डेटासेट, एक ट्रांसफ़ॉर्मर, और स्केल — भौतिक कौशल के लिए भी एक सामान्य “मैनिफ़ोल्ड” खोजते हुए, रोबोट-नियंत्रण के लिए भी काम करना चाहिए, वैसे ही जैसे इसने पाठ और छवियों के लिए एक खोजा था। यह एक परिकल्पना है, कोई तय तथ्य नहीं, और अब तक का सबूत वाकई मिला-जुला है। यह पन्ना बताता है कि वास्तव में क्या प्रदर्शित किया गया है, किसके द्वारा, और इन सिस्टम को बनाने वाले लोग किन खुली समस्याओं की बात करते हैं।

पहला सबूत: एक्शन-टोकन और क्रॉस-रोबोट स्थानांतरण

Google DeepMind का RT-2, जुलाई 2023 में प्रकाशित, इस विचार का एक शुरुआती, ठोस परीक्षण था। एक अलग एक्शन-भविष्यवाणी मॉड्यूल बनाने के बजाय, DeepMind ने रोबोट-एक्शन टोकन को सीधे एक विज़न-लैंग्वेज मॉडल की अपनी आउटपुट-शब्दावली में प्रशिक्षित किया, ताकि वही नेटवर्क जो किसी छवि को शब्दों में वर्णित करता है, एक मोटर-कमांड भी दे सके (arXiv:2307.15818)। 6,000 मूल्यांकन-परीक्षणों में, इसने अपरिचित वस्तुओं और सेटिंग्स के लिए पिछले कार्य-विशिष्ट आधार-रेखाओं से लगभग तीन गुना बेहतर सामान्यीकरण किया — यह सबूत कि वेब-स्केल दृश्य और भाषा ज्ञान वाकई हेरफेर के लिए उपयोगी कुछ जानकारी साथ लाता है।

तीन महीने बाद, 34 संस्थाओं के एक सहयोग ने RT-X और Open X-Embodiment डेटासेट के साथ इसे और आगे बढ़ाया, दर्जनों अलग-अलग रोबोट-प्रकारों से डेटा जमा करते हुए और उन सभी में एक 55-अरब-पैरामीटर मॉडल को प्रशिक्षित करते हुए (arXiv:2310.08864)। इसने उसी आर्किटेक्चर के 5-अरब-पैरामीटर संस्करण से काफ़ी ज़्यादा उभरती-कौशल सफलता दिखाई — यह एक शुरुआती संकेत है कि स्केल विशेष रूप से अलग-अलग रोबोट-शरीरों में स्थानांतरण को चलाता है, न कि केवल एक के भीतर।

शरीरों के लिए फ़ाउंडेशन मॉडलों से भरा एक क्षेत्र

उस परिणाम ने कंपनी-निर्मित “रोबोट फ़ाउंडेशन मॉडल” की एक लहर शुरू कर दी, हर एक अलग आर्किटेक्चर के साथ और हर एक ऐसे दावे करते हुए जिन्हें स्वतंत्र रूप से सत्यापित तथ्य के बजाय कंपनी के दावे के रूप में पढ़ा जाना चाहिए।

Physical Intelligence के π0 (अक्टूबर 2024) ने PaliGemma विज़न-लैंग्वेज मॉडल को एक फ़्लो-मैचिंग एक्शन-हेड के साथ जोड़ा, आठ रोबोट-अवतारों में प्रशिक्षित किया, और कपड़े तह करने, मेज़ साफ़ करने, और किराने का सामान बैग करने जैसे कार्य प्रदर्शित किए। इस क्षेत्र के लिए असामान्य रूप से, Physical Intelligence ने “openpi” के रूप में भार और कोड ओपन-सोर्स किए, जिससे परिणाम केवल विश्वास पर लेने के बजाय स्वतंत्र रूप से पुनरुत्पादनीय बन गया। फिर भी, कंपनी का अपना आकलन साफ़ था: “सामान्यवादी रोबोट-नीतियां अभी भी अपने शैशवकाल में हैं, और हमें बहुत आगे जाना है” (Physical Intelligence ब्लॉग, 31 अक्टूबर, 2024)। एक नया संस्करण, π0.7, रोबोट-अवतारों में ज़ीरो-शॉट सामान्यीकरण का दावा करता है (arXiv:2604.15483), लेकिन इस लेखन के समय यह दावा एक ऐसे प्रीप्रिंट पर टिका है जो स्वतंत्र रूप से दोहराया नहीं गया।

NVIDIA ने मार्च 2025 में पहले खुले मानवाकार फ़ाउंडेशन मॉडल के रूप में GR00T N1 जारी किया, फिर अप्रैल 2026 में GR00T N1.7: एक 3-अरब-पैरामीटर मॉडल जो मानवीय अहं-केंद्रित वीडियो के 20,854 घंटों पर प्रशिक्षित है और तीन अलग-अलग रोबोट-प्लेटफ़ॉर्म पर सत्यापित है, Hugging Face पर खुले भार के साथ। NVIDIA ने रिपोर्ट किया कि उस अहं-केंद्रित प्रशिक्षण-डेटा को लगभग बीस गुना स्केल करने से निपुण कार्यों पर “औसत कार्य-पूर्णता दोगुने से भी ज़्यादा हो जाती है” — यह दावा NVIDIA का अपना बताए जाने लायक है, क्योंकि इसके साथ कोई स्वतंत्र बेंचमार्क नहीं है (Hugging Face ब्लॉग, 17 अप्रैल, 2026)। एक उत्तराधिकारी, GR00T N2, को मार्च 2026 में GTC में एक “विश्व-एक्शन मॉडल” के रूप में पूर्वावलोकन किया गया जो कार्रवाई से पहले भविष्य की स्थितियों की भविष्यवाणी करता है; NVIDIA के मुख्य-भाषण का यह दावा कि यह नए कार्यों में अग्रणी आधार-रेखाओं से “दोगुने से भी ज़्यादा बार” सफल होता है, सितंबर 2026 तक, एक परखा हुआ दावा नहीं बल्कि एक अप्रकाशित उत्पाद-दावा बना हुआ है।

Google DeepMind का RT-2 का उत्तराधिकारी, Gemini Robotics 2 (जिसे ER 2 भी कहा जाता है), ऊपरी-शरीर के प्रदर्शनों से Apptronik के Apollo 2 पर पूरे-शरीर के मानवाकार नियंत्रण की ओर बढ़ा, जिसमें गांठ बांधने और बैग सील करने जैसे कार्यों के लिए 22-डिग्री-स्वतंत्रता वाले पांच-उंगली हाथ का कमांड शामिल है। DeepMind के अपने उजागर किए गए आंकड़े इस क्षेत्र में सबसे स्पष्ट हैं: पूरे-शरीर हेरफेर पर 45.7–76.3% सफलता और बहु-उंगली निपुणता पर अत्यधिक परिवर्तनशील 32–92%, DeepMind ने साफ़ तौर पर कहा कि “बहु-उंगली निपुण हेरफेर अभी भी चुनौतीपूर्ण बना हुआ है” (DeepMind ब्लॉग, 30 जुलाई, 2026)। इस रिलीज़ पर Bloomberg की अपनी सुर्खी और भी स्पष्ट थी: Google के रोबोट “निपुणता से जूझ रहे हैं” (Bloomberg)।

सबसे स्पष्ट पहले-और-बाद: Figure का Helix 02

इस दृष्टिकोण के तहत क्या बदलता है इसका सबसे स्पष्ट एकल उदाहरण Figure से आता है। इसके मूल Helix सिस्टम (फरवरी 2025) ने एक दो-भाग वाला “System 1 / System 2” आर्किटेक्चर इस्तेमाल किया: एक 7-अरब-पैरामीटर विज़न-लैंग्वेज मॉडल जो 7–9 Hz पर तर्क करता है, जो एक 80-मिलियन-पैरामीटर ट्रांसफ़ॉर्मर को खिलाता है जो 200 Hz पर सूक्ष्म मोटर नियंत्रण चलाता है, केवल लगभग 500 घंटों के डेटा पर प्रशिक्षित — Figure कहता है कि यह पिछले VLA डेटासेट के आकार का 5% से भी कम है (Figure ब्लॉग, 20 फरवरी, 2025)।

Helix 02, जनवरी 2026 में जारी, ने एक तीसरी परत जोड़ी जिसे Figure “System 0” कहता है: एक 10-मिलियन-पैरामीटर, 1kHz पूरे-शरीर संतुलन-नियंत्रक जो 200,000 से ज़्यादा वातावरणों में पूरी तरह सिमुलेशन में प्रशिक्षित है साथ ही 1,000 से ज़्यादा घंटों की पुनः-लक्षित मानवीय गति के साथ। Figure का इसने क्या बदला इसका अपना विवरण इस क्षेत्र में कहीं भी उपलब्ध सबसे तीखी पुराना-बनाम-नया तुलना है: System 0 “स्थिर, स्वाभाविक गति के लिए हाथ से इंजीनियर की गई C++ की 109,504 पंक्तियों को एक ही न्यूरल प्रायर से बदल देता है” (Figure ब्लॉग, 27 जनवरी, 2026)। एक कंपनी के अपने हिसाब से, यही है क्लासिकल-रोबोटिक्स प्रतिमान — गिनाई गई, हाथ से ट्यून की गई नियंत्रण-तर्क — जिसे थोक में एक सीखे हुए मॉडल से बदला जा रहा है। Figure ने बिना किसी मानवीय रीसेट के चार-मिनट, 61-एक्शन वाला डिशवॉशर-लोडिंग कार्य प्रदर्शित किया, वहीं उसी रिलीज़ में यह चेतावनी भी दी कि “परिणाम शुरुआती हैं।”

Boston Dynamics और Toyota Research Institute Atlas मानवाकार पर “Large Behavior Model” काम से एक संबंधित लेकिन ज़्यादा नपी-तुली खोज रिपोर्ट करते हैं: वे क्षमताएं जिन्हें कभी हाथ-प्रोग्रामिंग चाहिए होती थी अब बिना नए कोड के जोड़ी जा सकती हैं, क्योंकि एक ही मॉडल के पास पूरे रोबोट का सीधा नियंत्रण है (Boston Dynamics ब्लॉग, अगस्त 2025)। एक फ़ॉलो-अप 2026 अध्ययन में पाया गया कि कार्य-विशिष्ट फ़ाइन-ट्यूनिंग के बाद, एक पूर्व-प्रशिक्षित बिहेवियर-मॉडल को शुरू से प्रशिक्षण की तुलना में लगभग 3–5 गुना कम कार्य-विशिष्ट डेटा चाहिए था और यह बदलती परिस्थितियों के प्रति ज़्यादा मज़बूत था (TRI) — एक असली, सीमित दक्षता-लाभ, खुले-सिरे वाली सामान्यता का सबूत नहीं।

Tesla का Optimus कार्यक्रम इस क्षेत्र में पारदर्शिता के मामले में सबसे स्पष्ट अपवाद है। Elon Musk और Ashok Elluswamy, जिन्होंने जून 2025 में Optimus की कमान संभाली, वही “फ़ोटॉन अंदर, नियंत्रण बाहर” वाला छोर-से-छोर आर्किटेक्चर बताते हैं जिसे Tesla अपने ड्राइवर-सहायता सॉफ़्टवेयर के लिए इस्तेमाल करता है। DeepMind, NVIDIA, Physical Intelligence, या Figure के विपरीत, Tesla ने इस आर्किटेक्चर पर कोई तकनीकी पेपर प्रकाशित नहीं किया है — केवल सम्मेलन-टिप्पणियां और आय-कॉल पर टिप्पणी (Not a Tesla App, Tesla के 2026 Q2 आय-कॉल का सारांश देते हुए, अगस्त 2026)।

संकुचित रिकॉर्ड सामान्य दक्षता नहीं हैं

बीजिंग में World Humanoid Robot Games (22–26 अगस्त, 2026) संकुचित और सामान्य क्षमता के बीच के अंतर को ठोस बनाते हैं। 666 टीमों के 2,056 रोबोटों में से, एक मशीन, Tiangong Ultra, ने 100 मीटर 8.64 सेकंड में दौड़ी — Usain Bolt के 9.58-सेकंड के मानवीय विश्व-रिकॉर्ड से तेज़। उसी टूर्नामेंट में, फ़ुटबॉल, बॉक्सिंग, और वेटलिफ़्टिंग स्पर्धाओं की कवरेज ने रोबोटों को असंरचित, संपर्क-भारी परिस्थितियों में जूझते हुए बताया (Al Jazeera)। एक दोहराने-योग्य, इंजीनियर की गई दौड़ किसी अप्रत्याशित वातावरण में लचीली दक्षता के बराबर उपलब्धि नहीं है, और Games उस अंतर को अमूर्त रूप में नहीं बल्कि उसी हफ़्ते दिखाते हैं।

ज़मीन से जुड़ा नज़रिया

Vincent Vanhoucke, जो Google DeepMind में रोबोटिक्स का नेतृत्व करते हैं, इस पूरे रुझान पर उपलब्ध सबसे तीखी वास्तविकता-जांच पेश करते हैं: “ज़्यादातर — अगर सभी नहीं — रोबोट-लर्निंग दृष्टिकोणों को किसी भी व्यावहारिक कार्य के लिए तैनात नहीं किया जा सकता,” क्योंकि असली तैनाती के लिए “99.X प्रतिशत या उससे ज़्यादा सटीकता और विश्वसनीयता” चाहिए जहां शैक्षणिक प्रदर्शन लगभग 80% सफलता रिपोर्ट करते हैं — उनके शब्दों में, “एक बुनियादी रूप से अलग जानवर,” कोई स्केलिंग-समस्या नहीं जिसे ज़्यादा डेटा से हल किया जाए (IEEE Spectrum, 28 मई, 2024)।

Rodney Brooks, MIT के रोबोटिसिस्ट जिन्होंने iRobot और Rethink Robotics की सह-स्थापना की, इस बात पर और दबाव डालते हैं कि वीडियो-नकल प्रशिक्षण विशेष रूप से ग़लत आधार-सामग्री क्यों हो सकता है: स्पर्श में एक ऐसा चैनल शामिल है जिसे मौजूदा पाइपलाइन कभी नहीं पकड़ती, जिसमें वे जिस न्यूरोसाइंस-शोध का हवाला देते हैं वह मानवीय त्वचा में स्पर्श-संवेदी न्यूरॉन के कम से कम पंद्रह अलग परिवारों की पहचान करता है। वे आज के हेरफेर-प्रदर्शनों को शुरुआती और सीमित कहते हैं, और इन दावों को खारिज करते हैं कि मानवाकार दशकों के भीतर मानव-स्तरीय सामान्य निपुणता तक पहुंच जाएंगे, इन्हें “शुद्ध कल्पना-सोच” बताते हुए (TechCrunch, 26 सितंबर, 2025)।

दोनों बातें एक साथ सच हैं। फ़ाउंडेशन-मॉडल दृष्टिकोण ने असली, मापा गया क्रॉस-रोबोट स्थानांतरण पैदा किया है जो हाथ-कोडित नियंत्रण ने कभी हासिल नहीं किया, और हर विश्वसनीय लैब जो आंकड़े प्रकाशित करती है — केवल संशयवादी नहीं — औद्योगिक और घरेलू विश्वसनीयता को वास्तव में जो चाहिए उससे कहीं कम सफलता-दर रिपोर्ट करती है।

References

Summarized position

Google DeepMind trained robot action tokens directly into a vision-language model’s output vocabulary and reported roughly 3x better generalization to unseen objects, backgrounds, and settings than prior baselines across 6,000 evaluation trials.

Google DeepMind, Authors, "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"
arXiv, Primary source
Summarized position

Vincent Vanhoucke said most robot-learning approaches "cannot be deployed for any practical task" because real-world use demands 99.X percent reliability, calling that bar "a fundamentally different beast" from an 80 percent-success research demo.

Vincent Vanhoucke, Head of robotics, Google DeepMind / Google Research
IEEE Spectrum ("Will Scaling Solve Robotics?" by Nishanth J. Kumar), Reported interview
Summarized position

Google DeepMind disclosed whole-body manipulation success rates of 45.7–76.3% and multi-finger dexterity success of 32–92% for Gemini Robotics 2 on Apptronik’s Apollo 2, stating that "multi-finger dexterous manipulation remains challenging".

Google DeepMind, Gemini Robotics 2 / ER 2 announcement
DeepMind blog, Primary source
Summarized position

Figure said Helix 02’s new "System 0" whole-body balance controller "replaces 109,504 lines of hand-engineered C++ with a single neural prior for stable, natural motion," trained on over 1,000 hours of retargeted human motion across more than 200,000 simulated environments, and cautioned that "the results are early".

Figure, Helix 02 announcement
Figure AI blog, Primary source
Summarized position

NVIDIA reported that scaling GR00T N1.7’s egocentric-video training data from roughly 1,000 to 20,854 hours "more than doubles average task completion" on dexterous manipulation tasks, without citing an independent benchmark.

NVIDIA, GR00T N1.7 announcement
Hugging Face / NVIDIA blog, Primary source
Summarized position

Rodney Brooks argued that current video-imitation training pipelines skip the tactile channel entirely — citing touch-sensing research describing at least fifteen distinct families of touch neurons in human skin — and called claims that humanoids will reach human-level general dexterity within decades "pure fantasy thinking".

Rodney Brooks, Roboticist; MIT CSAIL emeritus; co-founder, iRobot and Rethink Robotics
"Why Today’s Humanoids Won’t Learn Dexterity" (rodneybrooks.com), Primary source
  1. arXiv:2310.08864 arxiv.org
  2. Physical Intelligence ब्लॉग pi.website
  3. arXiv:2604.15483 arxiv.org
  4. Bloomberg bloomberg.com
  5. Figure ब्लॉग figure.ai
  6. Boston Dynamics ब्लॉग bostondynamics.com
  7. TRI toyotaresearchinstitute.github.io
  8. Not a Tesla App, Tesla के 2026 Q2 आय-कॉल का सारांश देते हुए notateslaapp.com
  9. Al Jazeera aljazeera.com
  10. TechCrunch techcrunch.com

Type to search the manual.

navigate open esc close