Dau mawili tofauti kuhusu jinsi roboti inavyopaswa kujifunza
Robotiki ya kawaida hujenga kazi kwa mkono: moduli za uhisi, kipanga mipango, kitatuzi cha kinematiki cha kinyume, mashine ya hali, na maelfu ya mistari ya msimbo wa udhibiti uliolengwa kwa roboti moja, kishikizo kimoja, seti finyu moja ya vitu. Inatoa kitu chenye thamani—dhamana rasmi kuhusu kile mfumo utakachofanya na kisichofanya—lakini haihamishiki. Kazi mpya, au mkono mpya wa roboti, kwa kawaida humaanisha kuandika upya sehemu kubwa ya mfumo.
Dau linalobadilisha uwanja huu tangu 2023 ni tofauti: mapishi yaleyale yaliyozalisha mifano mikubwa ya lugha—seti kubwa za data, transfoma, na kiwango—yanapaswa pia kufanya kazi kwa udhibiti wa roboti, kugundua «manifold» ya jumla ya ujuzi wa kimwili kama ilivyogundua moja kwa maandishi na picha. Hilo ni dhana, wala si ukweli uliokwisha amuliwa, na ushahidi hadi sasa ni wa mchanganyiko kwa kweli. Ukurasa huu unaelezea kile ambacho kimeonyeshwa kwa kweli, na nani, na kile watu wanaojenga mifumo hii wanasema bado ni matatizo yaliyo wazi.
Ushahidi wa kwanza: alama za hatua na uhamishaji baina ya roboti
RT-2 ya Google DeepMind, iliyochapishwa Julai 2023, ilikuwa jaribio la mapema, la wazi la wazo hilo. Badala ya kujenga moduli tofauti ya utabiri wa hatua, DeepMind ilifunza alama za hatua za roboti moja kwa moja katika msamiati wa matokeo wa mfano wa uoni-lugha wenyewe, hivyo mtandao uleule unaoelezea picha kwa maneno pia unaweza kutoa amri ya motor (arXiv:2307.15818). Katika majaribio 6,000 ya tathmini, ilijumlisha kwa vitu na mazingira yasiyofahamika karibu mara tatu bora zaidi kuliko misingi ya awali mahususi ya kazi—ushahidi kwamba maarifa ya kuona na ya lugha ya kiwango cha wavuti kwa kweli hubeba taarifa fulani muhimu kwa udhibiti wa vitu.
Miezi mitatu baadaye, ushirikiano wa taasisi 34 ulisonga mbele zaidi na RT-X na seti ya data ya Open X-Embodiment, ikikusanya data kutoka aina kadhaa tofauti za roboti na kufunza mfano mmoja wa vigezo bilioni 55 katika zote (arXiv:2310.08864). Ilionyesha mafanikio ya ujuzi unaojitokeza ya juu zaidi kwa kiasi kikubwa kuliko toleo la vigezo bilioni 5 la muundo huohuo—ishara ya mapema kwamba kiwango hasa kinasababisha uhamishaji baina ya miili tofauti ya roboti, wala si ndani ya moja tu.
Uwanja uliojaa mifano ya msingi kwa ajili ya miili
Matokeo hayo yalisababisha wimbi la «mifano ya msingi ya roboti» iliyojengwa na kampuni, kila moja ikiwa na muundo tofauti na kila moja ikitoa madai yanayostahili kusomwa kama madai ya kampuni badala ya ukweli uliothibitishwa kwa uhuru.
π0 ya Physical Intelligence (Oktoba 2024) ilichanganya mfano wa uoni-lugha wa PaliGemma na kichwa cha hatua cha kulinganisha mtiririko, kilichofunzwa katika miili minane ya roboti, na kuonyesha kazi kama kukunja nguo, kusafisha meza, na kuweka bidhaa kwenye mifuko. Kwa njia isiyo ya kawaida kwa uwanja huu, Physical Intelligence ilifungua chanzo cha uzito na msimbo kama «openpi», ikifanya matokeo kuwa yanayoweza kurudiwa kwa uhuru badala ya kuchukuliwa kwa imani. Hata hivyo, tathmini ya kampuni yenyewe ilikuwa ya wazi: «sera za roboti za jumla bado ziko katika utoto wake, na tuna njia ndefu ya kwenda» (blogu ya Physical Intelligence, Okt. 31, 2024). Toleo jipya zaidi, π0.7, linadai ujumlishaji wa sampuli-sifuri katika miili ya roboti (arXiv:2604.15483), lakini kufikia sasa dai hilo linategemea karatasi ya awali ambayo haijarudiwa kwa uhuru.
NVIDIA ilitoa GR00T N1 Machi 2025 kama mfano wa kwanza wa msingi wa roboti ya kibinadamu iliyofunguliwa, kisha GR00T N1.7 Aprili 2026: mfano wa vigezo bilioni 3 uliofunzwa kwa masaa 20,854 ya video ya mtazamo wa nafsi ya binadamu na kuthibitishwa katika majukwaa matatu tofauti ya roboti, yenye uzito wazi kwenye Hugging Face. NVIDIA iliripoti kwamba kuongeza data hiyo ya mafunzo ya mtazamo wa nafsi kwa karibu mara ishirini «kunazidisha kwa zaidi ya mara mbili ukamilishaji wa wastani wa kazi» katika kazi za ustadi—dai linalostahili kuashiriwa kama la NVIDIA lenyewe, kwa kuwa hakuna kipimo huru kinacholiambatana (blogu ya Hugging Face, Apr. 17, 2026). Mrithi, GR00T N2, alionyeshwa mapema katika GTC Machi 2026 kama «mfano wa hatua wa dunia» unaotabiri hali za baadaye kabla ya kutenda; dai la hotuba kuu ya NVIDIA kwamba unafaulu kazi mpya «zaidi ya mara mbili mara nyingi zaidi» kuliko misingi inayoongoza linabaki, kufikia Septemba 2026, dai la bidhaa isiyotolewa badala ya moja iliyojaribiwa.
Mrithi wa RT-2 wa Google DeepMind, Gemini Robotics 2 (pia inaitwa ER 2), ulihama kutoka maonyesho ya sehemu ya juu ya mwili kwenda udhibiti wa mwili mzima wa kibinadamu kwenye Apollo 2 ya Apptronik, ikiwemo amri ya mkono wenye digrii 22 za uhuru na vidole vitano kwa kazi kama kufunga fundo na kufunga mifuko. Nambari zilizofichuliwa na DeepMind yenyewe ndizo za wazi zaidi katika uwanja huu: asilimia 45.7–76.3 ya mafanikio katika udhibiti wa mwili mzima na asilimia 32–92 tofauti sana katika ustadi wa vidole vingi, huku DeepMind ikisema waziwazi kwamba «udhibiti wa ustadi wa vidole vingi unabaki changamoto» (blogu ya DeepMind, Jul. 30, 2026). Kichwa cha habari cha Bloomberg kuhusu utoaji huo kilieleza kwa uwazi zaidi: roboti za Google «zinasumbuka na ustadi» (Bloomberg).
Kabla-na-baada wazi zaidi: Helix 02 ya Figure
Onyesho moja wazi zaidi la kile kinachobadilika chini ya mbinu hii linatoka Figure. Mfumo wake wa asili wa Helix (Februari 2025) ulitumia muundo wa sehemu mbili wa «System 1 / System 2»: mfano wa uoni-lugha wa vigezo bilioni 7 unaofikiri kwa Hz 7–9, ukilisha transfoma ya vigezo milioni 80 inayoendesha udhibiti wa mwendo mzuri kwa Hz 200, uliofunzwa kwa data ya karibu masaa 500 tu—Figure inasema chini ya asilimia 5 ya ukubwa wa seti za data za VLA za awali (blogu ya Figure, Feb. 20, 2025).
Helix 02, iliyotolewa Januari 2026, iliongeza tabaka la tatu Figure inaita «System 0»: kidhibiti cha usawa cha mwili mzima cha vigezo milioni 10, kHz 1, kilichofunzwa kabisa katika uigaji katika zaidi ya mazingira 200,000 pamoja na zaidi ya masaa 1,000 ya mwendo wa binadamu uliolengwa upya. Maelezo ya Figure yenyewe ya kile kilichobadilishwa ndiyo ulinganisho mkali zaidi wa zamani-dhidi-ya-mpya unaopatikana popote katika uwanja huu: System 0 «inabadilisha mistari 109,504 ya C++ iliyoundwa kwa mkono na kianzio kimoja cha neva cha mwendo thabiti, wa asili» (blogu ya Figure, Jan. 27, 2026). Hilo ndilo dhana ya robotiki ya kawaida—mantiki ya udhibiti iliyoorodheshwa, iliyorekebishwa kwa mkono—ikibadilishwa kabisa na mfano uliojifunzwa, kwa hesabu ya kampuni yenyewe. Figure ilionyesha kazi ya dakika nne, hatua 61 ya kupakia mashine ya kuosha vyombo bila kuwekwa upya na binadamu, huku ikitahadharisha katika utoaji huohuo kwamba «matokeo ni ya mapema».
Boston Dynamics na Toyota Research Institute wanaripoti ugunduzi unaohusiana lakini wenye kipimo zaidi kutoka kazi ya «Large Behavior Model» kwenye roboti ya kibinadamu Atlas: uwezo ambao hapo awali ulihitaji upangaji programu kwa mkono sasa unaweza kuongezwa bila msimbo mpya, kwa kuwa mfano mmoja una udhibiti wa moja kwa moja wa roboti nzima (blogu ya Boston Dynamics, Aug. 2025). Utafiti wa ufuatiliaji wa 2026 uligundua kwamba baada ya urekebishaji mahususi wa kazi, mfano wa tabia uliofunzwa awali ulihitaji data mahususi ya kazi ndogo mara 3–5 na ulikuwa thabiti zaidi kwa hali zinazobadilika kuliko kufunza kutoka mwanzo (TRI)—faida halisi, yenye mipaka ya ufanisi, wala si ushahidi wa ujumlishaji usio na mipaka.
Mpango wa Optimus wa Tesla ndio tofauti wazi zaidi ya uwanja huu kuhusu uwazi. Elon Musk na Ashok Elluswamy, aliyechukua Optimus Juni 2025, wanaeleza muundo huohuo wa mwanzo-hadi-mwisho wa «fotoni ndani, udhibiti nje» ambao Tesla inatumia kwa programu yake ya msaada wa dereva. Tofauti na DeepMind, NVIDIA, Physical Intelligence, au Figure, Tesla haijachapisha karatasi ya kiufundi kuhusu muundo huu—maoni ya mikutano na maoni ya simu za mapato pekee (Not a Tesla App, ikifupisha simu ya mapato ya Q2 2026 ya Tesla, Aug. 2026).
Rekodi finyu si umahiri wa jumla
Michezo ya Roboti za Kibinadamu Duniani huko Beijing (Agosti 22–26, 2026) inafanya tofauti kati ya uwezo finyu na wa jumla kuwa halisi. Katika roboti 2,056 kutoka timu 666, mashine moja, Tiangong Ultra, ilikimbia mita 100 kwa sekunde 8.64—haraka zaidi kuliko rekodi ya dunia ya binadamu ya sekunde 9.58 ya Usain Bolt. Katika mashindano hayohayo, uchambuzi wa matukio ya mpira wa miguu, ndondi, na kunyanyua uzito ulieleza roboti zikisumbuka katika hali zisizopangwa, zenye mgusano mwingi (Al Jazeera). Mbio zilizopangwa, zinazoweza kurudiwa si mafanikio yaleyale na umahiri unaonyumbulika katika mazingira yasiyotabirika, na Michezo hiyo inaonyesha pengo hilo katika wiki hiyohiyo badala ya kwa dhana tu.
Mtazamo wa msingi wa hali halisi
Vincent Vanhoucke, anayeongoza robotiki katika Google DeepMind, anatoa ukaguzi mkali zaidi wa uhalisia unaopatikana kuhusu mwelekeo huu wote: «wengi—kama si wote—wa mbinu za ujifunzaji wa roboti hazwezi kutumika kwa kazi yoyote ya vitendo», kwa sababu utumiaji halisi unahitaji «usahihi na uaminifu wa asilimia 99.X au zaidi» ambapo maonyesho ya kitaaluma yanaripoti karibu asilimia 80 ya mafanikio—kwa maneno yake, «mnyama tofauti kabisa», wala si tatizo la kiwango la kutatuliwa kwa data zaidi (IEEE Spectrum, May 28, 2024).
Rodney Brooks, mtaalamu wa robotiki wa MIT aliyeanzisha kwa pamoja iRobot na Rethink Robotics, anasukuma zaidi kuhusu kwa nini mafunzo ya kuiga video hasa huenda ni msingi usiofaa: kugusa kunahusisha kituo ambacho mifumo ya sasa haijawahi kunasa, huku utafiti wa sayansi ya neva anaonukuu ukibainisha angalau familia kumi na tano tofauti za nyuroni za kuhisi kugusa katika ngozi ya binadamu. Anaita maonyesho ya udhibiti wa vitu ya leo ya mapema na finyu, na anakataa madai kwamba roboti za kibinadamu zitafikia ustadi wa jumla wa kiwango cha binadamu ndani ya miongo kama «fikra safi za ndoto» (TechCrunch, Sept. 26, 2025).
Mambo yote mawili ni ya kweli kwa wakati mmoja. Mbinu ya mfano wa msingi imezalisha uhamishaji halisi, uliopimwa baina ya roboti ambao udhibiti ulioandikwa kwa mkono haujawahi kufanikisha, na kila maabara ya kuaminika inayochapisha nambari—wala si wenye shaka tu—inaripoti viwango vya mafanikio chini kwa kiasi kikubwa ya kile uaminifu wa kiviwanda na wa nyumbani unahitaji kwa kweli.