Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Ripoti ya kuokoka kwa binadamu
SW

Jinsi mifano ya msingi ya enzi ya AGI inavyobadilisha uwezo wa mwili wa roboti

Jinsi mbinu za mfano wa msingi zinazoendesha AGI zinavyotumika kwenye miili ya roboti, zikibadilisha udhibiti ulioandikwa kwa mkono na ujumlishaji mpana zaidi.

Written by
Dwight Ringdahl
Status
Vyanzo vimekaguliwa
Revised
Sources
16 cited
Reading
7 min

Dau mawili tofauti kuhusu jinsi roboti inavyopaswa kujifunza

Robotiki ya kawaida hujenga kazi kwa mkono: moduli za uhisi, kipanga mipango, kitatuzi cha kinematiki cha kinyume, mashine ya hali, na maelfu ya mistari ya msimbo wa udhibiti uliolengwa kwa roboti moja, kishikizo kimoja, seti finyu moja ya vitu. Inatoa kitu chenye thamani—dhamana rasmi kuhusu kile mfumo utakachofanya na kisichofanya—lakini haihamishiki. Kazi mpya, au mkono mpya wa roboti, kwa kawaida humaanisha kuandika upya sehemu kubwa ya mfumo.

Dau linalobadilisha uwanja huu tangu 2023 ni tofauti: mapishi yaleyale yaliyozalisha mifano mikubwa ya lugha—seti kubwa za data, transfoma, na kiwango—yanapaswa pia kufanya kazi kwa udhibiti wa roboti, kugundua «manifold» ya jumla ya ujuzi wa kimwili kama ilivyogundua moja kwa maandishi na picha. Hilo ni dhana, wala si ukweli uliokwisha amuliwa, na ushahidi hadi sasa ni wa mchanganyiko kwa kweli. Ukurasa huu unaelezea kile ambacho kimeonyeshwa kwa kweli, na nani, na kile watu wanaojenga mifumo hii wanasema bado ni matatizo yaliyo wazi.

Ushahidi wa kwanza: alama za hatua na uhamishaji baina ya roboti

RT-2 ya Google DeepMind, iliyochapishwa Julai 2023, ilikuwa jaribio la mapema, la wazi la wazo hilo. Badala ya kujenga moduli tofauti ya utabiri wa hatua, DeepMind ilifunza alama za hatua za roboti moja kwa moja katika msamiati wa matokeo wa mfano wa uoni-lugha wenyewe, hivyo mtandao uleule unaoelezea picha kwa maneno pia unaweza kutoa amri ya motor (arXiv:2307.15818). Katika majaribio 6,000 ya tathmini, ilijumlisha kwa vitu na mazingira yasiyofahamika karibu mara tatu bora zaidi kuliko misingi ya awali mahususi ya kazi—ushahidi kwamba maarifa ya kuona na ya lugha ya kiwango cha wavuti kwa kweli hubeba taarifa fulani muhimu kwa udhibiti wa vitu.

Miezi mitatu baadaye, ushirikiano wa taasisi 34 ulisonga mbele zaidi na RT-X na seti ya data ya Open X-Embodiment, ikikusanya data kutoka aina kadhaa tofauti za roboti na kufunza mfano mmoja wa vigezo bilioni 55 katika zote (arXiv:2310.08864). Ilionyesha mafanikio ya ujuzi unaojitokeza ya juu zaidi kwa kiasi kikubwa kuliko toleo la vigezo bilioni 5 la muundo huohuo—ishara ya mapema kwamba kiwango hasa kinasababisha uhamishaji baina ya miili tofauti ya roboti, wala si ndani ya moja tu.

Uwanja uliojaa mifano ya msingi kwa ajili ya miili

Matokeo hayo yalisababisha wimbi la «mifano ya msingi ya roboti» iliyojengwa na kampuni, kila moja ikiwa na muundo tofauti na kila moja ikitoa madai yanayostahili kusomwa kama madai ya kampuni badala ya ukweli uliothibitishwa kwa uhuru.

π0 ya Physical Intelligence (Oktoba 2024) ilichanganya mfano wa uoni-lugha wa PaliGemma na kichwa cha hatua cha kulinganisha mtiririko, kilichofunzwa katika miili minane ya roboti, na kuonyesha kazi kama kukunja nguo, kusafisha meza, na kuweka bidhaa kwenye mifuko. Kwa njia isiyo ya kawaida kwa uwanja huu, Physical Intelligence ilifungua chanzo cha uzito na msimbo kama «openpi», ikifanya matokeo kuwa yanayoweza kurudiwa kwa uhuru badala ya kuchukuliwa kwa imani. Hata hivyo, tathmini ya kampuni yenyewe ilikuwa ya wazi: «sera za roboti za jumla bado ziko katika utoto wake, na tuna njia ndefu ya kwenda» (blogu ya Physical Intelligence, Okt. 31, 2024). Toleo jipya zaidi, π0.7, linadai ujumlishaji wa sampuli-sifuri katika miili ya roboti (arXiv:2604.15483), lakini kufikia sasa dai hilo linategemea karatasi ya awali ambayo haijarudiwa kwa uhuru.

NVIDIA ilitoa GR00T N1 Machi 2025 kama mfano wa kwanza wa msingi wa roboti ya kibinadamu iliyofunguliwa, kisha GR00T N1.7 Aprili 2026: mfano wa vigezo bilioni 3 uliofunzwa kwa masaa 20,854 ya video ya mtazamo wa nafsi ya binadamu na kuthibitishwa katika majukwaa matatu tofauti ya roboti, yenye uzito wazi kwenye Hugging Face. NVIDIA iliripoti kwamba kuongeza data hiyo ya mafunzo ya mtazamo wa nafsi kwa karibu mara ishirini «kunazidisha kwa zaidi ya mara mbili ukamilishaji wa wastani wa kazi» katika kazi za ustadi—dai linalostahili kuashiriwa kama la NVIDIA lenyewe, kwa kuwa hakuna kipimo huru kinacholiambatana (blogu ya Hugging Face, Apr. 17, 2026). Mrithi, GR00T N2, alionyeshwa mapema katika GTC Machi 2026 kama «mfano wa hatua wa dunia» unaotabiri hali za baadaye kabla ya kutenda; dai la hotuba kuu ya NVIDIA kwamba unafaulu kazi mpya «zaidi ya mara mbili mara nyingi zaidi» kuliko misingi inayoongoza linabaki, kufikia Septemba 2026, dai la bidhaa isiyotolewa badala ya moja iliyojaribiwa.

Mrithi wa RT-2 wa Google DeepMind, Gemini Robotics 2 (pia inaitwa ER 2), ulihama kutoka maonyesho ya sehemu ya juu ya mwili kwenda udhibiti wa mwili mzima wa kibinadamu kwenye Apollo 2 ya Apptronik, ikiwemo amri ya mkono wenye digrii 22 za uhuru na vidole vitano kwa kazi kama kufunga fundo na kufunga mifuko. Nambari zilizofichuliwa na DeepMind yenyewe ndizo za wazi zaidi katika uwanja huu: asilimia 45.7–76.3 ya mafanikio katika udhibiti wa mwili mzima na asilimia 32–92 tofauti sana katika ustadi wa vidole vingi, huku DeepMind ikisema waziwazi kwamba «udhibiti wa ustadi wa vidole vingi unabaki changamoto» (blogu ya DeepMind, Jul. 30, 2026). Kichwa cha habari cha Bloomberg kuhusu utoaji huo kilieleza kwa uwazi zaidi: roboti za Google «zinasumbuka na ustadi» (Bloomberg).

Kabla-na-baada wazi zaidi: Helix 02 ya Figure

Onyesho moja wazi zaidi la kile kinachobadilika chini ya mbinu hii linatoka Figure. Mfumo wake wa asili wa Helix (Februari 2025) ulitumia muundo wa sehemu mbili wa «System 1 / System 2»: mfano wa uoni-lugha wa vigezo bilioni 7 unaofikiri kwa Hz 7–9, ukilisha transfoma ya vigezo milioni 80 inayoendesha udhibiti wa mwendo mzuri kwa Hz 200, uliofunzwa kwa data ya karibu masaa 500 tu—Figure inasema chini ya asilimia 5 ya ukubwa wa seti za data za VLA za awali (blogu ya Figure, Feb. 20, 2025).

Helix 02, iliyotolewa Januari 2026, iliongeza tabaka la tatu Figure inaita «System 0»: kidhibiti cha usawa cha mwili mzima cha vigezo milioni 10, kHz 1, kilichofunzwa kabisa katika uigaji katika zaidi ya mazingira 200,000 pamoja na zaidi ya masaa 1,000 ya mwendo wa binadamu uliolengwa upya. Maelezo ya Figure yenyewe ya kile kilichobadilishwa ndiyo ulinganisho mkali zaidi wa zamani-dhidi-ya-mpya unaopatikana popote katika uwanja huu: System 0 «inabadilisha mistari 109,504 ya C++ iliyoundwa kwa mkono na kianzio kimoja cha neva cha mwendo thabiti, wa asili» (blogu ya Figure, Jan. 27, 2026). Hilo ndilo dhana ya robotiki ya kawaida—mantiki ya udhibiti iliyoorodheshwa, iliyorekebishwa kwa mkono—ikibadilishwa kabisa na mfano uliojifunzwa, kwa hesabu ya kampuni yenyewe. Figure ilionyesha kazi ya dakika nne, hatua 61 ya kupakia mashine ya kuosha vyombo bila kuwekwa upya na binadamu, huku ikitahadharisha katika utoaji huohuo kwamba «matokeo ni ya mapema».

Boston Dynamics na Toyota Research Institute wanaripoti ugunduzi unaohusiana lakini wenye kipimo zaidi kutoka kazi ya «Large Behavior Model» kwenye roboti ya kibinadamu Atlas: uwezo ambao hapo awali ulihitaji upangaji programu kwa mkono sasa unaweza kuongezwa bila msimbo mpya, kwa kuwa mfano mmoja una udhibiti wa moja kwa moja wa roboti nzima (blogu ya Boston Dynamics, Aug. 2025). Utafiti wa ufuatiliaji wa 2026 uligundua kwamba baada ya urekebishaji mahususi wa kazi, mfano wa tabia uliofunzwa awali ulihitaji data mahususi ya kazi ndogo mara 3–5 na ulikuwa thabiti zaidi kwa hali zinazobadilika kuliko kufunza kutoka mwanzo (TRI)—faida halisi, yenye mipaka ya ufanisi, wala si ushahidi wa ujumlishaji usio na mipaka.

Mpango wa Optimus wa Tesla ndio tofauti wazi zaidi ya uwanja huu kuhusu uwazi. Elon Musk na Ashok Elluswamy, aliyechukua Optimus Juni 2025, wanaeleza muundo huohuo wa mwanzo-hadi-mwisho wa «fotoni ndani, udhibiti nje» ambao Tesla inatumia kwa programu yake ya msaada wa dereva. Tofauti na DeepMind, NVIDIA, Physical Intelligence, au Figure, Tesla haijachapisha karatasi ya kiufundi kuhusu muundo huu—maoni ya mikutano na maoni ya simu za mapato pekee (Not a Tesla App, ikifupisha simu ya mapato ya Q2 2026 ya Tesla, Aug. 2026).

Rekodi finyu si umahiri wa jumla

Michezo ya Roboti za Kibinadamu Duniani huko Beijing (Agosti 22–26, 2026) inafanya tofauti kati ya uwezo finyu na wa jumla kuwa halisi. Katika roboti 2,056 kutoka timu 666, mashine moja, Tiangong Ultra, ilikimbia mita 100 kwa sekunde 8.64—haraka zaidi kuliko rekodi ya dunia ya binadamu ya sekunde 9.58 ya Usain Bolt. Katika mashindano hayohayo, uchambuzi wa matukio ya mpira wa miguu, ndondi, na kunyanyua uzito ulieleza roboti zikisumbuka katika hali zisizopangwa, zenye mgusano mwingi (Al Jazeera). Mbio zilizopangwa, zinazoweza kurudiwa si mafanikio yaleyale na umahiri unaonyumbulika katika mazingira yasiyotabirika, na Michezo hiyo inaonyesha pengo hilo katika wiki hiyohiyo badala ya kwa dhana tu.

Mtazamo wa msingi wa hali halisi

Vincent Vanhoucke, anayeongoza robotiki katika Google DeepMind, anatoa ukaguzi mkali zaidi wa uhalisia unaopatikana kuhusu mwelekeo huu wote: «wengi—kama si wote—wa mbinu za ujifunzaji wa roboti hazwezi kutumika kwa kazi yoyote ya vitendo», kwa sababu utumiaji halisi unahitaji «usahihi na uaminifu wa asilimia 99.X au zaidi» ambapo maonyesho ya kitaaluma yanaripoti karibu asilimia 80 ya mafanikio—kwa maneno yake, «mnyama tofauti kabisa», wala si tatizo la kiwango la kutatuliwa kwa data zaidi (IEEE Spectrum, May 28, 2024).

Rodney Brooks, mtaalamu wa robotiki wa MIT aliyeanzisha kwa pamoja iRobot na Rethink Robotics, anasukuma zaidi kuhusu kwa nini mafunzo ya kuiga video hasa huenda ni msingi usiofaa: kugusa kunahusisha kituo ambacho mifumo ya sasa haijawahi kunasa, huku utafiti wa sayansi ya neva anaonukuu ukibainisha angalau familia kumi na tano tofauti za nyuroni za kuhisi kugusa katika ngozi ya binadamu. Anaita maonyesho ya udhibiti wa vitu ya leo ya mapema na finyu, na anakataa madai kwamba roboti za kibinadamu zitafikia ustadi wa jumla wa kiwango cha binadamu ndani ya miongo kama «fikra safi za ndoto» (TechCrunch, Sept. 26, 2025).

Mambo yote mawili ni ya kweli kwa wakati mmoja. Mbinu ya mfano wa msingi imezalisha uhamishaji halisi, uliopimwa baina ya roboti ambao udhibiti ulioandikwa kwa mkono haujawahi kufanikisha, na kila maabara ya kuaminika inayochapisha nambari—wala si wenye shaka tu—inaripoti viwango vya mafanikio chini kwa kiasi kikubwa ya kile uaminifu wa kiviwanda na wa nyumbani unahitaji kwa kweli.

References

Summarized position

Google DeepMind trained robot action tokens directly into a vision-language model’s output vocabulary and reported roughly 3x better generalization to unseen objects, backgrounds, and settings than prior baselines across 6,000 evaluation trials.

Google DeepMind, Authors, "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"
arXiv, Primary source
Summarized position

Vincent Vanhoucke said most robot-learning approaches "cannot be deployed for any practical task" because real-world use demands 99.X percent reliability, calling that bar "a fundamentally different beast" from an 80 percent-success research demo.

Vincent Vanhoucke, Head of robotics, Google DeepMind / Google Research
IEEE Spectrum ("Will Scaling Solve Robotics?" by Nishanth J. Kumar), Reported interview
Summarized position

Google DeepMind disclosed whole-body manipulation success rates of 45.7–76.3% and multi-finger dexterity success of 32–92% for Gemini Robotics 2 on Apptronik’s Apollo 2, stating that "multi-finger dexterous manipulation remains challenging".

Google DeepMind, Gemini Robotics 2 / ER 2 announcement
DeepMind blog, Primary source
Summarized position

Figure said Helix 02’s new "System 0" whole-body balance controller "replaces 109,504 lines of hand-engineered C++ with a single neural prior for stable, natural motion," trained on over 1,000 hours of retargeted human motion across more than 200,000 simulated environments, and cautioned that "the results are early".

Figure, Helix 02 announcement
Figure AI blog, Primary source
Summarized position

NVIDIA reported that scaling GR00T N1.7’s egocentric-video training data from roughly 1,000 to 20,854 hours "more than doubles average task completion" on dexterous manipulation tasks, without citing an independent benchmark.

NVIDIA, GR00T N1.7 announcement
Hugging Face / NVIDIA blog, Primary source
Summarized position

Rodney Brooks argued that current video-imitation training pipelines skip the tactile channel entirely — citing touch-sensing research describing at least fifteen distinct families of touch neurons in human skin — and called claims that humanoids will reach human-level general dexterity within decades "pure fantasy thinking".

Rodney Brooks, Roboticist; MIT CSAIL emeritus; co-founder, iRobot and Rethink Robotics
"Why Today’s Humanoids Won’t Learn Dexterity" (rodneybrooks.com), Primary source
  1. arXiv:2310.08864 arxiv.org
  2. blogu ya Physical Intelligence pi.website
  3. arXiv:2604.15483 arxiv.org
  4. Bloomberg bloomberg.com
  5. blogu ya Figure figure.ai
  6. blogu ya Boston Dynamics bostondynamics.com
  7. TRI toyotaresearchinstitute.github.io
  8. Not a Tesla App, ikifupisha simu ya mapato ya Q2 2026 ya Tesla notateslaapp.com
  9. Al Jazeera aljazeera.com
  10. TechCrunch techcrunch.com

Type to search the manual.

navigate open esc close