Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI İnsanlığın hayatta kalma brifingi
TR

AGI çağı temel modellerinin bir robot bedeninin neler yapabileceğini nasıl değiştirdiği

AGI ilerlemesini yönlendiren temel model yöntemlerinin robot bedenlerine nasıl uygulandığı, el ile kodlanmış kontrolün yerini daha geniş ama sınırlı genellemenin alması.

Written by
Dwight Ringdahl
Status
Kaynakları doğrulandı
Revised
Sources
16 cited
Reading
6 min

Bir robotun nasıl öğrenmesi gerektiği hakkında iki farklı bahis

Klasik robotik bir görevi elle inşa eder: algı modülleri, bir planlayıcı, bir ters kinematik çözücü, bir durum makinesi ve bir robota, bir kavramaya, dar bir nesne setine göre ayarlanmış binlerce satır kontrol kodu. Değerli bir şey sunar — sistemin ne yapıp ne yapmayacağına dair resmi garantiler — ama aktarılmaz. Yeni bir görev veya yeni bir robot kolu genellikle yığının çoğunun yeniden yazılması anlamına gelir.

2023’ten bu yana alanı yeniden şekillendiren bahis farklıdır: büyük dil modellerini üreten aynı tarif — devasa veri kümeleri, bir transformer ve ölçek — robot kontrolü için de işe yaramalı, metin ve görüntüler için keşfettiği gibi fiziksel beceri için genel bir “manifold” keşfetmeli. Bu bir hipotezdir, çözülmüş bir gerçek değildir ve şimdiye kadarki kanıt gerçekten karışıktır. Bu sayfa, gerçekte kimin tarafından, ne gösterildiğini ve bu sistemleri inşa eden insanların hâlâ açık sorunlar olarak nelerden bahsettiğini ortaya koyuyor.

İlk kanıt: eylem jetonları ve robotlar arası aktarım

Temmuz 2023’te yayımlanan Google DeepMind’ın RT-2’si, bu fikrin erken, somut bir testiydi. Ayrı bir eylem tahmini modülü inşa etmek yerine, DeepMind robot eylem jetonlarını doğrudan bir görü-dil modelinin kendi çıktı kelime dağarcığına eğitti, böylece bir görüntüyü kelimelerle tanımlayan aynı ağ da bir motor komutu üretebiliyor (arXiv:2307.15818). 6.000 değerlendirme denemesi genelinde, tanıdık olmayan nesnelere ve ortamlara önceki göreve özgü temel çizgilerden kabaca üç kat daha iyi genelleme yaptı — web ölçeğindeki görsel ve dil bilgisinin gerçekten manipülasyon için yararlı bazı bilgiler taşıdığının kanıtı.

Üç ay sonra, 34 kurumun iş birliği, düzinelerce farklı robot türünden veri toplayarak ve hepsi genelinde 55 milyar parametreli tek bir model eğiterek RT-X ve Open X-Embodiment veri kümesiyle daha da ileri gitti (arXiv:2310.08864). Aynı mimarinin 5 milyar parametreli bir versiyonundan önemli ölçüde daha yüksek ortaya çıkan beceri başarısı gösterdi — ölçeğin özellikle farklı robot bedenleri arasındaki aktarımı yönlendirdiğine dair, sadece bir tanesinin içinde değil, erken bir sinyal.

Bedenler için temel modellerin kalabalık bir alanı

Bu sonuç, her biri farklı bir mimariye sahip ve her biri şirket iddiaları olarak okunmayı hak eden — bağımsız olarak doğrulanmış gerçekler olarak değil — şirket tarafından inşa edilmiş bir “robot temel modelleri” dalgasını tetikledi.

Physical Intelligence’ın π0’ı (Ekim 2024), PaliGemma görü-dil modelini bir akış eşleştirme eylem başlığıyla birleştirdi, sekiz robot bedeni genelinde eğitildi ve çamaşır katlama, masa temizleme ve alışveriş poşetleme gibi görevler gösterdi. Bu alan için alışılmadık bir şekilde, Physical Intelligence ağırlıkları ve kodu “openpi” olarak açık kaynak hâline getirdi, sonucu inanca dayanmak yerine bağımsız olarak tekrarlanabilir kıldı. Buna rağmen, şirketin kendi değerlendirmesi keskindi: “genelist robot politikaları hâlâ bebeklik döneminde ve gidecek uzun bir yolumuz var” (Physical Intelligence blogu, 31 Ekim 2024). Daha yeni bir sürüm olan π0.7, robot bedenleri genelinde sıfır atışlı genelleme iddia ediyor (arXiv:2604.15483), ama bu yazının yazıldığı sırada bu iddia bağımsız olarak tekrarlanmamış bir ön baskıya dayanıyor.

NVIDIA, Mart 2025’te ilk açık insansı temel modeli olarak GR00T N1’i, ardından Nisan 2026’da GR00T N1.7’yi piyasaya sürdü: 20.854 saat insan birinci şahıs videosu üzerinde eğitilmiş, üç farklı robot platformunda doğrulanmış, Hugging Face’de açık ağırlıklara sahip 3 milyar parametreli bir model. NVIDIA, bu birinci şahıs eğitim verisini kabaca yirmi kat ölçeklendirmenin, becerikli görevlerde “ortalama görev tamamlamasını iki kattan fazla artırdığını” bildirdi — bu iddiayı NVIDIA’nın kendisi olarak işaretlemeye değer, çünkü hiçbir bağımsız gösterge testi buna eşlik etmiyor (Hugging Face blogu, 17 Nisan 2026). Bir halef olan GR00T N2, Mart 2026’da GTC’de, hareket etmeden önce gelecekteki durumları tahmin eden bir “dünya eylem modeli” olarak önizlendi; NVIDIA’nın açılış konuşmasındaki, öncü temel çizgilerden “iki kattan fazla sıklıkla” yeni görevlerde başarılı olduğu iddiası, Eylül 2026 itibarıyla, test edilmiş değil, yayımlanmamış bir ürün iddiası olarak kalıyor.

Google DeepMind’ın RT-2’nin halefi, Gemini Robotics 2 (ER 2 olarak da adlandırılır), üst gövde gösterilerinden Apptronik’in Apollo 2’sinde tam vücut insansı kontrolüne geçti, düğüm bağlama ve poşet mühürleme gibi görevler için 22 serbestlik dereceli beş parmaklı bir elin komutası dahil. DeepMind’ın kendi açıkladığı rakamlar alandaki en samimi rakamlardır: tam vücut manipülasyonunda yüzde 45,7-76,3 başarı ve çok parmaklı beceride yüksek derecede değişken yüzde 32-92, DeepMind “çok parmaklı becerikli manipülasyonun zorlu kalmaya devam ettiğini” açıkça belirtiyor (DeepMind blogu, 30 Temmuz 2026). Bloomberg’in yayın hakkındaki kendi başlığı bunu daha da açık bir şekilde ifade etti: Google’ın robotları “beceriyle mücadele ediyor” (Bloomberg).

En net öncesi-sonrası: Figure’ın Helix 02’si

Bu yaklaşım altında nelerin değiştiğinin tek en net örneği Figure’dan geliyor. Orijinal Helix sistemi (Şubat 2025), iki parçalı bir “Sistem 1 / Sistem 2” mimarisi kullandı: 7-9 Hz’de akıl yürüten 7 milyar parametreli bir görü-dil modeli, 200 Hz’de ince motor kontrolü çalıştıran 80 milyon parametreli bir transformer’ı besliyor, yalnızca yaklaşık 500 saatlik veri üzerinde eğitilmiş — Figure, önceki VLA veri kümelerinin boyutunun yüzde 5’inin altında olduğunu söylüyor (Figure blogu, 20 Şubat 2025).

Ocak 2026’da piyasaya sürülen Helix 02, Figure’ın “Sistem 0” dediği üçüncü bir katman ekledi: 200.000’den fazla ortamda tamamen simülasyonda eğitilmiş 10 milyon parametreli, 1kHz’lik tam vücut denge kontrolörü, artı 1.000 saatten fazla yeniden hedeflenmiş insan hareketi. Figure’ın bunun yerine geçtiği şeye dair kendi açıklaması, bu alanda herhangi bir yerde bulunan en keskin eski-yeni karşılaştırmasıdır: Sistem 0 “109.504 satırlık el ile mühendislik yapılmış C++’ın yerine, kararlı, doğal hareket için tek bir sinir öncülünü koyuyor” (Figure blogu, 27 Ocak 2026). Bu, sayılanmış, elle ayarlanmış kontrol mantığı olan klasik robotik paradigmasının, bir şirketin kendi anlatımında toptan öğrenilmiş bir model tarafından değiştirilmesidir. Figure, aynı yayında “sonuçların erken olduğu” uyarısını yaparken, insan sıfırlaması olmadan dört dakikalık, 61 eylemli bir bulaşık makinesi doldurma görevini gösterdi.

Boston Dynamics ve Toyota Araştırma Enstitüsü, Atlas insansısı üzerindeki “Büyük Davranış Modeli” çalışmasından ilişkili ama daha ölçülü bir bulgu bildiriyor: bir zamanlar elle programlama gerektiren yetenekler artık yeni kod olmadan eklenebiliyor, çünkü tek bir model robotun tamamının doğrudan kontrolüne sahip (Boston Dynamics blogu, Ağustos 2025). Bir takip 2026 çalışması, göreve özgü ince ayardan sonra, önceden eğitilmiş bir davranış modelinin sıfırdan eğitimden kabaca 3-5 kat daha az göreve özgü veriye ihtiyaç duyduğunu ve değişen koşullara karşı daha sağlam olduğunu buldu (TRI) — açık uçlu genelliğin kanıtı değil, gerçek, sınırlı bir verimlilik kazanımı.

Tesla’nın Optimus programı, alanın şeffaflık konusundaki en net aykırı değeridir. Haziran 2025’te Optimus’u devralan Elon Musk ve Ashok Elluswamy, Tesla’nın sürücü yardım yazılımı için kullandığı aynı “fotonlar içeri, kontroller dışarı” uçtan uca mimariyi tanımlıyor. DeepMind, NVIDIA, Physical Intelligence veya Figure’ın aksine, Tesla bu mimari hakkında bir teknik makale yayımlamadı — yalnızca konferans yorumları ve kazanç görüşmesi yorumları (Not a Tesla App, Tesla’nın 2026 2. çeyrek kazanç görüşmesini özetliyor, Ağustos 2026).

Dar rekorlar genel yetkinlik değildir

Pekin’deki World Humanoid Robot Games (22-26 Ağustos 2026), dar ve genel yetenek arasındaki farkı somutlaştırıyor. 666 takımdan 2.056 robot genelinde, bir makine, Tiangong Ultra, 100 metreyi 8,64 saniyede koştu — Usain Bolt’un 9,58 saniyelik insan dünya rekorundan daha hızlı. Aynı turnuvada, futbol, boks ve halter etkinliklerinin haberciliği, robotların yapılandırılmamış, temas ağırlıklı koşullarda mücadele ettiğini tanımladı (Al Jazeera). Tekrarlanabilir, mühendislik edilmiş bir sprint, öngörülemez bir ortamdaki esnek yetkinlikle aynı başarı değildir ve Oyunlar bu boşluğu soyut olarak değil, aynı hafta içinde gösteriyor.

Temellendirilmiş bakış

Google DeepMind’da robotiğe başkanlık eden Vincent Vanhoucke, bu eğilimin tamamı hakkında mevcut en keskin gerçeklik kontrolünü sunuyor: “hiçbir — belki tüm olmasa da çoğu — robot öğrenme yaklaşımı herhangi bir pratik görev için dağıtılamaz,” çünkü gerçek dağıtım, akademik gösterilerin kabaca yüzde 80 başarı bildirdiği yerde “yüzde 99,X veya daha yüksek doğruluk ve güvenilirlik” gerektiriyor — kendi sözleriyle, daha fazla veriyle çözülecek bir ölçeklendirme sorunu değil, “temelde farklı bir canavar” (IEEE Spectrum, 28 Mayıs 2024).

iRobot ve Rethink Robotics’in eş kurucusu MIT robotikçisi Rodney Brooks, özellikle video-taklit eğitiminin neden yanlış alt tabaka olabileceği konusunda daha da ileri gidiyor: dokunma, mevcut hiçbir ardışık düzenin hiçbir zaman yakalamadığı bir kanal içeriyor, alıntıladığı sinirbilim araştırması insan derisinde en az on beş farklı dokunma algılama nöron ailesi belirliyor. Bugünün manipülasyon gösterilerini erken ve sınırlı olarak nitelendiriyor ve insansıların onlarca yıl içinde insan düzeyinde genel beceriye ulaşacağı iddialarını “saf fantezi düşüncesi” olarak reddediyor (TechCrunch, 26 Eylül 2025).

Her iki şey de aynı anda doğrudur. Temel model yaklaşımı, elle kodlanmış kontrolün hiçbir zaman başaramadığı gerçek, ölçülmüş robotlar arası aktarım üretti ve rakam yayımlayan her güvenilir laboratuvar — sadece şüpheciler değil — endüstriyel ve ev güvenilirliğinin gerçekte gerektirdiğinin oldukça altında başarı oranları bildiriyor.

References

Summarized position

Google DeepMind trained robot action tokens directly into a vision-language model’s output vocabulary and reported roughly 3x better generalization to unseen objects, backgrounds, and settings than prior baselines across 6,000 evaluation trials.

Google DeepMind, Authors, "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"
arXiv, Primary source
Summarized position

Vincent Vanhoucke said most robot-learning approaches "cannot be deployed for any practical task" because real-world use demands 99.X percent reliability, calling that bar "a fundamentally different beast" from an 80 percent-success research demo.

Vincent Vanhoucke, Head of robotics, Google DeepMind / Google Research
IEEE Spectrum ("Will Scaling Solve Robotics?" by Nishanth J. Kumar), Reported interview
Summarized position

Google DeepMind disclosed whole-body manipulation success rates of 45.7–76.3% and multi-finger dexterity success of 32–92% for Gemini Robotics 2 on Apptronik’s Apollo 2, stating that "multi-finger dexterous manipulation remains challenging".

Google DeepMind, Gemini Robotics 2 / ER 2 announcement
DeepMind blog, Primary source
Summarized position

Figure said Helix 02’s new "System 0" whole-body balance controller "replaces 109,504 lines of hand-engineered C++ with a single neural prior for stable, natural motion," trained on over 1,000 hours of retargeted human motion across more than 200,000 simulated environments, and cautioned that "the results are early".

Figure, Helix 02 announcement
Figure AI blog, Primary source
Summarized position

NVIDIA reported that scaling GR00T N1.7’s egocentric-video training data from roughly 1,000 to 20,854 hours "more than doubles average task completion" on dexterous manipulation tasks, without citing an independent benchmark.

NVIDIA, GR00T N1.7 announcement
Hugging Face / NVIDIA blog, Primary source
Summarized position

Rodney Brooks argued that current video-imitation training pipelines skip the tactile channel entirely — citing touch-sensing research describing at least fifteen distinct families of touch neurons in human skin — and called claims that humanoids will reach human-level general dexterity within decades "pure fantasy thinking".

Rodney Brooks, Roboticist; MIT CSAIL emeritus; co-founder, iRobot and Rethink Robotics
"Why Today’s Humanoids Won’t Learn Dexterity" (rodneybrooks.com), Primary source
  1. arXiv:2310.08864 arxiv.org
  2. Physical Intelligence blogu pi.website
  3. arXiv:2604.15483 arxiv.org
  4. Bloomberg bloomberg.com
  5. Figure blogu figure.ai
  6. Boston Dynamics blogu bostondynamics.com
  7. TRI toyotaresearchinstitute.github.io
  8. Not a Tesla App, Tesla'nın 2026 2. çeyrek kazanç görüşmesini özetliyor notateslaapp.com
  9. Al Jazeera aljazeera.com
  10. TechCrunch techcrunch.com

Type to search the manual.

navigate open esc close