Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI موجز البقاء البشري
AR

كيف تغيّر نماذج الأساس في عصر الذكاء العام الاصطناعي ما يمكن أن يفعله جسد الروبوت

كيف تُطبَّق أساليب نماذج الأساس التي تدفع تقدم الذكاء العام الاصطناعي على أجساد الروبوتات، لتحل محل التحكم المبرمج يدويًا بتعميم أوسع لكنه لا يزال محدودًا.

Written by
Dwight Ringdahl
Status
تم التحقق من المصادر
Revised
Sources
16 cited
Reading
6 min

رهانان مختلفان حول كيف ينبغي للروبوت أن يتعلم

تبني الروبوتات الكلاسيكية مهمة يدويًا: وحدات إدراك، ومخطِّط، وحلّال حركية عكسية، وآلة حالات، وآلاف الأسطر من شيفرة التحكم المضبوطة لروبوت واحد، وقابض واحد، ومجموعة ضيقة من الأجسام. وتقدم هذه الطريقة شيئًا قيّمًا — ضمانات صورية بشأن ما سيفعله النظام وما لن يفعله — لكنها لا تنتقل. فمهمة جديدة، أو ذراع روبوت جديدة، تعني عادةً إعادة كتابة جزء كبير من المكدس.

والرهان الذي يُعيد تشكيل المجال منذ 2023 مختلف: فالوصفة نفسها التي أنتجت النماذج اللغوية الكبيرة — بيانات ضخمة، ومحوّل، وتوسع — ينبغي أن تنجح أيضًا في التحكم بالروبوتات، مكتشفةً “طيّة” عامة للمهارة المادية كما اكتشفت واحدة للنص والصور. وهذه فرضية، لا حقيقة مستقرة، والأدلة حتى الآن متباينة فعليًا. تعرض هذه الصفحة ما أُثبت فعليًا، ومن أثبته، وما يقوله الأشخاص الذين يبنون هذه الأنظمة إنه لا يزال مشكلات مفتوحة.

الدليل الأول: رموز الإجراءات والنقل بين الروبوتات

كان RT-2 من Google DeepMind، المنشور في يوليو 2023، اختبارًا مبكرًا وملموسًا للفكرة. فبدلًا من بناء وحدة منفصلة للتنبؤ بالإجراءات، دربت DeepMind رموز إجراءات روبوتية مباشرة داخل مفردات المخرجات الخاصة بنموذج رؤية-لغة، بحيث تستطيع الشبكة نفسها التي تصف صورة بكلمات أن تُصدر أمر محرك أيضًا (arXiv:2307.15818). وعبر 6,000 محاولة تقييم، عمّم النموذج على أجسام وإعدادات غير مألوفة بمعدل ثلاثة أضعاف تقريبًا أفضل من خطوط الأساس السابقة الخاصة بمهام محددة — دليل على أن المعرفة البصرية واللغوية بحجم الويب تحمل فعلًا معلومات مفيدة للتلاعب اليدوي.

وبعد ثلاثة أشهر، ذهب تعاون بين 34 مؤسسة أبعد من ذلك بـRT-X ومجموعة بيانات Open X-Embodiment، بتجميع بيانات من عشرات أنواع الروبوتات المختلفة وتدريب نموذج واحد بـ55 مليار معامل عبرها جميعًا (arXiv:2310.08864). وأظهر نجاحًا في المهارات الناشئة أعلى جوهريًا من نسخة بـ5 مليارات معامل من البنية نفسها — إشارة مبكرة إلى أن التوسع تحديدًا يدفع النقل عبر أجساد روبوتات مختلفة، لا داخل جسد واحد فقط.

مجال مزدحم بنماذج أساس للأجساد

أطلقت تلك النتيجة موجة من “نماذج أساس الروبوتات” المبنية من قِبَل الشركات، لكل منها بنية مختلفة وادعاءات تستحق أن تُقرَأ كادعاءات شركة لا كحقائق مُتحقَّق منها بشكل مستقل.

جمع π0 من Physical Intelligence (أكتوبر 2024) بين نموذج الرؤية-اللغة PaliGemma ورأس إجراء بمطابقة تدفق، مُدرَّب عبر ثمانية أجساد روبوتات، وأظهر مهامًا كطي الغسيل، وتنظيف طاولة، وتعبئة البقالة في أكياس. وعلى نحو غير معتاد لهذا المجال، أتاحت Physical Intelligence الأوزان والشيفرة كمصدر مفتوح تحت اسم “openpi”، ما جعل النتيجة قابلة لإعادة الإنتاج بشكل مستقل بدلًا من أخذها على الثقة. ومع ذلك، كان تقييم الشركة نفسها صريحًا: “سياسات الروبوتات العامّة لا تزال في مهدها، وأمامنا طريق طويل” (مدونة Physical Intelligence، 31 أكتوبر 2024). وتدّعي نسخة أحدث، π0.7، تعميمًا بدون أمثلة سابقة عبر أجساد روبوتات (arXiv:2604.15483)، لكن هذا الادعاء يستند، حتى وقت كتابة هذا، إلى ورقة أولية لم يُعَد إنتاجها بشكل مستقل.

أطلقت NVIDIA نموذج GR00T N1 في مارس 2025 كأول نموذج أساس مفتوح للروبوتات الشبيهة بالبشر، ثم GR00T N1.7 في أبريل 2026: نموذج بـ3 مليارات معامل مُدرَّب على 20,854 ساعة من فيديو ذاتي المنظور بشري، ومُتحقَّق منه على ثلاث منصات روبوت مختلفة، بأوزان مفتوحة على Hugging Face. وأفادت NVIDIA بأن توسيع بيانات التدريب ذاتية المنظور تلك بنحو عشرين ضعفًا “يُضاعف أكثر من مرة متوسط إنجاز المهام” في المهام اليدوية الدقيقة — ادعاء يستحق الإشارة إليه كادعاء خاص بـNVIDIA، إذ لا يرافقه معيار مرجعي مستقل (مدونة Hugging Face، 17 أبريل 2026). وقُدِّم خلَف، GR00T N2، في معاينة أولى بمؤتمر GTC في مارس 2026 كـ“نموذج إجراء عالمي” يتنبأ بحالات مستقبلية قبل التصرف؛ ويبقى ادعاء الكلمة الرئيسية لـNVIDIA بأنه ينجح في مهام جديدة “أكثر من ضعف” خطوط الأساس الرائدة، حتى سبتمبر 2026، ادعاء منتج غير مُطلَق لا ادعاءً مُختبَرًا.

انتقل خلَف RT-2 من Google DeepMind، Gemini Robotics 2 (ويُسمى أيضًا ER 2)، من عروض توضيحية للجزء العلوي من الجسم إلى تحكم بجسم كامل شبيه بالبشر على Apollo 2 من Apptronik، بما في ذلك قيادة يد ذات خمسة أصابع و22 درجة حرية لمهام كربط العقد وإغلاق الأكياس. وأرقام DeepMind المُفصَح عنها هي الأكثر صراحة في المجال: نجاح بنسبة 45.7–76.3% في التلاعب بكامل الجسم، ونسبة متفاوتة جدًا 32–92% في المهارة اليدوية متعددة الأصابع، مع تصريح DeepMind بوضوح بأن “التلاعب اليدوي الماهر متعدد الأصابع لا يزال يمثل تحديًا” (مدونة DeepMind، 30 يوليو 2026). وصاغ عنوان بلومبرغ الأمر بمزيد من الصراحة: روبوتات جوجل “تكافح مع المهارة اليدوية” (Bloomberg).

أوضح مقارنة قبل وبعد: Helix 02 من Figure

يأتي أوضح توضيح واحد لما يتغير تحت هذا النهج من Figure. استخدم نظامها الأصلي Helix (فبراير 2025) بنية من جزأين “النظام 1 / النظام 2”: نموذج رؤية-لغة بـ7 مليارات معامل يستدل عند 7-9 هرتز، يغذّي محوّلًا بـ80 مليون معامل يُشغِّل تحكمًا حركيًا دقيقًا عند 200 هرتز، مُدرَّبًا على نحو 500 ساعة فقط من البيانات — وتقول Figure إن ذلك أقل من 5% من حجم مجموعات بيانات VLA السابقة (مدونة Figure، 20 فبراير 2025).

أضاف Helix 02، الصادر في يناير 2026، طبقة ثالثة تسميها Figure “النظام 0”: متحكم توازن بكامل الجسم بـ10 ملايين معامل و1 كيلوهرتز، مُدرَّب بالكامل في محاكاة عبر أكثر من 200,000 بيئة إضافة إلى أكثر من 1,000 ساعة من حركة بشرية معاد توجيهها. ووصف Figure نفسها لما استبدله ذلك هو أوضح مقارنة بين القديم والجديد متاحة في هذا المجال بأكمله: يستبدل النظام 0 “109,504 سطرًا من شيفرة C++ المهندسة يدويًا بأولوية عصبية واحدة لحركة مستقرة وطبيعية” (مدونة Figure، 27 يناير 2026). وهذا هو نموذج الروبوتات الكلاسيكي — منطق تحكم مُعدَّد ومضبوط يدويًا — يُستبدَل بالكامل بنموذج مُتعلَّم، وفق حساب الشركة نفسها. وأظهرت Figure مهمة تحميل غسالة صحون استغرقت أربع دقائق و61 إجراءً دون إعادة ضبط بشرية، مع التحذير في المنشور نفسه بأن “النتائج مبكرة”.

وتُبلِّغ Boston Dynamics ومعهد تويوتا للأبحاث عن نتيجة ذات صلة لكنها أكثر تحفظًا من عمل “نموذج السلوك الكبير” على الروبوت الشبيه بالبشر Atlas: يمكن الآن إضافة قدرات كانت تتطلب سابقًا برمجة يدوية دون شيفرة جديدة، إذ يتحكم نموذج واحد مباشرة في الروبوت بأكمله (مدونة Boston Dynamics، أغسطس 2025). ووجدت دراسة متابعة عام 2026 أنه بعد الضبط الدقيق الخاص بمهمة، احتاج نموذج سلوك مُدرَّب مسبقًا إلى بيانات أقل بنحو 3 إلى 5 أضعاف خاصة بالمهمة وكان أكثر متانة أمام الظروف المتغيرة من التدريب من الصفر (TRI) — مكسب كفاءة حقيقي ومحدود، لا دليل على عمومية مفتوحة النهاية.

وبرنامج Optimus من تسلا هو الحالة الشاذة الأوضح في المجال من حيث الشفافية. ويصف إيلون ماسك وأشوك إيلوسوامي، الذي تولى قيادة Optimus في يونيو 2025، البنية نفسها من طرف إلى طرف “فوتونات تدخل، تحكم يخرج” التي تستخدمها تسلا لبرمجيات مساعدة السائق لديها. وبخلاف DeepMind، وNVIDIA، وPhysical Intelligence، أو Figure، لم تنشر تسلا ورقة تقنية حول هذه البنية — فقط ملاحظات في مؤتمرات وتعليقات في مكالمات أرباح (Not a Tesla App، ملخصًا مكالمة أرباح تسلا للربع الثاني من 2026، أغسطس 2026).

الأرقام القياسية الضيقة ليست كفاءة عامة

توضّح ألعاب الروبوتات الشبيهة بالبشر العالمية في بكين (22-26 أغسطس 2026) التمييز بين القدرة الضيقة والقدرة العامة بشكل ملموس. فعبر 2,056 روبوتًا من 666 فريقًا، أنجزت آلة واحدة، Tiangong Ultra، سباق 100 متر في 8.64 ثانية — أسرع من الرقم القياسي البشري العالمي لأوسين بولت البالغ 9.58 ثانية. وفي البطولة نفسها، وصفت التغطية الإعلامية لفعاليات كرة القدم، والملاكمة، ورفع الأثقال روبوتات تكافح في ظروف غير منظَّمة وكثيرة التلامس (Al Jazeera). فسباق مُهندَس وقابل للتكرار ليس الإنجاز نفسه ككفاءة مرنة في بيئة لا يمكن التنبؤ بها، وتوضّح الألعاب هذه الفجوة في الأسبوع نفسه لا في المجرد.

وجهة نظر التأسيس

يقدّم فينسنت فانهوكه، الذي يرأس الروبوتات في Google DeepMind، أوضح فحص واقع متاح لهذا الاتجاه بأكمله: “معظم — إن لم يكن كل — مناهج تعلّم الروبوتات لا يمكن نشرها لأي مهمة عملية”، لأن النشر الفعلي يتطلب “دقة وموثوقية بنسبة 99.X بالمئة أو أعلى” بينما تُبلِّغ العروض الأكاديمية عن نحو 80% نجاحًا — وهي، بكلماته، “وحش مختلف جوهريًا”، لا مشكلة توسع يمكن حلها بمزيد من البيانات (IEEE Spectrum، 28 مايو 2024).

ويذهب رودني بروكس، خبير الروبوتات في MIT والمؤسس المشارك لـiRobot وRethink Robotics، أبعد في تفسير لماذا قد يكون التدريب بالتقليد عبر الفيديو تحديدًا الركيزة الخاطئة: فاللمس ينطوي على قناة لا تلتقطها أنابيب المعالجة الحالية أبدًا، مستشهدًا ببحث في علم الأعصاب يحدد ما لا يقل عن خمس عشرة عائلة متمايزة من خلايا استشعار اللمس العصبية في الجلد البشري. ويصف عروض التلاعب اليدوي الحالية بأنها مبكرة ومحدودة، ويرفض الادعاءات بأن الروبوتات الشبيهة بالبشر ستبلغ مهارة يدوية عامة بمستوى بشري خلال عقود بوصفها “تفكيرًا خياليًا محضًا” (TechCrunch، 26 سبتمبر 2025).

والأمران صحيحان في آن واحد. فقد أنتج نهج نماذج الأساس نقلًا حقيقيًا ومقيسًا بين الروبوتات لم يحققه التحكم المُبرمَج يدويًا قط، وكل مختبر موثوق ينشر أرقامًا — لا المتشككون فقط — يُبلِّغ عن معدلات نجاح أقل بكثير مما تتطلبه الموثوقية الصناعية والمنزلية فعليًا.

References

Summarized position

Google DeepMind trained robot action tokens directly into a vision-language model’s output vocabulary and reported roughly 3x better generalization to unseen objects, backgrounds, and settings than prior baselines across 6,000 evaluation trials.

Google DeepMind, Authors, "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"
arXiv, Primary source
Summarized position

Vincent Vanhoucke said most robot-learning approaches "cannot be deployed for any practical task" because real-world use demands 99.X percent reliability, calling that bar "a fundamentally different beast" from an 80 percent-success research demo.

Vincent Vanhoucke, Head of robotics, Google DeepMind / Google Research
IEEE Spectrum ("Will Scaling Solve Robotics?" by Nishanth J. Kumar), Reported interview
Summarized position

Google DeepMind disclosed whole-body manipulation success rates of 45.7–76.3% and multi-finger dexterity success of 32–92% for Gemini Robotics 2 on Apptronik’s Apollo 2, stating that "multi-finger dexterous manipulation remains challenging".

Google DeepMind, Gemini Robotics 2 / ER 2 announcement
DeepMind blog, Primary source
Summarized position

Figure said Helix 02’s new "System 0" whole-body balance controller "replaces 109,504 lines of hand-engineered C++ with a single neural prior for stable, natural motion," trained on over 1,000 hours of retargeted human motion across more than 200,000 simulated environments, and cautioned that "the results are early".

Figure, Helix 02 announcement
Figure AI blog, Primary source
Summarized position

NVIDIA reported that scaling GR00T N1.7’s egocentric-video training data from roughly 1,000 to 20,854 hours "more than doubles average task completion" on dexterous manipulation tasks, without citing an independent benchmark.

NVIDIA, GR00T N1.7 announcement
Hugging Face / NVIDIA blog, Primary source
Summarized position

Rodney Brooks argued that current video-imitation training pipelines skip the tactile channel entirely — citing touch-sensing research describing at least fifteen distinct families of touch neurons in human skin — and called claims that humanoids will reach human-level general dexterity within decades "pure fantasy thinking".

Rodney Brooks, Roboticist; MIT CSAIL emeritus; co-founder, iRobot and Rethink Robotics
"Why Today’s Humanoids Won’t Learn Dexterity" (rodneybrooks.com), Primary source
  1. arXiv:2310.08864 arxiv.org
  2. مدونة Physical Intelligence pi.website
  3. arXiv:2604.15483 arxiv.org
  4. Bloomberg bloomberg.com
  5. مدونة Figure figure.ai
  6. مدونة Boston Dynamics bostondynamics.com
  7. TRI toyotaresearchinstitute.github.io
  8. Not a Tesla App، ملخصًا مكالمة أرباح تسلا للربع الثاني من 2026 notateslaapp.com
  9. Al Jazeera aljazeera.com
  10. TechCrunch techcrunch.com

Type to search the manual.

navigate open esc close