Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI মানবজাতির বেঁচে থাকার ব্রিফিং
BN

এজিআই-যুগের ফাউন্ডেশন মডেলগুলো একটি রোবট-শরীরের সক্ষমতাকে কীভাবে বদলাচ্ছে

এজিআই অগ্রগতি চালিত করা ফাউন্ডেশন-মডেল পদ্ধতিগুলো কীভাবে রোবট-শরীরে প্রয়োগ করা হয়, হাতে-কোড করা নিয়ন্ত্রণের বদলে ব্যাপকতর অথচ এখনো সীমিত সাধারণীকরণ এনে।

Written by
Dwight Ringdahl
Status
উৎস-যাচাইকৃত
Revised
Sources
16 cited
Reading
6 min

একটি রোবটের শেখা উচিত কীভাবে, তা নিয়ে দুটি ভিন্ন বাজি

প্রথাগত রোবটবিদ্যা একটি কাজ হাতে করে তৈরি করে: উপলব্ধি মডিউল, একটি পরিকল্পক, একটি ইনভার্স-কাইনেম্যাটিক্স সমাধানকারী, একটি স্টেট মেশিন, এবং হাজার হাজার লাইনের নিয়ন্ত্রণ কোড যা একটি রোবট, একটি গ্রিপার, বস্তুর একটি সংকীর্ণ সেটের জন্য সুরচিত। এটি কিছু মূল্যবান জিনিস দেয় — সিস্টেমটি কী করবে এবং করবে না তার আনুষ্ঠানিক নিশ্চয়তা — কিন্তু এটি স্থানান্তরযোগ্য নয়। একটি নতুন কাজ, বা একটি নতুন রোবট বাহু, সাধারণত পুরো স্ট্যাকের বেশিরভাগ পুনর্লিখনের প্রয়োজন হয়।

2023 সাল থেকে এই ক্ষেত্রকে নতুন আকার দেওয়া বাজিটি ভিন্ন: যে রেসিপিটি বৃহৎ ভাষা মডেল তৈরি করেছিল — বিশাল ডেটাসেট, একটি ট্রান্সফরমার, এবং স্কেল — একইভাবে রোবট নিয়ন্ত্রণের জন্যও কাজ করা উচিত, শারীরিক দক্ষতার জন্য একটি সাধারণ “মানিফোল্ড” আবিষ্কার করে ঠিক যেভাবে এটি টেক্সট ও ছবির জন্য একটি আবিষ্কার করেছিল। এটি একটি হাইপোথিসিস, নিষ্পত্তিকৃত সত্য নয়, এবং এখন পর্যন্ত প্রমাণ প্রকৃতপক্ষে মিশ্র। এই পাতাটি তুলে ধরে প্রকৃতপক্ষে কী প্রদর্শিত হয়েছে, কার দ্বারা, এবং এই সিস্টেমগুলো তৈরি করা মানুষেরা কোন সমস্যাগুলোকে এখনো খোলা বলে বর্ণনা করেন।

প্রথম প্রমাণ: অ্যাকশন টোকেন এবং ক্রস-রোবট স্থানান্তর

Google DeepMind-এর RT-2, জুলাই 2023-এ প্রকাশিত, এই ধারণার একটি প্রারম্ভিক, কংক্রিট পরীক্ষা ছিল। একটি পৃথক অ্যাকশন-পূর্বাভাস মডিউল তৈরির পরিবর্তে, DeepMind রোবট-অ্যাকশন টোকেনগুলো সরাসরি একটি ভিশন-ল্যাঙ্গুয়েজ মডেলের নিজস্ব আউটপুট শব্দভান্ডারে প্রশিক্ষণ দেয়, যাতে একটি শব্দে একটি ছবি বর্ণনা করা একই নেটওয়ার্ক একটি মোটর কমান্ডও নির্গত করতে পারে (arXiv:2307.15818)। 6,000টি মূল্যায়ন পরীক্ষা জুড়ে, এটি অপরিচিত বস্তু ও পরিবেশে পূর্ববর্তী কাজ-নির্দিষ্ট বেসলাইনের চেয়ে প্রায় তিনগুণ ভালো সাধারণীকরণ করেছে — প্রমাণ যে ওয়েব-স্কেল ভিজ্যুয়াল ও ভাষাগত জ্ঞান সত্যিই ম্যানিপুলেশনের জন্য উপযোগী কিছু তথ্য বহন করে।

তিন মাস পর, 34টি প্রতিষ্ঠানের একটি সহযোগিতা RT-X এবং Open X-Embodiment ডেটাসেট নিয়ে আরও এগিয়ে যায়, বিভিন্ন ধরনের রোবটের দশক দশক তথ্য একত্রিত করে এবং সবগুলোজুড়ে একটি 55-বিলিয়ন-প্যারামিটার মডেলকে প্রশিক্ষণ দেয় (arXiv:2310.08864)। এটি একই আর্কিটেকচারের একটি 5-বিলিয়ন-প্যারামিটার সংস্করণের চেয়ে উল্লেখযোগ্যভাবে উচ্চতর উদীয়মান-দক্ষতা সাফল্য দেখিয়েছে — একটি প্রাথমিক সংকেত যে স্কেল নির্দিষ্টভাবে বিভিন্ন রোবট-শরীর জুড়ে স্থানান্তর চালিত করে, কেবল একটির মধ্যে নয়।

শরীরের জন্য ফাউন্ডেশন মডেলের একটি ভিড়পূর্ণ ক্ষেত্র

সেই ফলাফল কোম্পানি-নির্মিত “রোবট ফাউন্ডেশন মডেল”-এর একটি ঢেউ শুরু করে, প্রতিটির ভিন্ন আর্কিটেকচার এবং প্রতিটিই এমন দাবি করে যা স্বাধীনভাবে যাচাইকৃত সত্যের চেয়ে কোম্পানির দাবি হিসেবে পড়া উচিত।

Physical Intelligence-এর π0 (অক্টোবর 2024) PaliGemma ভিশন-ল্যাঙ্গুয়েজ মডেলকে একটি ফ্লো-ম্যাচিং অ্যাকশন হেডের সাথে একত্রিত করেছে, আটটি রোবট সংস্করণজুড়ে প্রশিক্ষিত, এবং কাপড় ভাঁজ করা, টেবিল পরিষ্কার করা, এবং মুদিপণ্য ব্যাগে ভরার মতো কাজ প্রদর্শন করেছে। এই ক্ষেত্রের জন্য অস্বাভাবিকভাবে, Physical Intelligence ওজন ও কোড “openpi” হিসেবে ওপেন-সোর্স করেছে, ফলাফলটিকে বিশ্বাসের বদলে স্বাধীনভাবে পুনরুৎপাদনযোগ্য করে তুলেছে। তা সত্ত্বেও, কোম্পানির নিজস্ব মূল্যায়ন ছিল স্পষ্টবাদী: “সাধারণবাদী রোবট নীতিমালা এখনো তাদের শৈশবে আছে, এবং আমাদের অনেক পথ যেতে হবে” (Physical Intelligence ব্লগ, 31 অক্টোবর, 2024)। একটি নতুন সংস্করণ, π0.7, রোবট সংস্করণজুড়ে জিরো-শট সাধারণীকরণের দাবি করে (arXiv:2604.15483), কিন্তু এই লেখা পর্যন্ত সেই দাবি একটি প্রিপ্রিন্টের ওপর ভিত্তি করে যা স্বাধীনভাবে পুনরাবৃত্ত হয়নি।

NVIDIA মার্চ 2025-এ GR00T N1 প্রথম উন্মুক্ত মানবাকার ফাউন্ডেশন মডেল হিসেবে প্রকাশ করে, তারপর এপ্রিল 2026-এ GR00T N1.7: একটি 3-বিলিয়ন-প্যারামিটার মডেল যা 20,854 ঘণ্টার মানবীয় ইগোসেন্ট্রিক ভিডিওতে প্রশিক্ষিত এবং তিনটি ভিন্ন রোবট প্ল্যাটফর্মে যাচাইকৃত, Hugging Face-এ উন্মুক্ত ওজনসহ। NVIDIA প্রতিবেদন করেছে যে সেই ইগোসেন্ট্রিক প্রশিক্ষণ তথ্য প্রায় বিশগুণ বাড়ানো দক্ষতা-নির্ভর কাজে “গড় কাজ সম্পন্নকরণ দ্বিগুণেরও বেশি করে” — একটি দাবি যা NVIDIA-র নিজস্ব হিসেবে চিহ্নিত করার মতো, কারণ এর সাথে কোনো স্বাধীন বেঞ্চমার্ক নেই (Hugging Face ব্লগ, 17 এপ্রিল, 2026)। একটি উত্তরসূরি, GR00T N2, মার্চ 2026-এ GTC-তে একটি “world action model” হিসেবে পূর্বপ্রদর্শিত হয়েছিল যা কাজ করার আগে ভবিষ্যৎ অবস্থার পূর্বাভাস দেয়; NVIDIA-র মূল ভাষণের দাবি যে এটি অগ্রণী বেসলাইনের তুলনায় নতুন কাজে “দ্বিগুণেরও বেশিবার” সফল হয়, তা সেপ্টেম্বর 2026 পর্যন্ত একটি অপ্রকাশিত পণ্য-দাবি, পরীক্ষিত নয়।

Google DeepMind-এর RT-2-এর উত্তরসূরি, Gemini Robotics 2 (যাকে ER 2-ও বলা হয়), ঊর্ধ্বাংশ-শরীর প্রদর্শন থেকে Apptronik-এর Apollo 2-এ সম্পূর্ণ-শরীর মানবাকার নিয়ন্ত্রণে সরে গেছে, যার মধ্যে রয়েছে গিঁট বাঁধা ও ব্যাগ সিল করার মতো কাজের জন্য একটি 22-ডিগ্রি-স্বাধীনতার পাঁচ-আঙুলবিশিষ্ট হাতের নির্দেশনা। DeepMind-এর নিজস্ব প্রকাশিত সংখ্যাগুলো এই ক্ষেত্রে সবচেয়ে স্পষ্টবাদী: সম্পূর্ণ-শরীর ম্যানিপুলেশনে 45.7–76.3% সাফল্য এবং বহু-আঙুল দক্ষতায় অত্যন্ত পরিবর্তনশীল 32–92%, DeepMind স্পষ্টভাবে বলেছে যে “বহু-আঙুল দক্ষ ম্যানিপুলেশন এখনো চ্যালেঞ্জিং রয়ে গেছে” (DeepMind ব্লগ, 30 জুলাই, 2026)। Bloomberg-এর নিজস্ব শিরোনাম প্রকাশের ওপর আরও স্পষ্টভাবে বলেছে: Google-এর রোবটগুলো “দক্ষতার সাথে সংগ্রাম করছে” (Bloomberg)।

সবচেয়ে স্পষ্ট আগে-ও-পরে দৃষ্টান্ত: Figure-এর Helix 02

এই পদ্ধতিতে কী পরিবর্তিত হয় তার সবচেয়ে স্পষ্ট চিত্র আসে Figure থেকে। এর মূল Helix সিস্টেম (ফেব্রুয়ারি 2025) একটি দুই-অংশের “System 1 / System 2” আর্কিটেকচার ব্যবহার করেছিল: একটি 7-বিলিয়ন-প্যারামিটার ভিশন-ল্যাঙ্গুয়েজ মডেল 7–9 Hz-এ যুক্তি করছিল, যা একটি 80-মিলিয়ন-প্যারামিটার ট্রান্সফরমারকে খাওয়াচ্ছিল যা 200 Hz-এ সূক্ষ্ম মোটর নিয়ন্ত্রণ চালাচ্ছিল, মাত্র প্রায় 500 ঘণ্টার তথ্যে প্রশিক্ষিত — Figure বলে যে এটি পূর্ববর্তী VLA ডেটাসেটের আকারের 5%-এরও কম (Figure ব্লগ, 20 ফেব্রুয়ারি, 2025)।

Helix 02, জানুয়ারি 2026-এ প্রকাশিত, একটি তৃতীয় স্তর যোগ করেছে যাকে Figure বলে “System 0”: একটি 10-মিলিয়ন-প্যারামিটার, 1kHz সম্পূর্ণ-শরীর ভারসাম্য নিয়ন্ত্রক যা সম্পূর্ণভাবে সিমুলেশনে 200,000-এরও বেশি পরিবেশ জুড়ে এবং 1,000-এরও বেশি ঘণ্টার পুনর্নির্দেশিত মানবীয় গতিতে প্রশিক্ষিত। এটি কী প্রতিস্থাপন করেছে তার নিজস্ব বর্ণনা এই ক্ষেত্রে যেকোনো স্থানে পাওয়া সবচেয়ে তীক্ষ্ণ পুরাতন-বনাম-নতুন তুলনা: System 0 “স্থিতিশীল, স্বাভাবিক গতির জন্য 109,504 লাইনের হাতে-প্রকৌশলিত C++ কোডকে একটি একক নিউরাল প্রায়র দিয়ে প্রতিস্থাপন করে” (Figure ব্লগ, 27 জানুয়ারি, 2026)। এটি প্রথাগত-রোবটবিদ্যা দৃষ্টান্ত — গণনাকৃত, হাতে-সুরচিত নিয়ন্ত্রণ যুক্তি — সম্পূর্ণভাবে একটি শিখিত মডেল দ্বারা প্রতিস্থাপিত হওয়া, একটি কোম্পানির নিজস্ব হিসেবে। Figure একটি চার-মিনিটের, 61-পদক্ষেপের ডিশওয়াশার-লোডিং কাজ প্রদর্শন করেছে কোনো মানবীয় রিসেট ছাড়াই, একই প্রকাশনায় সতর্ক করে যে “ফলাফলগুলো প্রাথমিক।”

Boston Dynamics এবং Toyota Research Institute Atlas মানবাকার রোবটের ওপর “Large Behavior Model” কাজ থেকে একটি সম্পর্কিত কিন্তু আরও পরিমিত ফলাফল প্রতিবেদন করে: যে সক্ষমতাগুলোর একসময় হাতে-প্রোগ্রামিং প্রয়োজন ছিল তা এখন নতুন কোড ছাড়াই যোগ করা যায়, কারণ একটি মডেল সম্পূর্ণ রোবটের সরাসরি নিয়ন্ত্রণ রাখে (Boston Dynamics ব্লগ, আগস্ট 2025)। একটি ফলো-আপ 2026 গবেষণায় দেখা যায় যে কাজ-নির্দিষ্ট সূক্ষ্ম-সমন্বয়ের পর, একটি পূর্ব-প্রশিক্ষিত আচরণ মডেলের শুরু থেকে প্রশিক্ষণের তুলনায় প্রায় 3–5 গুণ কম কাজ-নির্দিষ্ট তথ্যের প্রয়োজন হয়েছে এবং পরিবর্তনশীল পরিস্থিতিতে আরও দৃঢ় ছিল (TRI) — একটি প্রকৃত, সীমাবদ্ধ দক্ষতা লাভ, উন্মুক্ত-প্রান্তের সাধারণীকরণের প্রমাণ নয়।

Tesla-র Optimus প্রোগ্রাম স্বচ্ছতার ক্ষেত্রে এই ক্ষেত্রের সবচেয়ে স্পষ্ট ব্যতিক্রম। Elon Musk এবং Ashok Elluswamy, যিনি জুন 2025-এ Optimus-এর দায়িত্ব নেন, একই “photons in, controls out” প্রান্ত-থেকে-প্রান্ত আর্কিটেকচার বর্ণনা করেন যা Tesla তার ড্রাইভার-সহায়তা সফটওয়্যারের জন্য ব্যবহার করে। DeepMind, NVIDIA, Physical Intelligence, বা Figure-এর বিপরীতে, Tesla এই আর্কিটেকচারের ওপর কোনো প্রযুক্তিগত পেপার প্রকাশ করেনি — শুধুমাত্র সম্মেলনের মন্তব্য এবং আয়-সংক্রান্ত কলের ভাষ্য (Not a Tesla App, Tesla-র 2026-এর দ্বিতীয়-প্রান্তিক আয়-কলের সারসংক্ষেপ, আগস্ট 2026)।

সংকীর্ণ রেকর্ড সাধারণ দক্ষতা নয়

বেইজিং-এ World Humanoid Robot Games (22–26 আগস্ট, 2026) সংকীর্ণ ও সাধারণ সক্ষমতার মধ্যে পার্থক্যকে কংক্রিট করে তোলে। 666টি দল থেকে 2,056টি রোবট জুড়ে, একটি যন্ত্র, Tiangong Ultra, 100 মিটার 8.64 সেকেন্ডে দৌড়েছে — Usain Bolt-এর 9.58-সেকেন্ডের মানবীয় বিশ্ব রেকর্ডের চেয়ে দ্রুত। একই টুর্নামেন্টে, ফুটবল, বক্সিং, এবং ওজন-উত্তোলন ইভেন্টগুলোর কভারেজ রোবটদের অসংগঠিত, স্পর্শ-নির্ভর পরিস্থিতিতে সংগ্রাম করার বর্ণনা দিয়েছে (Al Jazeera)। একটি পুনরাবৃত্তিযোগ্য, প্রকৌশলগত স্প্রিন্ট একটি অপ্রত্যাশিত পরিবেশে নমনীয় দক্ষতার সমান অর্জন নয়, এবং Games বিমূর্তভাবে নয়, একই সপ্তাহে সেই ব্যবধান তুলে ধরে।

ভিত্তি-প্রতিষ্ঠার দৃষ্টিভঙ্গি

Vincent Vanhoucke, যিনি Google DeepMind-এ রোবটবিদ্যার প্রধান, এই পুরো প্রবণতার সবচেয়ে তীক্ষ্ণ বাস্তবতা যাচাই প্রদান করেন: “বেশিরভাগ — যদি সবগুলো না-ও হয় — রোবট শেখার পদ্ধতি কোনো ব্যবহারিক কাজের জন্য স্থাপন করা যায় না,” কারণ প্রকৃত স্থাপনার জন্য প্রয়োজন “99.X শতাংশ বা তার বেশি নির্ভুলতা ও নির্ভরযোগ্যতা” যেখানে একাডেমিক প্রদর্শনী প্রায় 80% সাফল্যের প্রতিবেদন দেয় — তার ভাষায়, এটি “একটি মৌলিকভাবে ভিন্ন জন্তু,” আরও তথ্য দিয়ে সমাধান করার মতো একটি স্কেলিং সমস্যা নয় (IEEE Spectrum, 28 মে, 2024)।

Rodney Brooks, যিনি iRobot ও Rethink Robotics সহ-প্রতিষ্ঠা করা MIT-এর রোবটবিদ, বিশেষভাবে ভিডিও-অনুকরণ প্রশিক্ষণ কেন ভুল ভিত্তি হতে পারে তা নিয়ে আরও এগিয়ে যান: স্পর্শের সাথে জড়িত একটি চ্যানেল যা বর্তমান পাইপলাইনগুলো কখনো ধারণ করে না, স্নায়ুবিজ্ঞান গবেষণা উদ্ধৃত করে যা মানুষের ত্বকে অন্তত পনেরোটি ভিন্ন পরিবারের স্পর্শ-সংবেদী নিউরন চিহ্নিত করে। তিনি আজকের ম্যানিপুলেশন প্রদর্শনীকে প্রাথমিক ও সীমিত বলে অভিহিত করেন, এবং মানবাকার রোবট দশকের মধ্যে মানব-স্তরের সাধারণ দক্ষতায় পৌঁছাবে এমন দাবিকে “নিছক কল্পনাপ্রসূত চিন্তা” বলে খারিজ করেন (TechCrunch, 26 সেপ্টেম্বর, 2025)।

উভয় বিষয়ই একসাথে সত্য। ফাউন্ডেশন-মডেল পদ্ধতি প্রকৃত, পরিমাপযোগ্য ক্রস-রোবট স্থানান্তর তৈরি করেছে যা হাতে-কোড করা নিয়ন্ত্রণ কখনো অর্জন করেনি, এবং সংখ্যা প্রকাশ করা প্রতিটি বিশ্বাসযোগ্য গবেষণাগার — কেবল সংশয়বাদীরা নয় — শিল্প ও গার্হস্থ্য নির্ভরযোগ্যতার প্রকৃত প্রয়োজনের চেয়ে বেশ কম সাফল্যের হার প্রতিবেদন করে।

References

Summarized position

Google DeepMind trained robot action tokens directly into a vision-language model’s output vocabulary and reported roughly 3x better generalization to unseen objects, backgrounds, and settings than prior baselines across 6,000 evaluation trials.

Google DeepMind, Authors, "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"
arXiv, Primary source
Summarized position

Vincent Vanhoucke said most robot-learning approaches "cannot be deployed for any practical task" because real-world use demands 99.X percent reliability, calling that bar "a fundamentally different beast" from an 80 percent-success research demo.

Vincent Vanhoucke, Head of robotics, Google DeepMind / Google Research
IEEE Spectrum ("Will Scaling Solve Robotics?" by Nishanth J. Kumar), Reported interview
Summarized position

Google DeepMind disclosed whole-body manipulation success rates of 45.7–76.3% and multi-finger dexterity success of 32–92% for Gemini Robotics 2 on Apptronik’s Apollo 2, stating that "multi-finger dexterous manipulation remains challenging".

Google DeepMind, Gemini Robotics 2 / ER 2 announcement
DeepMind blog, Primary source
Summarized position

Figure said Helix 02’s new "System 0" whole-body balance controller "replaces 109,504 lines of hand-engineered C++ with a single neural prior for stable, natural motion," trained on over 1,000 hours of retargeted human motion across more than 200,000 simulated environments, and cautioned that "the results are early".

Figure, Helix 02 announcement
Figure AI blog, Primary source
Summarized position

NVIDIA reported that scaling GR00T N1.7’s egocentric-video training data from roughly 1,000 to 20,854 hours "more than doubles average task completion" on dexterous manipulation tasks, without citing an independent benchmark.

NVIDIA, GR00T N1.7 announcement
Hugging Face / NVIDIA blog, Primary source
Summarized position

Rodney Brooks argued that current video-imitation training pipelines skip the tactile channel entirely — citing touch-sensing research describing at least fifteen distinct families of touch neurons in human skin — and called claims that humanoids will reach human-level general dexterity within decades "pure fantasy thinking".

Rodney Brooks, Roboticist; MIT CSAIL emeritus; co-founder, iRobot and Rethink Robotics
"Why Today’s Humanoids Won’t Learn Dexterity" (rodneybrooks.com), Primary source
  1. arXiv:2310.08864 arxiv.org
  2. Physical Intelligence ব্লগ pi.website
  3. arXiv:2604.15483 arxiv.org
  4. Bloomberg bloomberg.com
  5. Figure ব্লগ figure.ai
  6. Boston Dynamics ব্লগ bostondynamics.com
  7. TRI toyotaresearchinstitute.github.io
  8. Not a Tesla App, Tesla-র 2026-এর দ্বিতীয়-প্রান্তিক আয়-কলের সারসংক্ষেপ notateslaapp.com
  9. Al Jazeera aljazeera.com
  10. TechCrunch techcrunch.com

Type to search the manual.

navigate open esc close