একটি রোবটের শেখা উচিত কীভাবে, তা নিয়ে দুটি ভিন্ন বাজি
প্রথাগত রোবটবিদ্যা একটি কাজ হাতে করে তৈরি করে: উপলব্ধি মডিউল, একটি পরিকল্পক, একটি ইনভার্স-কাইনেম্যাটিক্স সমাধানকারী, একটি স্টেট মেশিন, এবং হাজার হাজার লাইনের নিয়ন্ত্রণ কোড যা একটি রোবট, একটি গ্রিপার, বস্তুর একটি সংকীর্ণ সেটের জন্য সুরচিত। এটি কিছু মূল্যবান জিনিস দেয় — সিস্টেমটি কী করবে এবং করবে না তার আনুষ্ঠানিক নিশ্চয়তা — কিন্তু এটি স্থানান্তরযোগ্য নয়। একটি নতুন কাজ, বা একটি নতুন রোবট বাহু, সাধারণত পুরো স্ট্যাকের বেশিরভাগ পুনর্লিখনের প্রয়োজন হয়।
2023 সাল থেকে এই ক্ষেত্রকে নতুন আকার দেওয়া বাজিটি ভিন্ন: যে রেসিপিটি বৃহৎ ভাষা মডেল তৈরি করেছিল — বিশাল ডেটাসেট, একটি ট্রান্সফরমার, এবং স্কেল — একইভাবে রোবট নিয়ন্ত্রণের জন্যও কাজ করা উচিত, শারীরিক দক্ষতার জন্য একটি সাধারণ “মানিফোল্ড” আবিষ্কার করে ঠিক যেভাবে এটি টেক্সট ও ছবির জন্য একটি আবিষ্কার করেছিল। এটি একটি হাইপোথিসিস, নিষ্পত্তিকৃত সত্য নয়, এবং এখন পর্যন্ত প্রমাণ প্রকৃতপক্ষে মিশ্র। এই পাতাটি তুলে ধরে প্রকৃতপক্ষে কী প্রদর্শিত হয়েছে, কার দ্বারা, এবং এই সিস্টেমগুলো তৈরি করা মানুষেরা কোন সমস্যাগুলোকে এখনো খোলা বলে বর্ণনা করেন।
প্রথম প্রমাণ: অ্যাকশন টোকেন এবং ক্রস-রোবট স্থানান্তর
Google DeepMind-এর RT-2, জুলাই 2023-এ প্রকাশিত, এই ধারণার একটি প্রারম্ভিক, কংক্রিট পরীক্ষা ছিল। একটি পৃথক অ্যাকশন-পূর্বাভাস মডিউল তৈরির পরিবর্তে, DeepMind রোবট-অ্যাকশন টোকেনগুলো সরাসরি একটি ভিশন-ল্যাঙ্গুয়েজ মডেলের নিজস্ব আউটপুট শব্দভান্ডারে প্রশিক্ষণ দেয়, যাতে একটি শব্দে একটি ছবি বর্ণনা করা একই নেটওয়ার্ক একটি মোটর কমান্ডও নির্গত করতে পারে (arXiv:2307.15818)। 6,000টি মূল্যায়ন পরীক্ষা জুড়ে, এটি অপরিচিত বস্তু ও পরিবেশে পূর্ববর্তী কাজ-নির্দিষ্ট বেসলাইনের চেয়ে প্রায় তিনগুণ ভালো সাধারণীকরণ করেছে — প্রমাণ যে ওয়েব-স্কেল ভিজ্যুয়াল ও ভাষাগত জ্ঞান সত্যিই ম্যানিপুলেশনের জন্য উপযোগী কিছু তথ্য বহন করে।
তিন মাস পর, 34টি প্রতিষ্ঠানের একটি সহযোগিতা RT-X এবং Open X-Embodiment ডেটাসেট নিয়ে আরও এগিয়ে যায়, বিভিন্ন ধরনের রোবটের দশক দশক তথ্য একত্রিত করে এবং সবগুলোজুড়ে একটি 55-বিলিয়ন-প্যারামিটার মডেলকে প্রশিক্ষণ দেয় (arXiv:2310.08864)। এটি একই আর্কিটেকচারের একটি 5-বিলিয়ন-প্যারামিটার সংস্করণের চেয়ে উল্লেখযোগ্যভাবে উচ্চতর উদীয়মান-দক্ষতা সাফল্য দেখিয়েছে — একটি প্রাথমিক সংকেত যে স্কেল নির্দিষ্টভাবে বিভিন্ন রোবট-শরীর জুড়ে স্থানান্তর চালিত করে, কেবল একটির মধ্যে নয়।
শরীরের জন্য ফাউন্ডেশন মডেলের একটি ভিড়পূর্ণ ক্ষেত্র
সেই ফলাফল কোম্পানি-নির্মিত “রোবট ফাউন্ডেশন মডেল”-এর একটি ঢেউ শুরু করে, প্রতিটির ভিন্ন আর্কিটেকচার এবং প্রতিটিই এমন দাবি করে যা স্বাধীনভাবে যাচাইকৃত সত্যের চেয়ে কোম্পানির দাবি হিসেবে পড়া উচিত।
Physical Intelligence-এর π0 (অক্টোবর 2024) PaliGemma ভিশন-ল্যাঙ্গুয়েজ মডেলকে একটি ফ্লো-ম্যাচিং অ্যাকশন হেডের সাথে একত্রিত করেছে, আটটি রোবট সংস্করণজুড়ে প্রশিক্ষিত, এবং কাপড় ভাঁজ করা, টেবিল পরিষ্কার করা, এবং মুদিপণ্য ব্যাগে ভরার মতো কাজ প্রদর্শন করেছে। এই ক্ষেত্রের জন্য অস্বাভাবিকভাবে, Physical Intelligence ওজন ও কোড “openpi” হিসেবে ওপেন-সোর্স করেছে, ফলাফলটিকে বিশ্বাসের বদলে স্বাধীনভাবে পুনরুৎপাদনযোগ্য করে তুলেছে। তা সত্ত্বেও, কোম্পানির নিজস্ব মূল্যায়ন ছিল স্পষ্টবাদী: “সাধারণবাদী রোবট নীতিমালা এখনো তাদের শৈশবে আছে, এবং আমাদের অনেক পথ যেতে হবে” (Physical Intelligence ব্লগ, 31 অক্টোবর, 2024)। একটি নতুন সংস্করণ, π0.7, রোবট সংস্করণজুড়ে জিরো-শট সাধারণীকরণের দাবি করে (arXiv:2604.15483), কিন্তু এই লেখা পর্যন্ত সেই দাবি একটি প্রিপ্রিন্টের ওপর ভিত্তি করে যা স্বাধীনভাবে পুনরাবৃত্ত হয়নি।
NVIDIA মার্চ 2025-এ GR00T N1 প্রথম উন্মুক্ত মানবাকার ফাউন্ডেশন মডেল হিসেবে প্রকাশ করে, তারপর এপ্রিল 2026-এ GR00T N1.7: একটি 3-বিলিয়ন-প্যারামিটার মডেল যা 20,854 ঘণ্টার মানবীয় ইগোসেন্ট্রিক ভিডিওতে প্রশিক্ষিত এবং তিনটি ভিন্ন রোবট প্ল্যাটফর্মে যাচাইকৃত, Hugging Face-এ উন্মুক্ত ওজনসহ। NVIDIA প্রতিবেদন করেছে যে সেই ইগোসেন্ট্রিক প্রশিক্ষণ তথ্য প্রায় বিশগুণ বাড়ানো দক্ষতা-নির্ভর কাজে “গড় কাজ সম্পন্নকরণ দ্বিগুণেরও বেশি করে” — একটি দাবি যা NVIDIA-র নিজস্ব হিসেবে চিহ্নিত করার মতো, কারণ এর সাথে কোনো স্বাধীন বেঞ্চমার্ক নেই (Hugging Face ব্লগ, 17 এপ্রিল, 2026)। একটি উত্তরসূরি, GR00T N2, মার্চ 2026-এ GTC-তে একটি “world action model” হিসেবে পূর্বপ্রদর্শিত হয়েছিল যা কাজ করার আগে ভবিষ্যৎ অবস্থার পূর্বাভাস দেয়; NVIDIA-র মূল ভাষণের দাবি যে এটি অগ্রণী বেসলাইনের তুলনায় নতুন কাজে “দ্বিগুণেরও বেশিবার” সফল হয়, তা সেপ্টেম্বর 2026 পর্যন্ত একটি অপ্রকাশিত পণ্য-দাবি, পরীক্ষিত নয়।
Google DeepMind-এর RT-2-এর উত্তরসূরি, Gemini Robotics 2 (যাকে ER 2-ও বলা হয়), ঊর্ধ্বাংশ-শরীর প্রদর্শন থেকে Apptronik-এর Apollo 2-এ সম্পূর্ণ-শরীর মানবাকার নিয়ন্ত্রণে সরে গেছে, যার মধ্যে রয়েছে গিঁট বাঁধা ও ব্যাগ সিল করার মতো কাজের জন্য একটি 22-ডিগ্রি-স্বাধীনতার পাঁচ-আঙুলবিশিষ্ট হাতের নির্দেশনা। DeepMind-এর নিজস্ব প্রকাশিত সংখ্যাগুলো এই ক্ষেত্রে সবচেয়ে স্পষ্টবাদী: সম্পূর্ণ-শরীর ম্যানিপুলেশনে 45.7–76.3% সাফল্য এবং বহু-আঙুল দক্ষতায় অত্যন্ত পরিবর্তনশীল 32–92%, DeepMind স্পষ্টভাবে বলেছে যে “বহু-আঙুল দক্ষ ম্যানিপুলেশন এখনো চ্যালেঞ্জিং রয়ে গেছে” (DeepMind ব্লগ, 30 জুলাই, 2026)। Bloomberg-এর নিজস্ব শিরোনাম প্রকাশের ওপর আরও স্পষ্টভাবে বলেছে: Google-এর রোবটগুলো “দক্ষতার সাথে সংগ্রাম করছে” (Bloomberg)।
সবচেয়ে স্পষ্ট আগে-ও-পরে দৃষ্টান্ত: Figure-এর Helix 02
এই পদ্ধতিতে কী পরিবর্তিত হয় তার সবচেয়ে স্পষ্ট চিত্র আসে Figure থেকে। এর মূল Helix সিস্টেম (ফেব্রুয়ারি 2025) একটি দুই-অংশের “System 1 / System 2” আর্কিটেকচার ব্যবহার করেছিল: একটি 7-বিলিয়ন-প্যারামিটার ভিশন-ল্যাঙ্গুয়েজ মডেল 7–9 Hz-এ যুক্তি করছিল, যা একটি 80-মিলিয়ন-প্যারামিটার ট্রান্সফরমারকে খাওয়াচ্ছিল যা 200 Hz-এ সূক্ষ্ম মোটর নিয়ন্ত্রণ চালাচ্ছিল, মাত্র প্রায় 500 ঘণ্টার তথ্যে প্রশিক্ষিত — Figure বলে যে এটি পূর্ববর্তী VLA ডেটাসেটের আকারের 5%-এরও কম (Figure ব্লগ, 20 ফেব্রুয়ারি, 2025)।
Helix 02, জানুয়ারি 2026-এ প্রকাশিত, একটি তৃতীয় স্তর যোগ করেছে যাকে Figure বলে “System 0”: একটি 10-মিলিয়ন-প্যারামিটার, 1kHz সম্পূর্ণ-শরীর ভারসাম্য নিয়ন্ত্রক যা সম্পূর্ণভাবে সিমুলেশনে 200,000-এরও বেশি পরিবেশ জুড়ে এবং 1,000-এরও বেশি ঘণ্টার পুনর্নির্দেশিত মানবীয় গতিতে প্রশিক্ষিত। এটি কী প্রতিস্থাপন করেছে তার নিজস্ব বর্ণনা এই ক্ষেত্রে যেকোনো স্থানে পাওয়া সবচেয়ে তীক্ষ্ণ পুরাতন-বনাম-নতুন তুলনা: System 0 “স্থিতিশীল, স্বাভাবিক গতির জন্য 109,504 লাইনের হাতে-প্রকৌশলিত C++ কোডকে একটি একক নিউরাল প্রায়র দিয়ে প্রতিস্থাপন করে” (Figure ব্লগ, 27 জানুয়ারি, 2026)। এটি প্রথাগত-রোবটবিদ্যা দৃষ্টান্ত — গণনাকৃত, হাতে-সুরচিত নিয়ন্ত্রণ যুক্তি — সম্পূর্ণভাবে একটি শিখিত মডেল দ্বারা প্রতিস্থাপিত হওয়া, একটি কোম্পানির নিজস্ব হিসেবে। Figure একটি চার-মিনিটের, 61-পদক্ষেপের ডিশওয়াশার-লোডিং কাজ প্রদর্শন করেছে কোনো মানবীয় রিসেট ছাড়াই, একই প্রকাশনায় সতর্ক করে যে “ফলাফলগুলো প্রাথমিক।”
Boston Dynamics এবং Toyota Research Institute Atlas মানবাকার রোবটের ওপর “Large Behavior Model” কাজ থেকে একটি সম্পর্কিত কিন্তু আরও পরিমিত ফলাফল প্রতিবেদন করে: যে সক্ষমতাগুলোর একসময় হাতে-প্রোগ্রামিং প্রয়োজন ছিল তা এখন নতুন কোড ছাড়াই যোগ করা যায়, কারণ একটি মডেল সম্পূর্ণ রোবটের সরাসরি নিয়ন্ত্রণ রাখে (Boston Dynamics ব্লগ, আগস্ট 2025)। একটি ফলো-আপ 2026 গবেষণায় দেখা যায় যে কাজ-নির্দিষ্ট সূক্ষ্ম-সমন্বয়ের পর, একটি পূর্ব-প্রশিক্ষিত আচরণ মডেলের শুরু থেকে প্রশিক্ষণের তুলনায় প্রায় 3–5 গুণ কম কাজ-নির্দিষ্ট তথ্যের প্রয়োজন হয়েছে এবং পরিবর্তনশীল পরিস্থিতিতে আরও দৃঢ় ছিল (TRI) — একটি প্রকৃত, সীমাবদ্ধ দক্ষতা লাভ, উন্মুক্ত-প্রান্তের সাধারণীকরণের প্রমাণ নয়।
Tesla-র Optimus প্রোগ্রাম স্বচ্ছতার ক্ষেত্রে এই ক্ষেত্রের সবচেয়ে স্পষ্ট ব্যতিক্রম। Elon Musk এবং Ashok Elluswamy, যিনি জুন 2025-এ Optimus-এর দায়িত্ব নেন, একই “photons in, controls out” প্রান্ত-থেকে-প্রান্ত আর্কিটেকচার বর্ণনা করেন যা Tesla তার ড্রাইভার-সহায়তা সফটওয়্যারের জন্য ব্যবহার করে। DeepMind, NVIDIA, Physical Intelligence, বা Figure-এর বিপরীতে, Tesla এই আর্কিটেকচারের ওপর কোনো প্রযুক্তিগত পেপার প্রকাশ করেনি — শুধুমাত্র সম্মেলনের মন্তব্য এবং আয়-সংক্রান্ত কলের ভাষ্য (Not a Tesla App, Tesla-র 2026-এর দ্বিতীয়-প্রান্তিক আয়-কলের সারসংক্ষেপ, আগস্ট 2026)।
সংকীর্ণ রেকর্ড সাধারণ দক্ষতা নয়
বেইজিং-এ World Humanoid Robot Games (22–26 আগস্ট, 2026) সংকীর্ণ ও সাধারণ সক্ষমতার মধ্যে পার্থক্যকে কংক্রিট করে তোলে। 666টি দল থেকে 2,056টি রোবট জুড়ে, একটি যন্ত্র, Tiangong Ultra, 100 মিটার 8.64 সেকেন্ডে দৌড়েছে — Usain Bolt-এর 9.58-সেকেন্ডের মানবীয় বিশ্ব রেকর্ডের চেয়ে দ্রুত। একই টুর্নামেন্টে, ফুটবল, বক্সিং, এবং ওজন-উত্তোলন ইভেন্টগুলোর কভারেজ রোবটদের অসংগঠিত, স্পর্শ-নির্ভর পরিস্থিতিতে সংগ্রাম করার বর্ণনা দিয়েছে (Al Jazeera)। একটি পুনরাবৃত্তিযোগ্য, প্রকৌশলগত স্প্রিন্ট একটি অপ্রত্যাশিত পরিবেশে নমনীয় দক্ষতার সমান অর্জন নয়, এবং Games বিমূর্তভাবে নয়, একই সপ্তাহে সেই ব্যবধান তুলে ধরে।
ভিত্তি-প্রতিষ্ঠার দৃষ্টিভঙ্গি
Vincent Vanhoucke, যিনি Google DeepMind-এ রোবটবিদ্যার প্রধান, এই পুরো প্রবণতার সবচেয়ে তীক্ষ্ণ বাস্তবতা যাচাই প্রদান করেন: “বেশিরভাগ — যদি সবগুলো না-ও হয় — রোবট শেখার পদ্ধতি কোনো ব্যবহারিক কাজের জন্য স্থাপন করা যায় না,” কারণ প্রকৃত স্থাপনার জন্য প্রয়োজন “99.X শতাংশ বা তার বেশি নির্ভুলতা ও নির্ভরযোগ্যতা” যেখানে একাডেমিক প্রদর্শনী প্রায় 80% সাফল্যের প্রতিবেদন দেয় — তার ভাষায়, এটি “একটি মৌলিকভাবে ভিন্ন জন্তু,” আরও তথ্য দিয়ে সমাধান করার মতো একটি স্কেলিং সমস্যা নয় (IEEE Spectrum, 28 মে, 2024)।
Rodney Brooks, যিনি iRobot ও Rethink Robotics সহ-প্রতিষ্ঠা করা MIT-এর রোবটবিদ, বিশেষভাবে ভিডিও-অনুকরণ প্রশিক্ষণ কেন ভুল ভিত্তি হতে পারে তা নিয়ে আরও এগিয়ে যান: স্পর্শের সাথে জড়িত একটি চ্যানেল যা বর্তমান পাইপলাইনগুলো কখনো ধারণ করে না, স্নায়ুবিজ্ঞান গবেষণা উদ্ধৃত করে যা মানুষের ত্বকে অন্তত পনেরোটি ভিন্ন পরিবারের স্পর্শ-সংবেদী নিউরন চিহ্নিত করে। তিনি আজকের ম্যানিপুলেশন প্রদর্শনীকে প্রাথমিক ও সীমিত বলে অভিহিত করেন, এবং মানবাকার রোবট দশকের মধ্যে মানব-স্তরের সাধারণ দক্ষতায় পৌঁছাবে এমন দাবিকে “নিছক কল্পনাপ্রসূত চিন্তা” বলে খারিজ করেন (TechCrunch, 26 সেপ্টেম্বর, 2025)।
উভয় বিষয়ই একসাথে সত্য। ফাউন্ডেশন-মডেল পদ্ধতি প্রকৃত, পরিমাপযোগ্য ক্রস-রোবট স্থানান্তর তৈরি করেছে যা হাতে-কোড করা নিয়ন্ত্রণ কখনো অর্জন করেনি, এবং সংখ্যা প্রকাশ করা প্রতিটি বিশ্বাসযোগ্য গবেষণাগার — কেবল সংশয়বাদীরা নয় — শিল্প ও গার্হস্থ্য নির্ভরযোগ্যতার প্রকৃত প্রয়োজনের চেয়ে বেশ কম সাফল্যের হার প্রতিবেদন করে।