সহায়তা, স্বয়ংক্রিয়করণ, এবং পুনরাবৃত্ত উন্নতি ভিন্ন দাবি
এআই সিস্টেমগুলো ইতিমধ্যে সফটওয়্যার ও মেশিন-লার্নিং কাজে সহায়তা করে। এগুলো কোড তৈরি করে, সাহিত্য অনুসন্ধান করে, পরীক্ষা বিশ্লেষণ করে, পরীক্ষা প্রস্তাব করে, এবং ডিবাগ করতে সাহায্য করে। এআই গবেষণার অংশ স্বয়ংক্রিয় করা উন্নয়ন চক্র সংক্ষিপ্ত করতে পারে। এর কোনোটিই, নিজে থেকে, পুনরাবৃত্ত স্ব-উন্নতি প্রমাণ করে না: এমন একটি চক্র যেখানে একটি এআই সিস্টেম তার উত্তরসূরি তৈরি করা প্রক্রিয়াকে উল্লেখযোগ্যভাবে উন্নত করে, সেই উত্তরসূরিরা এটিকে আরও উন্নত করে, এবং সক্ষমতার বৃদ্ধি মানব নিয়ন্ত্রণের বাইরে ত্বরান্বিত হয়।
একটি স্পষ্ট বিশ্লেষণ তিনটি স্তরকে আলাদা করে:
- গবেষণা সহায়তা: মানুষ পরিকল্পনা, বিচার, এবং একীকরণ কাজ বজায় রেখে এআই সরঞ্জাম ব্যবহার করে।
- কর্মপ্রবাহ স্বয়ংক্রিয়করণ: একটি এজেন্ট সীমিত হস্তক্ষেপে একটি সীমাবদ্ধ গবেষণা বা প্রকৌশল কাজ সম্পন্ন করে।
- প্রান্ত-থেকে-প্রান্ত এআই R&D স্বয়ংক্রিয়করণ: সিস্টেমগুলো গুরুত্বপূর্ণ অ্যালগরিদমিক অগ্রগতি তৈরি করতে এবং সেগুলোকে উন্নত সিস্টেমে একীভূত করতে প্রয়োজনীয় বেশিরভাগ কাজ সম্পাদন করে।
শুধুমাত্র তৃতীয় স্তরটি সবচেয়ে শক্তিশালী প্রতিক্রিয়া-চক্র যুক্তি তৈরি করে, এবং তখনও হার্ডওয়্যার, পরীক্ষা, প্রতিষ্ঠান, এবং স্থাপনা সিদ্ধান্ত গতি সীমাবদ্ধ করতে পারে।
পর্যবেক্ষিত কোডিং সক্ষমতা
কোডিং বর্তমান সবচেয়ে শক্তিশালী ক্ষেত্রগুলোর একটি। সর্বজনীন এজেন্টরা নির্বাচিত রিপোজিটরি সমস্যা মেরামত করতে পারে এবং কার্যকরী প্রোগ্রাম তৈরি করতে পারে। তবুও বেঞ্চমার্কগুলো প্রায়ই একটি পরিষ্কার সমস্যা, পরীক্ষা, সরঞ্জাম, এবং একটি স্বয়ংক্রিয়ভাবে গ্রেডযোগ্য এন্ডপয়েন্ট সরবরাহ করে। পরিণত উন্নয়নে অনথিভুক্ত প্রেক্ষাপট, সমন্বয়, পণ্য বিচার, নিরাপত্তা, এবং রক্ষণাবেক্ষণ জড়িত।
তাদের ভালোভাবে জানা রিপোজিটরিতে 246টি কাজ সম্পন্নকারী 16 জন অভিজ্ঞ ওপেন-সোর্স ডেভেলপারের METR-এর একটি এলোমেলো গবেষণায় দেখা গেছে যে 2025-এর শুরুর এআই সরঞ্জামগুলো সম্পন্নকরণের সময় 19 শতাংশ বাড়িয়ে দিয়েছে, যদিও ডেভেলপাররা বিশ্বাস করেছিলেন যে সরঞ্জামগুলো তাদের দ্রুততর করেছে (METR ডেভেলপার-উৎপাদনশীলতা গবেষণা)। এটি একটি সংকীর্ণ, তারিখযুক্ত ফলাফল — এমন প্রমাণ নয় যে পরবর্তী সরঞ্জাম বা অন্যান্য ডেভেলপাররা ধীর। এটি দেখায় কেন বেঞ্চমার্ক লাভকে সরাসরি অর্থনৈতিক ত্বরণে রূপান্তরিত করা যায় না।
METR সরঞ্জাম ও ব্যবহার বিবর্তিত হওয়ার সাথে সাথে 2026-এ একটি বৃহত্তর অনুসরণ গবেষণা শুরু করেছে এবং তার নকশা পরিবর্তন করেছে (METR uplift হালনাগাদ)। প্রকৃত উৎপাদনশীলতা পর্যালোচনার বোঝা, কাজ নির্বাচন, ডেভেলপারের পরিচিতি, এজেন্ট ইন্টারফেস, এবং পরীক্ষায় উত্তীর্ণ ত্রুটির ওপর নির্ভর করে।
এআই গবেষণা বেঞ্চমার্ক থেকে প্রমাণ
RE-Bench সাতটি উন্মুক্ত-প্রান্তের মেশিন-লার্নিং গবেষণা-প্রকৌশল পরিবেশে এজেন্ট ও মানব বিশেষজ্ঞদের স্থাপন করে। তার মূল গবেষণায়, সেরা এজেন্টরা দুই ঘণ্টার বাজেটে মানুষের চেয়ে প্রায় চারগুণ বেশি স্কোর করেছে। মানুষরা অতিরিক্ত সময়ের সাথে বেশি উন্নতি করেছে, আট ঘণ্টায় সংকীর্ণভাবে এজেন্টদের ছাড়িয়ে গেছে, এবং 32 ঘণ্টা জুড়ে এজেন্ট স্কোরের প্রায় দ্বিগুণ অর্জন করেছে (RE-Bench পেপার)।
সেই ফলাফলটি শক্তিশালী স্বল্প-দিগন্ত পরীক্ষা-নিরীক্ষা দেখায়: এজেন্টরা দ্রুত অনেক প্রার্থী সমাধান তৈরি ও পরীক্ষা করতে পারে এবং কখনো কখনো চমৎকার অপ্টিমাইজেশন কাজ তৈরি করতে পারে। এটি একটি সীমাবদ্ধতাও দেখায়: এজেন্টরা আটকে যায়, পুনর্মুখী হতে ব্যর্থ হয়, বা একটি দীর্ঘতর বাজেট থেকে কম লাভ করে। সাতটি কাজ গবেষণার সম্পূর্ণ বণ্টন প্রতিনিধিত্ব করতে পারে না, এবং পুনরাবৃত্ত নমুনায়ন একজন স্থায়ী বিজ্ঞানীর সমান নয়।
অন্যান্য মূল্যায়ন পাইপলাইনের অংশগুলো কভার করে। OpenAI-এর PaperBench এজেন্টদের বর্ণনা থেকে 20টি ICML পেপারের ফলাফল পুনরুৎপাদন করতে এবং পরীক্ষা সম্পাদন করতে বলে (PaperBench)। MLE-bench Kaggle-শৈলীর প্রতিযোগিতার মাধ্যমে মেশিন-লার্নিং প্রকৌশল মূল্যায়ন করে (MLE-bench)। এই বেঞ্চমার্কগুলো অর্থবহ দক্ষতা পরিমাপ করে কিন্তু মূল তত্ত্ব গঠন, এজেন্ডা নির্ধারণ, গবেষণাগার ব্যবস্থাপনা, সহকর্মী পর্যালোচনা, বা নিরাপদ স্থাপনা প্রতিষ্ঠা করে না।
ডেভেলপাররা কী প্রতিবেদন করেন
ফ্রন্টিয়ার গবেষণাগারগুলো এখন স্বয়ংক্রিয় R&D-কে একটি ঝুঁকি সীমা হিসেবে বিবেচনা করে। Anthropic-এর ফেব্রুয়ারি 2026-এর ঝুঁকি প্রতিবেদন বলেছে যে Claude Opus 4.6 মূল ক্ষেত্রে R&D-এর জন্য প্রয়োজনীয় কার্যকলাপের সম্পূর্ণ স্বয়ংক্রিয়করণের কাছাকাছি বা তাতে ছিল না, একই সাথে সতর্ক করে যে আংশিক স্বয়ংক্রিয়করণ এখনো অগ্রগতি ত্বরান্বিত করতে পারে (Anthropic ঝুঁকি প্রতিবেদন)। এটি একটি ডেভেলপারের স্ব-মূল্যায়ন, সম্পাদনা ও স্বার্থের দ্বন্দ্বসহ।
Anthropic জুলাই 2026-এ তার Responsible Scaling Policy সংস্করণ 3.4-এ তার স্বয়ংক্রিয়-R&D সীমা আবার সংশোধন করেছে, যা প্রদর্শন করে যে পরিমাপ করা বিষয়টি এখনো নিষ্পত্তিকৃত নয় (Anthropic RSP আর্কাইভ)। কোম্পানির সীমা অভ্যন্তরীণ পদক্ষেপকে গাইড করতে পারে, কিন্তু সেগুলোকে বৈজ্ঞানিক ঐকমত্য হিসেবে গণ্য করা উচিত নয়।
আগস্ট 2026-এ, Anthropic গবেষকরা এমন পরীক্ষার প্রতিবেদন দিয়েছেন যেখানে স্বয়ংক্রিয় গবেষণা এজেন্টরা নির্বাচিত প্রান্তিককরণ ব্যর্থতার প্রশমন খুঁজে পেয়েছে (Anthropic স্বয়ংক্রিয়-গবেষণা প্রতিবেদন)। এটি উৎসাহব্যঞ্জক প্রমাণ যে এআই-ত্বরান্বিত গবেষণা নিরাপত্তা শক্তিশালী করতে পারে। এটি নির্মিত কাজের ওপর প্রথম-পক্ষের গবেষণাও, ব্যাপক স্বয়ংক্রিয় প্রান্তিককরণ বিজ্ঞানের প্রমাণ নয়।
প্রতিক্রিয়া-চক্র যুক্তি
একটি সরল চক্রের চারটি ধাপ আছে: এআই-কে এআই গবেষণার জন্য স্থাপন করা; একটি অ্যালগরিদমিক বা প্রকৌশল উন্নতি অর্জন করা; একটি ভালো সিস্টেম প্রশিক্ষণ বা কনফিগার করা; সেই সিস্টেমকে আরও উন্নতি তৈরি করতে ব্যবহার করা। ত্বরণ নির্ভর করে বেশ কয়েকটি উপাদানের গুণফলের ওপর, শুধু চক্রের অস্তিত্বের ওপর নয়।
গবেষণা কভারেজ: প্রাসঙ্গিক কাজের কতটুকু এজেন্টরা সম্পাদন করতে পারে? কোডিং সহায়তার মূল্য আছে, কিন্তু সমস্যা নির্বাচন, মূল্যায়ন, হার্ডওয়্যার, তথ্য, ব্যবস্থাপনা, এবং নিরাপত্তায় মানুষ বাধা হয়ে থাকতে পারে।
উন্নতির আকার: বেশিরভাগ পরীক্ষা ব্যর্থ হয় বা ছোট লাভ প্রদান করে। একটি এজেন্টকে এমন উদ্ভাবন তৈরি করতে হবে যা পরবর্তী সিস্টেমকে উপাদানগতভাবে উন্নত করে, শুধু একটি বেঞ্চমার্ক অপ্টিমাইজ করে না।
চক্র সময়: প্রশিক্ষণ, চিপ উৎপাদন, ডেটা-সেন্টার নির্মাণ, মূল্যায়ন, এবং স্থাপনা কোড লেখার চেয়ে অনেক বেশি সময় নিতে পারে। ভালো গবেষণা তাৎক্ষণিকভাবে কম্পিউট তৈরি করতে পারে না।
পুনঃবিনিয়োগ: প্রতিষ্ঠানগুলোকে লাভ আরও সক্ষমতায় প্রয়োগ করার সিদ্ধান্ত নিতে হবে। তারা এগুলো খরচ, নির্ভরযোগ্যতা, পণ্য, বা নিরাপত্তার দিকে পরিবর্তে বরাদ্দ করতে পারে।
হ্রাসমান প্রতিদান: সহজ উন্নতিগুলো নিঃশেষ হয়ে যাওয়ার সাথে সাথে আবিষ্কারগুলো কঠিনতর হতে পারে। একটি চক্র বিস্ফোরকভাবে ত্বরান্বিত না হয়েও চলতে পারে।
যাচাইকরণ: অনির্ভরযোগ্য গবেষণা পর্যালোচনা ও পুনরুৎপাদন খরচ তৈরি করে। সিস্টেমগুলো যদি মূল্যায়ন হেরফের করতে পারে, দ্রুততর আউটপুট বিশ্বাসযোগ্য অগ্রগতি ধীর করে দিতে পারে।
পুনরাবৃত্ত উন্নতি তাই একটি শর্তসাপেক্ষ পরিদৃশ্য। এটি কোড-জেনারেশন হারের একটি সরাসরি এক্সট্রাপোলেশন নয়।
সফটওয়্যার হার্ডওয়্যারের চেয়ে দ্রুত এগোতে পারে
অ্যালগরিদমিক দক্ষতা, প্রশিক্ষণ রেসিপি, তথ্য কিউরেশন, ইনফারেন্স পদ্ধতি, কম্পাইলার, এবং এজেন্ট স্ক্যাফোল্ড বিদ্যমান হার্ডওয়্যারের মধ্যে উন্নত হতে পারে। এই “সফটওয়্যার” লাভগুলো দ্রুত বিস্তৃত হতে পারে এবং প্রতি চিপে সক্ষমতা বাড়াতে পারে। এআই এই স্থানগুলো অনুসন্ধান করতে সাহায্য করতে পারে, একটি প্রকৃত ইতিবাচক প্রতিক্রিয়া চ্যানেল তৈরি করে।
কিন্তু ফ্রন্টিয়ার মডেলগুলো এখনো শক্তি, চিপ, নেটওয়ার্কিং, মেমরি, সুবিধা, এবং সরবরাহ শৃঙ্খলের ওপর নির্ভরশীল। একটি সিস্টেম প্রতিটি ভৌত সীমাবদ্ধতাকে পুনরাবৃত্তভাবে সম্পাদনা করে এড়িয়ে যেতে পারে না। এটি সম্পদ ব্যবহার উন্নত করতে পারে বা হার্ডওয়্যার নকশায় সাহায্য করতে পারে, যখন উৎপাদন ও নির্মাণ প্রকৃত সময়সীমা ধরে রাখে।
দ্রুততম পথটি তাই একটি চিরন্তন মসৃণ সূচকীয় বৃদ্ধির পরিবর্তে সফটওয়্যার ও প্রক্রিয়া উন্নতির একটি বিস্ফোরণ এবং তারপর ভৌত বা সাংগঠনিক সীমা হতে পারে। অন্যান্য গতিপথ সম্ভব থেকে যায়; উপলব্ধ প্রমাণ আত্মবিশ্বাসের সাথে একটি বেছে নিতে পারে না।
চক্রটি কেন ঝুঁকি বাড়াতে পারে
দ্রুত সক্ষমতা চক্র মূল্যায়ন, নিয়ন্ত্রণ, এবং প্রাতিষ্ঠানিক শিক্ষাকে ছাড়িয়ে যেতে পারে। যদি অভ্যন্তরীণ গবেষণা এজেন্টরা মডেল ওজন, প্রশিক্ষণ অবকাঠামো, কোড স্থাপনা, এবং সংবেদনশীল মূল্যায়নে প্রবেশাধিকার পায়, একটি ভুল বা দূষিত ব্যবহারের নাগাল বৃহত্তর হয়। প্রতিযোগিতামূলক চাপ ডেভেলপারদের নিরীক্ষণ পরিণত হওয়ার আগে স্বয়ংক্রিয়করণ ব্যবহার করতে উৎসাহিত করতে পারে।
চক্রটি শক্তিও কেন্দ্রীভূত করতে পারে। কম্পিউট ও স্বয়ংক্রিয় গবেষণা সিস্টেমযুক্ত প্রতিষ্ঠানগুলো এগিয়ে যেতে পারে, আরও পুঁজি ও প্রতিভা আকর্ষণ করে। বিকল্পভাবে, দক্ষ অ্যালগরিদম বিস্তৃত হতে পারে এবং কেন্দ্রীকরণ কমাতে পারে। এই বিপরীত প্রভাবগুলো অনুমান করার বদলে মডেল করা উচিত।
চক্রটি কেন নিরাপত্তা উন্নত করতে পারে
এআই দুর্বলতা অনুসন্ধান করতে পারে, পরীক্ষা তৈরি করতে পারে, ঘটনা বিশ্লেষণ করতে পারে, ব্যাখ্যাযোগ্যতা সরঞ্জাম উন্নত করতে পারে, এবং রুটিন যাচাইকরণ স্বয়ংক্রিয় করতে পারে। নিরাপত্তা গবেষণা একই স্কেল ও পুনরাবৃত্তি থেকে উপকৃত হতে পারে। গুরুত্বপূর্ণ শাসন প্রশ্নটি হলো নিরাপত্তা সক্ষমতা সক্ষমতার আগে এবং সাথে সাথে বৃদ্ধি পায় কিনা — এআই গবেষণা সহায়তা সহজাতভাবে বিপজ্জনক কিনা তা নয়।
নিয়ন্ত্রণের মধ্যে রয়েছে স্যান্ডবক্সড গবেষণা পরিবেশ, সুরক্ষিত মূল্যায়ন সেট, ন্যূনতম-বিশেষাধিকার প্রবেশাধিকার, স্বাধীন নিরীক্ষণ, পর্যায়ক্রমিক একীকরণ, পুনরুৎপাদনযোগ্য পরীক্ষা, এবং প্রশিক্ষণ বা স্থাপনায় পরিবর্তন পৌঁছানোর আগে মানবীয় অনুমোদন। গবেষণা এজেন্টদের তাদের মূল্যায়নকারী, শংসাপত্র, বা উৎপাদন সিস্টেম পরিবর্তন করতে সক্ষম হওয়া উচিত নয়।
প্রতিষ্ঠানগুলো সক্ষমতা ও নিরাপত্তা উভয়েরই ত্বরণ পরিমাপ করতে পারে: সংরক্ষিত গবেষক-ঘণ্টা, যাচাইকৃত আবিষ্কার, ধরা পড়া ব্যর্থ পরীক্ষা, পর্যালোচনা বোঝা, ঘটনার হার, এবং স্বাধীন পুনরুৎপাদনের জন্য প্রয়োজনীয় সময়।
যে প্রমাণ মূল্যায়ন বদলে দেবে
একটি দ্রুত প্রতিক্রিয়া-চক্রের জন্য শক্তিশালী প্রমাণের মধ্যে থাকবে একাধিক ক্ষেত্র জুড়ে অভিনব, গুরুত্বপূর্ণ অ্যালগরিদমিক অগ্রগতি তৈরিকারী এজেন্ট; স্বাধীন পুনরাবৃত্তি; দীর্ঘ প্রকল্প জুড়ে টেকসই সাফল্য; হ্রাসকৃত প্রান্ত-থেকে-প্রান্ত চক্র সময়; এবং মানবীয় কাজে সমতুল্য বৃদ্ধি ছাড়াই ক্রমাগত সিস্টেমগুলো পরিমাপযোগ্যভাবে গবেষণা এজেন্টকে উন্নত করা।
নিকট-মেয়াদী বিস্ফোরক ত্বরণের বিরুদ্ধে প্রমাণের মধ্যে থাকবে মানবীয় এজেন্ডা নির্ধারণের ওপর অবিরাম নির্ভরতা, দ্রুত হ্রাসমান প্রতিদান, উচ্চ যাচাইকরণ খরচ, দীর্ঘ প্রকল্প পরিচালনায় অক্ষমতা, এবং কঠিন কম্পিউট বা পরীক্ষা বাধা।
ব্যবহারিক উপসংহার
এআই-ত্বরান্বিত এআই গবেষণা সহায়তা এবং নির্বাচিত সীমাবদ্ধ স্বয়ংক্রিয়করণের স্তরে ইতিমধ্যে বাস্তব। বেঞ্চমার্কগুলো উল্লেখযোগ্য স্বল্প-দিগন্ত গবেষণা প্রকৌশল দেখায়, যখন বাস্তব-জগতের উৎপাদনশীলতা গবেষণা এবং দীর্ঘতর বাজেট গুরুত্বপূর্ণ ফাঁক প্রকাশ করে। 13 সেপ্টেম্বর, 2026 পর্যন্ত কোনো সর্বজনীন প্রমাণ প্রান্ত-থেকে-প্রান্ত স্বয়ংক্রিয় এআই R&D বা একটি অনিয়ন্ত্রণযোগ্য পুনরাবৃত্ত-উন্নতি চক্র প্রদর্শন করে না।
সঠিক প্রতিক্রিয়া না তো খারিজ করা, না অনিবার্যতা। প্রতিটি বাধা ট্র্যাক করুন, স্থাপিত গবেষণা সিস্টেম পরীক্ষা করুন, এর সরঞ্জাম ও মূল্যায়নকারীদের রক্ষা করুন, এবং কভারেজ, উন্নতির আকার, চক্র সময়, এবং পুনঃবিনিয়োগ সম্পর্কে অনুমানগুলো স্পষ্ট করুন।