Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI মানবজাতির বেঁচে থাকার ব্রিফিং
BN

বর্তমান এআই সক্ষমতা ড্যাশবোর্ড: সেপ্টেম্বর 2026

ফ্রন্টিয়ার এআই সক্ষমতার একটি নির্দিষ্ট, বহুমাত্রিক স্ন্যাপশট — Stanford-এর AI Index যাকে বলে 'অসম বুদ্ধিমত্তা' — এবং কেন বেঞ্চমার্ক এজিআই-এর প্রমাণ নয়।

Written by
Dwight Ringdahl
Status
উৎস-যাচাইকৃত
Revised
Sources
9 cited
Reading
6 min

এই স্ন্যাপশটটি কীভাবে পড়বেন

এই ড্যাশবোর্ডটি 13 সেপ্টেম্বর, 2026 পর্যন্ত উপলব্ধ সর্বজনীন প্রমাণ লিপিবদ্ধ করে। এটি একটি লাইভ লিডারবোর্ড নয় এবং নীরবে হালনাগাদ করা উচিত নয়। এআই পণ্য, স্ক্যাফোল্ড, মূল্যায়ন সেট, এবং দাম এত দ্রুত পরিবর্তিত হয় যে একটি তারিখহীন “বর্তমান” পাতা সৎ থাকতে পারে না।

সক্ষমতা বহুমাত্রিক। একটি সিস্টেম একটি অলিম্পিয়াড সমস্যা সমাধান করতে পারে অথচ একটি অ্যানালগ ঘড়ি পড়তে ব্যর্থ হতে পারে, বিশেষজ্ঞ জীববিজ্ঞান প্রশ্নের উত্তর দিতে পারে অথচ একটি ল্যাবরেটরি কর্মপ্রবাহ সম্পন্ন করতে ব্যর্থ হতে পারে, বা একটি কোডিং গ্রেডার পাস করতে পারে অথচ এমন একটি প্যাচ তৈরি করতে পারে যা একজন রক্ষণাবেক্ষণকারী প্রত্যাখ্যান করবেন। Stanford-এর 2026 AI Index এই ধরনটিকে অসম বুদ্ধিমত্তা বলে এবং নিয়ন্ত্রিত ও বাস্তব পরিবেশের মধ্যে বড় ব্যবধান নথিভুক্ত করে (Stanford AI Index, প্রযুক্তিগত কর্মক্ষমতা)।

নিচের রেটিংগুলো প্রমাণ বর্ণনা করে, একটি সার্বজনীন মডেল নয়। “শক্তিশালী” মানে শীর্ষস্থানীয় সিস্টেমগুলো প্রাসঙ্গিক সর্বজনীন মূল্যায়নে চিত্তাকর্ষকভাবে সম্পাদন করে। এর অর্থ নিরাপদ, মানব-সমতুল্য, বা স্বায়ত্তশাসিত উচ্চ-ঝুঁকিপূর্ণ ব্যবহারের জন্য যথেষ্ট নির্ভরযোগ্য নয়।

মাত্রা সেপ্টেম্বর 2026-এর প্রমাণ গুরুত্বপূর্ণ সীমাবদ্ধতা
ভাষা ও জ্ঞান ব্যাপক প্রশ্ন-উত্তর ও মাল্টিমোডাল পরীক্ষায় শক্তিশালী হ্যালুসিনেশন, দূষণ, এবং অসম বাস্তব নির্ভরযোগ্যতা রয়ে গেছে
গণিত ও কাঠামোবদ্ধ যুক্তি নির্বাচিত সমস্যায় ফ্রন্টিয়ার সিস্টেমগুলো শীর্ষ প্রতিযোগিতা-স্তরের ফলাফলে পৌঁছেছে কর্মক্ষমতা অসম এবং সরঞ্জাম ও ইনফারেন্স বাজেটের প্রতি সংবেদনশীল রয়ে গেছে
কোডিং ও কম্পিউটার ব্যবহার কোডিং ও কাঠামোবদ্ধ ডেস্কটপ-এজেন্ট বেঞ্চমার্কে দ্রুত লাভ গ্রেডার পাস করা রক্ষণাবেক্ষণযোগ্য উৎপাদন কাজের নিশ্চয়তা দেয় না
দীর্ঘ-কাজ স্বায়ত্তশাসন পরিমাপকৃত সফটওয়্যার-কাজের দিগন্ত দ্রুত বৃদ্ধি পেয়েছে মূলত পরিচ্ছন্ন সফটওয়্যার/ML/সাইবার কাজ; স্বাধীন পরিচালনার সময়কাল নয়
বিজ্ঞান সহায়তা শক্তিশালী ডোমেইন জ্ঞান এবং উন্নত প্রোটোকল/সমস্যা-সমাধান কর্মক্ষমতা জ্ঞান স্কোর প্রান্ত-থেকে-প্রান্ত পরীক্ষামূলক দক্ষতা প্রতিষ্ঠা করে না
সাইবার সক্ষমতা এজেন্টরা প্রকৃত দুর্বলতা খুঁজে পেতে ও নির্বাচিত বিশেষজ্ঞ কাজ সম্পন্ন করতে পারে প্রান্ত-থেকে-প্রান্ত স্বয়ংক্রিয় আক্রমণ সর্বজনীনভাবে প্রতিষ্ঠিত নয়
প্ররোচনা নিয়ন্ত্রিত পরীক্ষায় পরিমাপযোগ্য মতামত পরিবর্তন জনসংখ্যা-স্তরের দূষিত প্রভাব প্রদর্শিত হয়নি
রোবটবিদ্যা ও মূর্তায়ন নিয়ন্ত্রিত পরিবেশে শক্তিশালী অগ্রগতি গৃহস্থালি ও উন্মুক্ত-জগতের নির্ভরযোগ্যতা অনেক কম রয়ে গেছে
নিরাপত্তা ও নির্ভরযোগ্যতা সুরক্ষা ব্যবস্থা ও মূল্যায়ন উন্নত হচ্ছে প্রতিবেদন অসামঞ্জস্যপূর্ণ এবং কোনো পদ্ধতি নিয়ন্ত্রণের নিশ্চয়তা দেয় না

যুক্তি চিত্তাকর্ষক এবং অসম

2026 AI Index প্রতিবেদন করে যে একটি Google DeepMind সিস্টেম প্রতিযোগিতার সময়সীমার অধীনে 2025 International Mathematical Olympiad-এ একটি স্বর্ণপদক-স্তরের স্কোর অর্জন করেছে। একই অধ্যায় প্রতিবেদন করে যে ClockBench-এ সেরা পরীক্ষিত মডেল সঠিকভাবে অ্যানালগ ঘড়ি পড়েছে মাত্র প্রায় অর্ধেক সময়, মানুষের জন্য প্রায় 90 শতাংশের বিপরীতে। এই পরীক্ষাগুলো সমান গুরুত্বপূর্ণ নয়, কিন্তু তাদের বৈপরীত্য একটি স্কেলার “বুদ্ধিমত্তা স্তর”-এর ধারণাকে পরাজিত করে।

বেঞ্চমার্ক লাভ একটি ভালো বেস মডেল, বেশি ইনফারেন্স-সময়ের গণনা, সরঞ্জাম ব্যবহার, একাধিক সমাধানের নমুনা, বা বিশেষায়িত স্ক্যাফোল্ডিং প্রতিফলিত করতে পারে। একটি ফলাফল বিবৃত শর্তের অধীনে সম্পূর্ণ পরীক্ষিত সিস্টেমের অন্তর্গত। এটিকে একটি সস্তা পণ্য স্তরে বা সময়-সীমাবদ্ধ স্থাপনায় সহজে স্থানান্তরিত করা উচিত নয়।

অনেক পরীক্ষাও দ্রুত সম্পৃক্ত হয়ে যায়। Stanford Humanity’s Last Exam-এ তীক্ষ্ণ লাভ এবং SWE-bench Verified-এ প্রায়-সম্পৃক্তি প্রতিবেদন করে, একই সাথে অবৈধ প্রশ্ন এবং সম্ভাব্য লিডারবোর্ড অভিযোজন উল্লেখ করে। সম্পৃক্তির মানে একটি মূল্যায়নের শীর্ষস্থানীয় সিস্টেমগুলোকে আলাদা করার ক্ষমতা কম; এর মানে অন্তর্নিহিত ডোমেইন সমাধান হয়ে গেছে তা নয়।

কোডিং ও কম্পিউটার ব্যবহার

শীর্ষস্থানীয় এজেন্টরা নির্বাচিত রিপোজিটরি সমস্যা মেরামত করতে পারে, উল্লেখযোগ্য কোড লিখতে পারে, এবং গ্রাফিক্যাল অ্যাপ্লিকেশন পরিচালনা করতে পারে। Stanford OSWorld কর্মক্ষমতা প্রায় 12 শতাংশ থেকে 66.3 শতাংশে বৃদ্ধি পাওয়ার প্রতিবেদন করে, তবুও প্রায় প্রতি তিনটির একটি কাঠামোবদ্ধ কাজে ব্যর্থ হচ্ছে। প্রকৃত কম্পিউটার ব্যবহার পরিবর্তনশীল ইন্টারফেস, অস্পষ্ট উদ্দেশ্য, শংসাপত্র, প্রতিকূল বিষয়বস্তু, এবং পরিণতি যোগ করে যা একটি বেঞ্চমার্ক বাদ দিতে পারে।

স্বয়ংক্রিয় গ্রেডিং আরেকটি সীমারেখা। SWE-bench প্যাচের ওপর METR-এর 2026 গবেষণায় দেখা গেছে যে বেঞ্চমার্কের পরীক্ষা পাস করার মানে এই নয় যে রক্ষণাবেক্ষণকারীরা পরিবর্তনগুলো মার্জ করবেন, কার্যকরী পরীক্ষার ক্ষেত্রের বাইরে মানের মাত্রা তুলে ধরে (METR রক্ষণাবেক্ষণকারী পর্যালোচনা গবেষণা)। উৎপাদন কোডিংয়ের জন্য প্রয়োজন আর্কিটেকচার, যোগাযোগ, নিরাপত্তা, রক্ষণাবেক্ষণ, এবং ব্যর্থতার জন্য দায়িত্ব।

এই প্রমাণ নির্বাচিত কাজের যথেষ্ট সহায়তা ও স্বয়ংক্রিয়করণ সমর্থন করে। এটি “সফটওয়্যার প্রকৌশল সমাধান হয়ে গেছে” সমর্থন করে না।

দীর্ঘ-কাজ স্বায়ত্তশাসন

METR-এর মে 2026-এর ড্যাশবোর্ড মানব-বিশেষজ্ঞ কাজের সময়কাল অনুমান করে যে সময়ে একটি এজেন্টের 50 বা 80 শতাংশ পূর্বাভাসিত সাফল্যের হার আছে। কাজগুলো মূলত সফটওয়্যার প্রকৌশল, মেশিন লার্নিং, এবং সাইবার নিরাপত্তা সংক্রান্ত। METR বলে যে ষোল ঘণ্টার ওপরে পরিমাপ বর্তমান সেটসহ অনির্ভরযোগ্য (METR টাস্ক হরাইজন)।

মেট্রিকটি প্রায়ই ভুলভাবে প্রতিবেদিত হয়। একটি চার-ঘণ্টার দিগন্তের মানে এই নয় যে এজেন্টটি চার ঘণ্টা স্বাধীনভাবে চলে; এর মানে একজন মানব বিশেষজ্ঞের সাধারণত পরিমাপকৃত অসুবিধার কাজের জন্য প্রায় চার ঘণ্টা প্রয়োজন। সফল এজেন্টরা অনেক দ্রুত শেষ করতে পারে। সেটটি স্বয়ংসম্পূর্ণ ও বস্তুনিষ্ঠভাবে গ্রেডযোগ্য, বেশিরভাগ প্রাতিষ্ঠানিক কাজের বিপরীতে।

METR আরও সতর্ক করে যে ডোমেইনগুলো মাত্রার ক্রম অনুসারে ভিন্ন, ত্রুটি বার বিস্তৃত হতে পারে, এবং যেখানে 98-শতাংশ নির্ভরযোগ্যতা প্রয়োজন সেখানে একটি 50-শতাংশ দিগন্ত অপর্যাপ্ত (METR সীমাবদ্ধতা)। প্রবণতাটি নির্বাচিত ডিজিটাল কাজে দ্রুত অগ্রগতির অর্থবহ প্রমাণ — চাকরি স্বয়ংক্রিয়করণ বা এজিআই-এর দিকে গণনাকারী একটি ঘড়ি নয়।

বিজ্ঞান, জীববিজ্ঞান, এবং সাইবার

UK AI Security Institute প্রতিবেদন করে যে অক্টোবর 2025 পর্যন্ত পরীক্ষিত সিস্টেমগুলো নির্বাচিত রসায়ন ও জীববিজ্ঞান প্রশ্নে তার PhD-বিশেষজ্ঞ ভিত্তিরেখা অতিক্রম করেছে এবং প্রোটোকল-জেনারেশন ও ল্যাবরেটরি সমস্যা-সমাধানে উন্নত হয়েছে। এটি প্রান্ত-থেকে-প্রান্ত প্লাজমিড নকশায় অবিরাম অসুবিধাও প্রতিবেদন করে (AISI Frontier AI Trends Report)। এগুলো সরকারি মূল্যায়ন ফলাফল, কিন্তু বিশেষজ্ঞ ভিত্তিরেখা ও কাজ গঠন এখনো অর্থ নির্ধারণ করে।

সাইবার সক্ষমতা প্রশ্ন-উত্তর থেকে এমন এজেন্টের দিকে অগ্রসর হয়েছে যারা দুর্বলতা আবিষ্কার করে এবং বহু-পদক্ষেপ চ্যালেঞ্জ সমাধান করে। AISI ফেব্রুয়ারি 2026-এ তার সাইবার-কাজ পরিমাপে দ্রুততর বৃদ্ধির প্রতিবেদন করেছে (AISI সাইবার প্রবণতা)। International AI Safety Report সেই প্রমাণকে স্থাপনা থেকে আলাদা করে: আক্রমণকারীরা এআই ব্যবহার করে, তবুও সম্পূর্ণভাবে স্বায়ত্তশাসিত প্রান্ত-থেকে-প্রান্ত আক্রমণ সর্বজনীনভাবে প্রতিবেদিত হয়নি এবং আক্রমণ বা প্রতিরক্ষা কোনটি বেশি লাভ করে তা অনিশ্চিত রয়ে গেছে (International AI Safety Report 2026)।

প্ররোচনা ও সামাজিক সক্ষমতা

কথোপকথনমূলক এআই পরীক্ষায় মনোভাব পরিবর্তন করতে পারে। 76,977 জন অংশগ্রহণকারীসহ একটি 2026-এর AISI-নেতৃত্বাধীন গবেষণা খুঁজে পেয়েছে যে স্কেল বা মৌলিক ব্যক্তিগতকরণের চেয়ে প্রম্পটিং ও প্ররোচনা-কেন্দ্রিক পোস্ট-ট্রেনিং থেকে বড় প্ররোচনা প্রভাব; ব্যক্তিগতকরণ প্রভাব এক শতাংশ বিন্দুর নিচে ছিল। বর্ধিত প্ররোচনা কম বাস্তব নির্ভুলতার সাথে সম্পর্কিত ছিল (AISI প্ররোচনা গবেষণা)।

সেই অনুসন্ধানটি পরীক্ষামূলক শর্তের অধীনে পরিমাপকৃত সক্ষমতা প্রতিষ্ঠা করে। এটি টেকসই আচরণ পরিবর্তন, নির্বাচনী প্রভাব, বা জনসংখ্যা নিয়ন্ত্রণ প্রমাণ করে না। নাগাল, প্ল্যাটফর্ম বিতরণ, প্রতিযোগী বার্তা, ব্যবহারকারীর বিশ্বাস, এবং স্থায়িত্ব পৃথক পরিবর্তনশীল রয়ে যায়।

মূর্তায়ন একটি প্রধান ফাঁক রয়ে গেছে

রোবটবিদ্যা নিয়ন্ত্রিত ও উন্মুক্ত পরিবেশের মধ্যে সবচেয়ে স্পষ্ট পার্থক্য দেখায়। Stanford একটি সিমুলেশন বেঞ্চমার্কে উচ্চ সাফল্যের প্রতিবেদন করে কিন্তু পরীক্ষিত বাস্তব গৃহস্থালি কাজে মাত্র 12 শতাংশ। স্বয়ংক্রিয় যানবাহন সীমাবদ্ধ পরিষেবা এলাকায় অর্থপূর্ণ স্কেলে পরিচালিত হয়, যেখানে অপারেশনাল ডিজাইন ডোমেইন এবং অফ-সাইট মানবীয় সহায়তা ব্যাখ্যার জন্য গুরুত্বপূর্ণ।

একটি ভাষা মডেলের ব্যাপক ডিজিটাল ইন্টারফেসকে ভৌত-জগতের সাধারণতার সাথে ভুল করা উচিত নয়। সংবেদন, ম্যানিপুলেশন, মানুষের চারপাশে নিরাপত্তা, নতুন ত্রুটি থেকে পুনরুদ্ধার, হার্ডওয়্যার রক্ষণাবেক্ষণ, এবং খরচ সবই স্থাপনাকে সীমাবদ্ধ করে। এই ম্যানুয়ালের মানবাকার-রোবট অধ্যায় বেঞ্চমার্ক প্রদর্শনী ও বাস্তব-জগতের রোবট কর্মক্ষমতার মধ্যে সেই ফাঁক আরও বিস্তারিতভাবে, কোম্পানি অনুসারে ট্র্যাক করে।

নির্ভরযোগ্যতা সক্ষমতার অংশ

একটি এজেন্ট যা 66 শতাংশ সময় সফল হয় তা পর্যালোচনাসহ উপযোগী হতে পারে এবং ছাড়া অগ্রহণযোগ্য। উচ্চ-ঝুঁকিপূর্ণ সিস্টেমের প্রয়োজন ক্যালিব্রেটেড অনিশ্চয়তা, ত্রুটি শনাক্তকরণ, আপিল, নিরীক্ষা লগ, রোলব্যাক, নিরাপত্তা, এবং মানবীয় ফলব্যাক। গড় বেঞ্চমার্ক স্কোর বিরল কিন্তু গুরুত্বপূর্ণ ত্রুটি লুকিয়ে রাখে।

2026 AI Index দেখেছে যে ডেভেলপাররা দায়িত্বশীল-এআই মূল্যায়নের চেয়ে মূলধারার সক্ষমতা বেঞ্চমার্ক অনেক বেশি ধারাবাহিকভাবে প্রতিবেদন করেন (AI Index দায়িত্বশীল-এআই অধ্যায়)। অনুপস্থিত সর্বজনীন ফলাফল অনুপস্থিত অভ্যন্তরীণ পরীক্ষা প্রমাণ করে না, কিন্তু তারা তুলনা ও সর্বজনীন নিশ্চয়তা সীমাবদ্ধ করে।

এই ড্যাশবোর্ডটি কী প্রতিষ্ঠা করে না

এটি চেতনা, উদ্দেশ্য, সমস্ত চাকরি জুড়ে অর্থনৈতিক মূল্য, বা একটি গৃহীত এজিআই সীমারেখা প্রতিষ্ঠা করে না। এটি দেখায় না যে একটি বেঞ্চমার্ক ফলাফল একটি ভিন্ন ভাষা, জনসংখ্যা, সরঞ্জামসেট, খরচ সীমা, বা প্রতিকূল পরিবেশে স্থানান্তরিত হয়। এটি নিষ্পত্তি করে না বর্তমান আর্কিটেকচার দৃঢ়ভাবে সাধারণ হয়ে উঠতে পারে কিনা।

এই স্ন্যাপশট অনুসারে, সবচেয়ে শক্তিশালী উপসংহার হলো যে ফ্রন্টিয়ার সিস্টেমগুলো অসাধারণ প্রশস্ততা ও দ্রুত উন্নতি দেখায় অবিরাম ভঙ্গুরতা, ডোমেইন ফাঁক, এবং অসম্পূর্ণ নিরাপত্তা প্রমাণের পাশাপাশি। তা “শুধু অটোকমপ্লিট” বা “এজিআই এসে গেছে” এর চেয়ে বেশি গুরুত্বপূর্ণ — এবং বেশি সঠিক।

Type to search the manual.

navigate open esc close