যে ধরনের দাবি করা হচ্ছে তা দিয়ে শুরু করুন
“এআই এটি করতে পারে,” “এজিআই শীঘ্রই আসবে,” এবং “এই সিস্টেম বিপর্যয় ঘটাতে পারে” একই দাবি নয়। তাদের ভিন্ন প্রমাণের প্রয়োজন। একটি সুরচিত প্রদর্শনী প্রতিষ্ঠা করতে পারে যে একটি মডেল অনুকূল পরিস্থিতিতে একবার সফল হয়েছিল। এটি নির্ভরযোগ্যতা, অর্থনৈতিক মূল্য, বা নিরাপদ স্বায়ত্তশাসিত পরিচালনা প্রতিষ্ঠা করে না। একটি পূর্বাভাস ভবিষ্যৎ সম্পর্কে একটি বিচার প্রকাশ করে। এটি বর্তমান একটি সক্ষমতার পরিমাপ নয়।
এটি গুরুত্বপূর্ণ কারণ এজিআই-এর কোনো সার্বজনীনভাবে গৃহীত পরীক্ষা নেই। সংজ্ঞাগুলো প্রশস্ততা, কর্মক্ষমতা, স্বায়ত্তশাসন, শিক্ষণ, ভৌত দক্ষতা, এবং অর্থনৈতিক প্রভাবের বিভিন্ন সংমিশ্রণের ওপর জোর দেয়। একটি শিরোনাম এজিআই প্রমাণ করে কিনা তা জিজ্ঞাসা করার বদলে, পাঠকদের জিজ্ঞাসা করা উচিত কী পরিমাপ করা হয়েছিল, কোন পরিস্থিতিতে, এবং উপসংহারটি প্রমাণের বাইরে কতদূর ভ্রমণ করে।
নিচের সিঁড়িটি একটি কঠোর র্যাঙ্কিং নয় যাতে একটি স্তরের প্রতিটি আইটেম এর নিচের সবকিছুকে পরাজিত করে। একটি পুনরুৎপাদনযোগ্য গবেষণাগার মূল্যায়ন একটি সংকীর্ণ প্রক্রিয়ার জন্য গোলমেলে স্থাপনা তথ্যের চেয়ে শক্তিশালী প্রমাণ হতে পারে। এর উদ্দেশ্য হলো সেই অনুমানমূলক পদক্ষেপগুলো প্রকাশ করা যা প্রচারমূলক ও ভীতিকর দাবিগুলো প্রায়ই লুকিয়ে রাখে।
স্তর এক: গল্প ও কিউরেটেড প্রদর্শনী
গল্প সম্ভাবনা ও ব্যর্থতা মোড প্রকাশ করে। একটি এজেন্ট একটি অ্যাপ্লিকেশন তৈরি করার একটি স্ক্রিন রেকর্ডিং দেখায় যে অন্তত একটি চালনা প্রদর্শিত ফলাফল তৈরি করেছে, প্রদর্শনীটি খাঁটি বলে ধরে নিলে। একটি অবাক করা হ্যালুসিনেশন দেখায় যে একটি ব্যর্থতা ঘটতে পারে। কোনোটিই আমাদের বলে না আচরণটি কত ঘন ঘন দেখা যায়।
জিজ্ঞাসা করুন উপস্থাপক সেরা চালনা নির্বাচন করেছিলেন কিনা, বিরতি বা ব্যর্থতা সম্পাদনা করেছিলেন কিনা, লুকানো মানবীয় সহায়তা ব্যবহার করেছিলেন কিনা, বা একটি পরিচিত কাজ বেছে নিয়েছিলেন কিনা। সম্পূর্ণ প্রম্পট, সরঞ্জাম, মডেল সংস্করণ, নমুনায়ন সেটিং, প্রচেষ্টার সংখ্যা, এবং ব্যর্থতার ক্ষেত্রগুলো খুঁজুন। এগুলো ছাড়া, ফলাফলটিকে একটি হার হিসেবে নয়, তদন্তের যোগ্য একটি সূত্র হিসেবে বিবেচনা করুন।
প্রদর্শনী উপযোগী থেকে যায়। আনুষ্ঠানিক পরিমাপ বিদ্যমান হওয়ার আগে নতুন দক্ষতা প্রায়ই এলোমেলো আকারে দেখা দেয়। ভুলটি হলো “ঘটতে পারে”-কে “সাধারণত ঘটে”-তে পরিণত করা, তারপর “অর্থনীতি রূপান্তরিত করবে”-তে।
স্তর দুই: বেঞ্চমার্ক বা নিয়ন্ত্রিত মূল্যায়ন
একটি মূল্যায়ন কাজ, শর্ত, এবং একটি স্কোরিং নিয়ম সংজ্ঞায়িত করে। এটি একটি গল্পের চেয়ে আরও পদ্ধতিগতভাবে সিস্টেম তুলনা করতে পারে। শক্তিশালী মূল্যায়ন হেল্ড-আউট কাজ ব্যবহার করে, দূষণ প্রতিরোধ করে, অনিশ্চয়তা প্রতিবেদন করে, স্ক্যাফোল্ডিং ও মানবীয় সহায়তা নথিভুক্ত করে, এবং প্রাসঙ্গিক ব্যর্থতা মোড পরীক্ষা করে। স্বাধীন পুনরাবৃত্তি আত্মবিশ্বাস বাড়ায়।
বেঞ্চমার্ক স্কোর তবুও বিভ্রান্তিকর হতে পারে। প্রশিক্ষণ তথ্যে অনুরূপ প্রশ্ন থাকতে পারে। দলগুলো একটি সর্বজনীন পরীক্ষার জন্য অপ্টিমাইজ করতে পারে। বহু-পছন্দের জ্ঞান একটি অপরিচিত কর্মক্ষেত্রে দক্ষতা প্রতিষ্ঠা করে না। গড় বিপর্যয়কর লেজ ব্যর্থতা লুকায়। একটি সিস্টেম যা 90 শতাংশ সময় সফল হয় তা একটি 30-পদক্ষেপের কর্মপ্রবাহে অব্যবহারযোগ্য হতে পারে কারণ ত্রুটি যৌগিক হয়।
International AI Safety Report 2026 নিয়ন্ত্রিত প্রি-স্থাপনা পরীক্ষার ফলাফল বাস্তব-জগতের কর্মক্ষমতা নির্ভরযোগ্যভাবে পূর্বাভাস দেয় না এমন সমস্যার জন্য “মূল্যায়ন ফাঁক” শব্দটি ব্যবহার করে। এটি বর্তমান সক্ষমতা প্রোফাইলগুলোকে “অসম” বলেও বর্ণনা করে: কর্মক্ষমতা কাজ ও প্রেক্ষাপট জুড়ে যথেষ্ট পরিবর্তিত হয়, এবং সিস্টেমগুলো কঠিন মূল্যায়নে সফল হওয়া সত্ত্বেও আপাত সরল কাজে ব্যর্থ হতে পারে। এগুলো পরিমাপের সীমা সম্পর্কে অনুসন্ধান, প্রমাণ নয় যে প্রতিটি বেঞ্চমার্ক অকেজো। একটি বিশ্বাসযোগ্য নিবন্ধের উচিত স্কোর এবং পরীক্ষাটি কী বাদ দেয় উভয়ই প্রতিবেদন করা।
স্তর তিন: প্রতিকূল, কার্যকারণ, এবং উত্তোলন গবেষণা
ঝুঁকির দাবির জন্য একটি প্রমিত বেঞ্চমার্কের চেয়ে বেশি প্রয়োজন। রেড টিমরা নিষিদ্ধ বা বিপজ্জনক আচরণ প্ররোচিত করার উপায় খুঁজে। কার্যকারণ পরীক্ষা একটি বৈশিষ্ট্য পরিবর্তন করে এবং ফলাফল পরিবর্তিত হয় কিনা তা পরীক্ষা করে। উত্তোলন গবেষণা এআই দিয়ে মানুষ কী অর্জন করতে পারে তা একটি অর্থবহ ভিত্তিরেখার সাথে তুলনা করে, যেমন শুধুমাত্র ইন্টারনেট।
এই গবেষণাগুলো ভিন্ন প্রশ্নের উত্তর দেয়। একটি রেড টিম অনুসন্ধান পরীক্ষিত আক্রমণের অধীনে প্রবেশযোগ্যতা দেখায়, জনসংখ্যা-ব্যাপী ঘটনা নয়। একটি সক্ষমতা মূল্যায়ন দেখাতে পারে যে একটি মডেল একটি ক্ষতিকর পরিকল্পনা তৈরি করতে পারে দেখানো ছাড়াই যে একজন প্রকৃত অভিনেতা এটি সম্পাদন করতে পারবেন। একটি উত্তোলন গবেষণা অপব্যবহারের জন্য আরও প্রাসঙ্গিক হতে পারে, কিন্তু এর অংশগ্রহণকারী, সময়সীমা, ভিত্তিরেখা, ফলাফল পরিমাপ, এবং সুরক্ষা ব্যবস্থা এর অর্থ নির্ধারণ করে।
ছোট নমুনা বিস্তৃত অনিশ্চয়তা তৈরি করে। বিশেষজ্ঞ অংশগ্রহণকারীরা নবিশ উত্তোলনকে অবমূল্যায়ন করতে পারেন কিন্তু পরিশীলিত আক্রমণকারীদের আরও ভালোভাবে প্রতিনিধিত্ব করেন। প্রক্সি কাজ প্রকৃত ক্ষতি তৈরি এড়ায় কিন্তু বাস্তব-জগতের বাধা বাদ দিতে পারে। মডেল ও নিয়ন্ত্রণ পরিবর্তনের সাথে সাথে ফলাফল দ্রুত পুরনো হয়ে যায়। ভালো প্রতিবেদন সেই সীমাগুলোকে “এআই সক্ষম করে” বা “এআই ঝুঁকি বাড়ায় না”-তে সংকুচিত করার বদলে নাম দেয়।
স্তর চার: ক্ষেত্র ও স্থাপনা প্রমাণ
বাস্তব-জগতের তথ্য গ্রহণ, উৎপাদনশীলতা, ঘটনা, অপব্যবহার, এবং প্রাতিষ্ঠানিক অভিযোজন প্রকাশ করতে পারে। এলোমেলো ক্ষেত্র পরীক্ষা ও সাবধানে ডিজাইন করা আধা-পরীক্ষা কার্যকারণ প্রভাব অনুমান করতে পারে। ঘটনা ডেটাবেস ও অভিযোগ তথ্য পুনরাবৃত্ত ক্ষতি দেখাতে পারে। নিরীক্ষা এমন বৈষম্য শনাক্ত করতে পারে যা একজন ডেভেলপারের গবেষণাগার পরীক্ষা করেনি।
স্থাপনা প্রমাণেরও অন্ধ দাগ আছে। কোম্পানিগুলো তারা প্রকাশ করার চেয়ে বেশি পর্যবেক্ষণ করে। ব্যবহারকারীরা একটি সরঞ্জাম গ্রহণ করবেন কিনা এবং কীভাবে বেছে নেন, সরল তুলনাকে পক্ষপাতদুষ্ট করে তোলে। প্রতিবেদিত ঘটনা সমস্ত ঘটনার সমান নয়। গ্রাহক সহায়তায় একটি উৎপাদনশীলতা লাভ স্বয়ংক্রিয়ভাবে গবেষণা, ব্যবস্থাপনা, ওষুধ, বা রোবটবিদ্যায় সাধারণীকরণ করে না।
পাঠকদের জনসংখ্যা, পরিবেশ, তুলনা গোষ্ঠী, সময়কাল, ফলাফল, এবং স্বার্থের দ্বন্দ্ব খুঁজে দেখা উচিত। “কর্মীরা আরও কাজ সম্পন্ন করেছেন” “ব্যবসা আরও মূল্য তৈরি করেছে” থেকে ভিন্ন, এবং উভয়ই “কর্মসংস্থান কমেছে” থেকে ভিন্ন। জেনারেটিভ এআই সম্পর্কে বর্তমান শ্রম প্রমাণকে অনুমানকৃত এজিআই সম্পর্কে প্রমাণ হিসেবে পুনরায় লেবেল করা উচিত নয়।
স্তর পাঁচ: প্রবণতা এক্সট্রাপোলেশন ও পূর্বাভাস
পূর্বাভাসগুলো পরিমাপকে অনুমানের সাথে একত্রিত করে। কম্পিউট প্রবণতা, অ্যালগরিদমিক অগ্রগতি, বিনিয়োগ, বেঞ্চমার্ক কর্মক্ষমতা, এবং এজেন্ট নির্ভরযোগ্যতা একটি পূর্বাভাসকে অবহিত করতে পারে, কিন্তু কোনোটিই একচেটিয়াভাবে একটি এজিআই তারিখ নির্ধারণ করে না। সীমাবদ্ধতাগুলো হালকা হতে পারে, বাঁধতে পারে, বা স্থানান্তরিত হতে পারে। সংজ্ঞাগুলো সরে যেতে পারে।
METR-এর সময়-দিগন্ত গবেষণা মানব-বিশেষজ্ঞ সম্পন্নকরণ সময় অনুমান করে যে সময়ে একটি পরীক্ষিত এজেন্ট একটি বিবৃত নির্ভরযোগ্যতায় সফল হবে বলে পূর্বাভাসিত, সাধারণত 50 বা 80 শতাংশ। এর বর্তমান সেটটি মূলত স্বয়ংসম্পূর্ণ, ভালোভাবে-নির্দিষ্ট সফটওয়্যার-প্রকৌশল, মেশিন-লার্নিং, এবং সাইবার নিরাপত্তা কাজ দিয়ে গঠিত যাদের স্পষ্ট স্কোরিং নিয়ম আছে। পরিমাপটি একটি সংজ্ঞায়িত এজেন্ট সেটআপ ও কাজ বণ্টন সম্পর্কে উপযোগী প্রমাণ। এটি এআই স্বায়ত্তশাসিতভাবে চলার সময়, সমস্ত অর্থনৈতিকভাবে মূল্যবান কাজের একটি পরিমাপ, বা এজিআই-এর দিকে গণনাকারী একটি টাইমার নয়। METR আরও সতর্ক করে যে 16 ঘণ্টার ওপরে পরিমাপ তার বর্তমান কাজ সেটসহ অনির্ভরযোগ্য।
তার কার্যকরী সংজ্ঞা, তারিখ, সম্ভাবনা, মডেল, ভিত্তি হার, এবং ট্র্যাক রেকর্ড দিয়ে একটি পূর্বাভাস মূল্যায়ন করুন। একটি ক্যালিব্রেটেড পূর্বাভাস বলে, প্রকৃতপক্ষে, “30 শতাংশ নির্ধারিত ফলাফল প্রায় 30 শতাংশ সময় ঘটা উচিত।” রেজোলিউশন মানদণ্ড ছাড়া একটি আত্মবিশ্বাসী তারিখ স্কোর করা যায় না। বিশেষজ্ঞ জরিপ অবহিত বিশ্বাস ধারণ করে কিন্তু মতভেদকে পরীক্ষামূলক প্রমাণে রূপান্তরিত করে না।
পরিদৃশ্য অন্য উদ্দেশ্য পূরণ করে। তারা শর্তসাপেক্ষ পথ অন্বেষণ করে: যদি সক্ষমতা, প্রবেশাধিকার, স্বায়ত্তশাসন, এবং প্রাতিষ্ঠানিক প্রতিক্রিয়া নির্দিষ্ট মান নেয়, তাহলে কী অনুসরণ করে? একটি পরিদৃশ্য সবচেয়ে সম্ভাব্য ভবিষ্যৎ না হয়েও দুর্বলতা প্রকাশ করতে পারে। এটিকে সেভাবেই লেবেল করুন।
স্তর ছয়: প্রক্রিয়া ও তাত্ত্বিক যুক্তি
কিছু গুরুতর এজিআই ঝুঁকি প্রাসঙ্গিক সিস্টেম ছাড়া সরাসরি প্রদর্শন করা যায় না — এবং শুধু প্রমাণ পেতে তৈরি করা উচিত নয়। গবেষকরা পরিবর্তে পুরস্কার হ্যাকিং, যন্ত্রগত সম্পদ অনুসন্ধান, প্রতিযোগিতামূলক প্রতিযোগিতা, বা কর্তৃত্বের ধীর অর্পণের মতো প্রক্রিয়া প্রস্তাব করেন। আনুষ্ঠানিক মডেল স্পষ্ট করতে পারে একটি উপসংহার অনুমান থেকে অনুসরণ করে কিনা।
কেন্দ্রীয় প্রশ্নটি যুক্তিটি প্রাণবন্ত শোনায় কিনা নয়। এটি হলো কোন প্রাঙ্গণের পরীক্ষামূলক সমর্থন আছে। সিস্টেমটির কি একটি স্থায়ী উদ্দেশ্য আছে? এটি কি প্রয়োজনীয় দিগন্ত জুড়ে পরিকল্পনা করতে পারে? এর কি সরঞ্জাম, অর্থ, অবকাঠামো, বা নিজের অনুলিপিতে প্রবেশাধিকার আছে? নিরীক্ষণ কি ব্যর্থ হবে? প্রতিষ্ঠানগুলো কি সাড়া দিতে পারে? প্রতিটি সংযোগ সম্পূর্ণ শৃঙ্খলের সম্ভাবনা পরিবর্তন করতে পারে।
সরাসরি বিপর্যয় তথ্যের অনুপস্থিতি শূন্য ঝুঁকির প্রমাণ নয়। একটি যৌক্তিকভাবে সম্ভাব্য পথও একটি বড় সম্ভাবনা প্রতিষ্ঠা করে না। অনিশ্চয়তার অধীনে সিদ্ধান্তগুলোর পরিণতি, প্রত্যাবর্তনযোগ্যতা, সতর্কতা সময়, এবং সুরক্ষা ব্যবস্থার খরচ ও কার্যকারিতা বিবেচনা করা উচিত। এটি একটি ঝুঁকি-ব্যবস্থাপনা বিচার, তত্ত্ব পর্যবেক্ষণে পরিণত হয়েছে এমন আবিষ্কার নয়।
গুরুত্বপূর্ণ দাবির জন্য একটি প্রমাণ কার্ড ব্যবহার করুন
যেকোনো বড় বিবৃতির জন্য, ছয়টি ক্ষেত্র রেকর্ড করুন:
- দাবি: প্রকৃতপক্ষে দাবি করা সংকীর্ণ প্রস্তাবনা।
- স্থিতি: পর্যবেক্ষিত ফলাফল, অনুমান, পূর্বাভাস, পরিদৃশ্য, বা সুপারিশ।
- উৎস: প্রাথমিক গবেষণা, সরকারি তথ্য, সংশ্লেষণ, কোম্পানি প্রতিবেদন, গণমাধ্যম, বা মতামত।
- পরিধি: মডেল, সংস্করণ, কাজ, জনসংখ্যা, এখতিয়ার, এবং তারিখ।
- অনিশ্চয়তা: নমুনা আকার, আত্মবিশ্বাস ব্যবধান, পুনরাবৃত্তি, অনুপস্থিত তথ্য, এবং সম্ভাব্য বিকল্প।
- হালনাগাদ ট্রিগার: প্রমাণ যা দাবিটিকে শক্তিশালী, দুর্বল, বা প্রত্যাহার করবে।
NIST-এর স্বেচ্ছামূলক Generative AI Profile AI Risk Management Framework-এর একটি ক্রস-সেক্টর সহযোগী, কোনো এজিআই পরীক্ষা বা সনদায়ন নয়। এটি কাঠামোর Govern, Map, Measure, এবং Manage ফাংশনের অধীনে প্রস্তাবিত কার্যক্রম সংগঠিত করে এবং ঝুঁকি ব্যবস্থাপনাকে একটি জীবনচক্র কার্যকলাপ হিসেবে বিবেচনা করে। বিস্তৃত NIST AI RMF পরিমাপ নির্দেশিকা নথিভুক্ত পরীক্ষা, অনিশ্চয়তার পরিমাপ, স্থাপনা-প্রাসঙ্গিক পরিমাপ, নিরীক্ষণ, এবং যেখানে এটি অভ্যন্তরীণ পক্ষপাত কমাতে পারে সেখানে স্বাধীন পর্যালোচনার আহ্বান জানায়। সঠিক টেমপ্লেট প্রমাণের শৃঙ্খলকে নিরীক্ষাযোগ্য করার চেয়ে কম গুরুত্বপূর্ণ।
আত্মবিশ্বাসকে প্রমাণের সাথে মেলান
বিশ্বাসযোগ্য এজিআই কভারেজের জন্য মিথ্যা নিরপেক্ষতার প্রয়োজন নেই। কিছু তথ্য সুপ্রতিষ্ঠিত: মডেলগুলো অনেক মূল্যায়নে উন্নত হচ্ছে, প্রকৃত ক্ষতি ইতিমধ্যে ঘটছে, সক্ষমতা অসম রয়ে গেছে, এবং প্রতিষ্ঠানগুলোর অসম্পূর্ণ দৃশ্যমানতা আছে। অন্যান্য প্রস্তাবনা — এজিআই তারিখ, বিচ্ছিন্ন টেক-অফ, ডিজিটাল চেতনা, স্থিতিশীল প্রান্তিককরণ, বিলুপ্তি সম্ভাবনা — গভীরভাবে বিতর্কিত থেকে যায়।
শৃঙ্খলাবদ্ধ প্রতিক্রিয়া হলো নির্ভুলতা। এর ফলাফল বর্ণনা করার সময় “গবেষণাটি খুঁজে পেয়েছে,” এর বাইরে সরে যাওয়ার সময় “লেখকরা অনুমান করেন,” বিশ্বাস প্রতিবেদন করার সময় “পূর্বাভাসদাতারা নির্ধারণ করেন,” এবং একটি পথ অন্বেষণ করার সময় “এই পরিদৃশ্য অনুমান করে” বলুন। তারপর উৎসটিকে দাবির কাছাকাছি যুক্ত করুন।
সেই ভাষা একটি কাউন্টডাউন বা একটি ঘোষণার চেয়ে কম নাটকীয় মনে হতে পারে। এটি বেশি উপযোগী। মানবতা উন্নত এআই সম্পর্কে ভালো সিদ্ধান্ত নেবে জেনে যে প্রমাণ কী সমর্থন করে, কোথায় এটি থামে, এবং কী মূল্যায়ন পরিবর্তন করবে।