Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI মানবজাতির বেঁচে থাকার ব্রিফিং
BN

টুরিং পরীক্ষা এবং যা এটিকে প্রতিস্থাপন করেছে

কেন মানবসদৃশ কথোপকথন এজিআই প্রতিষ্ঠা করতে পারে না, এবং আধুনিক মূল্যায়ন কীভাবে একটি বেঞ্চমার্ক পোর্টফোলিও জুড়ে সক্ষমতা, নির্ভরযোগ্যতা, ও স্বায়ত্তশাসন পরিমাপ করে।

Written by
Dwight Ringdahl
Status
উৎস-যাচাইকৃত
Revised
Sources
7 cited
Reading
5 min

টুরিং প্রকৃতপক্ষে যা প্রস্তাব করেছিলেন

1950 সালে, Alan Turing জিজ্ঞাসা করেছিলেন যন্ত্র চিন্তা করতে পারে কিনা এবং দ্রুত সেই দার্শনিকভাবে জটিল প্রশ্নটিকে একটি কার্যক্ষম প্রশ্ন দিয়ে প্রতিস্থাপন করেছিলেন। তার “অনুকরণ খেলায়,” একজন মানব জিজ্ঞাসাবাদী একজন ব্যক্তি ও একটি যন্ত্রের সাথে টেক্সটের মাধ্যমে যোগাযোগ করতেন এবং কোনটি কোনটি তা চিহ্নিত করার চেষ্টা করতেন। Turing এটি একটি অপ্রবেশযোগ্য অভ্যন্তরীণ সারবস্তুর বদলে পর্যবেক্ষণযোগ্য আচরণের মাধ্যমে যন্ত্র বুদ্ধিমত্তা নিয়ে আলোচনার একটি উপায় হিসেবে প্রস্তাব করেছিলেন (Turing, “Computing Machinery and Intelligence”)।

ধারণাটি গভীর ছিল, কিন্তু পরিচিত বাক্যাংশ “টুরিং পরীক্ষা পাস করে” অনেক পছন্দ লুকিয়ে রাখে। কথোপকথনটি কতক্ষণ চলে? বিচারক কী জানেন? কোন বিষয় অনুমোদিত? কতজন বিচারক অংশগ্রহণ করেন, এবং কোন ত্রুটির হার সাফল্য হিসেবে গণনা করে? Turing একটি একক সরকারি সীমারেখাসহ একটি আধুনিক সনদায়ন কর্মসূচি প্রতিষ্ঠা করেননি। পরীক্ষাটি একটি চিন্তা-পরীক্ষা ও গবেষণা মাইলফলক, একটি এজিআই নিয়ন্ত্রকের পরিমাপ যন্ত্র নয়।

কেন কথোপকথন খেলার জন্য খুব সহজ হয়ে উঠল

অনুকরণ খেলা একটি নির্দিষ্ট মিথস্ক্রিয়ায় মানুষের মতো দেখানোর জন্য একটি সিস্টেমকে পুরস্কৃত করে। এটি প্রকৃত প্রশস্ততার মাধ্যমে অর্জন করা যায়, তবে এড়িয়ে চলা, রোল-প্লে, রসিকতা, ইচ্ছাকৃত ভুল, বা একজন বিচারকের প্রত্যাশা শোষণের মাধ্যমেও। প্রারম্ভিক চ্যাটবট ELIZA 1960-এর দশকে দেখিয়েছিল যে মানুষ সহজেই অগভীর কথোপকথনমূলক ধরনে বোঝাপড়া প্রক্ষেপ করে। আজকের ভাষা মডেল অনেক বেশি সুসংগত সংলাপ তৈরি করে, নৃতাত্ত্বিকীকরণকে আরও সহজ করে তোলে।

একটি সংক্ষিপ্ত টেক্সট কথোপকথন পাস করা নির্ভরযোগ্য পরিকল্পনা, গাণিতিক নির্ভুলতা, বৈজ্ঞানিক বিচার, ভৌত-জগতের দক্ষতা, বা ভুল থেকে পুনরুদ্ধারের সক্ষমতা প্রদর্শন করবে না। এটি দেখাবে না যে মডেলটি একটি নতুন চাকরি শিখতে পারে, একটি দীর্ঘ প্রকল্প জুড়ে লক্ষ্য সংরক্ষণ করতে পারে, বা কখন এটির একজন মানুষের কাছে জমা দেওয়া উচিত তা চিনতে পারে। বিপরীতভাবে, একটি শক্তিশালী অ-মৌখিক সিস্টেম একজন নৈমিত্তিক বক্তার অনুকরণে ব্যর্থ হয়েও বিজ্ঞান বা লজিস্টিক্স রূপান্তরিত করতে পারে। মানব সাদৃশ্য পরিণামমূলক যান্ত্রিক সক্ষমতার জন্য প্রয়োজনীয় বা যথেষ্ট নয়।

পরীক্ষাটি বুদ্ধিমত্তাকে প্রতারণার সাথেও মিশ্রিত করে। একটি সিস্টেম নিজেকে সততার সাথে একটি যন্ত্র হিসেবে চিহ্নিত করার জন্য শাস্তি পেতে পারে এবং একজন বিচারককে অন্যথা বিশ্বাস করাতে ম্যানিপুলেট করার জন্য পুরস্কৃত হতে পারে। এটি নিরাপত্তা মূল্যায়নের জন্য একটি খারাপ ফিট, যেখানে ক্যালিব্রেটেড অনিশ্চয়তা, অনুসরণযোগ্যতা, এবং সত্যবাদী প্রকাশ প্রায়ই সামাজিক বিশ্বাসযোগ্যতার চেয়ে বেশি গুরুত্বপূর্ণ।

একটি পরীক্ষা থেকে একটি মূল্যায়ন পোর্টফোলিওতে

আধুনিক মূল্যায়ন অনেক কাজ সেট ব্যবহার করে কারণ বুদ্ধিমত্তা বহুমাত্রিক। জ্ঞান ও যুক্তি বেঞ্চমার্ক বিষয় জুড়ে প্রশ্ন পরীক্ষা করে; কোডিং মূল্যায়ন তৈরি করা প্রোগ্রামগুলো পরীক্ষার ক্ষেত্রের বিরুদ্ধে চালায়; মাল্টিমোডাল পরীক্ষা টেক্সট, চিত্র, ছবি, অডিও, এবং ভিডিও একত্রিত করে; এজেন্ট বেঞ্চমার্ক মডেলগুলোকে ইন্টারঅ্যাক্টিভ পরিবেশে স্থাপন করে যেখানে তাদের নেভিগেট করতে হয়, সফটওয়্যার ব্যবহার করতে হয়, এবং লক্ষ্য সম্পন্ন করতে হয়।

প্রতিটি পরিবার একটি সংকীর্ণ প্রশ্নের উত্তর দেয়। MMLU, উদাহরণস্বরূপ, একাডেমিক ও পেশাদার বহু-পছন্দের জ্ঞানের নমুনা নেয়, কিন্তু উচ্চ স্কোর প্রতিষ্ঠা করে না যে একটি মডেল সেই পেশাগুলো অনুশীলন করতে পারে। GAIA বাস্তব-জগতের প্রশ্নে সহকারীদের পরীক্ষা করে যার জন্য যুক্তি, সরঞ্জাম, এবং একাধিক পদক্ষেপের প্রয়োজন হতে পারে (GAIA পেপার)। OSWorld প্রকৃত অপারেটিং-সিস্টেম অ্যাপ্লিকেশন জুড়ে কম্পিউটার-ব্যবহার এজেন্ট মূল্যায়ন করে (OSWorld পেপার)। ARC-AGI সংরক্ষিত জ্ঞান পুনরুৎপাদনের বদলে নতুন ভিজ্যুয়াল যুক্তি কাজে অভিযোজনের ওপর কেন্দ্রীভূত (ARC Prize বেঞ্চমার্ক)। এই মূল্যায়নগুলো ভিন্ন শক্তি ও ব্যর্থতা মোড প্রকাশ করে; কোনোটিই একটি এজিআই শনাক্তকারী নয়।

কাজ-সম্পন্নকরণ গবেষণা একটি সময় ও জটিলতার মাত্রা যোগ করে। METR মানব-বিশেষজ্ঞ কাজের সময়কাল অনুমান করে যে সময়ে একটি এজেন্টের সাফল্যের একটি প্রদত্ত সম্ভাবনা আছে। এর বর্তমান সেট মূলত সফটওয়্যার প্রকৌশল, মেশিন লার্নিং, এবং সাইবার নিরাপত্তা কভার করে, এবং প্রতিষ্ঠানটি স্পষ্টভাবে সতর্ক করে যে “সময় দিগন্ত” মানব সময়ে পরিমাপকৃত কাজের অসুবিধা — একটি এআই স্বাধীনভাবে পরিচালনা করতে পারে এমন সময়কাল নয় (METR পদ্ধতি)। এটি এও সতর্ক করে যে ভালোভাবে-নির্দিষ্ট বেঞ্চমার্ক কাজগুলো বেশিরভাগ চাকরির চেয়ে পরিষ্কার এবং কর্মক্ষমতা ডোমেইন অনুসারে তীব্রভাবে ভিন্ন।

নির্ভরযোগ্যতা একটি স্কোরের অর্থ বদলে দেয়

উচ্চ-ঝুঁকিপূর্ণ ব্যবহারের জন্য গড় কর্মক্ষমতা যথেষ্ট নয়। একটি সিস্টেম যা অর্ধেক সময় সফল হয় তা গবেষণার জন্য চিত্তাকর্ষক হতে পারে তবুও ওষুধ, বিমান চলাচল, বা অবকাঠামোতে অব্যবহারযোগ্য। তাই মূল্যায়নকারীদের প্রয়োজন সাফল্যের হার, পুনরাবৃত্ত পরীক্ষা, সবচেয়ে খারাপ-ক্ষেত্রের আচরণ, অনিশ্চয়তার ব্যবধান, এবং বণ্টন-স্থানান্তরের অধীনে পরীক্ষা। তাদের পরিমাপ করা উচিত একটি মডেল কখন অনিশ্চিত তা জানে কিনা, স্পষ্টীকরণ চায় কিনা, এবং নিরাপদে নিয়ন্ত্রণ ফিরিয়ে দেয় কিনা।

মূল্যায়ন সেটআপ অন্তর্নিহিত মডেলের মতোই গুরুত্বপূর্ণ। সরঞ্জাম প্রবেশাধিকার, প্রম্পট শব্দচয়ন, স্মৃতি, নমুনায়ন সেটিং, ইনফারেন্স-সময়ের গণনা, এবং আশেপাশের এজেন্ট সফটওয়্যার ফলাফলকে উপাদানগতভাবে পরিবর্তন করতে পারে। একটি স্কোর একটি বিবৃত তারিখে একটি পরীক্ষিত সিস্টেম কনফিগারেশনের অন্তর্গত। এটিকে একটি মডেলের নামের একটি চিরন্তন বৈশিষ্ট্য হিসেবে বিবেচনা করা মিথ্যা তুলনাকে উৎসাহিত করে।

তথ্য দূষণ আরেকটি সমস্যা। সর্বজনীন বেঞ্চমার্ক প্রশ্ন ও সমাধান প্রশিক্ষণ তথ্যে দেখা দিতে পারে। আক্ষরিক মুখস্থবিদ্যা ছাড়াও, বেঞ্চমার্ক-কেন্দ্রিক টিউনিং সমতুল্য সাধারণীকরণ ছাড়াই একটি স্কোর উন্নত করতে পারে। ভালো মূল্যায়নগুলো ব্যক্তিগত বা নতুন তৈরি কাজ ব্যবহার করে, সম্ভাব্য প্রকাশ নথিভুক্ত করে, এবং প্রায়ই সতেজ করে। স্বাধীন পরীক্ষা ঝুঁকি কমায় — নির্মূল করে না — যে একজন ডেভেলপার শুধুমাত্র অনুকূল ফলাফল নির্বাচন করেন।

নিরাপত্তা মূল্যায়ন ভিন্ন প্রশ্ন জিজ্ঞাসা করে

সক্ষমতা মূল্যায়ন পরিমাপ করে অনুকূল পরিস্থিতিতে একটি সিস্টেম কী করতে পারে। নিরাপত্তা মূল্যায়ন জিজ্ঞাসা করে এটি অপব্যবহৃত, চাপগ্রস্ত, প্রতারিত, বিরোধপূর্ণ নির্দেশনা দেওয়া, বা একটি পরিণামমূলক পরিবেশে স্থাপন করা হলে কী করতে পারে। প্রাসঙ্গিক পরীক্ষার মধ্যে রয়েছে জৈবিক বা সাইবার অপব্যবহারে সহায়তা, ম্যানিপুলেশন, স্বায়ত্তশাসন, সুরক্ষা এড়ানো, প্রতারণা, এবং সম্পদ অর্জনের সক্ষমতা। 2026 International AI Safety Report জোর দেয় যে মূল্যায়নগুলো সীমিত বাহ্যিক বৈধতা, দ্রুত অপ্রচলনতা, এবং ফ্রন্টিয়ার সিস্টেমে অসম্পূর্ণ প্রবেশাধিকারের মুখোমুখি (International AI Safety Report 2026)।

রেড টিম সৃজনশীলভাবে ব্যর্থতা খুঁজে, যখন কাঠামোবদ্ধ বেঞ্চমার্ক তুলনা সক্ষম করে। বাস্তব-জগতের নিরীক্ষণ তারপর পরীক্ষা করে প্রি-স্থাপনা ফলাফল প্রকৃত ব্যবহার পূর্বাভাস দিয়েছিল কিনা। ঘটনা প্রতিবেদন অপরিহার্য কারণ কোনো গবেষণাগার সেট প্রতিটি প্রেক্ষাপট গণনা করতে পারে না। একটি মূল্যায়ন ব্যবস্থার উচিত ফলাফলকে সিদ্ধান্তের সাথে সংযুক্ত করা: অতিরিক্ত সুরক্ষা ব্যবস্থা, সীমাবদ্ধ সরঞ্জাম প্রবেশাধিকার, পর্যায়ক্রমিক প্রকাশ, বাহ্যিক পর্যালোচনা, বা একটি সংজ্ঞায়িত সীমারেখা অতিক্রান্ত হলে একটি স্থাপনা বিরতি।

একটি বিশ্বাসযোগ্য এজিআই মূল্যায়নের জন্য কী প্রয়োজন হবে

Google DeepMind-এর “এজিআই-এর স্তরসমূহ” কাঠামো যুক্তি দেয় যে মূল্যায়নের উচিত কর্মক্ষমতা ও প্রশস্ততা উভয়ই কভার করা এবং সক্ষমতা যে মানব-এআই মিথস্ক্রিয়ার মাধ্যমে প্রকাশিত হয় তা বিবেচনা করা (DeepMind কাঠামো)। একটি বিশ্বাসযোগ্য মূল্যায়নের প্রয়োজন হবে ব্যাপক ডোমেইন, প্রকৃতপক্ষে নতুন কাজ, একাধিক কর্মক্ষমতা স্তর, এবং স্বায়ত্তশাসনের স্পষ্ট প্রতিবেদন। এটি স্থানান্তর, শিক্ষণ দক্ষতা, দৃঢ়তা, সামাজিক মিথস্ক্রিয়া, এবং উন্মুক্ত-প্রান্তের কাজ পরীক্ষা করবে — শুধু পরীক্ষার প্রশ্ন নয়।

এর স্বাধীন পুনরাবৃত্তি ও প্রতিকূল পরীক্ষণও প্রয়োজন হবে। ডেভেলপারদের উচিত বিপজ্জনক বিবরণ প্রকাশ বা ব্যক্তিগত পরীক্ষার সাথে আপস না করে দাবি ব্যাখ্যা করার জন্য যথেষ্ট পদ্ধতি প্রকাশ করা। ফলাফলগুলোর উচিত বেস মডেলকে সরঞ্জাম ও স্ক্যাফোল্ডিং থেকে আলাদা করা, ব্যর্থতার উদাহরণ অন্তর্ভুক্ত করা, এবং একটি যৌগিক সংখ্যাকে একটি অধিবিদ্যাগত রায়ে রূপান্তর এড়ানো।

উত্তরসূরিটি একটি ড্যাশবোর্ড, একটি ফিনিশ লাইন নয়

কোনো আধুনিক পরীক্ষা এজিআই-এর সর্বজনীনভাবে গৃহীত গেট হয়ে ওঠার অর্থে টুরিং-এর খেলাকে “প্রতিস্থাপন” করেনি। যা এটি প্রতিস্থাপন করেছে তা একটি পোর্টফোলিও: জ্ঞান পরীক্ষা, নতুন-যুক্তি কাজ, ইন্টারঅ্যাক্টিভ পরিবেশ, কাজ-দিগন্ত পরিমাপ, ডোমেইন-নির্দিষ্ট বিশেষজ্ঞ পর্যালোচনা, বিপজ্জনক-সক্ষমতা মূল্যায়ন, এবং স্থাপনা থেকে প্রমাণ।

সেই উত্তরটি একটি বিচারককে বোকা বানানো একটি যন্ত্রের চেয়ে কম নাটকীয়, কিন্তু বেশি উপযোগী। সঠিক প্রশ্নটি আর “এটি কি পাস করেছে?” নয়। এটি হলো: এই সিস্টেমটি নির্ভরযোগ্যভাবে কী করতে পারে, কোন পরিস্থিতিতে, কী সহায়তাসহ, এবং পরিস্থিতি পরিবর্তিত হলে কী ঘটে? তারিখযুক্ত প্রমাণের একটি স্বচ্ছ ড্যাশবোর্ড যেকোনো একক ফিনিশ লাইনের চেয়ে সক্ষমতা ও ঝুঁকির একটি ভালো নির্দেশিকা প্রদান করে।

Type to search the manual.

navigate open esc close