Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI मानव अस्तित्व पर रिपोर्ट
HI

Current AI capability dashboard: September 2026

A fixed, multidimensional snapshot of frontier AI capability — what Stanford's AI Index calls 'jagged intelligence' — and why benchmarks aren't proof of AGI.

Written by
Dwight Ringdahl
Status
स्रोत-जाँचा
Revised
Sources
9 cited
Reading
7 min

इस स्नैपशॉट को कैसे पढ़ें

यह डैशबोर्ड 13 सितंबर, 2026 को उपलब्ध सार्वजनिक सबूत दर्ज करता है। यह कोई लाइव लीडरबोर्ड नहीं है और इसे चुपचाप अपडेट नहीं किया जाना चाहिए। AI उत्पाद, स्कैफ़ोल्ड, मूल्यांकन-सेट, और कीमतें इतनी तेज़ी से बदलती हैं कि बिना तारीख़ वाला “वर्तमान” पन्ना ईमानदार नहीं रह सकता।

क्षमता बहु-आयामी है। कोई सिस्टम किसी ओलंपियाड समस्या को हल कर सकता है फिर भी एनालॉग घड़ी नहीं पढ़ पाता, विशेषज्ञ जीव-विज्ञान सवालों के जवाब दे सकता है फिर भी प्रयोगशाला-वर्कफ़्लो पूरा नहीं कर पाता, या कोई कोडिंग ग्रेडर पास कर सकता है जबकि ऐसा पैच बनाता है जिसे कोई मेंटेनर ठुकरा देगा। Stanford का 2026 AI Index इस पैटर्न को जैग्ड इंटेलिजेंस (असमान बुद्धिमत्ता) कहता है और नियंत्रित तथा वास्तविक वातावरण के बीच बड़े अंतरों को दस्तावेज़ित करता है (Stanford AI Index, तकनीकी प्रदर्शन)।

नीचे दी गई रेटिंग सबूत का वर्णन करती हैं, किसी सार्वभौमिक मॉडल का नहीं। “मज़बूत” का अर्थ है कि प्रासंगिक सार्वजनिक मूल्यांकनों पर अग्रणी सिस्टम प्रभावशाली प्रदर्शन करते हैं। इसका अर्थ यह नहीं कि वे सुरक्षित, मानव-समतुल्य, या स्वायत्त उच्च-दांव उपयोग के लिए पर्याप्त विश्वसनीय हैं।

आयाम सितंबर 2026 का सबूत महत्वपूर्ण सीमा
भाषा और ज्ञान व्यापक प्रश्न-उत्तर और मल्टीमॉडल परीक्षणों में मज़बूत मतिभ्रम (hallucinations), संदूषण, और असमान तथ्यात्मक विश्वसनीयता बनी हुई है
गणित और संरचित तर्क फ्रंटियर सिस्टम ने चुनिंदा समस्याओं पर शीर्ष प्रतियोगिता-स्तर के परिणाम हासिल किए प्रदर्शन असमान बना हुआ है और उपकरणों तथा अनुमान-बजट के प्रति संवेदनशील है
कोडिंग और कंप्यूटर-उपयोग कोडिंग और संरचित डेस्कटॉप-एजेंट बेंचमार्क पर तेज़ लाभ ग्रेडर पास करना रखरखाव-योग्य उत्पादन-कार्य की गारंटी नहीं देता
लंबी-अवधि की स्वायत्तता मापे गए सॉफ़्टवेयर-कार्य क्षितिज तेज़ी से बढ़े ज़्यादातर साफ़-सुथरे सॉफ़्टवेयर/ML/साइबर कार्य; स्वतंत्र संचालन की अवधि नहीं
विज्ञान-सहायता मज़बूत डोमेन-ज्ञान और सुधरता प्रोटोकॉल/समस्या-निवारण प्रदर्शन ज्ञान-स्कोर छोर-से-छोर प्रायोगिक दक्षता स्थापित नहीं करते
साइबर-क्षमता एजेंट असली कमज़ोरियां खोज सकते हैं और चुनिंदा विशेषज्ञ कार्य पूरे कर सकते हैं छोर-से-छोर स्वायत्त हमले सार्वजनिक रूप से स्थापित नहीं हैं
अनुनय (Persuasion) नियंत्रित प्रयोगों में मापने-योग्य राय-परिवर्तन जनसंख्या-स्तर का दुर्भावनापूर्ण प्रभाव नहीं दिखाया गया
रोबोटिक्स और भौतिक-अवतार नियंत्रित वातावरण में मज़बूत प्रगति घरेलू और खुली-दुनिया की विश्वसनीयता अब भी बहुत कम है
सुरक्षा और विश्वसनीयता सुरक्षा-उपाय और मूल्यांकन सुधर रहे हैं रिपोर्टिंग असंगत है और कोई तरीका नियंत्रण की गारंटी नहीं देता

तर्क प्रभावशाली और असमान है

2026 AI Index रिपोर्ट करता है कि एक Google DeepMind सिस्टम ने 2025 अंतरराष्ट्रीय गणित ओलंपियाड में प्रतियोगिता की समय-सीमा के भीतर स्वर्ण-पदक-स्तर का स्कोर हासिल किया। वही अध्याय बताता है कि ClockBench पर सबसे अच्छे परीक्षण किए गए मॉडल ने एनालॉग घड़ियां केवल लगभग आधी बार सही पढ़ीं, जबकि मनुष्यों के लिए यह दर लगभग 90 प्रतिशत थी। ये परीक्षण समान रूप से महत्वपूर्ण नहीं हैं, लेकिन इनका विरोधाभास एक अदिश “बुद्धिमत्ता-स्तर” के विचार को खारिज करता है।

बेंचमार्क-लाभ किसी बेहतर बेस-मॉडल, ज़्यादा अनुमान-समय गणना, उपकरण-उपयोग, कई समाधानों के नमूने लेने, या विशेष स्कैफ़ोल्डिंग को दर्शा सकते हैं। कोई परिणाम बताई गई शर्तों के तहत पूर्ण परीक्षण किए गए सिस्टम का होता है। इसे किसी सस्ते उत्पाद-स्तर या समय-सीमित तैनाती में लापरवाही से स्थानांतरित नहीं किया जाना चाहिए।

कई परीक्षण भी तेज़ी से संतृप्त हो जाते हैं। Stanford Humanity’s Last Exam पर तीव्र लाभ और SWE-bench Verified पर लगभग-संतृप्ति की रिपोर्ट करता है, साथ ही अमान्य सवालों और संभावित लीडरबोर्ड-अनुकूलन को भी नोट करता है। संतृप्ति का अर्थ है कि किसी मूल्यांकन में अग्रणी सिस्टम को अलग करने की क्षमता कम हो गई है; इसका अर्थ यह नहीं कि अंतर्निहित क्षेत्र हल हो गया है।

कोडिंग और कंप्यूटर-उपयोग

अग्रणी एजेंट चुनिंदा रिपॉज़िटरी-समस्याओं को ठीक कर सकते हैं, महत्वपूर्ण कोड लिख सकते हैं, और ग्राफ़िकल एप्लिकेशन चला सकते हैं। Stanford OSWorld के प्रदर्शन में लगभग 12 प्रतिशत से 66.3 प्रतिशत तक की वृद्धि दर्ज करता है, फिर भी लगभग हर तीसरे संरचित कार्य में विफल रहता है। वास्तविक कंप्यूटर-उपयोग में बदलते इंटरफ़ेस, अस्पष्ट उद्देश्य, प्रमाण-पत्र, प्रतिकूल सामग्री, और ऐसे परिणाम जोड़ता है जिन्हें कोई बेंचमार्क छोड़ सकता है।

स्वचालित ग्रेडिंग एक और सीमा है। SWE-bench पैच के METR के 2026 अध्ययन में पाया गया कि बेंचमार्क के परीक्षण पास करने का मतलब यह नहीं था कि मेंटेनर बदलावों को मर्ज करेंगे, जिससे कार्यात्मक परीक्षण-मामलों से परे गुणवत्ता-आयाम उजागर होते हैं (METR मेंटेनर समीक्षा अध्ययन)। उत्पादन-कोडिंग को आर्किटेक्चर, संवाद, सुरक्षा, रखरखाव, और विफलताओं के लिए ज़िम्मेदारी चाहिए।

यह सबूत चुनिंदा काम की महत्वपूर्ण सहायता और स्वचालन का समर्थन करता है। यह “सॉफ़्टवेयर इंजीनियरिंग हल हो गई है” का समर्थन नहीं करता।

लंबी-अवधि की स्वायत्तता

METR का मई 2026 का डैशबोर्ड उस मानव-विशेषज्ञ कार्य-अवधि का अनुमान लगाता है जिस पर किसी एजेंट की 50- या 80-प्रतिशत अनुमानित सफलता-दर होती है। ये कार्य मुख्य रूप से सॉफ़्टवेयर इंजीनियरिंग, मशीन लर्निंग, और साइबर-सुरक्षा से जुड़े हैं। METR कहता है कि मौजूदा सुइट के साथ सोलह घंटे से ऊपर के माप अविश्वसनीय हैं (METR कार्य-क्षितिज)।

इस मेट्रिक की अक्सर ग़लत रिपोर्टिंग होती है। चार घंटे का क्षितिज इसका मतलब नहीं है कि एजेंट चार घंटे तक स्वतंत्र रूप से चलता है; इसका मतलब है कि मापी गई कठिनाई के कार्यों के लिए एक मानव विशेषज्ञ को आमतौर पर लगभग चार घंटे चाहिए। सफल एजेंट कहीं ज़्यादा तेज़ी से पूरा कर सकते हैं। यह सुइट स्व-निहित और वस्तुनिष्ठ रूप से ग्रेड-योग्य है, ज़्यादातर संगठनात्मक काम के विपरीत।

METR आगे चेतावनी देता है कि क्षेत्र परिमाण के क्रमों से अलग होते हैं, त्रुटि-सीमाएं व्यापक हो सकती हैं, और जहां 98-प्रतिशत विश्वसनीयता चाहिए वहां 50-प्रतिशत क्षितिज अपर्याप्त है (METR सीमाएं)। यह रुझान चुनिंदा डिजिटल कार्यों में तेज़ प्रगति का सार्थक सबूत है — न कि नौकरी-स्वचालन या AGI की ओर उलटी गिनती करती कोई घड़ी।

विज्ञान, जीव-विज्ञान, और साइबर

UK AI Security Institute रिपोर्ट करता है कि अक्टूबर 2025 तक परीक्षण किए गए सिस्टम ने चुनिंदा रसायन-विज्ञान और जीव-विज्ञान सवालों पर उसकी PhD-विशेषज्ञ आधार-रेखाओं को पार कर लिया और प्रोटोकॉल-निर्माण तथा प्रयोगशाला समस्या-निवारण में सुधार किया। यह छोर-से-छोर प्लाज़्मिड-डिज़ाइन में लगातार कठिनाई की भी रिपोर्ट करता है (AISI Frontier AI Trends Report)। ये सरकारी मूल्यांकन-परिणाम हैं, लेकिन विशेषज्ञ आधार-रेखाएं और कार्य-निर्माण अब भी अर्थ तय करते हैं।

साइबर-क्षमता प्रश्न-उत्तर से आगे बढ़कर ऐसे एजेंटों तक पहुंच गई है जो कमज़ोरियां खोजते हैं और बहु-चरणीय चुनौतियां हल करते हैं। AISI ने फरवरी 2026 में अपने साइबर-कार्य मापों में तेज़ वृद्धि की रिपोर्ट की (AISI साइबर रुझान)। International AI Safety Report उस सबूत को तैनाती से अलग करती है: हमलावर AI का इस्तेमाल करते हैं, फिर भी पूरी तरह स्वायत्त छोर-से-छोर हमले सार्वजनिक रूप से रिपोर्ट नहीं किए गए हैं और क्या हमले या बचाव को ज़्यादा फ़ायदा होगा यह अनिश्चित बना हुआ है (International AI Safety Report 2026)।

अनुनय और सामाजिक क्षमता

संवादी AI प्रयोगों में दृष्टिकोण बदल सकता है। 76,977 प्रतिभागियों वाले 2026 के एक AISI-नेतृत्व वाले अध्ययन में पाया गया कि स्केल या बुनियादी वैयक्तिकरण की तुलना में प्रॉम्प्टिंग और अनुनय-केंद्रित पोस्ट-ट्रेनिंग से बड़े अनुनय-प्रभाव मिले; वैयक्तिकरण-प्रभाव एक प्रतिशत अंक से कम थे। बढ़े हुए अनुनय का संबंध कम तथ्यात्मक सटीकता से था (AISI अनुनय अध्ययन)।

यह खोज प्रायोगिक परिस्थितियों में मापी गई क्षमता स्थापित करती है। यह टिकाऊ व्यवहार-परिवर्तन, चुनाव-प्रभाव, या जनसंख्या-नियंत्रण साबित नहीं करती। पहुंच, प्लेटफ़ॉर्म-वितरण, प्रतिस्पर्धी संदेश, उपयोगकर्ता-भरोसा, और स्थायित्व अलग-अलग चर बने रहते हैं।

भौतिक-अवतार एक बड़ा अंतर बना हुआ है

रोबोटिक्स नियंत्रित और खुले वातावरण के बीच सबसे स्पष्ट अंतर दिखाता है। Stanford एक सिमुलेशन बेंचमार्क में उच्च सफलता की रिपोर्ट करता है लेकिन परीक्षण किए गए वास्तविक घरेलू कार्यों पर केवल 12 प्रतिशत। स्वायत्त वाहन सीमित सेवा-क्षेत्रों में सार्थक पैमाने पर चलते हैं, जिनके संचालन-डिज़ाइन डोमेन और साइट-बाहर मानवीय सहायता व्याख्या के लिए मायने रखते हैं।

किसी भाषा मॉडल के व्यापक डिजिटल इंटरफ़ेस को भौतिक-दुनिया की व्यापकता के लिए ग़लत नहीं समझा जाना चाहिए। संवेदन, हेरफेर, लोगों के आसपास सुरक्षा, नई त्रुटियों से उबरना, हार्डवेयर रखरखाव, और लागत — ये सभी तैनाती को सीमित करते हैं। इस गाइड का मानवाकार-रोबोट अध्याय कंपनी-दर-कंपनी बेंचमार्क-प्रदर्शनों और वास्तविक-दुनिया के रोबोट-प्रदर्शन के बीच के इस अंतर पर ज़्यादा विस्तार से नज़र रखता है।

विश्वसनीयता क्षमता का हिस्सा है

66 प्रतिशत बार सफल होने वाला एजेंट समीक्षा के साथ उपयोगी हो सकता है और उसके बिना अस्वीकार्य। उच्च-दांव वाले सिस्टम को कैलिब्रेटेड अनिश्चितता, विफलता-पहचान, अपील, ऑडिट-लॉग, रोलबैक, सुरक्षा, और मानवीय फ़ॉलबैक चाहिए। औसत बेंचमार्क-स्कोर दुर्लभ लेकिन गंभीर त्रुटियों को छुपा देते हैं।

2026 AI Index पाता है कि डेवलपर्स ज़िम्मेदार-AI मूल्यांकनों की तुलना में मुख्यधारा क्षमता-बेंचमार्क की कहीं ज़्यादा स्थिरता से रिपोर्ट करते हैं (AI Index ज़िम्मेदार-AI अध्याय)। गायब सार्वजनिक परिणाम अनुपस्थित आंतरिक परीक्षण साबित नहीं करते, लेकिन वे तुलना और सार्वजनिक आश्वासन को सीमित करते हैं।

यह डैशबोर्ड क्या स्थापित नहीं करता

यह चेतना, इरादे, हर नौकरी में आर्थिक मूल्य, या किसी स्वीकृत AGI सीमा को स्थापित नहीं करता। यह यह नहीं दिखाता कि कोई बेंचमार्क-परिणाम किसी अलग भाषा, जनसंख्या, उपकरण-सेट, लागत-सीमा, या प्रतिकूल वातावरण में स्थानांतरित होता है। यह इसका समाधान नहीं करता कि क्या मौजूदा आर्किटेक्चर मज़बूती से सामान्य बन सकते हैं।

इस स्नैपशॉट के अनुसार, सबसे मज़बूत निष्कर्ष यह है कि फ्रंटियर सिस्टम लगातार भंगुरता, डोमेन-अंतरों, और अधूरे सुरक्षा-सबूत के साथ-साथ असाधारण व्यापकता और तेज़ सुधार दिखाते हैं। यह “सिर्फ़ ऑटोकंप्लीट” या “AGI आ चुकी है” दोनों से ज़्यादा गंभीर — और ज़्यादा सटीक — है।

Type to search the manual.

navigate open esc close