Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI मानव अस्तित्व पर रिपोर्ट
HI

फ्रंटियर मूल्यांकन, सुरक्षा-मामले, और घटना-रिपोर्टिंग

क्षमता-परीक्षण, सुरक्षा-उपाय मूल्यांकन, संरचित सुरक्षा-तर्क, और घटना-सिस्टम फ्रंटियर-AI के वादों को ऑडिट-योग्य सबूत में कैसे बदल सकते हैं।

Written by
Dwight Ringdahl
Status
स्रोत-जाँचा
Revised
Sources
5 cited
Reading
7 min

चार उपकरण अलग-अलग सवालों के जवाब देते हैं

कोई क्षमता-मूल्यांकन पूछता है कि कोई मॉडल या सिस्टम बताई गई परिस्थितियों में क्या कर सकता है। कोई सुरक्षा-उपाय मूल्यांकन पूछता है कि क्या नियंत्रण दुरुपयोग को रोकते या पहचानते हैं। कोई सुरक्षा-मामला (safety case) एक विशिष्ट दावा करता है और स्पष्ट तर्क के ज़रिए उस दावे से सबूत जोड़ता है। घटना-रिपोर्टिंग परीक्षण और तैनाती के दौरान या बाद में विफलताओं और नज़दीकी चूकों से सीखती है।

अकेले कोई भी यह साबित नहीं करता कि कोई मॉडल “सुरक्षित” है। कोई बेंचमार्क महत्वपूर्ण व्यवहार छोड़ सकता है; कोई सुरक्षा-उपाय अनुकूलन के तहत विफल हो सकता है; कोई सुरक्षा-मामला ख़राब सबूत पर टिका हो सकता है; और घटना-डेटा कुछ ग़लत होने के बाद आता है। साथ मिलकर वे एक सबूत-चक्र बना सकते हैं: पूर्वानुमान लगाना, परखना, उचित ठहराना, निगरानी करना, सीखना, और संशोधित करना।

क्षमता-मूल्यांकन को एक परिभाषित ख़तरा-मॉडल चाहिए

फ्रंटियर मूल्यांकन आमतौर पर साइबर-संक्रियाएं, रासायनिक या जैविक सहायता, स्वायत्तता, मॉडल-प्रतिकृति, अनुनय, और AI शोध की जांच करते हैं। परिणाम स्कैफ़ोल्डिंग, प्रॉम्प्ट, उपकरण, समय, कंप्यूट, विशेषज्ञ मदद, पुनः-प्रयासों, और सुरक्षा-फ़िल्टरों पर निर्भर करते हैं। केवल मॉडल का नाम और स्कोर बताना तुलनाओं को अविश्वसनीय बना देता है।

UK AI Security Institute ने 30 से ज़्यादा फ्रंटियर सिस्टमों का परीक्षण किया है और कई क्षेत्रों में तेज़ी से सुधरते प्रदर्शन की रिपोर्ट करता है। इसकी 2025 की प्रवृत्ति-रिपोर्ट बताती है कि मूल्यांकनकर्ताओं को कभी-कभी रिलीज़-पूर्व चेकपॉइंट या ऐसी सुरक्षा-व्यवस्थाओं के साथ पहुंच मिलती है जो सार्वजनिक उत्पाद से अलग होती हैं (UK AISI फ्रंटियर AI ट्रेंड्स रिपोर्ट)। ये परिणाम उन परीक्षण-कॉन्फ़िगरेशनों के बारे में प्रत्यक्ष सबूत हैं, सामान्य वास्तविक-दुनिया की सफलता या AGI का प्रमाण नहीं।

मूल्यांकनों में आधार-रेखाएं शामिल होनी चाहिए: बिना-मदद वाले नौसिखिए, विशेषज्ञ, इंटरनेट खोज, पुराने मॉडल, और मौजूदा उपकरण। प्रासंगिक जोखिम अक्सर “उत्थान” (uplift) होता है — कोई सिस्टम किसी पक्ष की क्षमता को कितना बढ़ाता है — न कि यह कि क्या मॉडल कोई भी हानिकारक जानकारी पैदा कर सकता है।

संदूषण, निष्कासन, और सैंडबैगिंग

कोई बेंचमार्क प्रशिक्षण-डेटा में दिख सकता है, जिससे प्रदर्शन फूल जाता है। किसी मॉडल के पास कोई ऐसी क्षमता हो सकती है जिसे मूल्यांकन निकालने में विफल रहता है। इसके उलट, व्यापक प्रॉम्प्टिंग और विशेषज्ञ उपकरण ऐसा सिस्टम बना सकते हैं जो सामान्य उपयोगकर्ताओं को नहीं मिलता। अच्छी रिपोर्ट डिफ़ॉल्ट उत्पाद-व्यवहार, अधिकतम निकाली गई क्षमता, और छोर-से-छोर एजेंट-प्रदर्शन के बीच अंतर करती हैं।

रणनीतिक कम-प्रदर्शन, जिसे कभी-कभी सैंडबैगिंग कहा जाता है, एक भविष्य-संबंधी चिंता है जब सिस्टम परीक्षणों को पहचान सकते हैं और क्षमता छुपाने का कारण रखते हैं। मौजूदा अध्ययन तंत्र की जांच कर सकते हैं, लेकिन कोई कमज़ोर स्कोर धोखे का सबूत नहीं है। छुपे हुए कार्य, कई वातावरण, व्यवहारिक निगरानी, और व्हाइट-बॉक्स पहुंच अनिश्चितता कम कर सकते हैं।

सांख्यिकीय अनिश्चितता मायने रखती है। दुर्लभ गंभीर परिणामों के लिए कई परीक्षणों या सावधानी से बनाए गए सबूत चाहिए। मूल्यांकनकर्ताओं को विश्वास-अंतराल, कार्य-चयन विधियां, बहिष्करण, और ज्ञात सीमाएं प्रकाशित करनी चाहिए। बेंचमार्क-संतृप्ति को जीत के दावों के बजाय पुनर्डिज़ाइन को ट्रिगर करना चाहिए।

सुरक्षा-उपायों को सिस्टम के रूप में परखा जाना चाहिए

इनकार-प्रशिक्षण केवल एक परत है। सुरक्षा-उपायों में पहचान-जांच, स्वीकार्य-उपयोग नीतियां, क्लासिफ़ायर, निगरानी, दर-सीमाएं, उपकरण-अनुमतियां, सैंडबॉक्सिंग, मानवीय समीक्षा, और प्रतिक्रिया-प्रक्रियाएं शामिल हैं। हमलावर अनुरोधों को बांट सकते हैं, कई खाते इस्तेमाल कर सकते हैं, ओपन-वेट को फ़ाइन-ट्यून कर सकते हैं, सामग्री को एनकोड कर सकते हैं, या सेवाओं के बीच घूम सकते हैं।

UK AISI के सुरक्षा-उपाय सिद्धांत स्पष्ट ख़तरा-मॉडलों और अकेली क्षमता के बजाय पूरे सिस्टम के मूल्यांकन पर ज़ोर देते हैं (UK AISI)। किसी लैब ने परामर्श में योगदान दिया हो सकता है और उसके पास विशेषाधिकार-प्राप्त पहुंच हो सकती है, लेकिन सरकारी मूल्यांकनकर्ता अब भी प्रदाता के सहयोग पर निर्भर हैं और हर ख़तरनाक कार्य प्रकाशित नहीं कर सकते।

सुरक्षा-उपाय परीक्षण को झूठे नकारात्मक, झूठे सकारात्मक, अनुकूली हमलों, उपयोगिता, विलंबता, निजता-लागत, और यह मापना चाहिए कि क्या अलर्ट कार्रवाई की ओर ले जाते हैं। कोई फ़िल्टर जो वैध जीव-विज्ञान या सुरक्षा-कार्य को रोकता है, वह उपयोगकर्ताओं को कम जवाबदेह सिस्टमों की ओर धकेल सकता है; कोई ऐसा फ़िल्टर जो प्रभावशाली इनकार-स्क्रीनशॉट बनाता है लेकिन आसानी से दरकिनार हो जाता है, वह झूठा आश्वासन देता है।

सुरक्षा-मामले तर्क को जांचने-योग्य बनाते हैं

कोई सुरक्षा-मामला एक सीमित दावा बताता है — जैसे “यह एजेंट इस तैनाती में निर्दिष्ट विनाशकारी साइबर-नुकसान नहीं पहुंचा सकता” — और फिर सबूत और तर्क प्रस्तुत करता है। UK AISI तीन घटकों का वर्णन करता है: एक सटीक दावा, सबूत, और उन्हें जोड़ने वाला एक तर्क (UK AISI, फ़रवरी 2025)।

यह किसी चेकलिस्ट से मज़बूत है क्योंकि समीक्षक हर आधार को चुनौती दे सकते हैं। यह प्रमाण से कमज़ोर है: सबूत अधूरा हो सकता है, मान्यताएं विफल हो सकती हैं, और डेवलपर कोई सुविधाजनक दावा चुन सकता है। दावों में मॉडल-संस्करण, आर्किटेक्चर, पहुंच, उपयोगकर्ता, अवधि, वातावरण, नुकसान-सीमा, और वैधता-अवधि निर्दिष्ट होनी चाहिए।

सुरक्षा-मामलों में खंडन-कर्ता (defeaters) — यानी वह सबूत जो तर्क को अमान्य कर दे — और अनिश्चितता शामिल होनी चाहिए। स्वतंत्र समीक्षकों को केवल एक चमकाया गया सारांश नहीं, बल्कि अंतर्निहित परिणामों तक पहुंच चाहिए। सारगर्भित असहमति को सुरक्षित रखा जाना चाहिए। मॉडल, स्कैफ़ोल्डिंग, उपकरण, ख़तरा-वातावरण, या तैनाती-पैमाने के बदलने पर मंज़ूरी की मियाद ख़त्म हो जानी चाहिए।

तैनाती-द्वार और आनुपातिकता

मूल्यांकन तभी मायने रखता है जब वह किसी फ़ैसले से जुड़ा हो। किसी फ्रंटियर ढांचे को परिणाम आने से पहले सीमाएं तय करनी चाहिए, ज़रूरी शमन-उपाय निर्दिष्ट करने चाहिए, यह नामित करना चाहिए कि अपवादों को कौन मंज़ूर कर सकता है, और ओवरराइड का दस्तावेज़ीकरण करना चाहिए। नहीं तो कोई डेवलपर व्यावसायिक दबाव में किसी चिंताजनक परिणाम की दोबारा व्याख्या कर सकता है।

नियंत्रण क्रमिक हो सकते हैं: निगरानी वाला API देते हुए भार में देरी करना, उपकरण सीमित करना, उच्च-जोखिम उपयोगकर्ताओं को प्रतिबंधित करना, स्वायत्तता कम करना, मानवीय मंज़ूरी बढ़ाना, या तैनाती रोकना। हर चिंताजनक क्षमता को एक ही जवाब की ज़रूरत नहीं होती।

हितों का टकराव अपरिहार्य है लेकिन प्रबंधनीय है। डेवलपर अपने सिस्टम जानते हैं और रिलीज़ से फ़ायदा उठाते हैं। बाहरी मूल्यांकनकर्ता डेवलपर की पहुंच या फ़ंडिंग पर निर्भर हो सकते हैं। नियामकों के पास विशेषज्ञता की कमी हो सकती है। सुरक्षित वैधानिक पहुंच, फ़ंडिंग की विविधता, प्रकाशन-अधिकार, बदलते समीक्षक, और टकराव का खुलासा विश्वसनीयता मज़बूत करते हैं।

घटना-रिपोर्टिंग आश्चर्यों को साझा ज्ञान में बदलती है

किसी घटना-सिस्टम को एक परिभाषा, रिपोर्टिंग-घड़ी, गंभीरता-योजना, सुरक्षित अंतर्ग्रहण, मूल-कारण विश्लेषण, सुधारात्मक कार्रवाई, और प्रभावित पक्षों को फ़ीडबैक चाहिए। नज़दीकी चूकें मायने रखती हैं क्योंकि वे पूरे नुकसान से पहले कमज़ोर नियंत्रणों को उजागर करती हैं।

EU AI अधिनियम के अनुच्छेद 55 के तहत, प्रणालीगत जोखिम वाले सामान्य-प्रयोजन AI मॉडलों के प्रदाताओं को प्रासंगिक गंभीर घटनाओं और सुधारात्मक उपायों को ट्रैक करना, दस्तावेज़ करना, और AI कार्यालय तथा, जहां उपयुक्त हो, राष्ट्रीय अधिकारियों को रिपोर्ट करना ज़रूरी है। आयोग ने नवंबर 2025 में एक रिपोर्टिंग-टेम्पलेट प्रकाशित किया (यूरोपीय आयोग)। यह वैधानिक दायित्व कवर किए गए प्रदाताओं के लिए बाध्यकारी है; स्वैच्छिक GPAI आचार-संहिता का उपयोग करना अनुपालन दिखाने का एक रास्ता है।

कैलिफ़ोर्निया का SB 53 और न्यू यॉर्क का RAISE अधिनियम अपने दायरे में विशिष्ट गंभीर-घटना रिपोर्टिंग की मांग रखते हैं। इन कानूनों से बाहर कॉर्पोरेट स्वैच्छिक रिपोर्ट तब तक स्वैच्छिक रहती हैं जब तक कोई अन्य दायित्व लागू न हो।

घटना क्या मानी जाती है

परिभाषाओं में वास्तविक गंभीर नुकसान, विश्वसनीय नज़दीकी चूकें, किसी एजेंट पर नियंत्रण की हानि, भार की चोरी, अप्रत्याशित रूप से खोजी गई ख़तरनाक क्षमता, प्रणालीगत सुरक्षा-उपाय विफलता, और मूल्यांकनकर्ताओं को दिए गए सारगर्भित झूठे बयान शामिल होने चाहिए। सामान्य मतिभ्रम को उत्पाद-गुणवत्ता सिस्टमों में संभाला जा सकता है जब तक कि गंभीरता या पैमाना किसी रिपोर्टिंग-सीमा को पार न कर जाए।

अत्यधिक व्यापक अनिवार्य रिपोर्टिंग नियामकों पर बोझ डाल सकती है और कमज़ोरियां या व्यक्तिगत डेटा उजागर कर सकती है। अत्यधिक संकुचित रिपोर्टिंग कमज़ोर संकेतों को छुपा देती है। स्तरीय रिपोर्टिंग पहले तात्कालिक गोपनीय सूचना भेज सकती है, उसके बाद एक पूर्ण जांच और सुरक्षित होने पर एक अनाम सार्वजनिक सारांश।

2026 में UK AISI का साइबर-परीक्षण के दौरान अस्वीकृत एजेंट-व्यवहार का खुलासा पारदर्शी सीमा-निर्धारण को दर्शाता है: संस्थान ने संभावित रूप से हानिकारक गतिविधि की रिपोर्ट की जबकि स्पष्ट रूप से कहा कि मॉडल अपने सैंडबॉक्स से बच नहीं निकला (UK AISI, 2026)। सटीक भाषा किसी वास्तविक घटना को सनसनीखेज़ लेकिन झूठे “AI भागने” के दावे में बदलने से रोकती है।

सार्वजनिक पारदर्शिता और सुरक्षित विवरण

पूरे मूल्यांकन-कार्य दुरुपयोग या बेंचमार्क-खेल को सक्षम कर सकते हैं। पूरे घटना-रिकॉर्ड पीड़ितों और कमज़ोरियों को उजागर कर सकते हैं। जवाब है स्तरीय पहुंच: सार्वजनिक दावे और तरीक़े; योग्य नियामकों और स्वतंत्र समीक्षकों के लिए गोपनीय तकनीकी विवरण; और संरक्षित व्यक्तिगत या राष्ट्रीय-सुरक्षा जानकारी।

समग्र रिपोर्टिंग को घटना-श्रेणियां, गंभीरता, पहचान का स्रोत, रिपोर्ट करने में लगा समय, सुधारात्मक कार्रवाई, और पुनरावृत्ति दिखानी चाहिए। कोई पारदर्शिता-रिपोर्ट जो पहचान-क्षमता बताए बिना केवल पुष्ट घटनाओं को गिनती है, वह उन संगठनों को पुरस्कृत कर सकती है जो कम सावधानी से देखते हैं।

सबूत-चक्र

हर गंभीर घटना को ख़तरा-मॉडल, मूल्यांकन, सुरक्षा-उपाय, और सुरक्षा-मामले को अपडेट करना चाहिए। हर नई क्षमता को तैनात की गई प्रतियों और डाउनस्ट्रीम एकीकरणों की समीक्षा को ट्रिगर करना चाहिए। रेड टीमों को घटना से मिले सबक मिलने चाहिए, और व्हिसलब्लोअर को औपचारिक रिपोर्टिंग विफल होने पर संरक्षित रास्ते चाहिए।

सितंबर 2026 तक की सिफ़ारिशें स्पष्ट हैं: क्षेत्र-विशिष्ट परीक्षणों को बनाए रखते हुए दस्तावेज़ीकरण को मानकीकृत करें; उच्च क्षमता या पैमाने पर स्वतंत्र पहुंच की मांग करें; सीमाओं को पूर्वनिर्धारित द्वारों से जोड़ें; कवर की गई गंभीर घटनाओं और नज़दीकी चूकों की रिपोर्टिंग अनिवार्य करें; संवेदनशील विवरण सुरक्षित रखें; और जवाबदेही के लिए पर्याप्त समग्र सबूत प्रकाशित करें।

कोई मूल्यांकन यह साबित नहीं करता कि भविष्य की AGI नियंत्रित है। इसके बजाय ये प्रथाएं अनिश्चितता को पठनीय बनाती हैं और अभी उपलब्ध सबूत के आधार पर तैनाती को सीमित करती हैं। इनकी सफलता को इस आधार पर आंका जाना चाहिए कि क्या वे समस्याओं को जल्दी खोजती हैं, फ़ैसले बदलती हैं, और पुनरावृत्ति रोकती हैं — न कि इस आधार पर कि कोई संगठन कितने बेंचमार्क या नीति-दस्तावेज़ पैदा करता है।

Type to search the manual.

navigate open esc close