Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI मानव अस्तित्व पर रिपोर्ट
HI

04 बचाव के रास्ते

बचाव के वे रास्ते जो वाकई मौजूद हैं

तकनीकी और संस्थागत नियंत्रण तय करते हैं कि अध्याय 02 में बताए गए गंभीर परिदृश्य अधिक या कम संभावित बनते हैं या नहीं; घरेलू तैयारी इनका विकल्प नहीं बन सकती।

Written by
Dwight Ringdahl
Revised
Sources
2 cited

तकनीकी सुरक्षा उपाय

  • इंटरप्रेटेबिलिटी शोध। मॉडल के आंतरिक निरूपण और आंतरिक गणना का निरीक्षण, व्यवहारगत मूल्यांकन, पहुंच नियंत्रण, और तैनाती निगरानी के एक पूरक के रूप में।
  • स्केलेबल निगरानी। तकनीकें — बहस (debate), पुनरावर्ती पुरस्कार मॉडलिंग, कमज़ोर-से-मज़बूत सामान्यीकरण — जिनका उद्देश्य कम सक्षम निरीक्षकों को अधिक सक्षम सिस्टम की निगरानी में मदद करना है।
  • सुधार-सुलभता (corrigibility) शोध। यह अध्ययन करना कि सिस्टम वैध सुधार, संशोधन, और बंद किए जाने के प्रति ग्रहणशील कैसे बने रह सकते हैं; अब तक कोई पैमाने पर मज़बूत समाधान प्रदर्शित नहीं किया गया है।
  • कंप्यूट गवर्नेंस। क्षेत्राधिकार-विशिष्ट निर्यात नियंत्रण, बुनियादी ढांचे की निगरानी, और सीमाएं जिन्हें क्षमता के लिए अपूर्ण प्रॉक्सी के तौर पर इस्तेमाल किया जाता है — न कि AGI या सुरक्षा की परिभाषा के तौर पर।

Anthropic के मुख्य कार्यकारी ने अपने 2025 के निबंध में इनमें से पहले उपाय के पक्ष में तर्क दिया:

Summarized position

Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.

Dario Amodei, CEO, Anthropic
The Urgency of Interpretability, Primary source

संस्थागत उपाय

समन्वय की समस्या

अंतरराष्ट्रीय समन्वय मायने रखता है क्योंकि एकतरफ़ा नियंत्रण सुरक्षा प्रोत्साहन और प्रतिस्पर्धी स्थिति, दोनों को बदल सकते हैं। नीतिगत परिदृश्य अब पूरी तरह स्वैच्छिक नहीं रहा: EU AI अधिनियम अपने दायरे में आने वाले प्रदाताओं पर बाध्यकारी दायित्व लागू करता है, जबकि लैब सुरक्षा ढांचे और शिखर सम्मेलन की प्रतिबद्धताएं काफ़ी हद तक स्वैच्छिक बनी हुई हैं। वर्तमान में फ्रंटियर-मॉडल शस्त्र-नियंत्रण के लिए कोई बाध्यकारी वैश्विक संधि मौजूद नहीं है।

एक शुरुआती अंतरराष्ट्रीय आरंभ-बिंदु वह गैर-बाध्यकारी घोषणापत्र था जिसे पहले वैश्विक AI सुरक्षा शिखर सम्मेलन में 28 देशों और EU ने समर्थन दिया:

Summarized position

28 nations and the European Union commits signatories to AI that is designed, developed, deployed and used safely and responsibly.

28 nations and the European Union, The Bletchley Declaration, AI Safety Summit
GOV.UK, Signed statement
  • अप्रतिबंधित रिलीज़ से पहले खतरनाक क्षमताओं के लिए जोखिम-आनुपातिक पूर्व-तैनाती मूल्यांकन।
  • घटना रिपोर्टिंग जो नियामकों और डेवलपरों को गंभीर विफलताओं और लगभग-चूक गई घटनाओं से सीखने देती है।
  • दायित्व नियम जो नियंत्रण, जानकारी, कार्य-कारण, और नुकसान रोकने की क्षमता को ध्यान में रखते हैं।

एक व्यक्तिगत तकनीकविद् क्या कर सकता है

पाठक मतदाताओं, कर्मचारियों, शोधकर्ताओं, ग्राहकों, निवेशकों, और नागरिक संगठनों के सदस्यों के रूप में नीति को प्रभावित कर सकते हैं। व्यावहारिक विकल्पों में शामिल हैं: इंटरप्रेटेबिलिटी और एलाइनमेंट शोध में योगदान देना या उसे वित्तपोषित करना; यदि आप उत्पादन में AI सिस्टम तैनात करते हैं तो अपने संगठन के भीतर सुरक्षा प्रथाओं को आगे बढ़ाना; ऊपर बताए गए रिपोर्टिंग और मूल्यांकन बुनियादी ढांचे को नियामक बाधा मानने के बजाय उसका समर्थन करना; और स्वचालित हेरफेर या वास्तविक सहमति मान लेने के बजाय प्रेरक दावों के पीछे के स्रोत और साक्ष्य की जांच करना।

शोध नीति संगठनात्मक

इस अध्याय में

11 पृष्ठ इस अध्याय में

व्याख्या-योग्यता: कोई मॉडल आंतरिक रूप से क्या कर रहा है, यह पढ़ना व्याख्या-योग्यता शोध वास्तव में क्या करता है, Anthropic के CEO ने इसे अत्यावश्यक क्यों बताया, और यह क्षेत्र मॉडल का मन पढ़ने में सफल होने के कितने क़रीब है।
स्रोत-जाँचा 7 min
स्केल-योग्य निगरानी: ज़्यादा सक्षम सिस्टमों पर निगरानी रखना मानवीय निगरानीकर्ताओं को ख़ुद से ज़्यादा सक्षम AI सिस्टमों की निगरानी करने देने के लिए शोधकर्ता जिन तकनीकी तरीक़ों को परख रहे हैं, AI डिबेट के ज़रिए परखे गए।
स्रोत-जाँचा 7 min
कंप्यूट शासन: चिप्स, डेटा-सेंटर, और सीमाएं चिप निर्यात-नियंत्रण, डेटा-सेंटर रिपोर्टिंग, और कंप्यूट सीमाएं उन्नत AI विकास को कैसे नियंत्रित कर सकती हैं, उनकी सीमाओं और प्रवर्तन-चुनौतियों सहित।
स्रोत-जाँचा 6 min
अंतरराष्ट्रीय संधियां और शिखर सम्मेलन: शासन-व्यवस्था कहां खड़ी है Bletchley घोषणा, बाद के AI सुरक्षा शिखर सम्मेलनों, और अंतरराष्ट्रीय AI शासन-व्यवस्था किसी अनुसमर्थित संधि की ओर कितनी आगे बढ़ी है, इसका सीधा लेखा-जोखा।
स्रोत-जाँचा 6 min
सुधार-सुलभता: सुधार को स्वीकार करने वाले सिस्टम क्यों "बस एक ऑफ़-स्विच बना दो" सुनने से कहीं ज़्यादा कठिन है, और सुधार-सुलभता शोध क्या हल करने की कोशिश कर रहा है — जिसमें शटडाउन के विरोध के कारण शामिल हैं।
स्रोत-जाँचा 7 min
AI लैब्स के भीतर व्हिसलब्लोअर सुरक्षा व्हिसलब्लोअर अधिकार, रिपोर्टिंग-चैनल, और प्रतिशोध-विरोधी नियम AI-लैब कर्मचारियों को सुरक्षा-विफलताएं सार्वजनिक नुकसान बनने से पहले उजागर करने में कैसे मदद कर सकते हैं।
स्रोत-जाँचा 7 min
ओपन-सोर्स AI बहस: सुरक्षा-उपकरण या सुरक्षा-जोखिम शक्तिशाली AI मॉडल-भार खुले तौर पर जारी करने के पक्ष और विपक्ष में सबसे मज़बूत सुरक्षा, शोध, प्रतिस्पर्धा, और दुरुपयोग तर्कों की जांच, एक $200 जेलब्रेक सहित।
स्रोत-जाँचा 7 min
2026 में AI कानून और प्रवर्तन सितंबर 2026 तक EU, US और अंतरराष्ट्रीय ढांचों में कौन-से AI नियम बाध्यकारी हैं, कौन-से अब भी स्वैच्छिक हैं, और प्रवर्तन कहां असर करता है।
स्रोत-जाँचा 7 min
फ्रंटियर मूल्यांकन, सुरक्षा-मामले, और घटना-रिपोर्टिंग क्षमता-परीक्षण, सुरक्षा-उपाय मूल्यांकन, संरचित सुरक्षा-तर्क, और घटना-सिस्टम फ्रंटियर-AI के वादों को ऑडिट-योग्य सबूत में कैसे बदल सकते हैं।
स्रोत-जाँचा 7 min
फ्रंटियर AI लैब्स के सुरक्षा-ढांचे, तुलना में छह लैब्स के सुरक्षा-ढांचों की तुलना: सीमाएं, सुरक्षा-उपाय, और सीमा पार होने पर क्या होता है, वास्तविक व्यवहार के स्वतंत्र ऑडिट के विरुद्ध जांचा गया।
स्रोत-जाँचा 14 min

Type to search the manual.

navigate open esc close