04 बचाव के रास्ते
बचाव के वे रास्ते जो वाकई मौजूद हैं
तकनीकी और संस्थागत नियंत्रण तय करते हैं कि अध्याय 02 में बताए गए गंभीर परिदृश्य अधिक या कम संभावित बनते हैं या नहीं; घरेलू तैयारी इनका विकल्प नहीं बन सकती।
तकनीकी सुरक्षा उपाय
- इंटरप्रेटेबिलिटी शोध। मॉडल के आंतरिक निरूपण और आंतरिक गणना का निरीक्षण, व्यवहारगत मूल्यांकन, पहुंच नियंत्रण, और तैनाती निगरानी के एक पूरक के रूप में।
- स्केलेबल निगरानी। तकनीकें — बहस (debate), पुनरावर्ती पुरस्कार मॉडलिंग, कमज़ोर-से-मज़बूत सामान्यीकरण — जिनका उद्देश्य कम सक्षम निरीक्षकों को अधिक सक्षम सिस्टम की निगरानी में मदद करना है।
- सुधार-सुलभता (corrigibility) शोध। यह अध्ययन करना कि सिस्टम वैध सुधार, संशोधन, और बंद किए जाने के प्रति ग्रहणशील कैसे बने रह सकते हैं; अब तक कोई पैमाने पर मज़बूत समाधान प्रदर्शित नहीं किया गया है।
- कंप्यूट गवर्नेंस। क्षेत्राधिकार-विशिष्ट निर्यात नियंत्रण, बुनियादी ढांचे की निगरानी, और सीमाएं जिन्हें क्षमता के लिए अपूर्ण प्रॉक्सी के तौर पर इस्तेमाल किया जाता है — न कि AGI या सुरक्षा की परिभाषा के तौर पर।
Anthropic के मुख्य कार्यकारी ने अपने 2025 के निबंध में इनमें से पहले उपाय के पक्ष में तर्क दिया:
Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.
The Urgency of Interpretability, Primary source
संस्थागत उपाय
अंतरराष्ट्रीय समन्वय मायने रखता है क्योंकि एकतरफ़ा नियंत्रण सुरक्षा प्रोत्साहन और प्रतिस्पर्धी स्थिति, दोनों को बदल सकते हैं। नीतिगत परिदृश्य अब पूरी तरह स्वैच्छिक नहीं रहा: EU AI अधिनियम अपने दायरे में आने वाले प्रदाताओं पर बाध्यकारी दायित्व लागू करता है, जबकि लैब सुरक्षा ढांचे और शिखर सम्मेलन की प्रतिबद्धताएं काफ़ी हद तक स्वैच्छिक बनी हुई हैं। वर्तमान में फ्रंटियर-मॉडल शस्त्र-नियंत्रण के लिए कोई बाध्यकारी वैश्विक संधि मौजूद नहीं है।
एक शुरुआती अंतरराष्ट्रीय आरंभ-बिंदु वह गैर-बाध्यकारी घोषणापत्र था जिसे पहले वैश्विक AI सुरक्षा शिखर सम्मेलन में 28 देशों और EU ने समर्थन दिया:
28 nations and the European Union commits signatories to AI that is designed, developed, deployed and used safely and responsibly.
GOV.UK, Signed statement
- अप्रतिबंधित रिलीज़ से पहले खतरनाक क्षमताओं के लिए जोखिम-आनुपातिक पूर्व-तैनाती मूल्यांकन।
- घटना रिपोर्टिंग जो नियामकों और डेवलपरों को गंभीर विफलताओं और लगभग-चूक गई घटनाओं से सीखने देती है।
- दायित्व नियम जो नियंत्रण, जानकारी, कार्य-कारण, और नुकसान रोकने की क्षमता को ध्यान में रखते हैं।
एक व्यक्तिगत तकनीकविद् क्या कर सकता है
पाठक मतदाताओं, कर्मचारियों, शोधकर्ताओं, ग्राहकों, निवेशकों, और नागरिक संगठनों के सदस्यों के रूप में नीति को प्रभावित कर सकते हैं। व्यावहारिक विकल्पों में शामिल हैं: इंटरप्रेटेबिलिटी और एलाइनमेंट शोध में योगदान देना या उसे वित्तपोषित करना; यदि आप उत्पादन में AI सिस्टम तैनात करते हैं तो अपने संगठन के भीतर सुरक्षा प्रथाओं को आगे बढ़ाना; ऊपर बताए गए रिपोर्टिंग और मूल्यांकन बुनियादी ढांचे को नियामक बाधा मानने के बजाय उसका समर्थन करना; और स्वचालित हेरफेर या वास्तविक सहमति मान लेने के बजाय प्रेरक दावों के पीछे के स्रोत और साक्ष्य की जांच करना।