Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI मानव अस्तित्व पर रिपोर्ट
HI

फ्रंटियर AI लैब्स के सुरक्षा-ढांचे, तुलना में

छह लैब्स के सुरक्षा-ढांचों की तुलना: सीमाएं, सुरक्षा-उपाय, और सीमा पार होने पर क्या होता है, वास्तविक व्यवहार के स्वतंत्र ऑडिट के विरुद्ध जांचा गया।

Written by
Dwight Ringdahl
Status
स्रोत-जाँचा
Revised
Sources
13 cited
Reading
14 min

एक सुरक्षा-ढांचा वास्तव में क्या है

किसी फ्रंटियर AI लैब का सुरक्षा-ढांचा लैब की अपनी प्रकाशित नीति है जो क्षमता-सीमाएं — यानी वे विशिष्ट चीज़ें जो कोई मॉडल कर सकता है — और वे सुरक्षा-उपाय या संगठनात्मक प्रतिबद्धताएं परिभाषित करती है जिन्हें मॉडल के किसी सीमा तक पहुंचने पर ट्रिगर होना है। Anthropic अपने संस्करण को Responsible Scaling Policy कहता है; OpenAI, Preparedness Framework; Google DeepMind, Frontier Safety Framework; Meta, Advanced AI Scaling Framework; xAI, Frontier Artificial Intelligence Framework; Microsoft, Frontier Governance Framework। नाम अलग हैं; संरचनात्मक रूप से, सभी छह एक ही सवाल का जवाब देने की कोशिश करते हैं — कोई कंपनी कैसे जानती है कि कोई मॉडल जैसा है वैसा तैनात करने के लिए बहुत ख़तरनाक है, और वह इस बारे में वास्तव में क्या करने के लिए प्रतिबद्ध है?

यह सवाल मायने रखता है क्योंकि इनमें से किसी भी छह कंपनी के लिए फ़िलहाल कोई बाहरी नियामक बाध्यकारी, मॉडल-विशिष्ट क्षमता-सीमाएं तय नहीं करता (देखें 2026 में AI कानून और प्रवर्तन)। फ़िलहाल, ये दस्तावेज़ उद्योग का वास्तविक कार्यशील जवाब हैं। ये भी एक ही दस्तावेज़ की छह प्रतियां नहीं हैं: हर लैब कौन-से जोखिम ट्रैक करती है, कोई सीमा कैसे परिभाषित होती है, और — सबसे महत्वपूर्ण रूप से — सीमा पार होने पर क्या होता है, ये उन तरीक़ों से अलग हैं जो मायने रखते हैं।

तुलना शुरू होने से पहले एक बात कहनी ज़रूरी है, क्योंकि यह तय करती है कि नीचे सब कुछ कैसे पढ़ा जाए: तालिका में हर दावा लैब की अपनी बताई गई नीति है। इनमें से कोई भी इस बात का स्वतंत्र सत्यापन नहीं है कि लैब वाकई वह करती है जो वह कहती है। तालिका के बाद एक अलग खंड, “दावे बनाम व्यवहार”, श्रेणीबद्ध बाहरी ऑडिट, अकादमिक आलोचनाओं, और इन छह कंपनियों की बताई गई प्रतिबद्धताओं तथा उनके वास्तविक आचरण के बीच दस्तावेज़ीकृत अंतरों को कवर करता है — और वह खंड, तालिका नहीं, ज़्यादा महत्वपूर्ण है।

दायरा और स्रोत-संबंधी टिप्पणी

नीचे दिया गया हर ढांचा-विवरण लैब के अपने मौजूदा प्रकाशित दस्तावेज़ के विरुद्ध जांचा गया, साथ ही ("दावे बनाम व्यवहार" खंड के लिए) सितंबर 2026 तक नामित स्वतंत्र रिपोर्टों और शोध-पत्रों के विरुद्ध भी। सटीक संस्करण-संख्याएं और प्रभावी तारीख़ें हर जगह दी गई हैं ताकि लौटने वाला पाठक बता सके कि कुछ बदला है या नहीं। ये नीतियां अक्सर संशोधित होती हैं — अकेले Anthropic ने सितंबर 2023 से नौ क्रमांकित संस्करण प्रकाशित किए हैं — इसलिए हर पंक्ति को एक तारीख़-अंकित झलक मानें, कोई तय विवरण नहीं।

ढांचे, तुलना में

लैब (ढांचा) मौजूदा संस्करण / तारीख़ ट्रैक किए गए जोखिम-क्षेत्र सीमा / स्तर संरचना सीमा पार होने पर क्या होता है
Anthropic — Responsible Scaling Policy v3.4, 8 जुलाई, 2026 से प्रभावी ग़ैर-नवीन CBRN उत्थान; नवीन CBRN उत्थान; उच्च-दांव तोड़फोड़; स्वचालित AI R&D त्वरण क्षमता/उपयोग-सीमा तालिका; स्थिर ASL-2/ASL-3/ASL-4 स्तर v3.0 पुनर्लेखन में हटाए गए (पुराने ASL लेबल केवल पहले से मौजूद वर्तमान नियंत्रणों के लिए बनाए रखे गए) सार्वजनिक, ग़ैर-बाध्यकारी Frontier Safety Roadmap, पिछले प्रदर्शन के विरुद्ध श्रेणीबद्ध, साथ में हर 3–6 महीने में बाहरी समीक्षा वाली Risk Reports — कोई बिना-शर्त रोक नहीं
OpenAI — Preparedness Framework v2, 15 अप्रैल, 2025 जैविक और रासायनिक, साइबर-सुरक्षा, AI आत्म-सुधार (ट्रैक किए गए); दीर्घ-सीमा स्वायत्तता, सैंडबैगिंग, स्वायत्त प्रतिकृति और अनुकूलन, सुरक्षा-उपायों को कमज़ोर करना, न्यूक्लियर और रेडियोलॉजिकल (शोध-श्रेणियां, अभी पूर्ण मानदंड नहीं); अनुनय स्पष्ट रूप से बाहर रखा गया दो स्तर: High और Critical High: तैनाती से पहले सुरक्षा-उपाय ज़रूरी। Critical: विकास के दौरान सुरक्षा-उपाय ज़रूरी; विकास को पूरी तरह रोक सकता है। आंतरिक Safety Advisory Group सिफ़ारिश करता है; CEO/नामित व्यक्ति फ़ैसला करता है; बोर्ड की Safety and Security Committee निगरानी करती है
Google DeepMind — Frontier Safety Framework v3.1, 17 अप्रैल, 2026 CBRN; साइबर; हानिकारक हेरफेर (“खोजी और आगे शोध के अधीन” चिह्नित); ML R&D और मिसअलाइनमेंट (v3.1 में एक क्षेत्र में मिलाए गए) Critical Capability Levels (CCL) साथ में निचली-सीमा वाले Tracked Capability Levels (TCL, v3.0/3.1 में नए); Security Levels SL1–SL4 शब्दावली के रूप में इस्तेमाल, अनुपालन-मानक के रूप में नहीं कोई “अलर्ट सीमा” CCL तक पहुंचने से पहले एक औपचारिक क्षमता-आकलन ट्रिगर करती है; किसी CCL तक पहुंचने के लिए बाहरी तैनाती से पहले एक अतिरिक्त सुरक्षा-मामला और शासन-मंज़ूरी ज़रूरी (और, विशेष रूप से ML R&D CCL के लिए, उच्च-जोखिम आंतरिक तैनाती से पहले भी)
Meta — Advanced AI Scaling Framework v2, 3 फ़रवरी, 2025 (“Frontier AI Framework” v1.1 से नाम बदला; लगभग अप्रैल 2026 में प्रतिस्थापित) रासायनिक और जैविक; साइबर-सुरक्षा; नियंत्रण की हानि (v2 में जोड़ा गया) “किसी ख़तरा-परिदृश्य की ओर उत्थान का स्तर,” कोई स्थिर स्तर-पैमाना नहीं अगर गंभीर जोखिम कम न किया जा सके: मॉडल को बाहरी रूप से तैनात नहीं करेगी या उसका विकास जारी नहीं रखेगी
xAI — Frontier Artificial Intelligence Framework (FAIF) 30 जून, 2026 से प्रभावी (पहले के Risk Management Framework का स्थान लिया, जो आख़िरी बार 20 अगस्त, 2025 को अपडेट हुआ था) CBRN; आक्रामक साइबर-सुरक्षा; नियंत्रण की हानि; हानिकारक हेरफेर कम-से-कम सालाना पूर्ण प्रणालीगत जोखिम-आकलन; कोई स्थिर स्तर-पैमाना नहीं पूरे दस्तावेज़ में सशर्त भाषा (“हम कर सकते हैं,” “अगर हम तय करें कि यह उचित है”); साथियों के समकक्ष कोई स्पष्ट विकास-रोक ट्रिगर नहीं
Microsoft — Frontier Governance Framework फ़रवरी 2026 अपडेट (v1 फ़रवरी 2025 में था) CBRN हथियार; आक्रामक साइबर-संक्रियाएं; उन्नत स्वायत्तता; नियंत्रण की हानि और हानिकारक हेरफेर (फ़रवरी 2026 में जोड़ा गया) दो-चरण: कम-से-कम हर 6 महीने में स्वचालित “अग्रणी संकेतक” बेंचमार्क जांच, जो Low/Medium/High/Critical रेटिंग वाले गहरे आकलन तक बढ़ती है “अगर… हम किसी ऐसे जोखिम की पहचान करते हैं जिसे हम पर्याप्त रूप से कम नहीं कर सकते, तो हम विकास और तैनाती को तब तक रोक देंगे जब तक शमन-प्रथाएं जोखिम का सामना करने के लिए विकसित न हो जाएं” — सभी छह में सबसे प्रत्यक्ष रोक-प्रतिबद्धता

सबसे महत्वपूर्ण बदलाव: Anthropic का बिना-शर्त रोक से हटना

Anthropic की RSP के पास छह में सबसे लंबा सार्वजनिक इतिहास है, और इसका सबसे हालिया संरचनात्मक बदलाव 2026 में फ्रंटियर सुरक्षा-ढांचों के बीच सबसे ज़्यादा चर्चित घटनाक्रम है। 19 सितंबर, 2023 को प्रकाशित संस्करण 1.0 ने AI Safety Level (ASL) व्यवस्था पेश की — ASL-2, ASL-3, ASL-4 — जिनमें से हर एक को आवश्यक नियंत्रणों की एक विशिष्ट, स्थिर सूची से परिभाषित किया गया था, साथ में एक पक्की प्रतिबद्धता: Anthropic किसी सीमा से आगे तब तक प्रशिक्षण नहीं देगी जब तक सुरक्षा-उपाय पहले से पर्याप्त साबित न हो चुके हों। संस्करण 2.0 (अक्टूबर 2024), 2.1 (मार्च 2025), और 2.2 (मई 2025) ने उस संरचना को विस्तारित किया और CBRN सीमा जोड़ी।

24 फ़रवरी, 2026 से प्रभावी संस्करण 3.0 ने नीति को फिर से लिखा। Anthropic ने स्थिर ASL स्तरों की जगह एक क्षमता/उपयोग-सीमा तालिका रखी, और अपना तर्क सीधे एक परिशिष्ट में समझाया — कंपनी के अपने शब्द कि उसने विशिष्ट, मद-दर-मद नियंत्रण-सूचियों को क्यों छोड़ा, नीचे एक पंजीकृत उद्धरण के रूप में दिखते हैं। पुरानी पक्की रोक की जगह, v3.0 ने दो नए उपकरण पेश किए: एक सार्वजनिक, ग़ैर-बाध्यकारी Frontier Safety Roadmap जिसे खुले तौर पर Anthropic के अपने पिछले प्रदर्शन के विरुद्ध श्रेणीबद्ध किया जाता है, और हर तीन से छह महीने में प्रकाशित होने वाली Risk Reports जिनकी समीक्षा कम-से-कम एक जांचे गए, बाहरी, टकराव-मुक्त समीक्षक द्वारा होती है। Anthropic का दस्तावेज़ स्पष्ट रूप से कहता है कि यह एकतरफ़ा, निरपेक्ष-जोखिम रुख़ से एक सशर्त और प्रतिस्पर्धी-निर्भर रुख़ की ओर एक जान-बूझकर किया गया बदलाव है: एक नामित परिशिष्ट “Anthropic आगे” और “प्रतिस्पर्धियों के पास मज़बूत सुरक्षा-उपाय हैं” जैसे परिदृश्य बताता है, जिनके तहत कंपनी की अपनी प्रतिबद्धताएं बदल जाती हैं। संस्करण 3.1 (2 अप्रैल), 3.2 (29 अप्रैल), 3.3 (26 मई), और 3.4 (8 जुलाई, 2026, मौजूदा) ने तब से विवरण संशोधित किए हैं — सबसे हाल में स्वचालित-R&D सीमा को संकुचित करते हुए और आंतरिक Risk Report वितरण को व्यापक बनाते हुए — बिना पहले वाली पक्की रोक को बहाल किए।

नीति के इर्द-गिर्द शासन-व्यवस्था इन संस्करणों में स्थिर बनी रही है: एक नामित Responsible Scaling Officer, एक अनुपालन-न-करने की रिपोर्टिंग-चैनल, और एक वार्षिक तीसरे-पक्ष प्रक्रियात्मक अनुपालन-समीक्षा जिसे Anthropic ख़ुद “प्रक्रियात्मक अनुपालन की जांच, सारगर्भित परिणामों की नहीं” के रूप में बताती है — एक अंतर जिस पर ध्यान देना ज़रूरी है, क्योंकि इसका मतलब है कि ऑडिट यह पुष्टि करता है कि प्रक्रिया का पालन हुआ, यह नहीं कि परिणामी फ़ैसले सही थे।

यह बदलाव कंपनी के बाहर तुरंत एक विश्वसनीयता-संबंधी घटना के रूप में दर्ज हुआ। METR के नीति-निदेशक Chris Painter ने Anthropic की अनुमति से एक शुरुआती मसौदे की समीक्षा की और, Risk Reports की बढ़ी हुई पारदर्शिता का स्वागत करते हुए भी, रिपोर्टरों को नीचे उद्धृत सीधा आकलन दिया।

बाक़ी पांच ढांचे कहां मिलते और अलग होते हैं

Microsoft का Frontier Governance Framework Anthropic के नए सशर्त रुख़ से सबसे सीधा विरोधाभास है: इसकी रोक-प्रतिबद्धता, जो ऊपर तालिका में और नीचे पूरी तरह उद्धृत है, ऊपर से बिना-शर्त है, जो केवल Microsoft के अपने इस आकलन से बंधी है कि किसी जोखिम को पर्याप्त रूप से कम नहीं किया जा सकता — Anthropic के परिशिष्ट A जैसा कोई प्रतिस्पर्धी-निर्भर परिदृश्य-अपवाद नहीं।

Meta का Advanced AI Scaling Framework अपने संकुचित मामले के लिए इसी तरह की बिना-शर्त प्रतिबद्धता करता है: अगर कोई मॉडल Meta की “गंभीर जोखिम सीमा” तक पहुंचता है और उस जोखिम को कम नहीं किया जा सकता, तो Meta कहता है कि वह मॉडल को बाहरी रूप से तैनात नहीं करेगी या उसका विकास जारी नहीं रखेगी। Meta स्थिर स्तर-पैमाने के बजाय “किसी ख़तरा-परिदृश्य की ओर उत्थान का स्तर” इस्तेमाल करता है, लेकिन अंतर्निहित क्षेत्र — रासायनिक/जैविक जोखिम, साइबर-सुरक्षा, और नियंत्रण की हानि (Meta के v2 में जोड़ा गया) — लैब्स के बीच उससे कहीं ज़्यादा साझा निकलते हैं जितना हर ढांचे का अलग प्रकाशन बताता है। OpenAI का अपना Preparedness Framework v2 एक फ़ुटनोट में साफ़ कहता है कि उसकी Capability Reports और Safeguards Reports “Anthropic की अपडेट की गई RSP के समानांतर” हैं और उसके सीमा-मानदंड “आंशिक रूप से Meta के हालिया Frontier AI Framework से प्रभावित थे” — दस्तावेज़ों के एक ऐसे समूह में लैब-पार अभिसरण की एक दुर्लभ स्वीकृति जो अन्यथा ऐसे पढ़ती है जैसे हर एक अलग-थलग लिखा गया हो।

OpenAI की अपनी दो-स्तरीय संरचना सबसे कठिन द्वार — विकास को ही संभावित रूप से रोकना — केवल Critical स्तर पर रखती है, और तब भी फ़ैसले को एक आंतरिक Safety Advisory Group से गुज़ारती है जिसकी सिफ़ारिश को OpenAI का CEO या कोई नामित व्यक्ति पलट सकता है, जिसमें बोर्ड की अपनी Safety and Security Committee (उसी CEO द्वारा सह-नेतृत्व की गई) उस पलटाव की निगरानी करती है। यह ढांचा जुलाई 2026 में व्यवहार में लागू किया गया: OpenAI के GPT-5.6 System Card ने अपने छोटे, तेज़ Sol, Terra, और Luna मॉडलों को साइबर-सुरक्षा और जैविक व जैव-रासायनिक जोखिम दोनों में High क्षमता नामित किया — किसी परिवार के छोटे मॉडलों को यह पदनाम मिलने की पहली बार — जिसने नए एक्टिवेशन-क्लासिफ़ायर, रीयल-टाइम आउटपुट-ब्लॉकिंग, और लगभग 700,000 GPU-घंटे के स्वचालित रेड-टीमिंग को ट्रिगर किया (OpenAI, GPT-5.6 डिप्लॉयमेंट सेफ़्टी पेज)। यह OpenAI का अपने ही अनुपालन का अपना विवरण है, कोई स्वतंत्र ऑडिट नहीं।

Google DeepMind का Frontier Safety Framework फिर से अलग ढंग से काम करता है: द्विआधारी स्तर-पार करने के बजाय, किसी “अलर्ट सीमा” का मक़सद है किसी Critical Capability Level तक वाकई पहुंचने से पहले एक औपचारिक क्षमता-आकलन ट्रिगर करना, और किसी तक पहुंचने के लिए बाहरी तैनाती से पहले एक अतिरिक्त सुरक्षा-मामला और शासन-मंज़ूरी ज़रूरी है — जिसे विशेष रूप से ML R&D क्षेत्र के लिए, उच्च-जोखिम आंतरिक तैनाती तक भी बढ़ाया गया है (DeepMind, Frontier Safety Framework v3.1)। किसी लैब द्वारा सार्वजनिक रूप से अपने ही ढांचे की सीमाएं बताने का सबसे स्पष्ट उदाहरण: उन मॉडलों के लिए DeepMind का अनुशंसित Security Level 4, जो पूरी Google AI शोध-टीम के काम को पूरी तरह स्वचालित कर सकते हैं, इस स्पष्ट टिप्पणी के साथ आता है कि इसे “पूरे फ्रंटियर AI क्षेत्र द्वारा अपनाया जाना चाहिए” — DeepMind अपने ही प्रकाशित दस्तावेज़ में यह कह रहा है कि उस क्षमता-स्तर पर किसी एक कंपनी के नियंत्रण पर्याप्त नहीं हैं।

xAI का FAIF इस आयाम पर तुलनात्मक रूप से पतला है। अपने चार क्षेत्रों में, सशर्त भाषा लगभग स्थिर है — “हम कर सकते हैं,” “अगर हम तय करें कि यह उचित है” — और दस्तावेज़ में OpenAI के Critical स्तर या Meta की “तैनात नहीं करेगी” वाली भाषा के समकक्ष कोई तैनाती-रोकने वाली प्रतिबद्धता नहीं है (xAI, Frontier Artificial Intelligence Framework)। इसने एक पहले के Risk Management Framework का स्थान लिया, जो ख़ुद xAI की अपनी बताई समय-सारिणी से महीनों पीछे प्रकाशित हुआ था — एक ऐसा पैटर्न जिसका दस्तावेज़ीकृत इतिहास है, जो आगे शामिल है।

इन छह से आगे प्रकाशित फ्रंटियर-लैब नीतियों की एक व्यापक सूची के लिए, METR एक तुलना बनाए रखता है (METR, “Common Elements of Frontier AI Safety Policies”; सूची) जो बारह लैब्स को कवर करती है। यह मुख्य रूप से एक श्रेणीबद्ध स्कोरकार्ड के बजाय एक संरचनात्मक सूची के रूप में काम करता है — श्रेणीबद्ध तुलना के लिए, अगला खंड देखें।

दावे बनाम व्यवहार

ऊपर सब कुछ यह बताता है कि छह कंपनियां क्या करने की बात कहती हैं। क्या उन्होंने वाकई ऐसा किया है, यह एक अलग, और ज़्यादा महत्वपूर्ण सवाल है, और उपलब्ध सबूत ढांचों की तुलना में काफ़ी कम चापलूस हैं।

सबसे उपयोगी अकेली स्वतंत्र जांच है SaferAI Frontier Risk Management Tracker, जो किसी भी लैब के स्व-रिपोर्ट किए गए ढांचे से अलग एक वाकई स्वतंत्र रेटिंग है। यह बारह कंपनियों को — केवल ऊपर तुलना की गई छह को नहीं — चार आयामों पर श्रेणीबद्ध करता है: Risk Identification, Risk Analysis & Evaluation, Risk Treatment, और Risk Governance। इसके जुलाई 2026 अपडेट तक, 100% में से समग्र स्कोर थे: Anthropic 35% (समग्र रूप से सबसे ऊंचा, और विशेष रूप से Risk Governance पर 50% के साथ सबसे मज़बूत), OpenAI 34%, Microsoft 33%, Meta 33%, G42 24%, Google DeepMind 20%, xAI 18%, Amazon 18%, NVIDIA 16%, Magic 11%, Naver 10%, और Cohere 8% (सबसे कम) (SaferAI Frontier Risk Management Tracker)। SaferAI का अपना यह मानदंड कि अगर हर कंपनी क्षेत्र में कहीं भी पाई जाने वाली सबसे मज़बूत मौजूदा प्रथा अपनाए तो मौजूदा सर्वश्रेष्ठ अभ्यास क्या पैदा करेगा, नीचे उद्धृत है — और यह 100% के आस-पास भी नहीं है। समीक्षा की गई कोई भी लैब, अग्रणी सहित, उसके नज़दीक नहीं है जिसे SaferAI पर्याप्त मानता है।

OpenAI के Preparedness Framework को सीधे बाहरी शिक्षाविदों द्वारा जांचा गया है, न कि उसे जस-का-तस मान लिया गया। Coggins, Saeri, Daniell, Ruster, Liu, और Davis एक “affordances” ढांचा लागू करते हैं — यह अलग करते हुए कि कोई नीति-दस्तावेज़ क्या मांगता है, क्या अनुरोध करता है, क्या प्रोत्साहित करता है, और केवल क्या अनुमति देता है — और तीन निष्कर्षों पर पहुंचते हैं। पहला, यह ढांचा MIT AI Risk Repository के 24-उपक्षेत्र वर्गीकरण में केवल एक अल्पसंख्यक जोखिम-उपक्षेत्रों के मूल्यांकन का अनुरोध करता है, और किसी का भी मूल्यांकन नहीं मांगता। दूसरा, यह गंभीर नुकसान के लिए “Medium” क्षमता वाले सिस्टमों की तैनाती को प्रोत्साहित करता है — OpenAI की अपनी परिभाषा हज़ारों लोगों की मृत्यु या गंभीर चोट, या सैकड़ों अरब डॉलर के आर्थिक नुकसान को कवर करती है — यह OpenAI द्वारा अपने o1 मॉडल की तैनाती का हवाला देते हुए, इसके बावजूद कि उसकी जैविक/रासायनिक और अनुनय क्षमता को Medium रेट किया गया था। तीसरा, यह OpenAI के CEO को Safety Advisory Group की सुरक्षा-उपाय सिफ़ारिशों को पलटने की अनुमति देता है, जबकि वही CEO उस बोर्ड-समिति का सह-नेतृत्व करता है जिसे उस विवेकाधिकार की निगरानी करनी है — एक संरचनात्मक हित-टकराव का निष्कर्ष, कोई काल्पनिक नहीं।

Google DeepMind के अपने सुरक्षा-मामले का बाहरी ऑडिट हुआ है — छह लैब्स में, किसी विशिष्ट सुरक्षा-प्रासंगिक दावे को लैब की आंतरिक प्रक्रिया के बजाय नामित, प्रमाणित बाहरी समीक्षकों द्वारा जांचे जाने का सबसे स्पष्ट उदाहरण। DeepMind का यह आंतरिक तर्क कि उसके मॉडलों में “साज़िश” (scheme) करने की क्षमता नहीं है, Barrett, Campos Zabala, Fillingham, Siddique, Walpole, Bloomfield, और Papadatos द्वारा एक औपचारिक आश्वासन-कार्यप्रणाली का उपयोग करते हुए समीक्षा की गई। उनके आकलन ने DeepMind को वास्तविक कार्यप्रणाली-जुड़ाव और पारदर्शी तर्क का श्रेय दिया, लेकिन नीचे उद्धृत बात पाई — यह एक निष्कर्ष है इंजीनियरिंग-अभ्यास और वास्तव में प्रस्तुत सबूत के बीच की दूरी के बारे में, बुरी नीयत का कोई आरोप नहीं।

xAI किसी ढांचे के दावों के घटनाओं द्वारा सीधे खंडित होने का सबसे स्पष्ट मामला देता है, और यह दो बार हुआ। पहला, प्रक्रिया पर: xAI के फ़रवरी 2025 के मसौदा ढांचे ने “तीन महीनों के भीतर” एक अंतिम संस्करण का वादा किया था — लगभग 10 मई, 2025 की समय-सीमा। यह समय-सीमा xAI की ओर से किसी स्वीकृति के बिना गुज़र गई, जिसने निगरानी-समूह The Midas Project को नीचे उद्धृत पैटर्न बताने के लिए प्रेरित किया। अंतिम FAIF का पूर्ववर्ती 20 अगस्त, 2025 तक प्रकाशित नहीं हुआ — तीन महीने से ज़्यादा देर से। दूसरा, सार पर: उसी दिन, xAI ने ग़लती से लाखों उपयोगकर्ता-बातचीत प्रकाशित कर दीं, और Elon Musk ने अलग से स्वीकार किया कि किसी इंजीनियर ने कंपनी का पूरा कोड-रिपॉज़िटरी डाउनलोड कर लिया था — जो उसी दस्तावेज़ के अपने लिखित सुरक्षा-दावों को सीधे कमज़ोर करता है। AI Lab Watch ने यह भी दस्तावेज़ीकृत किया कि UK AI Security Institute को तीसरे-पक्ष मूल्यांकनकर्ता का श्रेय प्रकाशन के एक दिन बाद, बिना किसी स्पष्टीकरण के, चुपचाप Grok 4 मॉडल कार्ड से हटा दिया गया (AI Lab Watch, “xAI’s new safety framework is dreadful”)।

इस खंड की हर प्रविष्टि कोई दस्तावेज़ीकृत विफलता नहीं है। OpenAI के GPT-5.6 की High-क्षमता वाली पदनाम, जो ऊपर बताई गई, को सबसे अच्छे ढंग से इस रूप में पढ़ा जा सकता है कि कोई ढांचा काफ़ी हद तक जैसा लिखा गया वैसा ही लागू किया गया — लेकिन यह अब भी OpenAI की अपनी स्व-रिपोर्ट है; इसके पीछे के रेड-टीमिंग या क्लासिफ़ायर-प्रभावशीलता के दावों का कोई स्वतंत्र सत्यापन इसे लिखे जाने तक नहीं मिला।

इस पेज का उपयोग कैसे करें

यहां नामित हर ढांचा अपनी ही समय-सारिणी पर संशोधित होता है, आमतौर पर किसी चेंजलॉग प्रविष्टि से ज़्यादा सार्वजनिक सूचना के बिना। ऊपर दिए संस्करण-संख्या और प्रभावी तारीख़ें यह जांचने का सबसे तेज़ तरीक़ा हैं कि कोई दी गई पंक्ति अब भी मौजूदा है: Anthropic की RSP v3.4 (8 जुलाई, 2026) पर है, OpenAI का Preparedness Framework 15 अप्रैल, 2025 से v2 पर है और इसे लिखे जाने तक कोई v2.1 नहीं है, DeepMind का Frontier Safety Framework v3.1 (17 अप्रैल, 2026) पर है, Meta का Advanced AI Scaling Framework v2 (3 फ़रवरी, 2025, तब से प्रतिस्थापित) पर है, xAI का FAIF 30 जून, 2026 से प्रभावी हुआ, और Microsoft का Frontier Governance Framework आख़िरी बार फ़रवरी 2026 में अपडेट हुआ। अगर आपके इसे पढ़ने तक इनमें से कोई भी संख्या बदल गई है, तो तालिका को विशेष रूप से उस पंक्ति पर पुराना मानें।

इन ढांचों के पीछे क्षमता-परीक्षण और सुरक्षा-मामले के तर्क वास्तव में कैसे काम करते हैं — और उनकी अपनी सीमाएं क्या हैं — इसके लिए देखें फ्रंटियर मूल्यांकन, सुरक्षा-मामले, और घटना-रिपोर्टिंग। उन वास्तविक-दुनिया की घटनाओं, खुलासों, और नज़दीकी चूकों के कालानुक्रमिक रिकॉर्ड के लिए जिन्हें ये ढांचे रोकने या पकड़ने के लिए बने हैं, देखें AI घटनाओं की समय-रेखा

References

Direct quotation
“Earlier editions of our RSP defined “AI Safety Levels” with specific lists of required controls... when defining the risk mitigations needed for future levels of AI capability, we have found that providing a specific list of controls is overly rigid, and we instead prefer to focus on what sort of argument an AI developer should make”
Anthropic, Responsible Scaling Policy, Appendix B ("Notes on ASLs")
anthropic.com, Primary source
Direct quotation
“This is more evidence that society is not prepared for the potential catastrophic risks posed by AI”
Chris Painter, Director of Policy, METR
Winbuzzer, Reported interview
Direct quotation
“If, during the implementation of this framework, we identify a risk we cannot sufficiently mitigate, we will pause development and deployment until the point at which mitigation practices evolve to meet the risk”
Microsoft, Frontier Governance Framework (February 2026 update)
microsoft.com, Primary source
Direct quotation
“if a company were to apply all the best practices currently found across the other companies, they would achieve a score of 59%”
SaferAI, Frontier Risk Management Tracker
tracker.safer-ai.org, Research/report
Direct quotation
“OpenAI's Framework requests research & evaluation of a small minority of AI risks and demands none”
Sam Coggins, Alexander K. Saeri, Katherine A. Daniell, Lorenn P. Ruster, Jessie Liu, and Jenny L. Davis, Authors, "The 2025 OpenAI Preparedness Framework does not guarantee any AI risk mitigation practices: a proof-of-concept for affordance analyses of AI safety policies"
arXiv:2509.24394, Research/report
Direct quotation
“we identified gaps between what would be expected in established safety-engineering practice and what the safety case delivers”
Stephen Barrett, Francisco Javier Campos Zabala, Sean P. Fillingham, Umair Siddique, James Walpole, Robin Bloomfield, and Henry Papadatos, Authors, "Lessons from External Review of DeepMind’s Scheming Inability Safety Case"
arXiv:2604.21964, Research/report
Direct quotation
“xAI misses a second self-imposed deadline to implement a frontier safety policy”
The Midas Project, AI-safety watchdog group, quoted by TechCrunch
TechCrunch, Secondary coverage
  1. OpenAI, GPT-5.6 डिप्लॉयमेंट सेफ़्टी पेज deploymentsafety.openai.com
  2. DeepMind, Frontier Safety Framework v3.1 storage.googleapis.com
  3. xAI, Frontier Artificial Intelligence Framework media.x.ai
  4. METR, "Common Elements of Frontier AI Safety Policies" metr.org
  5. सूची metr.org
  6. AI Lab Watch, "xAI's new safety framework is dreadful" ailabwatch.substack.com

Type to search the manual.

navigate open esc close