एक सुरक्षा-ढांचा वास्तव में क्या है
किसी फ्रंटियर AI लैब का सुरक्षा-ढांचा लैब की अपनी प्रकाशित नीति है जो क्षमता-सीमाएं — यानी वे विशिष्ट चीज़ें जो कोई मॉडल कर सकता है — और वे सुरक्षा-उपाय या संगठनात्मक प्रतिबद्धताएं परिभाषित करती है जिन्हें मॉडल के किसी सीमा तक पहुंचने पर ट्रिगर होना है। Anthropic अपने संस्करण को Responsible Scaling Policy कहता है; OpenAI, Preparedness Framework; Google DeepMind, Frontier Safety Framework; Meta, Advanced AI Scaling Framework; xAI, Frontier Artificial Intelligence Framework; Microsoft, Frontier Governance Framework। नाम अलग हैं; संरचनात्मक रूप से, सभी छह एक ही सवाल का जवाब देने की कोशिश करते हैं — कोई कंपनी कैसे जानती है कि कोई मॉडल जैसा है वैसा तैनात करने के लिए बहुत ख़तरनाक है, और वह इस बारे में वास्तव में क्या करने के लिए प्रतिबद्ध है?
यह सवाल मायने रखता है क्योंकि इनमें से किसी भी छह कंपनी के लिए फ़िलहाल कोई बाहरी नियामक बाध्यकारी, मॉडल-विशिष्ट क्षमता-सीमाएं तय नहीं करता (देखें 2026 में AI कानून और प्रवर्तन)। फ़िलहाल, ये दस्तावेज़ उद्योग का वास्तविक कार्यशील जवाब हैं। ये भी एक ही दस्तावेज़ की छह प्रतियां नहीं हैं: हर लैब कौन-से जोखिम ट्रैक करती है, कोई सीमा कैसे परिभाषित होती है, और — सबसे महत्वपूर्ण रूप से — सीमा पार होने पर क्या होता है, ये उन तरीक़ों से अलग हैं जो मायने रखते हैं।
तुलना शुरू होने से पहले एक बात कहनी ज़रूरी है, क्योंकि यह तय करती है कि नीचे सब कुछ कैसे पढ़ा जाए: तालिका में हर दावा लैब की अपनी बताई गई नीति है। इनमें से कोई भी इस बात का स्वतंत्र सत्यापन नहीं है कि लैब वाकई वह करती है जो वह कहती है। तालिका के बाद एक अलग खंड, “दावे बनाम व्यवहार”, श्रेणीबद्ध बाहरी ऑडिट, अकादमिक आलोचनाओं, और इन छह कंपनियों की बताई गई प्रतिबद्धताओं तथा उनके वास्तविक आचरण के बीच दस्तावेज़ीकृत अंतरों को कवर करता है — और वह खंड, तालिका नहीं, ज़्यादा महत्वपूर्ण है।
नीचे दिया गया हर ढांचा-विवरण लैब के अपने मौजूदा प्रकाशित दस्तावेज़ के विरुद्ध जांचा गया, साथ ही ("दावे बनाम व्यवहार" खंड के लिए) सितंबर 2026 तक नामित स्वतंत्र रिपोर्टों और शोध-पत्रों के विरुद्ध भी। सटीक संस्करण-संख्याएं और प्रभावी तारीख़ें हर जगह दी गई हैं ताकि लौटने वाला पाठक बता सके कि कुछ बदला है या नहीं। ये नीतियां अक्सर संशोधित होती हैं — अकेले Anthropic ने सितंबर 2023 से नौ क्रमांकित संस्करण प्रकाशित किए हैं — इसलिए हर पंक्ति को एक तारीख़-अंकित झलक मानें, कोई तय विवरण नहीं।
ढांचे, तुलना में
| लैब (ढांचा) | मौजूदा संस्करण / तारीख़ | ट्रैक किए गए जोखिम-क्षेत्र | सीमा / स्तर संरचना | सीमा पार होने पर क्या होता है |
|---|---|---|---|---|
| Anthropic — Responsible Scaling Policy | v3.4, 8 जुलाई, 2026 से प्रभावी | ग़ैर-नवीन CBRN उत्थान; नवीन CBRN उत्थान; उच्च-दांव तोड़फोड़; स्वचालित AI R&D त्वरण | क्षमता/उपयोग-सीमा तालिका; स्थिर ASL-2/ASL-3/ASL-4 स्तर v3.0 पुनर्लेखन में हटाए गए (पुराने ASL लेबल केवल पहले से मौजूद वर्तमान नियंत्रणों के लिए बनाए रखे गए) | सार्वजनिक, ग़ैर-बाध्यकारी Frontier Safety Roadmap, पिछले प्रदर्शन के विरुद्ध श्रेणीबद्ध, साथ में हर 3–6 महीने में बाहरी समीक्षा वाली Risk Reports — कोई बिना-शर्त रोक नहीं |
| OpenAI — Preparedness Framework | v2, 15 अप्रैल, 2025 | जैविक और रासायनिक, साइबर-सुरक्षा, AI आत्म-सुधार (ट्रैक किए गए); दीर्घ-सीमा स्वायत्तता, सैंडबैगिंग, स्वायत्त प्रतिकृति और अनुकूलन, सुरक्षा-उपायों को कमज़ोर करना, न्यूक्लियर और रेडियोलॉजिकल (शोध-श्रेणियां, अभी पूर्ण मानदंड नहीं); अनुनय स्पष्ट रूप से बाहर रखा गया | दो स्तर: High और Critical | High: तैनाती से पहले सुरक्षा-उपाय ज़रूरी। Critical: विकास के दौरान सुरक्षा-उपाय ज़रूरी; विकास को पूरी तरह रोक सकता है। आंतरिक Safety Advisory Group सिफ़ारिश करता है; CEO/नामित व्यक्ति फ़ैसला करता है; बोर्ड की Safety and Security Committee निगरानी करती है |
| Google DeepMind — Frontier Safety Framework | v3.1, 17 अप्रैल, 2026 | CBRN; साइबर; हानिकारक हेरफेर (“खोजी और आगे शोध के अधीन” चिह्नित); ML R&D और मिसअलाइनमेंट (v3.1 में एक क्षेत्र में मिलाए गए) | Critical Capability Levels (CCL) साथ में निचली-सीमा वाले Tracked Capability Levels (TCL, v3.0/3.1 में नए); Security Levels SL1–SL4 शब्दावली के रूप में इस्तेमाल, अनुपालन-मानक के रूप में नहीं | कोई “अलर्ट सीमा” CCL तक पहुंचने से पहले एक औपचारिक क्षमता-आकलन ट्रिगर करती है; किसी CCL तक पहुंचने के लिए बाहरी तैनाती से पहले एक अतिरिक्त सुरक्षा-मामला और शासन-मंज़ूरी ज़रूरी (और, विशेष रूप से ML R&D CCL के लिए, उच्च-जोखिम आंतरिक तैनाती से पहले भी) |
| Meta — Advanced AI Scaling Framework | v2, 3 फ़रवरी, 2025 (“Frontier AI Framework” v1.1 से नाम बदला; लगभग अप्रैल 2026 में प्रतिस्थापित) | रासायनिक और जैविक; साइबर-सुरक्षा; नियंत्रण की हानि (v2 में जोड़ा गया) | “किसी ख़तरा-परिदृश्य की ओर उत्थान का स्तर,” कोई स्थिर स्तर-पैमाना नहीं | अगर गंभीर जोखिम कम न किया जा सके: मॉडल को बाहरी रूप से तैनात नहीं करेगी या उसका विकास जारी नहीं रखेगी |
| xAI — Frontier Artificial Intelligence Framework (FAIF) | 30 जून, 2026 से प्रभावी (पहले के Risk Management Framework का स्थान लिया, जो आख़िरी बार 20 अगस्त, 2025 को अपडेट हुआ था) | CBRN; आक्रामक साइबर-सुरक्षा; नियंत्रण की हानि; हानिकारक हेरफेर | कम-से-कम सालाना पूर्ण प्रणालीगत जोखिम-आकलन; कोई स्थिर स्तर-पैमाना नहीं | पूरे दस्तावेज़ में सशर्त भाषा (“हम कर सकते हैं,” “अगर हम तय करें कि यह उचित है”); साथियों के समकक्ष कोई स्पष्ट विकास-रोक ट्रिगर नहीं |
| Microsoft — Frontier Governance Framework | फ़रवरी 2026 अपडेट (v1 फ़रवरी 2025 में था) | CBRN हथियार; आक्रामक साइबर-संक्रियाएं; उन्नत स्वायत्तता; नियंत्रण की हानि और हानिकारक हेरफेर (फ़रवरी 2026 में जोड़ा गया) | दो-चरण: कम-से-कम हर 6 महीने में स्वचालित “अग्रणी संकेतक” बेंचमार्क जांच, जो Low/Medium/High/Critical रेटिंग वाले गहरे आकलन तक बढ़ती है | “अगर… हम किसी ऐसे जोखिम की पहचान करते हैं जिसे हम पर्याप्त रूप से कम नहीं कर सकते, तो हम विकास और तैनाती को तब तक रोक देंगे जब तक शमन-प्रथाएं जोखिम का सामना करने के लिए विकसित न हो जाएं” — सभी छह में सबसे प्रत्यक्ष रोक-प्रतिबद्धता |
सबसे महत्वपूर्ण बदलाव: Anthropic का बिना-शर्त रोक से हटना
Anthropic की RSP के पास छह में सबसे लंबा सार्वजनिक इतिहास है, और इसका सबसे हालिया संरचनात्मक बदलाव 2026 में फ्रंटियर सुरक्षा-ढांचों के बीच सबसे ज़्यादा चर्चित घटनाक्रम है। 19 सितंबर, 2023 को प्रकाशित संस्करण 1.0 ने AI Safety Level (ASL) व्यवस्था पेश की — ASL-2, ASL-3, ASL-4 — जिनमें से हर एक को आवश्यक नियंत्रणों की एक विशिष्ट, स्थिर सूची से परिभाषित किया गया था, साथ में एक पक्की प्रतिबद्धता: Anthropic किसी सीमा से आगे तब तक प्रशिक्षण नहीं देगी जब तक सुरक्षा-उपाय पहले से पर्याप्त साबित न हो चुके हों। संस्करण 2.0 (अक्टूबर 2024), 2.1 (मार्च 2025), और 2.2 (मई 2025) ने उस संरचना को विस्तारित किया और CBRN सीमा जोड़ी।
24 फ़रवरी, 2026 से प्रभावी संस्करण 3.0 ने नीति को फिर से लिखा। Anthropic ने स्थिर ASL स्तरों की जगह एक क्षमता/उपयोग-सीमा तालिका रखी, और अपना तर्क सीधे एक परिशिष्ट में समझाया — कंपनी के अपने शब्द कि उसने विशिष्ट, मद-दर-मद नियंत्रण-सूचियों को क्यों छोड़ा, नीचे एक पंजीकृत उद्धरण के रूप में दिखते हैं। पुरानी पक्की रोक की जगह, v3.0 ने दो नए उपकरण पेश किए: एक सार्वजनिक, ग़ैर-बाध्यकारी Frontier Safety Roadmap जिसे खुले तौर पर Anthropic के अपने पिछले प्रदर्शन के विरुद्ध श्रेणीबद्ध किया जाता है, और हर तीन से छह महीने में प्रकाशित होने वाली Risk Reports जिनकी समीक्षा कम-से-कम एक जांचे गए, बाहरी, टकराव-मुक्त समीक्षक द्वारा होती है। Anthropic का दस्तावेज़ स्पष्ट रूप से कहता है कि यह एकतरफ़ा, निरपेक्ष-जोखिम रुख़ से एक सशर्त और प्रतिस्पर्धी-निर्भर रुख़ की ओर एक जान-बूझकर किया गया बदलाव है: एक नामित परिशिष्ट “Anthropic आगे” और “प्रतिस्पर्धियों के पास मज़बूत सुरक्षा-उपाय हैं” जैसे परिदृश्य बताता है, जिनके तहत कंपनी की अपनी प्रतिबद्धताएं बदल जाती हैं। संस्करण 3.1 (2 अप्रैल), 3.2 (29 अप्रैल), 3.3 (26 मई), और 3.4 (8 जुलाई, 2026, मौजूदा) ने तब से विवरण संशोधित किए हैं — सबसे हाल में स्वचालित-R&D सीमा को संकुचित करते हुए और आंतरिक Risk Report वितरण को व्यापक बनाते हुए — बिना पहले वाली पक्की रोक को बहाल किए।
नीति के इर्द-गिर्द शासन-व्यवस्था इन संस्करणों में स्थिर बनी रही है: एक नामित Responsible Scaling Officer, एक अनुपालन-न-करने की रिपोर्टिंग-चैनल, और एक वार्षिक तीसरे-पक्ष प्रक्रियात्मक अनुपालन-समीक्षा जिसे Anthropic ख़ुद “प्रक्रियात्मक अनुपालन की जांच, सारगर्भित परिणामों की नहीं” के रूप में बताती है — एक अंतर जिस पर ध्यान देना ज़रूरी है, क्योंकि इसका मतलब है कि ऑडिट यह पुष्टि करता है कि प्रक्रिया का पालन हुआ, यह नहीं कि परिणामी फ़ैसले सही थे।
यह बदलाव कंपनी के बाहर तुरंत एक विश्वसनीयता-संबंधी घटना के रूप में दर्ज हुआ। METR के नीति-निदेशक Chris Painter ने Anthropic की अनुमति से एक शुरुआती मसौदे की समीक्षा की और, Risk Reports की बढ़ी हुई पारदर्शिता का स्वागत करते हुए भी, रिपोर्टरों को नीचे उद्धृत सीधा आकलन दिया।
बाक़ी पांच ढांचे कहां मिलते और अलग होते हैं
Microsoft का Frontier Governance Framework Anthropic के नए सशर्त रुख़ से सबसे सीधा विरोधाभास है: इसकी रोक-प्रतिबद्धता, जो ऊपर तालिका में और नीचे पूरी तरह उद्धृत है, ऊपर से बिना-शर्त है, जो केवल Microsoft के अपने इस आकलन से बंधी है कि किसी जोखिम को पर्याप्त रूप से कम नहीं किया जा सकता — Anthropic के परिशिष्ट A जैसा कोई प्रतिस्पर्धी-निर्भर परिदृश्य-अपवाद नहीं।
Meta का Advanced AI Scaling Framework अपने संकुचित मामले के लिए इसी तरह की बिना-शर्त प्रतिबद्धता करता है: अगर कोई मॉडल Meta की “गंभीर जोखिम सीमा” तक पहुंचता है और उस जोखिम को कम नहीं किया जा सकता, तो Meta कहता है कि वह मॉडल को बाहरी रूप से तैनात नहीं करेगी या उसका विकास जारी नहीं रखेगी। Meta स्थिर स्तर-पैमाने के बजाय “किसी ख़तरा-परिदृश्य की ओर उत्थान का स्तर” इस्तेमाल करता है, लेकिन अंतर्निहित क्षेत्र — रासायनिक/जैविक जोखिम, साइबर-सुरक्षा, और नियंत्रण की हानि (Meta के v2 में जोड़ा गया) — लैब्स के बीच उससे कहीं ज़्यादा साझा निकलते हैं जितना हर ढांचे का अलग प्रकाशन बताता है। OpenAI का अपना Preparedness Framework v2 एक फ़ुटनोट में साफ़ कहता है कि उसकी Capability Reports और Safeguards Reports “Anthropic की अपडेट की गई RSP के समानांतर” हैं और उसके सीमा-मानदंड “आंशिक रूप से Meta के हालिया Frontier AI Framework से प्रभावित थे” — दस्तावेज़ों के एक ऐसे समूह में लैब-पार अभिसरण की एक दुर्लभ स्वीकृति जो अन्यथा ऐसे पढ़ती है जैसे हर एक अलग-थलग लिखा गया हो।
OpenAI की अपनी दो-स्तरीय संरचना सबसे कठिन द्वार — विकास को ही संभावित रूप से रोकना — केवल Critical स्तर पर रखती है, और तब भी फ़ैसले को एक आंतरिक Safety Advisory Group से गुज़ारती है जिसकी सिफ़ारिश को OpenAI का CEO या कोई नामित व्यक्ति पलट सकता है, जिसमें बोर्ड की अपनी Safety and Security Committee (उसी CEO द्वारा सह-नेतृत्व की गई) उस पलटाव की निगरानी करती है। यह ढांचा जुलाई 2026 में व्यवहार में लागू किया गया: OpenAI के GPT-5.6 System Card ने अपने छोटे, तेज़ Sol, Terra, और Luna मॉडलों को साइबर-सुरक्षा और जैविक व जैव-रासायनिक जोखिम दोनों में High क्षमता नामित किया — किसी परिवार के छोटे मॉडलों को यह पदनाम मिलने की पहली बार — जिसने नए एक्टिवेशन-क्लासिफ़ायर, रीयल-टाइम आउटपुट-ब्लॉकिंग, और लगभग 700,000 GPU-घंटे के स्वचालित रेड-टीमिंग को ट्रिगर किया (OpenAI, GPT-5.6 डिप्लॉयमेंट सेफ़्टी पेज)। यह OpenAI का अपने ही अनुपालन का अपना विवरण है, कोई स्वतंत्र ऑडिट नहीं।
Google DeepMind का Frontier Safety Framework फिर से अलग ढंग से काम करता है: द्विआधारी स्तर-पार करने के बजाय, किसी “अलर्ट सीमा” का मक़सद है किसी Critical Capability Level तक वाकई पहुंचने से पहले एक औपचारिक क्षमता-आकलन ट्रिगर करना, और किसी तक पहुंचने के लिए बाहरी तैनाती से पहले एक अतिरिक्त सुरक्षा-मामला और शासन-मंज़ूरी ज़रूरी है — जिसे विशेष रूप से ML R&D क्षेत्र के लिए, उच्च-जोखिम आंतरिक तैनाती तक भी बढ़ाया गया है (DeepMind, Frontier Safety Framework v3.1)। किसी लैब द्वारा सार्वजनिक रूप से अपने ही ढांचे की सीमाएं बताने का सबसे स्पष्ट उदाहरण: उन मॉडलों के लिए DeepMind का अनुशंसित Security Level 4, जो पूरी Google AI शोध-टीम के काम को पूरी तरह स्वचालित कर सकते हैं, इस स्पष्ट टिप्पणी के साथ आता है कि इसे “पूरे फ्रंटियर AI क्षेत्र द्वारा अपनाया जाना चाहिए” — DeepMind अपने ही प्रकाशित दस्तावेज़ में यह कह रहा है कि उस क्षमता-स्तर पर किसी एक कंपनी के नियंत्रण पर्याप्त नहीं हैं।
xAI का FAIF इस आयाम पर तुलनात्मक रूप से पतला है। अपने चार क्षेत्रों में, सशर्त भाषा लगभग स्थिर है — “हम कर सकते हैं,” “अगर हम तय करें कि यह उचित है” — और दस्तावेज़ में OpenAI के Critical स्तर या Meta की “तैनात नहीं करेगी” वाली भाषा के समकक्ष कोई तैनाती-रोकने वाली प्रतिबद्धता नहीं है (xAI, Frontier Artificial Intelligence Framework)। इसने एक पहले के Risk Management Framework का स्थान लिया, जो ख़ुद xAI की अपनी बताई समय-सारिणी से महीनों पीछे प्रकाशित हुआ था — एक ऐसा पैटर्न जिसका दस्तावेज़ीकृत इतिहास है, जो आगे शामिल है।
इन छह से आगे प्रकाशित फ्रंटियर-लैब नीतियों की एक व्यापक सूची के लिए, METR एक तुलना बनाए रखता है (METR, “Common Elements of Frontier AI Safety Policies”; सूची) जो बारह लैब्स को कवर करती है। यह मुख्य रूप से एक श्रेणीबद्ध स्कोरकार्ड के बजाय एक संरचनात्मक सूची के रूप में काम करता है — श्रेणीबद्ध तुलना के लिए, अगला खंड देखें।
दावे बनाम व्यवहार
ऊपर सब कुछ यह बताता है कि छह कंपनियां क्या करने की बात कहती हैं। क्या उन्होंने वाकई ऐसा किया है, यह एक अलग, और ज़्यादा महत्वपूर्ण सवाल है, और उपलब्ध सबूत ढांचों की तुलना में काफ़ी कम चापलूस हैं।
सबसे उपयोगी अकेली स्वतंत्र जांच है SaferAI Frontier Risk Management Tracker, जो किसी भी लैब के स्व-रिपोर्ट किए गए ढांचे से अलग एक वाकई स्वतंत्र रेटिंग है। यह बारह कंपनियों को — केवल ऊपर तुलना की गई छह को नहीं — चार आयामों पर श्रेणीबद्ध करता है: Risk Identification, Risk Analysis & Evaluation, Risk Treatment, और Risk Governance। इसके जुलाई 2026 अपडेट तक, 100% में से समग्र स्कोर थे: Anthropic 35% (समग्र रूप से सबसे ऊंचा, और विशेष रूप से Risk Governance पर 50% के साथ सबसे मज़बूत), OpenAI 34%, Microsoft 33%, Meta 33%, G42 24%, Google DeepMind 20%, xAI 18%, Amazon 18%, NVIDIA 16%, Magic 11%, Naver 10%, और Cohere 8% (सबसे कम) (SaferAI Frontier Risk Management Tracker)। SaferAI का अपना यह मानदंड कि अगर हर कंपनी क्षेत्र में कहीं भी पाई जाने वाली सबसे मज़बूत मौजूदा प्रथा अपनाए तो मौजूदा सर्वश्रेष्ठ अभ्यास क्या पैदा करेगा, नीचे उद्धृत है — और यह 100% के आस-पास भी नहीं है। समीक्षा की गई कोई भी लैब, अग्रणी सहित, उसके नज़दीक नहीं है जिसे SaferAI पर्याप्त मानता है।
OpenAI के Preparedness Framework को सीधे बाहरी शिक्षाविदों द्वारा जांचा गया है, न कि उसे जस-का-तस मान लिया गया। Coggins, Saeri, Daniell, Ruster, Liu, और Davis एक “affordances” ढांचा लागू करते हैं — यह अलग करते हुए कि कोई नीति-दस्तावेज़ क्या मांगता है, क्या अनुरोध करता है, क्या प्रोत्साहित करता है, और केवल क्या अनुमति देता है — और तीन निष्कर्षों पर पहुंचते हैं। पहला, यह ढांचा MIT AI Risk Repository के 24-उपक्षेत्र वर्गीकरण में केवल एक अल्पसंख्यक जोखिम-उपक्षेत्रों के मूल्यांकन का अनुरोध करता है, और किसी का भी मूल्यांकन नहीं मांगता। दूसरा, यह गंभीर नुकसान के लिए “Medium” क्षमता वाले सिस्टमों की तैनाती को प्रोत्साहित करता है — OpenAI की अपनी परिभाषा हज़ारों लोगों की मृत्यु या गंभीर चोट, या सैकड़ों अरब डॉलर के आर्थिक नुकसान को कवर करती है — यह OpenAI द्वारा अपने o1 मॉडल की तैनाती का हवाला देते हुए, इसके बावजूद कि उसकी जैविक/रासायनिक और अनुनय क्षमता को Medium रेट किया गया था। तीसरा, यह OpenAI के CEO को Safety Advisory Group की सुरक्षा-उपाय सिफ़ारिशों को पलटने की अनुमति देता है, जबकि वही CEO उस बोर्ड-समिति का सह-नेतृत्व करता है जिसे उस विवेकाधिकार की निगरानी करनी है — एक संरचनात्मक हित-टकराव का निष्कर्ष, कोई काल्पनिक नहीं।
Google DeepMind के अपने सुरक्षा-मामले का बाहरी ऑडिट हुआ है — छह लैब्स में, किसी विशिष्ट सुरक्षा-प्रासंगिक दावे को लैब की आंतरिक प्रक्रिया के बजाय नामित, प्रमाणित बाहरी समीक्षकों द्वारा जांचे जाने का सबसे स्पष्ट उदाहरण। DeepMind का यह आंतरिक तर्क कि उसके मॉडलों में “साज़िश” (scheme) करने की क्षमता नहीं है, Barrett, Campos Zabala, Fillingham, Siddique, Walpole, Bloomfield, और Papadatos द्वारा एक औपचारिक आश्वासन-कार्यप्रणाली का उपयोग करते हुए समीक्षा की गई। उनके आकलन ने DeepMind को वास्तविक कार्यप्रणाली-जुड़ाव और पारदर्शी तर्क का श्रेय दिया, लेकिन नीचे उद्धृत बात पाई — यह एक निष्कर्ष है इंजीनियरिंग-अभ्यास और वास्तव में प्रस्तुत सबूत के बीच की दूरी के बारे में, बुरी नीयत का कोई आरोप नहीं।
xAI किसी ढांचे के दावों के घटनाओं द्वारा सीधे खंडित होने का सबसे स्पष्ट मामला देता है, और यह दो बार हुआ। पहला, प्रक्रिया पर: xAI के फ़रवरी 2025 के मसौदा ढांचे ने “तीन महीनों के भीतर” एक अंतिम संस्करण का वादा किया था — लगभग 10 मई, 2025 की समय-सीमा। यह समय-सीमा xAI की ओर से किसी स्वीकृति के बिना गुज़र गई, जिसने निगरानी-समूह The Midas Project को नीचे उद्धृत पैटर्न बताने के लिए प्रेरित किया। अंतिम FAIF का पूर्ववर्ती 20 अगस्त, 2025 तक प्रकाशित नहीं हुआ — तीन महीने से ज़्यादा देर से। दूसरा, सार पर: उसी दिन, xAI ने ग़लती से लाखों उपयोगकर्ता-बातचीत प्रकाशित कर दीं, और Elon Musk ने अलग से स्वीकार किया कि किसी इंजीनियर ने कंपनी का पूरा कोड-रिपॉज़िटरी डाउनलोड कर लिया था — जो उसी दस्तावेज़ के अपने लिखित सुरक्षा-दावों को सीधे कमज़ोर करता है। AI Lab Watch ने यह भी दस्तावेज़ीकृत किया कि UK AI Security Institute को तीसरे-पक्ष मूल्यांकनकर्ता का श्रेय प्रकाशन के एक दिन बाद, बिना किसी स्पष्टीकरण के, चुपचाप Grok 4 मॉडल कार्ड से हटा दिया गया (AI Lab Watch, “xAI’s new safety framework is dreadful”)।
इस खंड की हर प्रविष्टि कोई दस्तावेज़ीकृत विफलता नहीं है। OpenAI के GPT-5.6 की High-क्षमता वाली पदनाम, जो ऊपर बताई गई, को सबसे अच्छे ढंग से इस रूप में पढ़ा जा सकता है कि कोई ढांचा काफ़ी हद तक जैसा लिखा गया वैसा ही लागू किया गया — लेकिन यह अब भी OpenAI की अपनी स्व-रिपोर्ट है; इसके पीछे के रेड-टीमिंग या क्लासिफ़ायर-प्रभावशीलता के दावों का कोई स्वतंत्र सत्यापन इसे लिखे जाने तक नहीं मिला।
इस पेज का उपयोग कैसे करें
यहां नामित हर ढांचा अपनी ही समय-सारिणी पर संशोधित होता है, आमतौर पर किसी चेंजलॉग प्रविष्टि से ज़्यादा सार्वजनिक सूचना के बिना। ऊपर दिए संस्करण-संख्या और प्रभावी तारीख़ें यह जांचने का सबसे तेज़ तरीक़ा हैं कि कोई दी गई पंक्ति अब भी मौजूदा है: Anthropic की RSP v3.4 (8 जुलाई, 2026) पर है, OpenAI का Preparedness Framework 15 अप्रैल, 2025 से v2 पर है और इसे लिखे जाने तक कोई v2.1 नहीं है, DeepMind का Frontier Safety Framework v3.1 (17 अप्रैल, 2026) पर है, Meta का Advanced AI Scaling Framework v2 (3 फ़रवरी, 2025, तब से प्रतिस्थापित) पर है, xAI का FAIF 30 जून, 2026 से प्रभावी हुआ, और Microsoft का Frontier Governance Framework आख़िरी बार फ़रवरी 2026 में अपडेट हुआ। अगर आपके इसे पढ़ने तक इनमें से कोई भी संख्या बदल गई है, तो तालिका को विशेष रूप से उस पंक्ति पर पुराना मानें।
इन ढांचों के पीछे क्षमता-परीक्षण और सुरक्षा-मामले के तर्क वास्तव में कैसे काम करते हैं — और उनकी अपनी सीमाएं क्या हैं — इसके लिए देखें फ्रंटियर मूल्यांकन, सुरक्षा-मामले, और घटना-रिपोर्टिंग। उन वास्तविक-दुनिया की घटनाओं, खुलासों, और नज़दीकी चूकों के कालानुक्रमिक रिकॉर्ड के लिए जिन्हें ये ढांचे रोकने या पकड़ने के लिए बने हैं, देखें AI घटनाओं की समय-रेखा।