04 مخارج الطوارئ
مخارج الطوارئ الموجودة فعليًا
تحدد الضوابط التقنية والمؤسسية ما إذا كانت السيناريوهات الخطيرة في الفصل 02 ستصبح أكثر احتمالًا أو أقل؛ ولا يمكن للاستعداد الأسري أن يحل محلها.
روافع السلامة التقنية
- بحث قابلية التفسير. فحص تمثيلات النماذج وحساباتها الداخلية كأحد المكمّلات لتقييمات السلوك، وضوابط الوصول، ومراقبة النشر.
- الإشراف القابل للتوسّع. تقنيات — كالمناظرة، ونمذجة المكافأة التكرارية، والتعميم من الضعيف إلى القوي — يُقصد بها مساعدة مشرفين أقل قدرة على الإشراف على أنظمة أكثر قدرة.
- بحث القابلية للتصحيح. دراسة كيف يمكن للأنظمة أن تظل متقبّلة للتصحيح والتعديل والإيقاف المشروعَين؛ ولم يُثبَت بعد أي حل متين عبر النطاقات المختلفة.
- حوكمة الحوسبة. ضوابط تصدير خاصة بكل ولاية قضائية، ومراقبة للبنية التحتية، وعتبات تُستخدم كمؤشرات غير كاملة على القدرة — لا كتعريف للذكاء العام الاصطناعي أو للسلامة.
دافع الرئيس التنفيذي لشركة Anthropic عن الأولى من هذه النقاط في مقالته لعام 2025 حول الموضوع:
Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.
The Urgency of Interpretability, Primary source
الروافع المؤسسية
يهم التنسيق الدولي لأن الضوابط الأحادية الجانب يمكن أن تغيّر حوافز السلامة والموقع التنافسي معًا. لم يعد المشهد السياساتي طوعيًا بالكامل: يفرض قانون الذكاء الاصطناعي للاتحاد الأوروبي واجبات ملزمة على مزوّدي الخدمة المشمولين بنطاقه، في حين تظل أطر سلامة المختبرات والتزامات القمم طوعية إلى حد كبير. لا توجد حاليًا أي معاهدة عالمية ملزمة للحد من تسلّح النماذج المتقدمة.
كانت نقطة الانطلاق الدولية المبكرة الإعلانَ غير الملزم الذي أقرّته 28 دولة والاتحاد الأوروبي في أول قمة عالمية لسلامة الذكاء الاصطناعي:
28 nations and the European Union commits signatories to AI that is designed, developed, deployed and used safely and responsibly.
GOV.UK, Signed statement
- تقييم سابق للنشر يتناسب مع المخاطر للقدرات الخطيرة قبل الإصدار غير المقيّد.
- الإبلاغ عن الحوادث بما يتيح للجهات التنظيمية والمطوّرين التعلّم من الإخفاقات الجسيمة والحالات التي كادت أن تقع.
- قواعد مسؤولية تراعي عناصر السيطرة والمعرفة والسببية والقدرة على منع الضرر.
ماذا يمكن لتقني بمفرده أن يفعل
يمكن للقراء التأثير في السياسات بصفتهم ناخبين وعمالًا وباحثين وعملاء ومستثمرين وأعضاءً في منظمات مدنية. تشمل الخيارات العملية: المساهمة في بحث قابلية التفسير والمواءمة أو تمويله؛ ودفع ممارسات السلامة داخل مؤسستك إن كنت تنشر أنظمة ذكاء اصطناعي في الإنتاج؛ ودعم البنية التحتية للإبلاغ والتقييم المذكورة أعلاه بدلًا من معاملتها كعبء تنظيمي؛ والتحقق من مصدر الادعاءات المُقنِعة والأدلة الداعمة لها بدلًا من افتراض التلاعب الآلي أو الإجماع الحقيقي.