04 Çıkış yolları
Gerçekten var olan çıkış yolları
Teknik ve kurumsal kontroller, 02. bölümdeki ciddi senaryoların daha olası mı yoksa daha az olası mı hale geleceğini belirler; hane hazırlığı bunların yerini tutamaz.
Teknik güvenlik kaldıraçları
- Yorumlanabilirlik araştırması. Davranışsal değerlendirmelere, erişim kontrollerine ve dağıtım izlemesine bir tamamlayıcı olarak model temsillerinin ve iç hesaplamanın incelenmesi.
- Ölçeklenebilir gözetim. Daha az yetenekli denetleyicilerin daha yetenekli sistemleri denetlemesine yardımcı olmayı amaçlayan teknikler — tartışma, özyinelemeli ödül modelleme, zayıftan güçlüye genelleme.
- Düzeltilebilirlik araştırması. Sistemlerin meşru düzeltmeye, değişikliğe ve kapatılmaya nasıl açık kalabileceğinin incelenmesi; ölçeğe dayanıklı bir çözüm henüz gösterilmemiştir.
- Hesaplama yönetişimi. Yargı bölgesine özgü ihracat kontrolleri, altyapı izleme ve yetenek için kusurlu vekil göstergeler olarak kullanılan eşikler — AGI'nin veya güvenliğin bir tanımı olarak değil.
Anthropic'in CEO'su, bunlardan ilki için 2025 tarihli konuya ilişkin denemesinde savunuda bulundu:
Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.
The Urgency of Interpretability, Primary source
Kurumsal kaldıraçlar
Uluslararası koordinasyon önemlidir, çünkü tek taraflı kontroller hem güvenlik teşviklerini hem de rekabet konumunu değiştirebilir. Politika ortamı artık tamamen gönüllü değildir: AB Yapay Zekâ Yasası, kapsamdaki sağlayıcılara bağlayıcı yükümlülükler getirir; laboratuvar güvenlik çerçeveleri ve zirve taahhütleri ise büyük ölçüde gönüllü kalmaya devam eder. Şu anda bağlayıcı, küresel bir öncü model silah kontrolü anlaşması bulunmamaktadır.
Erken bir uluslararası başlangıç noktası, ilk küresel Yapay Zekâ Güvenliği Zirvesi'nde 28 ülke ve AB tarafından onaylanan bağlayıcı olmayan bildiriydi:
28 nations and the European Union commits signatories to AI that is designed, developed, deployed and used safely and responsibly.
GOV.UK, Signed statement
- Sınırsız kullanıma sunmadan önce tehlikeli yetenekler için riskle orantılı, dağıtım öncesi değerlendirme.
- Düzenleyicilerin ve geliştiricilerin ciddi hatalardan ve ucuz atlatmalardan ders çıkarmasını sağlayan olay bildirimi.
- Kontrolü, bilgiyi, nedenselliği ve zararı önleme becerisini hesaba katan sorumluluk kuralları.
Bireysel bir teknoloji uzmanının yapabilecekleri
Okuyucular, seçmen, çalışan, araştırmacı, müşteri, yatırımcı ve sivil toplum kuruluşu üyesi olarak politikayı etkileyebilir. Pratik seçenekler arasında yorumlanabilirlik ve hizalama araştırmalarına katkıda bulunmak veya bunları finanse etmek; üretimde yapay zekâ sistemleri konuşlandırıyorsanız kendi kuruluşunuz içinde güvenlik uygulamalarını teşvik etmek; yukarıdaki bildirim ve değerlendirme altyapısını düzenleyici bir sürtünme olarak görmek yerine desteklemek; ve ikna edici iddiaların arkasındaki kaynağı ve kanıtı, otomatik manipülasyon veya gerçek bir uzlaşı varsaymak yerine kontrol etmek yer alır.