En önemli sonuç yayılmadır
Son derece yetenekli veya insan düzeyinde yapay zekâ için tahminler, bazı araştırmacıların mevcut yöntemlerin bunu hiç üretebileceğinden şüphe duymasıyla birlikte, birkaç yıldan onlarca yıla kadar uzanıyor. Bu anlaşmazlık, paylaşılan bilimsel bir model etrafındaki küçük bir hata payı değildir. Tahminciler, neyin AGI sayıldığı, hangi teknik adımların kaldığı, hesaplama ve veri gibi girdilerin ne kadar hızlı büyüyebileceği ve ilerlemenin düzgün devam edip etmeyeceği konusunda anlaşmazlığa düşüyor. Bu nedenle herhangi bir zaman çizelgesi bir “AGI geri sayımı” olarak değil, belirtilen bir tanım altında tarihli bir tahmin olarak sunulmalıdır.
Demis Hassabis, kesin atfın neden önemli olduğuna dair yararlı bir örnek sunuyor. Mart 2025 tarihli bir CNBC röportajında, Google DeepMind CEO’su, insan düzeyinde yapay zekânın beş ila on yıl içinde gelebileceğini söyledi. AGI’ye ilişkin anlamlı kanıtın “yıl içinde” geleceğini söylemedi (CNBC röportajı). Doğru şekilde alıntılanan tahmin bile sorular bırakıyor: hangi görevlerde, ne kadar güvenilirlikle ve ne kadar özerklikle insan düzeyi? Alıntı, bir uzmanın yargısını kaydeder, ölçülen bir olasılığı değil.
Karıştırılmaması gereken dört tür tahmin
Laboratuvar lideri ifadeleri görünürdür ve frontier sistemlere doğrudan maruz kalmayla bilgilendirilir, ancak tarafsız ölçümler değildir. Yöneticiler, deneyler hakkında değerli özel bilgiye sahiptir, ancak aynı zamanda sermaye, yetenek, müşteri ve siyasi ilgi için rekabet eden kuruluşlara liderlik eder. İfadeleri şirkete özgü tanımlar kullanabilir ve nadiren eksiksiz bir tahmin modeli ortaya koyar.
Araştırmacı anketleri birçok görüşü toplar ve uzman görüşünün dağılımını ortaya çıkarır. 2024’te yayımlanan 2023 Yapay Zekâda İlerleme Uzman Anketi, 2.778 araştırmacıyı topladı ve makinelerin her mümkün görevde insanları geçmesi için geniş bir tahmin aralığı bildirdi; yazarlar ayrıca önemli anlaşmazlığı ve soru ifadesine duyarlılığı vurguladı (Grace ve diğerleri, 2024). Anketler bir anda inançları tanımlar. Bu inançları doğrulamaz veya yanıtlayanların bir tanımı paylaştığını garanti etmez.
Metaculus gibi tahmin platformları tahminleri sürekli olarak toplar. Medyanları anketlerden daha hızlı güncellenebilir, ancak sonuç tam çözüm kriterlerine ve katılımcı havuzuna bağlıdır. “Zayıf genel yapay zekâ,” “dönüştürücü yapay zekâ” ve “AGI” farklı sorulardır. Bir piyasa veya topluluk medyanı, site çapında bir son tarihe dönüştürülmek yerine, alınma tarihi, soru ifadesi, aralığı ve çözüm koşullarıyla birlikte gösterilmelidir.
Model tabanlı projeksiyonlar, hesaplama, gösterge testi performansı, algoritmik verimlilik veya ajanların tamamlayabileceği görevlerin uzunluğundaki eğilimleri ekstrapole eder. Bunlar varsayımları görünür kılar, ki bu değerlidir, ancak bir gösterge testi doyduğunda, bir kaynak kısıtlaması bağladığında veya yeni bir paradigma eğilimi değiştirdiğinde ekstrapolasyon başarısız olabilir. Bir eğri, geçmiş ölçümler hakkında kanıttır; uzatılması koşullu bir tahmindir.
Mevcut yetenek eğilimleri gerçekte ne gösteriyor
Hızlı iyileşmenin gerçek kanıtı var. Stanford AI Endeksi, düşen çıkarım maliyetlerini ve zorlu gösterge testlerinde yükselen puanları belgeliyor, aynı zamanda zor değerlendirmelerin çözülmediğini ve standartlaştırılmış sorumlu yapay zekâ değerlendirmesinin düzensiz olduğunu gösteriyor (Stanford AI Endeksi 2025). METR, frontier ajanların belirli bir başarı olasılığında tamamladığı yazılım odaklı görevlerin insan uzmanı süresinin hızla arttığını bildiriyor (METR zaman ufukları). Bunlar, seçilmiş sistemler ve testler hakkında gözlemlerdir, yaklaşan bir AGI tarihinin doğrudan gözlemleri değildir.
METR’nin metriği özellikle yanlış ifade edilmesi kolaydır. Birkaç saatlik bir yüzde 50 zaman ufku, METR’nin görev takımında, uyarlanmış modelin bir insan uzmanının o kadar zaman alan görevleri tamamlama olasılığının yüzde 50 olduğunu öngördüğü anlamına gelir. Yapay zekânın o kadar saat boyunca özerk olarak çalıştığı anlamına gelmez. Görevler öncelikle yazılım mühendisliği, makine öğrenmesi ve siber güvenliktir; alışılmadık derecede kendi kendine yeterli ve nesnel olarak notlandırılabilirdir; on altı saatin üzerindeki tahminler şu anda güvenilmez olarak tanımlanmaktadır; ve gerçek işler çok daha dağınıktır. METR araştırmacıları, hata paylarının kabaca iki kat bir faktörü kapsayabileceği ve alan farklılıklarının büyüklük mertebelerini kapsayabileceği konusunda uyardı (METR sınırlamaları notu).
Bu sonuçlar daha dar bir sonucu destekler: bazı dijital görev tamamlama biçimleri hızla iyileşiyor. Kendi başlarına, bir sistemin ne zaman güvenilir bir bilim insanı, yönetici, bakıcı, siyasi karar verici veya insan emeği için genel bir ikame haline geleceğini belirlemezler.
Makul tahminler neden farklılaşır
Erken bir gelişi bekleyen tahminciler genellikle ölçeklendirmenin devamlılığını, daha iyi akıl yürütme anı hesaplamasını, sentetik veriyi, araç kullanımını ve yapay zekâ destekli araştırmayı vurgular. Bu eğilimler birbirini güçlendirirse, ilerleme hızlanabilir. Ekonomik açıdan dönüştürücü sistemlerin insan zekâsının her özelliğini yeniden üretmesi gerekmediğini de savunabilirler; geniş dijital yetkinlik yeterli olabilir.
Daha uzun zaman çizelgeli tahminciler güvenilirliği, temellendirmeyi, sürekli öğrenmeyi, nedensel anlayışı, robotiği ve gösterge testleri ile açık uçlu çalışma arasındaki boşluğu vurgular. Ayrıca pratik kısıtlamalara işaret ederler: enerji, çipler, veri merkezi inşaatı, yüksek kaliteli veri, değerlendirme ve kurumların sistemleri güvenli bir şekilde dağıtma yeteneği. Bazıları mevcut büyük model yöntemlerinin ötesinde mimari ilerlemeler bekliyor. Bu konumların hiçbiri yalnızca güven veya kıdemle çözülemez.
Tanımlar başka bir görünür anlaşmazlık kaynağı yaratır. Uzaktan bilgisayar işinin çoğunu otomatikleştirebilen bir sistem, cisimleşmiş görevlerde başarısız olurken ekonomik olarak dönüştürücü olabilir. Geniş bir sınav bataryasında tipik insanların üzerinde puan alan bir model, bağımsız çalışmak için hâlâ çok güvenilmez olabilir. Bir tahminci her iki sistemi de AGI olarak adlandırabilir; başka biri kelimeyi gerçek dünyada sağlam insan-eşdeğeri öğrenme için ayırabilir.
Sorumlu bir zaman çizelgesi takipçisi nasıl sürdürülür
Yararlı bir takipçi, orijinal ifadeyi, konuşmacıyı, tarihi, kaynağı, tanımı ve tahmin aralığını korumalıdır. Kişisel bir tahmini kurumsal bir taahhütten ayırmalı, sonraki revizyonları kaydetmeli ve eski bir tahmini sessizce değiştirmemelidir. Toplu tahminler yalnızca bir medyan değil, belirsizlik aralıkları göstermelidir. Sayfa ayrıca potansiyel teşvikleri ve tahminin kamuya açık mı yoksa özel kanıta mı dayandığını açıklamalıdır.
Okuyucular beş soru uygulayabilir:
- Hangi sonuç tahmin ediliyor? AGI, insan düzeyinde yapay zekâ, görev otomasyonu veya süper zekâ?
- Hangi olasılık ve tarih bağlı? “Olabilir” bir medyan tahmin değildir.
- Tahmini hangi kanıt yönlendiriyor? Ölçeklendirme, bir anket, özel deneyler veya sezgi?
- Tahmincinin fikrini ne değiştirir? Olası bir çürütme olmayan bir tahmini değerlendirmek zordur.
- Puanlandı mı? Geçmiş tahminler son tarihlerinden sonra görünür kalmalıdır.
Pratik sonuç
Planlama, tek bir tarihi seçmeye bağlı olmamalıdır. Yakın vadeli zararlar ve fırsatlar, AGI’nin 2028’de, 2040’ta veya hiç gelmeyeceğine bakılmaksızın eylem gerektirir. Hükümetler ve kurumlar senaryo aralıkları kullanabilir: hızlı yetenek kazanımlarına hazırlanın, daha yavaş ilerleme altında yararlı kalan politikalar oluşturun ve daha güçlü koruyucu önlemler için ölçülebilir tetikleyiciler tanımlayın. Bu yaklaşım, tek bir tahminciye veya tek bir kuruma aşırı güvenmenin riskini azaltır ve karar vericilerin, hangi eylemlerin hem hızlı hem de yavaş ilerleme senaryoları altında hâlâ mantıklı kaldığını sormasını sağlar.
Belirsizliğin kendisi eyleme geçirilebilir. Pazarlama etiketleri yerine yetenekleri izlemeyi, değerlendirme ve dayanıklılığa yatırım yapmayı ve tahminleri sabit bir program üzerinde yeniden gözden geçirmeyi savunuyor. Bir zaman çizelgesi sayfası, hareket eden bir medyanı kaderi sayan bir saat gibi göstererek değil, tarihlerin ne kadar az şey kanıtladığını göstererek güven kazanır.