Turing’in gerçekte önerdiği şey
1950’de Alan Turing, makinelerin düşünüp düşünemeyeceğini sordu ve bu felsefi açıdan karmaşık soruyu hızla işlemsel bir soruyla değiştirdi. “Taklit oyunu”nda, bir insan sorgulayıcı bir kişiyle ve bir makineyle metin yoluyla iletişim kurdu ve hangisinin hangisi olduğunu belirlemeye çalıştı. Turing bunu, erişilemez bir içsel özden ziyade gözlemlenebilir davranış yoluyla makine zekâsını tartışmanın bir yolu olarak sundu (Turing, “Computing Machinery and Intelligence”).
Fikir derindi, ancak tanıdık “Turing testini geçiyor” ifadesi birçok seçimi gizler. Konuşma ne kadar uzun? Yargıç ne biliyor? Hangi konulara izin veriliyor? Kaç yargıç katılıyor ve hangi hata oranı başarı sayılıyor? Turing, tek bir resmi eşiği olan modern bir sertifikasyon programı kurmadı. Test bir düşünce deneyi ve araştırma dönüm noktasıdır, bir AGI düzenleyicisinin ölçüm aracı değildir.
Konuşma neden oyunlanması bu kadar kolay hale geldi
Taklit oyunu, belirli bir etkileşimde insan gibi görünen bir sistemi ödüllendirir. Bu, gerçek genişlik yoluyla elde edilebilir, ama aynı zamanda kaçamaklık, rol yapma, mizah, kasıtlı hatalar veya bir yargıcın beklentilerini istismar etme yoluyla da elde edilebilir. Erken sohbet botu ELIZA, 1960’larda insanların sığ konuşma örüntülerine kolayca anlayış yansıttığını gösterdi. Günümüzün dil modelleri çok daha tutarlı diyaloglar üretiyor, bu da antropomorfizmi daha da kolaylaştırıyor.
Kısa bir metin konuşmasını geçmek, güvenilir planlama, matematiksel doğruluk, bilimsel muhakeme, fiziksel dünya yetkinliği veya hatalardan kurtulma yeteneğini göstermez. Modelin yeni bir iş öğrenebileceğini, uzun bir proje boyunca hedefleri koruyabileceğini veya bir insana ne zaman ertelemesi gerektiğini tanıyabileceğini göstermez. Tersine, güçlü, sözel olmayan bir sistem, sıradan bir konuşmacıyı taklit etmede başarısız olurken bilimi veya lojistiği dönüştürebilir. İnsan benzerliği, sonuçlu makine yeteneği için ne gerekli ne de yeterlidir.
Test ayrıca zekâyı aldatmayla karıştırır. Bir sistem, kendisini dürüstçe bir makine olarak tanımladığı için cezalandırılabilir ve bir yargıcı aksine ikna etmek için manipüle ettiği için ödüllendirilebilir. Bu, kalibre edilmiş belirsizliğin, izlenebilirliğin ve dürüst açıklamanın genellikle sosyal makul görünürlükten daha önemli olduğu güvenlik değerlendirmesi için kötü bir uyumdur.
Tek bir testten bir değerlendirme portföyüne
Modern değerlendirme, zekâ çok boyutlu olduğu için birçok görev takımı kullanır. Bilgi ve akıl yürütme gösterge testleri konular arasında soruları test eder; kodlama değerlendirmeleri üretilen programları test durumlarına karşı çalıştırır; çok modlu testler metin, diyagram, görüntü, ses ve videoyu birleştirir; ajan gösterge testleri, modelleri gezinmek, yazılım kullanmak ve hedefleri tamamlamak zorunda oldukları etkileşimli ortamlara yerleştirir.
Her aile dar bir soruya yanıt verir. Örneğin MMLU, akademik ve mesleki çoktan seçmeli bilgiyi örnekler, ancak yüksek puanlar bir modelin bu meslekleri uygulayabileceğini kanıtlamaz. GAIA, asistanları akıl yürütme, araçlar ve birden çok adım gerektirebilecek gerçek dünya sorularında test eder (GAIA makalesi). OSWorld, bilgisayar kullanımı ajanlarını gerçek işletim sistemi uygulamaları genelinde değerlendirir (OSWorld makalesi). ARC-AGI, depolanmış bilgiyi yeniden üretmek yerine yeni görsel akıl yürütme görevlerine uyum sağlamaya odaklanır (ARC Prize gösterge testi). Bu değerlendirmeler farklı güçlü yönleri ve başarısızlık modlarını ortaya çıkarır; hiçbiri bir AGI dedektörü değildir.
Görev tamamlama çalışmaları bir zaman ve karmaşıklık boyutu ekler. METR, bir ajanın belirli bir başarı olasılığına sahip olduğu insan uzmanı görev süresini tahmin eder. Mevcut takımı öncelikle yazılım mühendisliği, makine öğrenmesi ve siber güvenliği kapsar ve kuruluş, “zaman ufku”nun insan zamanında ölçülen görev zorluğu olduğunu — bir yapay zekânın bağımsız olarak çalışabileceği süre değil — açıkça belirtir (METR metodolojisi). Ayrıca iyi belirlenmiş gösterge testi görevlerinin çoğu işten daha temiz olduğuna ve performansın alana göre keskin bir şekilde farklılaştığına dikkat çeker.
Güvenilirlik bir puanın anlamını değiştirir
Ortalama performans yüksek riskli kullanım için yeterli değildir. Yarısı zamanda başarılı olan bir sistem, araştırma için etkileyici olabilir ama tıpta, havacılıkta veya altyapıda kullanılamaz olabilir. Bu nedenle değerlendiricilerin başarı oranlarına, tekrarlanan denemelere, en kötü durum davranışına, belirsizlik aralıklarına ve dağılım kayması altında testlere ihtiyacı vardır. Bir modelin belirsiz olduğunu bilip bilmediğini, açıklama arayıp aramadığını ve kontrolü güvenli bir şekilde geri verip vermediğini ölçmelidirler.
Değerlendirme kurulumu, altta yatan model kadar önemlidir. Araç erişimi, istem ifadesi, bellek, örnekleme ayarları, çıkarım anı hesaplaması ve çevredeki ajan yazılımı sonuçları önemli ölçüde değiştirebilir. Bir puan, belirtilen bir tarihte test edilmiş bir sistem yapılandırmasına aittir. Bunu bir model adının zamansız bir özelliği olarak ele almak yanlış karşılaştırmaları teşvik eder.
Veri kirlenmesi başka bir sorundur. Kamuya açık gösterge testi soruları ve çözümleri eğitim verisinde görünebilir. Kelimesi kelimesine ezberleme olmasa bile, gösterge testi odaklı ince ayar, eşdeğer genelleme olmadan bir puanı iyileştirebilir. Daha iyi değerlendirmeler özel veya yeni oluşturulmuş görevler kullanır, olası maruziyeti belgeler ve sık sık yeniler. Bağımsız test, bir geliştiricinin yalnızca lehine sonuçları seçme riskini azaltır — ama ortadan kaldırmaz.
Güvenlik değerlendirmesi farklı sorular sorar
Yetenek değerlendirmesi, bir sistemin elverişli koşullar altında ne yapabileceğini ölçer. Güvenlik değerlendirmesi, kötüye kullanıldığında, strese sokulduğunda, aldatıldığında, çelişen talimatlar verildiğinde veya sonuçlu bir ortama yerleştirildiğinde ne yapabileceğini sorar. İlgili testler arasında biyolojik veya siber kötüye kullanıma yardım, manipülasyon, özerklik, koruyucu önlem kaçınma, aldatma ve kaynak edinme yeteneği yer alır. 2026 Uluslararası Yapay Zekâ Güvenliği Raporu, değerlendirmelerin sınırlı dış geçerlilik, hızlı eskime ve frontier sistemlere eksik erişimle karşı karşıya olduğunu vurguluyor (Uluslararası Yapay Zekâ Güvenliği Raporu 2026).
Kırmızı takımlar yaratıcı bir şekilde başarısızlıklar ararken, yapılandırılmış gösterge testleri karşılaştırma sağlar. Gerçek dünya izlemesi daha sonra yayın öncesi sonuçların gerçek kullanımı öngörüp öngörmediğini test eder. Olay raporlaması esastır çünkü hiçbir laboratuvar takımı her bağlamı sayamaz. Bir değerlendirme rejimi, sonuçları kararlara bağlamalıdır: ek koruyucu önlemler, kısıtlı araç erişimi, aşamalı yayın, dış inceleme veya tanımlanmış bir eşik aşıldığında bir dağıtım duraklaması.
Güvenilir bir AGI değerlendirmesi ne gerektirir
Google DeepMind’ın “Levels of AGI” çerçevesi, değerlendirmelerin hem performansı hem de genelliği kapsaması ve yeteneğin ifade edildiği insan-yapay zekâ etkileşimini dikkate alması gerektiğini savunuyor (DeepMind çerçevesi). Güvenilir bir değerlendirme, geniş alanlar, gerçekten yeni görevler, birden çok performans düzeyi ve net özerklik raporlaması gerektirir. Aktarımı, öğrenme verimliliğini, sağlamlığı, sosyal etkileşimi ve açık uçlu çalışmayı test eder — sadece sınav sorularını değil.
Ayrıca bağımsız tekrarlama ve düşmanca inceleme gerektirir. Geliştiriciler, tehlikeli ayrıntıları açığa çıkarmadan veya özel testleri tehlikeye atmadan iddiaları yorumlamak için yeterli metodolojiyi yayımlamalıdır. Sonuçlar temel modeli araçlardan ve iskeletten ayırmalı, başarısızlık örneklerini içermeli ve tek bir bileşik sayıyı metafizik bir hükme dönüştürmekten kaçınmalıdır.
Yerini alan şey bir gösterge paneli, bir bitiş çizgisi değil
Hiçbir modern test, AGI’ye evrensel olarak kabul edilmiş kapı hâline gelme anlamında Turing’in oyununun “yerini almadı.” Yerini alan şey bir portföydür: bilgi testleri, yeni akıl yürütme görevleri, etkileşimli ortamlar, görev ufku ölçümleri, alana özgü uzman incelemesi, tehlikeli yetenek değerlendirmeleri ve dağıtım kanıtı.
Bu yanıt, bir yargıcı kandıran bir makineden daha az teatral, ama daha kullanışlıdır. Doğru soru artık “Geçti mi?” değildir. Şudur: Bu sistem, hangi koşullar altında, ne kadar yardımla güvenilir bir şekilde ne yapabilir ve koşullar değiştiğinde ne olur? Tarihli kanıtın şeffaf bir gösterge paneli, herhangi bir tek bitiş çizgisinden daha iyi bir yetenek ve risk kılavuzu sağlar.