Bu anlık görüntü nasıl okunur
Bu gösterge paneli, 13 Eylül 2026 tarihinde mevcut olan kamuya açık kanıtları kaydeder. Canlı bir sıralama tablosu değildir ve sessizce güncellenmemelidir. Yapay zekâ ürünleri, iskeletler, değerlendirme setleri ve fiyatlar, tarihsiz bir “güncel” sayfanın dürüst kalması için çok hızlı değişiyor.
Yetenek çok boyutludur. Bir sistem bir olimpiyat problemini çözebilirken analog bir saati okuyamayabilir, uzman biyoloji sorularını yanıtlayabilirken bir laboratuvar iş akışını tamamlayamayabilir veya bir bakımcının reddedeceği bir yama üretirken bir kodlama değerlendiricisini geçebilir. Stanford’un 2026 AI Endeksi bu örüntüyü düzensiz zekâ olarak adlandırıyor ve kontrollü ile gerçek ortamlar arasındaki büyük boşlukları belgeliyor (Stanford AI Endeksi, teknik performans).
Aşağıdaki derecelendirmeler evrensel bir modeli değil, kanıtı tanımlar. “Güçlü”, öncü sistemlerin ilgili kamuya açık değerlendirmelerde etkileyici performans gösterdiği anlamına gelir. Güvenli, insan eşdeğeri veya özerk yüksek riskli kullanım için yeterince güvenilir olduğu anlamına gelmez.
| Boyut | Eylül 2026 kanıtı | Önemli sınırlama |
|---|---|---|
| Dil ve bilgi | Geniş soru-cevap ve çok modlu testlerde güçlü | Halüsinasyonlar, kirlenme ve düzensiz olgusal güvenilirlik devam ediyor |
| Matematik ve yapılandırılmış akıl yürütme | Frontier sistemler seçilmiş problemlerde en üst yarışma düzeyinde sonuçlara ulaştı | Performans düzensiz kalıyor ve araçlara ile çıkarım bütçesine duyarlı |
| Kodlama ve bilgisayar kullanımı | Kodlama ve yapılandırılmış masaüstü ajan gösterge testlerinde hızlı kazanımlar | Değerlendiriciyi geçmek, sürdürülebilir üretim işini garanti etmez |
| Uzun görev özerkliği | Ölçülen yazılım görevi ufukları hızla arttı | Çoğunlukla temiz yazılım/ML/siber görevler; bağımsız çalışma süresi değil |
| Bilim yardımı | Güçlü alan bilgisi ve gelişen protokol/sorun giderme performansı | Bilgi puanları uçtan uca deneysel yetkinliği ortaya koymaz |
| Siber yetenek | Ajanlar gerçek güvenlik açıkları bulabilir ve seçilmiş uzman görevlerini tamamlayabilir | Uçtan uca özerk saldırılar kamuya açık olarak kanıtlanmadı |
| İkna | Kontrollü deneylerde ölçülebilir görüş değişimleri | Nüfus ölçeğinde kötü niyetli etki gösterilmedi |
| Robotik ve cisimleşme | Kontrollü ortamlarda güçlü ilerleme | Ev içi ve açık dünya güvenilirliği çok daha düşük kalıyor |
| Güvenlik ve güvenilirlik | Koruyucu önlemler ve değerlendirmeler iyileşiyor | Raporlama tutarsız ve hiçbir yöntem kontrolü garanti etmiyor |
Akıl yürütme etkileyici ve düzensiz
2026 AI Endeksi, bir Google DeepMind sisteminin 2025 Uluslararası Matematik Olimpiyatı’nda yarışma zaman sınırı altında altın madalya düzeyinde bir puan elde ettiğini bildiriyor. Aynı bölüm, ClockBench’te en iyi test edilen modelin analog saatleri yalnızca yaklaşık yarı zamanda doğru okuduğunu, insanlar için ise bu oranın yaklaşık yüzde 90 olduğunu bildiriyor. Bu testler eşit derecede önemli değildir, ancak aralarındaki tezat, tek bir skaler “zekâ düzeyi” fikrini çürütür.
Gösterge testi kazanımları, daha iyi bir temel modeli, daha fazla çıkarım anı hesaplamasını, araç kullanımını, birkaç çözümü örneklemeyi veya özel iskeleti yansıtabilir. Bir sonuç, belirtilen koşullar altında tam test edilmiş sisteme aittir. Daha ucuz bir ürün katmanına veya zaman kısıtlı bir dağıtıma gelişigüzel aktarılmamalıdır.
Birçok test de hızla doyuyor. Stanford, Humanity’s Last Exam’de dik kazanımlar ve SWE-bench Verified’da neredeyse doygunluk bildiriyor, geçersiz sorulara ve olası sıralama tablosu uyarlamasına dikkat çekiyor. Doygunluk, bir değerlendirmenin öncü sistemleri ayırt etme gücünün azaldığı anlamına gelir; altta yatan alanın çözüldüğü anlamına gelmez.
Kodlama ve bilgisayar kullanımı
Öncü ajanlar seçilmiş depo sorunlarını onarabilir, önemli miktarda kod yazabilir ve grafik uygulamaları çalıştırabilir. Stanford, OSWorld performansının yaklaşık yüzde 12’den yüzde 66,3’e yükseldiğini, ancak yine de yapılandırılmış görevlerin yaklaşık üçte birinde başarısız olduğunu bildiriyor. Gerçek bilgisayar kullanımı, değişen arayüzler, belirsiz hedefler, kimlik bilgileri, düşmanca içerik ve bir gösterge testinin gözden kaçırabileceği sonuçlar ekler.
Otomatik notlandırma başka bir sınırdır. METR’nin SWE-bench yamaları üzerine 2026 çalışması, gösterge testinin testlerini geçmenin, bakımcıların değişiklikleri birleştireceği anlamına gelmediğini buldu ve işlevsel test durumlarının ötesindeki kalite boyutlarını vurguladı (METR bakımcı incelemesi çalışması). Üretim kodlaması mimari, iletişim, güvenlik, bakım ve başarısızlıklardan sorumluluk gerektirir.
Bu kanıt, seçilmiş çalışmanın önemli ölçüde yardım ve otomasyonunu destekler. “Yazılım mühendisliği çözüldü” iddiasını desteklemez.
Uzun görev özerkliği
METR’nin Mayıs 2026 gösterge paneli, bir ajanın yüzde 50 veya 80 öngörülen başarı oranına sahip olduğu insan uzmanı görev süresini tahmin ediyor. Görevler öncelikle yazılım mühendisliği, makine öğrenmesi ve siber güvenlikle ilgilidir. METR, mevcut takım ile on altı saatin üzerindeki ölçümlerin güvenilmez olduğunu belirtiyor (METR görev ufukları).
Metrik genellikle yanlış aktarılıyor. Dört saatlik bir ufuk, ajanın dört saat boyunca bağımsız çalıştığı anlamına gelmez; ölçülen zorluktaki görevler için bir insan uzmanının tipik olarak yaklaşık dört saate ihtiyaç duyduğu anlamına gelir. Başarılı ajanlar çok daha hızlı bitirebilir. Takım, çoğu kurumsal işin aksine kendi kendine yeterli ve nesnel olarak notlandırılabilir.
METR ayrıca alanların büyüklük mertebeleri kadar farklılaştığına, hata paylarının geniş olabileceğine ve yüzde 98 güvenilirlik gerektiğinde yüzde 50 ufkun yetersiz olduğuna dikkat çekiyor (METR sınırlamaları). Eğilim, seçilmiş dijital görevlerde hızlı ilerlemenin anlamlı bir kanıtıdır — iş otomasyonuna veya AGI’ye geri sayan bir saat değildir.
Bilim, biyoloji ve siber güvenlik
Birleşik Krallık Yapay Zekâ Güvenliği Enstitüsü, Ekim 2025’e kadar test edilen sistemlerin seçilmiş kimya ve biyoloji sorularında doktora uzmanı temel çizgilerini aştığını ve protokol üretimi ile laboratuvar sorun gidermede geliştiğini bildiriyor. Ayrıca uçtan uca plazmid tasarımıyla ilgili kalıcı zorluğu bildiriyor (AISI Frontier AI Trends Raporu). Bunlar devlet değerlendirme sonuçlarıdır, ancak uzman temel çizgileri ve görev tasarımı hâlâ anlamı belirliyor.
Siber yetenek, soru cevaplamadan güvenlik açıklarını keşfeden ve çok adımlı zorlukları çözen ajanlara doğru ilerledi. AISI, Şubat 2026’da siber görev ölçümlerinde daha hızlı büyüme bildirdi (AISI siber eğilimleri). Uluslararası Yapay Zekâ Güvenliği Raporu, bu kanıtı dağıtımdan ayırıyor: saldırganlar yapay zekâ kullanıyor, ancak tamamen özerk uçtan uca saldırılar kamuya açık olarak bildirilmedi ve saldırının mı savunmanın mı daha fazla kazanç sağladığı belirsiz kalıyor (Uluslararası Yapay Zekâ Güvenliği Raporu 2026).
İkna ve sosyal yetenek
Konuşmaya dayalı yapay zekâ deneylerde tutumları değiştirebilir. 76.977 katılımcıyı içeren 2026 AISI öncülüğündeki bir çalışma, ölçek veya temel kişiselleştirmeden ziyade istem verme ve ikna odaklı son eğitimden daha büyük ikna etkileri buldu; kişiselleştirme etkileri yüzde birin altındaydı. Artan ikna, azalmış olgusal doğrulukla ilişkilendirildi (AISI ikna çalışması).
Bu bulgu, deneysel koşullar altında ölçülen bir yeteneği kanıtlıyor. Kalıcı davranış değişikliğini, seçim etkilerini veya nüfus kontrolünü kanıtlamıyor. Erişim, platform dağıtımı, rakip mesajlar, kullanıcı güveni ve kalıcılık ayrı değişkenler olarak kalıyor.
Cisimleşme büyük bir boşluk olmaya devam ediyor
Robotik, kontrollü ve açık ortamlar arasındaki en net farkı gösteriyor. Stanford, bir simülasyon gösterge testinde yüksek başarı bildiriyor ancak test edilen gerçek ev görevlerinde yalnızca yüzde 12. Otonom araçlar, yorumlamayla ilgili operasyonel tasarım alanları ve saha dışı insan desteğiyle sınırlı hizmet alanlarında anlamlı bir ölçekte çalışıyor.
Bir dil modelinin geniş dijital arayüzü, fiziksel dünya genelliğiyle karıştırılmamalıdır. Algılama, manipülasyon, insanların etrafındaki güvenlik, yeni hatalardan kurtulma, donanım bakımı ve maliyet, dağıtımı kısıtlar. Bu kılavuzun insansı robotlar bölümü, gösterge testi gösterileri ile gerçek dünya robot performansı arasındaki bu boşluğu şirket şirket, daha ayrıntılı olarak takip ediyor.
Güvenilirlik yeteneğin bir parçasıdır
Yüzde 66 oranında başarılı olan bir ajan, incelemeyle yararlı olabilir, incelemesiz kabul edilemez olabilir. Yüksek riskli sistemler, kalibre edilmiş belirsizlik, hata tespiti, itiraz, denetim kayıtları, geri alma, güvenlik ve insan yedeği gerektirir. Ortalama gösterge testi puanları nadir ama sonuçlu hataları gizler.
2026 AI Endeksi, geliştiricilerin ana akım yetenek gösterge testlerini sorumlu yapay zekâ değerlendirmelerinden çok daha tutarlı bir şekilde bildirdiğini buluyor (AI Endeksi sorumlu yapay zekâ bölümü). Eksik kamuya açık sonuçlar, eksik dahili test kanıtı olmaz, ancak karşılaştırmayı ve kamuoyu güvencesini sınırlar.
Bu gösterge panelinin kanıtlamadıkları
Bilinç, niyet, tüm işlerde ekonomik değer veya kabul edilmiş bir AGI eşiği kanıtlamıyor. Bir gösterge testi sonucunun farklı bir dile, nüfusa, araç setine, maliyet sınırına veya düşmanca bir ortama aktarıldığını göstermiyor. Mevcut mimarilerin sağlam bir şekilde genel hale gelip gelemeyeceğini çözmüyor.
Bu anlık görüntü itibarıyla en güçlü sonuç, frontier sistemlerin kalıcı kırılganlık, alan boşlukları ve eksik güvenlik kanıtıyla birlikte olağanüstü genişlik ve hızlı iyileşme gösterdiğidir. Bu, “sadece otomatik tamamlama” ya da “AGI geldi” iddialarından daha sonuçlu — ve daha doğrudur.