Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI İnsanlığın hayatta kalma brifingi
TR

Ortaya çıkan yetenekler: ne gerçekten belirir, ne sadece ani görünür

Büyük modellerde eğitilmemiş yeteneklerin neden çıktığı, gösterge testi seçimlerinin görünür sıçramaları nasıl yarattığı ve bunun yapay zekâ güvenliği için gerçek anlamı.

Written by
Dwight Ringdahl
Status
Kaynakları doğrulandı
Revised
Sources
3 cited
Reading
5 min

İki anlam sık sık birbirine karıştırılıyor

Bir yapay zekâ yeteneği en az iki anlamda “ortaya çıkan” olabilir. Geniş anlamda, bir model açık, göreve özgü bir eğitim hedefi olmayan yararlı bir davranış sergiler. Öncelikle jetonları tahmin etmek üzere eğitilmiş bir dil modeli çeviri yapabilir, kod yazabilir, hukuku özetleyebilir veya bazı aritmetik problemleri çözebilir. Bu yetenekler, eğitim verisi ve hedefi yeniden kullanılabilir dahili örüntüleri ödüllendirdiği için ortaya çıkabilir.

Daha güçlü anlamda, ortaya çıkış, bir yeteneğin ölçek arttıkça aniden belirmesi anlamına gelir: daha küçük modeller başarısız olur, sonra daha büyük bir model aniden başarılı olur. Yaygın olarak tartışılan 2022 tarihli bir makale, model aileleri ve görevler genelinde bu tür sıçramaların örneklerini bildirdi (Wei ve diğerleri, 2022). Bu ayrım önemlidir. Planlanmamış yeteneğin varlığı iyi kurulmuştur; ölçülen bir yeteneğin gerçek bir süreksizlik geçirip geçirmediği metriğe, veriye ve örneklemeye bağlıdır.

Her iki anlam da bilinç, niyet veya sihir ima etmez. Karmaşık sistemler, her kullanım için bir modül yazan bir tasarımcı olmadan genel amaçlı temsiller kazanabilir. Bilimsel soru, davranışın eğitim ve sistem tasarımıyla nasıl değiştiği ve bunu ne kadar iyi öngörebildiğimizdir.

Bazı sıçramalar neden ölçüm eseridir

Bir modelin aritmetik doğruluğunun yüzde 20’den 30’a, sonra 40’a kademeli olarak yükseldiğini varsayalım. Yalnızca doğruluk yüzde 35’i aştığında bir puan veren bir gösterge testi, sıfır, sıfır, sonra bir gösterecektir — puanlama tarafından yaratılan bir süreksizlik. Aynı etki, tam eşleşme notlandırmasının neredeyse doğru bir cevap için kredi vermemesi veya bir görevin birkaç alt beceri gerektirmesi ve bunlardan biri eksikse başarısız olması durumunda da meydana gelir.

Schaeffer, Miranda ve Koyejo bildirilen vakaları yeniden analiz etti ve sürekli, doğrusal olmayan veya hataya duyarlı metriklerle ölçüldüğünde birçok ani geçişin düzgün hale geldiğini gösterdi (“Are Emergent Abilities of Large Language Models a Mirage?”). Bu, gerçek süreksizliklerin hiçbir zaman gerçekleşmediğini kanıtlamaz. Metrik etkilerini, seyrek örneklemeyi ve model ailesi farklılıklarını dışlamadan bir gösterge testi grafiğinin bir tanesini kanıtlayamayacağını gösterir.

Ölçek de tek değişen değişken değildir. Daha büyük modeller farklı veri, eğitim tarifleri, jetonlayıcılar, talimat ince ayarı, araçlar veya çıkarım bütçeleri kullanabilir. Adlandırılmış ürünleri karşılaştırmak, sistem düzeyinde bir mühendislik iyileştirmesini saf bir parametre eşiğiyle karıştırabilir. Araştırmacıların mekanizmayı belirlemek için kontrollü ölçeklendirme serilerine, yoğun kontrol noktalarına ve birkaç metriğe ihtiyacı vardır.

Öngörmesi hâlâ gerçekten zor olan şey

Düzgün, altta yatan bir iyileşme bile sonuçlu bir eşik üretebilir. Yüzde 40’tan yüzde 60’a geçen bir siber ajan, dağıtımın ekonomik hale geldiği noktayı aşabilir. Bir modelin bireysel olarak zayıf alt becerileri birbirine bağlama yeteneği bir iş akışının kilidini açabilir. Dış sistemler küçük iyileştirmeleri güçlendirebilir: araçlar eylemler sağlar, bellek bağlamı genişletir ve tekrarlanan örnekleme başarılı bir cevap bulur.

Geliştiriciler ayrıca mümkün olan her görevi kapsamlı bir şekilde test edemez. Modeller geniş veriler üzerinde eğitilir ve değerlendiricilerin hayal etmediği uygulamaları ve hataları keşfeden milyonlarca kullanıcıya dağıtılır. Bir yetenek bu nedenle kademeli olarak geliştiyse bile laboratuvar için şaşırtıcı olabilir. Şaşkınlık, matematiksel olarak keskin bir faz değişikliğinden ziyade sınırlı ölçümü yansıtabilir, ancak yine de operasyonel olarak önemlidir.

2026 Uluslararası Yapay Zekâ Güvenliği Raporu, frontier değerlendirmelerinin sınırlı dış geçerliliğe sahip olabileceğini ve sistemler ile iskeletler değiştikçe hızla eskiyebileceğini vurguluyor (Uluslararası Yapay Zekâ Güvenliği Raporu 2026). Bu, pratik bir belirsizlik iddiasıdır, korkulan her davranışın kendiliğinden ortaya çıkacağının kanıtı değildir.

Yetenek eğilim değildir

Bir model, kasıtlı olarak istendiğinde bir eylemi gerçekleştirmeye muktedir olabilir, ancak bunu kendiliğinden yapma olasılığı olmayabilir. Güvenlik analizi, yeteneği — sistemin bir şeyi yapıp yapamayacağını — eğilimden — ilgili koşullarda bunu yapma eğiliminde olup olmadığını — ayırmalıdır. Bir rol yapma senaryosunda aldatıcı bir plan üretebilen bir model, bu nedenle dağıtım sırasında aldatmayı sürdürdüğü gösterilmiş olmaz. Tersine, düşük ölçülen bir eğilim, doğru tetikleyiciyi yaratmayan bir değerlendirmeyi yansıtabilir.

Aynı ayrım durumsal farkındalık, koruyucu önlem kaçınma, kendini koruma ve stratejik davranış için de geçerlidir. Bunlar aktif araştırma konuları ve olası tehdit modeli bileşenleridir. Çeviri veya aritmetik ortaya çıktığı için bunların da mutlaka ortaya çıkacağını söylemek yanlıştır. Kanıt, test edilen modeli, istemi, ortamı, sıklığı ve alternatif açıklamaları belirlemelidir.

Antropomorfik dil karışıklığı artırır. Modeller, eğitim verilerinde benzer dil göründüğü veya etkileşim bir kişiliği ödüllendirdiği için hayatta kalmak istediklerine dair ifadeler üretebilir. Bu tür bir metin araştırmaya değer bir davranıştır; kararlı bir içsel hedefe doğrudan erişim değildir. Güdüler hakkındaki iddialar, tek bir konuşmadan alıntılardan daha güçlü kanıt gerektirir.

Ortaya çıkış neden hâlâ güvenlikle ilgili

Makul güvenlik dersi “her şey aniden olabilir” değildir. Geniş eğitimin, tasarımcıların açıkça saydığından daha fazla davranış yarattığı ve mevcut değerlendirmenin eksik kapsam sağladığıdır. Bu, aşamalı test, izleme ve derinlemesine savunmayı haklı çıkarır. Ayrıca bir gösterge testinde yokluğun her iskelet veya istem altında yokluk anlamına geldiğini varsaymaya karşı uyarır.

Değerlendirme, son koşudan önceki eğilimleri ölçmek için kontrol noktalarını kullanarak eğitim sırasında başlamalıdır. Ekipler siber, biyolojik yardım, ikna, özerklik ve model kontrolü riskleri için takımlar sürdürebilir, beklenmedik davranışı bulmak için açık uçlu kırmızı takım çalışmasını ekleyebilir. Özel testler kirlenmeyi azaltır; dış değerlendiriciler kurumsal kör noktaları azaltır. Dağıtım sonrası olay raporlaması, laboratuvar görevlerinin kaçırdığı başarısızlıkları yakalar.

Eşik politikaları, ortaya çıkış hakkında felsefi bir mutabakat gerektirmeden kanıtlanmış yeteneğe tepki vermelidir. Bir sistem ciddi bir zarara yönelik engelleri önemli ölçüde düşürebiliyorsa, eğri düzgün veya ani olsun, ilgili koruyucu önlemler uygulanmalıdır. Kanıt zayıfsa, rapor varsayımsal bir davranışı sessizce gözlemlenmiş gibi ele almak yerine belirsizliği belirtmelidir.

Öngörülebilirlik katmanlar hâlinde gelir

Bazı model özellikleri diğerlerinden daha öngörülebilirdir. Bir veri dağılımı genelindeki toplam kayıp genellikle düzgün ölçeklendirme yasalarını takip etmiştir. Sabit bir gösterge testindeki performans sınırlı bir aralıkta öngörülebilir olabilir. Karmaşık bir ortamdaki başarı, modellenmesi daha zor olan araçlara, güvenilirliğe ve etkileşimlere bağlıdır. Toplumsal etki, benimseme, teşvikler, kurumlar ve düşmanları ekleyerek onu daha da zorlaştırır.

Bu hiyerarşi yaygın bir çıkarım hatasını önler: öngörülebilir eğitim kaybı, her alt akış yeteneğini öngörülebilir kılmaz, ancak şaşırtıcı alt akış davranışı ölçeklendirme yasalarını geçersiz kılmaz. Araştırmacılar nadir başarısızlıklar veya belirli görevler konusunda belirsiz kalırken bir ortalamayı tahmin edebilirler.

Yorumlanabilirlik, davranışta net bir şekilde görünmeden önce temsilleri veya mekanizmaları ortaya çıkararak sonunda tahminleri iyileştirebilir. Ancak bugün, yorumlanabilirlik yöntemleri bir modelin “bildiği” veya yapacağı şeyin eksiksiz bir okuması yerine kısmi kanıt sağlıyor. Davranışsal değerlendirme ve gerçek dünya kontrolleri gerekli olmaya devam ediyor.

Bir ortaya çıkış iddiası nasıl okunur

Karşılaştırma genelinde neyin değiştiğini sorun: parametreler, hesaplama, veri, eğitim hedefi, araçlar veya istem verme. Metriğin sürekli olup olmadığını, ara kontrol noktalarının var olup olmadığını ve belirsizlik çubuklarının örtüşüp örtüşmediğini inceleyin. Görevin eğitim verisinde olup olmadığını ve bağımsız araştırmacıların sonucu tekrarlayıp tekrarlamadığını kontrol edin. En önemlisi, “yazarlar tarafından beklenmedik” ile “bilimsel olarak süreksiz” olanı birbirinden ayırın.

Ortaya çıkan yetenek, dikkatli kullanıldığında yararlı bir kavramdır. Geniş çapta eğitilmiş modeller, hiçbir mühendisin tek tek belirtmediği yetenekler kazanır. Bazı yetenekler yalnızca sistemler pratik eşikleri aştıktan sonra görünür hale gelir. Ancak birçok ünlü uçurum, davranışı nasıl puanladığımızın kısmen eseridir. Doğru sonuç ne ortaya çıkışın bir yanılsama olduğu ne de ölçeğin herhangi bir yeteneği öngörülemez bir şekilde çağırdığıdır. Yetenek gelişiminin yalnızca kısmen anlaşıldığı, ölçüm seçimlerinin önemli olduğu ve güvenlik politikasının hem kademeli hem de şaşırtıcı değişime karşı sağlam olması gerektiğidir.

Type to search the manual.

navigate open esc close