Cara membaca potret ini
Dasbor ini mencatat bukti publik yang tersedia pada 13 September 2026. Ini bukan papan peringkat langsung dan tidak boleh diperbarui secara diam-diam. Produk AI, perancah, kumpulan evaluasi, dan harga berubah terlalu cepat bagi sebuah halaman “saat ini” tanpa tanggal untuk tetap jujur.
Kemampuan bersifat multidimensional. Sebuah sistem dapat memecahkan soal olimpiade namun gagal membaca jam analog, menjawab pertanyaan biologi tingkat pakar namun gagal menyelesaikan alur kerja laboratorium, atau lolos penilai kode sambil menghasilkan tambalan (patch) yang akan ditolak oleh seorang pemelihara (maintainer). AI Index 2026 milik Stanford menyebut pola ini kecerdasan bergerigi (jagged intelligence) dan mendokumentasikan kesenjangan besar antara lingkungan terkontrol dan lingkungan nyata (Stanford AI Index, kinerja teknis).
Peringkat di bawah ini menggambarkan bukti, bukan model universal. “Kuat” berarti sistem terdepan tampil mengesankan pada evaluasi publik yang relevan. Ini tidak berarti aman, setara manusia, atau cukup andal untuk penggunaan otonom bertaruhan tinggi.
| Dimensi | Bukti September 2026 | Keterbatasan penting |
|---|---|---|
| Bahasa dan pengetahuan | Kuat di seluruh tanya-jawab luas dan pengujian multimodal | Halusinasi, kontaminasi, dan keandalan faktual yang tidak merata tetap ada |
| Matematika dan penalaran terstruktur | Sistem terdepan mencapai hasil level kompetisi teratas pada soal tertentu | Kinerja tetap bergerigi dan sensitif terhadap alat serta anggaran inferensi |
| Pengkodean dan penggunaan komputer | Kemajuan pesat pada tolok ukur pengkodean dan agen desktop terstruktur | Lolos penilai tidak menjamin pekerjaan produksi yang dapat dipelihara |
| Otonomi tugas panjang | Horizon tugas perangkat lunak yang terukur meningkat pesat | Sebagian besar tugas perangkat lunak/ML/siber yang bersih; bukan durasi operasi independen |
| Bantuan sains | Pengetahuan domain kuat dan kinerja protokol/pemecahan masalah yang membaik | Skor pengetahuan tidak membuktikan kompetensi eksperimental dari ujung ke ujung |
| Kemampuan siber | Agen dapat menemukan kerentanan nyata dan menyelesaikan tugas pakar tertentu | Serangan otonom dari ujung ke ujung belum ditetapkan secara publik |
| Persuasi | Pergeseran opini yang terukur dalam eksperimen terkontrol | Dampak berbahaya berskala populasi belum terbukti |
| Robotika dan perwujudan fisik | Kemajuan kuat di lingkungan terkontrol | Keandalan di rumah tangga dan dunia terbuka tetap jauh lebih rendah |
| Keamanan dan keandalan | Pengaman dan evaluasi terus membaik | Pelaporan tidak konsisten dan tidak ada metode yang menjamin kendali |
Penalaran mengesankan namun tidak merata
AI Index 2026 melaporkan bahwa sebuah sistem Google DeepMind mencapai skor level medali emas pada Olimpiade Matematika Internasional 2025 dalam batas waktu kompetisi. Bab yang sama melaporkan bahwa model terbaik yang diuji pada ClockBench hanya membaca jam analog dengan benar sekitar separuh waktu, dibandingkan sekitar 90 persen untuk manusia. Kedua pengujian ini tidak sama pentingnya, tetapi kontrasnya mengalahkan gagasan tentang satu “tingkat kecerdasan” skalar tunggal.
Peningkatan tolok ukur mungkin mencerminkan model dasar yang lebih baik, komputasi saat inferensi yang lebih banyak, penggunaan alat, pengambilan sampel beberapa solusi, atau perancah khusus. Sebuah hasil dimiliki oleh sistem lengkap yang diuji di bawah kondisi yang dinyatakan. Ini tidak boleh secara sembarangan dipindahkan ke tingkatan produk yang lebih murah atau penerapan yang terbatas waktu.
Banyak pengujian juga cepat jenuh. Stanford melaporkan peningkatan tajam pada Humanity’s Last Exam dan hampir jenuh pada SWE-bench Verified, sambil mencatat pertanyaan yang tidak valid dan kemungkinan adaptasi papan peringkat. Kejenuhan berarti sebuah evaluasi memiliki daya yang lebih kecil untuk membedakan sistem terdepan; ini tidak berarti domain yang mendasarinya telah terpecahkan.
Pengkodean dan penggunaan komputer
Agen terdepan dapat memperbaiki masalah repositori tertentu, menulis kode substansial, dan mengoperasikan aplikasi grafis. Stanford melaporkan kinerja OSWorld meningkat dari sekitar 12 persen menjadi 66,3 persen, masih gagal pada kira-kira satu dari tiga tugas terstruktur. Penggunaan komputer nyata menambahkan antarmuka yang berubah, tujuan yang tidak jelas, kredensial, konten adversarial, dan konsekuensi yang mungkin dilewatkan oleh sebuah tolok ukur.
Penilaian otomatis adalah batas lain. Studi METR 2026 terhadap tambalan SWE-bench menemukan bahwa lolos pengujian tolok ukur tidak berarti para pemelihara akan menggabungkan (merge) perubahan itu, menyoroti dimensi kualitas di luar kasus pengujian fungsional (studi tinjauan pemelihara METR). Pengkodean produksi membutuhkan arsitektur, komunikasi, keamanan, pemeliharaan, dan tanggung jawab atas kegagalan.
Bukti ini mendukung bantuan substansial dan otomatisasi pekerjaan tertentu. Ini tidak mendukung klaim bahwa “rekayasa perangkat lunak telah terpecahkan.”
Otonomi tugas panjang
Dasbor METR Mei 2026 memperkirakan durasi tugas pakar manusia di mana sebuah agen memiliki tingkat keberhasilan yang diprediksi 50 atau 80 persen. Tugas-tugas tersebut terutama menyangkut rekayasa perangkat lunak, pembelajaran mesin, dan keamanan siber. METR menyatakan bahwa pengukuran di atas enam belas jam tidak dapat diandalkan dengan rangkaian pengujian saat ini (horizon tugas METR).
Metrik ini seringkali salah dilaporkan. Horizon empat jam tidak berarti agen tersebut berjalan secara independen selama empat jam; ini berarti seorang pakar manusia biasanya membutuhkan sekitar empat jam untuk tugas dengan tingkat kesulitan yang terukur itu. Agen yang berhasil mungkin menyelesaikannya jauh lebih cepat. Rangkaian pengujian ini mandiri dan dapat dinilai secara objektif, tidak seperti sebagian besar pekerjaan organisasional.
METR selanjutnya memperingatkan bahwa domain berbeda dalam orde besaran, batas kesalahan (error bars) dapat lebar, dan horizon 50 persen tidak memadai di mana keandalan 98 persen dibutuhkan (keterbatasan METR). Trennya adalah bukti bermakna dari kemajuan pesat pada tugas digital tertentu—bukan jam hitung mundur menuju otomatisasi pekerjaan atau AGI.
Sains, biologi, dan siber
UK AI Security Institute melaporkan bahwa sistem yang diuji hingga Oktober 2025 melampaui garis dasar pakar tingkat PhD miliknya pada pertanyaan kimia dan biologi tertentu dan membaik dalam pembuatan protokol dan pemecahan masalah laboratorium. Institut ini juga melaporkan kesulitan yang persisten dengan desain plasmid dari ujung ke ujung (Laporan Tren AI Terdepan AISI). Ini adalah hasil evaluasi pemerintah, tetapi garis dasar pakar dan konstruksi tugas tetap menentukan maknanya.
Kemampuan siber telah berkembang dari menjawab pertanyaan menuju agen yang menemukan kerentanan dan memecahkan tantangan multilangkah. AISI melaporkan pertumbuhan yang lebih cepat dalam ukuran tugas sibernya pada Februari 2026 (tren siber AISI). International AI Safety Report membedakan bukti itu dari penerapan: para penyerang menggunakan AI, namun serangan otonom dari ujung ke ujung sepenuhnya belum dilaporkan secara publik dan mana yang mendapat lebih banyak keuntungan—ofensif atau pertahanan—tetap tidak pasti (International AI Safety Report 2026).
Persuasi dan kemampuan sosial
AI percakapan dapat mengubah sikap dalam eksperimen. Sebuah studi 2026 yang dipimpin AISI dengan 76.977 partisipan menemukan efek persuasi yang lebih besar dari prompting dan pasca-pelatihan yang berfokus pada persuasi dibandingkan dari skala atau personalisasi dasar; efek personalisasi berada di bawah satu poin persentase. Peningkatan persuasi dikaitkan dengan berkurangnya akurasi faktual (studi persuasi AISI).
Temuan itu menetapkan kemampuan terukur di bawah kondisi eksperimental. Ini tidak membuktikan perubahan perilaku yang bertahan lama, dampak pemilu, atau kendali populasi. Jangkauan, distribusi platform, pesan yang bersaing, kepercayaan pengguna, dan kegigihan tetap menjadi variabel terpisah.
Perwujudan fisik tetap menjadi kesenjangan utama
Robotika menunjukkan perbedaan paling jelas antara lingkungan terkontrol dan terbuka. Stanford melaporkan keberhasilan tinggi dalam tolok ukur simulasi tetapi hanya 12 persen pada tugas rumah tangga nyata yang diuji. Kendaraan otonom beroperasi pada skala yang bermakna di area layanan terbatas, dengan domain desain operasional dan dukungan manusia dari luar lokasi yang penting untuk interpretasinya.
Antarmuka digital luas milik sebuah model bahasa seharusnya tidak dikelirukan sebagai keumuman dunia fisik. Penginderaan, manipulasi, keamanan di sekitar manusia, pemulihan dari kesalahan baru, pemeliharaan perangkat keras, dan biaya semuanya membatasi penerapan. Bab humanoid-robots dalam manual ini melacak kesenjangan itu antara demonstrasi tolok ukur dan kinerja robot dunia nyata secara lebih detail, perusahaan demi perusahaan.
Keandalan adalah bagian dari kemampuan
Sebuah agen yang berhasil 66 persen dari waktunya mungkin berguna dengan tinjauan dan tidak dapat diterima tanpanya. Sistem bertaruhan tinggi membutuhkan ketidakpastian yang terkalibrasi, deteksi kegagalan, banding, log audit, rollback, keamanan, dan cadangan manusia. Skor tolok ukur rata-rata menyembunyikan kesalahan yang jarang namun konsekuensial.
AI Index 2026 menemukan bahwa para pengembang melaporkan tolok ukur kemampuan arus utama jauh lebih konsisten dibandingkan evaluasi AI yang bertanggung jawab (bab AI yang bertanggung jawab dari AI Index). Hasil publik yang hilang tidak membuktikan tidak adanya pengujian internal, tetapi hal itu membatasi perbandingan dan jaminan publik.
Apa yang tidak ditetapkan oleh dasbor ini
Dasbor ini tidak menetapkan kesadaran, niat, nilai ekonomi di seluruh pekerjaan, atau ambang batas AGI yang diterima. Ini tidak menunjukkan bahwa hasil sebuah tolok ukur berpindah ke bahasa, populasi, perangkat alat, batas biaya, atau lingkungan adversarial yang berbeda. Ini tidak menyelesaikan apakah arsitektur saat ini dapat menjadi umum secara kokoh.
Per potret ini, kesimpulan terkuat adalah bahwa sistem terdepan menunjukkan keluasan yang luar biasa dan penyempurnaan pesat berdampingan dengan kerapuhan yang persisten, kesenjangan domain, dan bukti keamanan yang belum lengkap. Itu jauh lebih konsekuensial—dan lebih akurat—dibandingkan baik “hanya autocomplete” maupun “AGI telah tiba.”