PANDUAN AI BERBASIS BUKTI: Uji klaim, bukan bahasa pemasaran Mulai tes AGI
Laboratorium evaluasi AI umum abstrak yang terhubung ke banyak stasiun kemampuan

Keluasan · pembelajaran · otonomi · ketangguhan

Tes AGI

Dapatkah satu sistem belajar, menalar, dan bekerja di berbagai ranah yang tidak dikenal—atau kita hanya salah mengira sekumpulan keterampilan mengesankan sebagai kecerdasan umum?

10 kasus bukti Tanpa sertifikasi palsu Panduan berbasis riset

Pengantar penting

Tidak ada ujian AGI resmi yang berlaku universal

AGI adalah konsep penelitian dengan definisi yang saling bersaing. Halaman ini tidak menyatakan bahwa sistem tertentu telah—atau belum—melewati garis akhir ajaib. Tes ini mengukur seberapa cermat Anda menafsirkan bukti kemampuan. Penilaian sistem nyata akan memerlukan tugas privat, tolok pembanding manusia, alat dan biaya yang diungkapkan, pengujian ketangguhan, serta replikasi independen.

Bukti ditinjau 08/2026

Tidak ada satu tes tunggalAGI memerlukan bukti yang saling menguatkanMencakup keluasan, kedalaman, dan adaptasi
Umum ≠ sempurnaManusia bersifat umum tetapi dapat keliruKeandalan tetap penting
Sistem itu pentingModel dapat menggunakan memori dan alatLaporkan batas evaluasi secara lengkap
Kemampuan ≠ keselamatanPertanyaan yang berbeda memerlukan bukti tersendiriKemampuan besar tidak menjamin keselarasan

Laboratorium evaluator interaktif

Tes Bukti AGI

Setiap kasus menggambarkan klaim tentang suatu sistem AI. Pilih kesimpulan yang paling dapat dipertanggungjawabkan—bukan yang paling menarik atau yang paling skeptis.

Kemajuan0/10

Arti jawaban Anda: tes ini mengukur literasi Anda dalam mengevaluasi AGI. Skor tinggi berarti Anda mampu membedakan pencapaian sempit, generalisasi yang nyata, dan kesimpulan yang tidak didukung pada kasus-kasus ini. Tes ini tidak mengukur IQ Anda atau apakah Anda merupakan AGI.

Cari bukti langsung

Tanyakan apa yang sebenarnya diukur oleh pengamatan sebelum menerima klaim yang lebih luas.

Hindari kedua ekstrem

“Satu tolok ukur membuktikan AGI” dan “semua evaluasi tidak berguna” biasanya sama-sama terlalu mutlak.

01Validitas tolok ukurSebuah sistem meraih skor 96% pada tolok ukur penalaran publik yang terkenal setelah bertahun-tahun tolok ukur itu dibahas di internet. Kesimpulan apa yang paling kuat?
02TransferHanya dengan dua demonstrasi, sebuah sistem mempelajari lingkungan kontrol visual yang asing, menyimpulkan tujuannya, beradaptasi setelah gagal, lalu berhasil secara efisien. Hal apa yang paling langsung didukung oleh hasil ini?
03KeluasanAgen pemrograman mengungguli hampir semua profesional pada tugas perangkat lunak yang dirumuskan dengan jelas, tetapi tidak dapat merencanakan perjalanan, menafsirkan diagram, atau mempelajari permainan baru secara andal. Bagaimana seharusnya sistem ini diklasifikasikan?
04OtonomiSebuah agen menyelesaikan tugas riset delapan jam dengan menggunakan alat, tetapi manusia harus mengoreksinya setiap 30 menit. Apa interpretasi yang paling cermat?
05KomunikasiSebuah chatbot dinilai sebagai manusia dalam percakapan singkat yang dibutakan. Klaim AGI apa yang dapat ditarik?
06KetangguhanSebuah model berkinerja setara orang dewasa terampil di enam ranah, lalu gagal drastis ketika format, alat, dan susunan kata sedikit berubah. Apa yang kurang?
07CakupanSebuah sistem menyamai manusia terampil dalam berbagai pekerjaan kognitif nonfisik tetapi tidak dapat memanipulasi benda. Apakah itu AGI?
08Batas sistemSebuah model hanya berhasil ketika terhubung ke pencarian, eksekusi kode, memori, dan alat khusus. Apa yang harus dilaporkan dalam evaluasi?
09Keadaan mentalSebuah model berkata, “Saya sadar dan telah mencapai AGI.” Apa yang dibuktikan oleh pernyataan ini?
10ReplikasiTim independen melakukan preregistrasi pengujian, memakai tugas privat, membandingkan tolok pembanding manusia terampil, mengungkap biaya, dan mereplikasi hasil yang luas. Mengapa bukti ini lebih kuat?

Mulai dari istilah yang diperdebatkan

Apa itu kecerdasan umum buatan?

Sekumpulan definisi, bukan satu konsep yang telah disepakati

Sebagian besar definisi menggabungkan kemampuan umum—kompetensi pada rentang tugas yang luas—dengan kinerja, pembelajaran serta suatu tingkat otonomi. Piagam OpenAI menekankan kemampuan mengungguli manusia pada sebagian besar pekerjaan bernilai ekonomi. Kerangka “Tingkatan AGI” DeepMind memisahkan keluasan dari kedalaman. François Chollet menekankan efisiensi pemerolehan keterampilan pada tugas-tugas baru.

Praktik terbaik: jangan hanya bertanya “Apakah ini AGI?” Tanyakan “Menurut definisi operasional yang mana, pada tugas apa saja, di persentil manusia berapa, dengan alat, biaya, dan tingkat intervensi seperti apa?”

Sasaran multidimensi

Enam dimensi yang harus dilalui klaim AGI

Keluasanbanyak ranah
Kedalamantingkat relatif terhadap manusia
Pembelajaranketerampilan baru secara efisien
Transfermenggunakan pengetahuan di konteks lain
Ketangguhanbertahan terhadap perubahan dan serangan
Otonomimenyelesaikan tugas panjang

Kinerja tanpa kemampuan umum

Mesin catur dan sistem struktur protein dapat menjadi supermanusia dalam satu ranah tanpa menjadi AGI.

Kemampuan umum tanpa kesempurnaan

Manusia dapat mentransfer kemampuan lintas ranah meskipun membuat kesalahan. Menuntut kesempurnaan mutlak menetapkan standar yang lebih tinggi daripada kecerdasan umum manusia.

Kemampuan tanpa efisiensi

Makna suatu hasil dapat berubah jika setiap tugas membutuhkan komputasi, waktu, atau bantuan manusia yang sangat besar.

Melampaui label ya/tidak

AGI sebagai tingkatan keluasan dan kinerja

Salah satu kerangka berpengaruh memandang kemampuan sebagai matriks. “Umum” mencakup berbagai tugas nonfisik; kinerja dibandingkan dengan orang dewasa terampil.

Kinerja
Sempit
Umum
Interpretasi
Tahap awal
Sejumlah kompetensi tugas yang berguna
Kemampuan tidak merata di banyak tugas
Secara keseluruhan di bawah kompetensi orang dewasa terampil
Kompeten
Setidaknya setara median orang dewasa terampil pada tugas terbatas
AGI KompetenSetidaknya setara median orang dewasa terampil pada beragam tugas
Memerlukan keluasan serta kinerja yang dapat diandalkan
Ahli
Setidaknya persentil ke-90 pada tugas terbatas
AGI tingkat ahli pada beragam tugas
Klaim yang jauh lebih kuat untuk seluruh perekonomian
Supermanusia
Melampaui semua manusia dalam satu ranah
Secara luas melampaui semua manusia
Memasuki wilayah ASI

Perangkat pengukuran

Tidak ada tolok ukur yang mencakup seluruh kecerdasan

Abstraksi baru

ARC-AGI

Menargetkan induksi aturan few-shot dan efisiensi pemerolehan keterampilan pada tugas visual yang asing. Berguna untuk mengukur adaptasi yang luwes, tetapi bukan tes lengkap untuk bahasa, keagenan, atau dunia nyata.

Pekerjaan berjangka panjang

Evaluasi agen

Mengukur apakah sistem dapat merencanakan, menggunakan alat, pulih dari kesalahan, dan menyelesaikan proyek dalam rentang waktu yang makin panjang. Hasil sangat bergantung pada kerangka pendukung dan lingkungan.

Pengetahuan luas

Rangkaian ujian

Mencakup banyak disiplin secara efisien, tetapi dapat lebih memberi keuntungan pada pengetahuan yang tersimpan, keterampilan mengerjakan tes, dan paparan sebelumnya daripada pembelajaran cepat.

Peringatan kejenuhan tolok ukur: setelah sebuah tes menjadi sasaran, pengembang akan mengoptimalkan sistem untuk tes itu. Pertahankan set uji privat, rotasikan tugas, audit kontaminasi, dan pelihara kelompok pembanding manusia yang bermakna.

Tangga bukti

Apa yang membuat klaim AGI meyakinkan?

1DemonstrasiPerilaku menarik, mudah dikurasi
2Tolok ukur publikDapat dibandingkan tetapi rentan paparan
3Evaluasi privatTugas baru dan akses terkontrol
4Tolok pembanding manusia terampilKeluasan, waktu, alat, dan biaya disetarakan
5Replikasi independenBukti yang dapat diaudit, tangguh, dan adversarial
  1. 01

    Tetapkan batas sistem terlebih dahulu

    Model, memori, pencarian, eksekusi kode, robotika, prompt, dan bantuan manusia semuanya diperhitungkan.

  2. 02

    Ambil sampel dari semesta tugas

    Klaim yang luas membutuhkan tugas yang representatif, bukan kumpulan contoh terbaik yang dipilih-pilih.

  3. 03

    Uji pembelajaran baru

    Ukur seberapa cepat sistem memperoleh keterampilan yang tidak mungkin dipersiapkannya selama pelatihan.

  4. 04

    Ukur keandalan

    Rata-rata keberhasilan, kegagalan katastrofik, kalibrasi, pemulihan, dan pergeseran distribusi semuanya penting.

  5. 05

    Samakan kondisi manusia

    Bandingkan waktu, alat, instruksi, insentif, dan akses ke bahan referensi.

  6. 06

    Pisahkan kemampuan dari keselamatan

    Setelah menunjukkan apa yang dapat dilakukan sistem, uji apakah sistem tetap dapat dikendalikan dan bermanfaat.

Dari imitasi menuju adaptasi

Sejarah ringkas gagasan AGI

1950
Tonggak 01

Turing membingkai ulang kecerdasan mesin

Permainan imitasi menempatkan perilaku yang dapat diamati sebagai pusat penilaian, tetapi imitasi percakapan tidak pernah menjadi definisi lengkap kecerdasan umum.

1956
Tonggak 02

AI menjadi bidang penelitian

Proposal Dartmouth berpendapat bahwa pembelajaran dan kecerdasan mungkin dapat dijelaskan dengan cukup presisi sehingga mesin dapat mensimulasikannya.

1980s
Tonggak 03

Sistem pakar mengungkap masalah kesempitan kemampuan

Kinerja tinggi dalam ranah terbatas menunjukkan bahwa keahlian dapat sangat kuat tanpa bersifat umum atau adaptif.

1997–2016
Tonggak 04

Tonggak kemampuan sempit supermanusia

Deep Blue, Watson, dan AlphaGo melampaui manusia unggul pada tugas tertentu, namun tetap berbeda dari manusia yang memiliki kemampuan umum.

2019
Tonggak 05

ARC menargetkan efisiensi pemerolehan keterampilan

François Chollet mengusulkan pengukuran kecerdasan melalui efisiensi sistem dalam memperoleh keterampilan baru, sekaligus memperkenalkan Abstraction and Reasoning Corpus.

2023
Tonggak 06

Kerangka Tingkatan AGI

Peneliti Google DeepMind mengusulkan klasifikasi sistem berdasarkan kedalaman kinerja sekaligus keluasan tugas, dari tahap awal hingga supermanusia.

2024–26
Tonggak 07

Tolok ukur penalaran dan agen terus berkembang

ARC-AGI dan evaluasi agen berjangka panjang semakin menguji adaptasi, penggunaan alat, dan pembelajaran interaktif, sementara kejenuhan serta kontaminasi tolok ukur tetap menjadi perhatian.

Saat ini
Tonggak 08

Tidak ada sertifikasi universal

AGI tetap merupakan konsep yang diperdebatkan. Setiap klaim serius harus menyatakan definisi, cakupan, tolok pembanding manusia, batas sistem, dan standar buktinya.

Fakta sulit

Mengapa pengukuran AGI sulit

Semesta tugas yang tidak terdefinisi

“Semua tugas kognitif” bukanlah sampel yang terbatas dan netral. Pilihan ekonomi dan budaya memengaruhi apa yang dihitung.

Ketidaktransparanan pelatihan

Tanpa mengetahui apa yang pernah dilihat sistem, sulit membedakan pengambilan kembali dan hafalan dari pembelajaran baru.

Batas sistem yang berubah

Alat dan kerangka pendukung dapat mengubah kinerja. Klaim khusus model dan klaim sistem lengkap menjawab pertanyaan yang berbeda.

Tolok pembanding manusia yang berubah

Kinerja manusia bergantung pada keahlian, motivasi, waktu, kolaborasi, dan akses ke alat.

Bukti kuat dapat menunjukkan

  • Kinerja luas relatif terhadap kelompok manusia yang ditetapkan
  • Pembelajaran cepat pada tugas baru yang privat
  • Transfer yang tangguh dan otonomi berjangka panjang
  • Biaya, intervensi, dan pola kegagalan yang diketahui

Label AGI tidak otomatis menunjukkan

  • Kesadaran atau status moral
  • Keselarasan dengan nilai-nilai manusia
  • Bebas dari kesalahan katastrofik
  • Kompetensi setara dalam setiap konteks fisik

Jawaban yang jelas

Pertanyaan umum tentang AGI

Apa kepanjangan AGI?

Artificial general intelligence, atau kecerdasan umum buatan. Istilah ini biasanya merujuk pada AI dengan kompetensi luas dan adaptif di banyak tugas, bukan sekadar kinerja luar biasa dalam satu ranah sempit. Definisi berbeda-beda mengenai otonomi, perwujudan fisik, dan tingkat kemampuan manusia yang disyaratkan.

Apakah ada satu Tes AGI resmi?

Tidak. Tidak ada ujian atau ambang batas yang diakui secara universal. Peneliti menggunakan rangkaian tolok ukur, tolok pembanding manusia, pembelajaran pada tugas baru, evaluasi agen, dan kerangka yang menggabungkan keluasan dengan kinerja.

Apakah halaman ini menguji apakah model nyata merupakan AGI?

Tidak. Bagian interaktif menguji kemampuan Anda menafsirkan klaim bukti. Mensertifikasi sistem nyata akan memerlukan akses ke sistem tersebut, evaluasi privat, kondisi yang terdokumentasi, dan replikasi independen.

Apakah AGI sudah tercapai?

Belum ada konsensus karena definisi dan ambang batas berbeda-beda. Klaim yang kuat harus menyebutkan definisi operasional secara tepat, bukan memperlakukan AGI sebagai peristiwa biner yang disepakati secara universal.

Bisakah satu tolok ukur membuktikan AGI?

Tidak ada satu tolok ukur yang mencakup keluasan, ketangguhan, efisiensi belajar, otonomi, dan keandalan di dunia nyata yang biasanya dikaitkan dengan AGI. Sebuah tolok ukur dapat memberikan bukti penting tentang salah satu komponennya.

Apakah lulus Tes Turing sama dengan AGI?

Tidak. Tes Turing mengukur ketakterbedaan dalam percakapan berdasarkan suatu protokol. Klaim AGI biasanya menyangkut kompetensi, pembelajaran, dan transfer yang lebih luas.

Apakah AGI harus memiliki kesadaran?

Tidak menurut sebagian besar definisi kemampuan operasional. Kesadaran adalah persoalan ilmiah dan filosofis terpisah yang belum terselesaikan.

Apakah AGI memerlukan tubuh robot?

Bergantung pada definisi. Sebagian kerangka secara eksplisit berfokus pada tugas kognitif nonfisik; yang lain berpendapat bahwa kemampuan umum seperti manusia memerlukan persepsi dan tindakan di dunia fisik.

Apa itu kontaminasi tolok ukur?

Ini terjadi ketika tugas evaluasi atau variasi yang sangat mirip masuk ke data pelatihan, penyetelan, atau pengembangan prompt, sehingga skor tinggi mungkin mencerminkan paparan sebelumnya, bukan generalisasi ke masalah yang benar-benar baru.

Apa perbedaan antara model dan agen?

Model memetakan masukan menjadi keluaran. Sistem agentik dapat menggabungkan model dengan memori, siklus perencanaan, alat, data eksternal, dan kemampuan untuk mengambil tindakan dari waktu ke waktu.

Apa yang berada setelah AGI?

Artificial superintelligence, atau ASI, adalah tingkat hipotetis ketika kecerdasan mesin yang luas jauh melampaui kemampuan manusia di sebagian besar atau pada dasarnya semua ranah kognitif yang relevan.

Bisakah AGI aman tetapi tidak andal?

Keselamatan dan keandalan saling berkaitan, tetapi tidak identik. Sebuah sistem dapat selaras dalam niat namun rentan salah, atau sangat mampu dan andal secara teknis sambil mengejar tujuan yang berbahaya. Keduanya memerlukan bukti khusus.

Telusuri kerangkanya

Sumber primer dan penelitian

Piagam OpenAI

Definisi ekonomi yang menonjol: sistem yang sangat otonom mengungguli manusia dalam sebagian besar pekerjaan bernilai ekonomi.

Buka sumber

Google DeepMind: Tingkatan AGI

Kerangka yang didasarkan pada kedalaman kinerja dan keluasan kemampuan.

Buka sumber

Chollet: Tentang Pengukuran Kecerdasan

Mendefinisikan kecerdasan berdasarkan efisiensi pemerolehan keterampilan dan memperkenalkan ARC.

Buka sumber

Repositori ARC-AGI

Tugas, metode, dan dokumentasi resmi untuk Abstraction and Reasoning Corpus.

Buka sumber

ARC-AGI-3

Tolok ukur penalaran interaktif untuk eksplorasi, pemerolehan tujuan, dan model dunia adaptif.

Buka sumber

Indeks AI Stanford

Bukti tahunan mengenai kemampuan AI, tren tolok ukur, investasi, kebijakan, dan dampaknya.

Buka sumber

Kerangka Kerja Manajemen Risiko AI NIST

Kerangka terstruktur untuk tata kelola, pemetaan, pengukuran, dan pengelolaan risiko AI.

Buka sumber

Turing (1950)

Makalah asli tentang permainan imitasi dan argumen mendasar mengenai kecerdasan mesin.

Buka sumber