PANDUAN AI INTERAKTIF: Nilai perilaku, lalu periksa buktinya Masuk ke laboratorium
Teleprinter bersejarah di ruangan gelap dengan dua orang anonim yang bercakap di balik layar

Manusia atau mesin?

Tes Turing

Masuklah ke balik layar, nilai delapan percakapan anonim, dan temukan mengapa permainan yang tampak sederhana ini telah membentuk 75 tahun perdebatan tentang mesin, bahasa, dan kecerdasan.

Penilaian buta 8 ronde percakapan Klaim diberi batasan secara cermat

Baca ini terlebih dahulu

Gagasan nyata—direka ulang tanpa klaim ilmiah palsu

Laboratorium interaktif di bawah ini secara akurat merekonstruksi perbandingan buta, penilaian wajib, penilaian tingkat keyakinan dan pengungkapan setelah tes. Percakapannya merupakan simulasi editorial, bukan rekaman studi terkontrol secara langsung. Hasil Anda mengukur sejauh mana tebakan Anda sesuai dengan label tersembunyi dalam demonstrasi ini; hasil tersebut tidak membuktikan apakah AI masa kini benar-benar berpikir.

Bukti ditinjau dan halaman diperbarui 08/2026

1950Makalah penting diterbitkanDi jurnal Mind
Hanya teksPetunjuk identitas disembunyikanPerilaku dinilai melalui dialog
Tidak ada ambang resmiProtokol mendefinisikan “lulus” secara berbeda30% bukan aturan universal
Perilaku ≠ pikiranKetakterbedaan adalah hasil yang dinilaiKesadaran tidak diukur secara langsung

Eksperimen interaktif

Laboratorium Permainan Imitasi

Anda adalah interogator. Pada setiap ronde, satu respons memiliki label tersembunyi simulasi sebagai mesin dan respons lainnya memiliki label manusia . Pilih respons mesin dan laporkan tingkat keyakinan Anda.

Kemajuan0/8

Label kejujuran: contoh-contoh ini sengaja ditulis untuk tujuan pembelajaran, bukan berasal dari orang sungguhan atau keluaran model tertentu. Contoh ini menunjukkan petunjuk umum—dan mengapa petunjuk tersebut tidak dapat diandalkan.

Peran AndaAnda menilai respons—bukan menjawab prompt itu sendiri
  1. 1

    Baca kedua saksi. Bandingkan cara A dan B menangani prompt yang sama.

  2. 2

    Pilih respons yang menurut Anda memiliki label mesin. Tepat satu respons pada setiap pasangan memiliki label tersebut.

  3. 3

    Atur keyakinan dari 50–100%. Gunakan 50% jika benar-benar menebak; gunakan 100% hanya jika Anda merasa yakin.

Petunjuk yang berguna—namun tidak sempurna:konteks dan penilaian pragmatisspesifik tanpa penjelasan berlebihankonsistensikoreksi yang alamihumor adaptifTata bahasa yang sempurna saja bukan bukti bahwa respons berasal dari mesin.
01Memori & detailCeritakan satu momen kecil dan biasa dari minggu ini yang terus teringat oleh Anda.
02AmbiguitasSam memberi tahu Alex bahwa presentasi mereka membingungkan. Presentasi siapa yang dimaksud?
03HumorBuat lelucon garing tentang printer.
04KoreksiSaya punya tiga apel. Saya makan dua lalu membeli satu lagi. Jadi sekarang saya punya tiga, benar?
05Penilaian sosialSeorang teman dengan bangga menyajikan makanan yang tidak Anda sukai. Apa yang Anda katakan?
06Detail pengalaman fisikApa yang menjengkelkan saat membuka stoples baru?
07Mengikuti batasanJawab tepat dengan enam kata: mengapa orang menyimpan tiket lama?
08MetakognisiPertanyaan apa yang akan membantu Anda menentukan apakah saya manusia?

Definisi inti

Apa yang sebenarnya diuji oleh Tes Turing

Kriteria perilaku, bukan pemindaian otak

Tugas penilai bersifat epistemik: Dapatkah saya mengetahui peserta mana yang merupakan mesin dari percakapan ini? Layar meniadakan penampilan, suara, dan konstruksi mekanis. Jika perilaku mesin menjadi tidak dapat dibedakan dari perilaku manusia dalam protokol tersebut, mesin berhasil dalam tugas imitasi itu.

Klaim yang cermat: “Dalam eksperimen ini, mesin tidak dapat dibedakan secara andal dari pembanding manusia.” Pernyataan itu lebih kuat daripada sekadar mengatakan mesin terdengar lancar, tetapi lebih sempit daripada menyatakan bahwa mesin memiliki kesadaran.

Penyamaran identitas

Penilai tidak boleh mengetahui identitas saksi atau menerima petunjuk melalui kanal samping seperti kecepatan mengetik, perbedaan antarmuka, atau metadata.

Perbandingan

Saksi manusia penting. Tingkat identifikasi mereka menunjukkan seberapa sering manusia sungguhan dikira mesin dalam kondisi yang sama.

Inferensi

Hasil memerlukan ukuran sampel, ketidakpastian, dan aturan yang dipilih sebelum data diperiksa—bukan judul berita yang dipilih setelah percakapan yang menguntungkan.

Cetak biru eksperimen

Cara menjalankan Tes Turing modern yang kredibel

  1. 01

    Tulis klaim sebelum pengujian

    Tentukan apakah hasil yang diukur berupa akurasi identifikasi, tingkat dinilai “manusia”, tingkat kemenangan berpasangan, atau kesetaraan statistik dengan saksi manusia.

  2. 02

    Rekrut peserta yang dapat dibandingkan

    Tetapkan keahlian penilai, bahasa, kelompok saksi manusia, aturan inklusi, dan kompensasi. Persona anak atau persona pengguna bahasa kedua akan mengubah tugas.

  3. 03

    Standarkan akses

    Berikan waktu, alat pengetahuan, dan batas pesan yang sebanding kepada manusia dan mesin. Tentukan apakah penelusuran web, jeda, penyuntingan, dan penolakan diperbolehkan.

  4. 04

    Acak dan samarkan identitas

    Tetapkan kondisi secara acak dan sembunyikan identitas. Normalkan antarmuka agar font, waktu respons, dan kesalahan sistem tidak membocorkan jawabannya.

  5. 05

    Gunakan dialog langsung dan adaptif

    Biarkan penilai mengajukan pertanyaan lanjutan. Catat transkrip lengkap, versi model, prompt, parameter, dan lapisan moderasi apa pun yang diperlukan untuk replikasi.

  6. 06

    Analisis set data lengkap

    Laporkan tolok pembanding manusia dan mesin, interval kepercayaan, data yang dikecualikan, kegagalan, dan hasil subkelompok. Satu penilai yang terkecoh hanyalah anekdot, bukan bukti kelulusan.

Variabel yang dapat sepenuhnya mengubah hasil
Pilihan desainMengapa pentingLaporkan
DurasiObrolan lima menit lebih menonjolkan kesan pertama; dialog panjang mengungkap konsistensi dan memori.Menit, giliran, dan batas pesan
Kelompok penilaiPakar AI, pekerja crowd, dan pengguna biasa menggunakan petunjuk yang berbeda.Rekrutmen, keahlian, dan bahasa
Tolok pembanding manusiaSebagian manusia sungguhan secara rutin diklasifikasikan sebagai mesin.Tingkat manusia dinilai “manusia” dan ketidakpastian
Konfigurasi modelPrompt, sampling, alat, dan instruksi persona dapat sangat menentukan kinerja.Model/versi dan konfigurasi yang tepat
AntarmukaLatensi, salah ketik, pemformatan, atau pesan keselamatan dapat membocorkan identitas.Prosedur penyamaran dan normalisasi
Kriteria kelulusanPeluang acak, 30%, noninferioritas, dan ketakterbedaan adalah klaim yang berbeda.Hipotesis dan statistik yang dipreregistrasi

Oktober 1950 · Mind 59(236)

Apa yang sebenarnya diusulkan Alan Turing

Turing membuka dengan pertanyaan “Bisakah mesin berpikir?” dan langsung berpendapat bahwa makna sehari-hari dari kata mesin dan berpikir terlalu ambigu untuk survei yang berguna. Ia menggantinya dengan sebuah “permainan imitasi.”

Makalah itu mula-mula menjelaskan permainan tiga orang yang melibatkan seorang pria, seorang wanita, dan interogator yang harus mengidentifikasi mereka melalui jawaban tertulis. Turing kemudian bertanya apa yang terjadi ketika mesin mengambil salah satu peran. Di bagian lain makalah, ia membahas pengaturan mesin versus manusia yang lebih langsung. Para akademisi masih memperdebatkan secara tepat formulasi mana yang seharusnya disebut sebagai Tes Turing.

Sembilan keberatan, satu perdebatan yang bertahan lama

Argumen yang dihadapi Turing pada 1950

01

Teologis

Berpikir dikaitkan dengan jiwa abadi yang hanya dimiliki manusia.

02

“Kepala di dalam pasir”

Konsekuensi dari mesin yang dapat berpikir dianggap terlalu mengerikan, sehingga orang berharap mesin semacam itu tidak mungkin ada.

03

Batas matematis

Sistem formal memiliki batas; Turing menjawab bahwa manusia juga membuat kesalahan dan mungkin memiliki batas.

04

Kesadaran

Sebuah mesin tidak dapat dikatakan berpikir kecuali ia merasakan sesuatu dan mengetahui bahwa ia merasakannya.

05

Ketidakmampuan

Mesin diklaim tidak akan pernah dapat bersikap baik, kreatif, humoris, banyak akal—atau melakukan banyak hal manusiawi lainnya.

06

Lady Lovelace

Mesin hanya dapat melakukan apa yang kita tahu cara memerintahkannya; Turing mempertimbangkan kejutan dan pembelajaran.

07

Kontinuitas saraf

Otak bersifat kontinu, sedangkan komputer digital bersifat diskret. Permainan ini berfokus pada respons yang dapat diamati.

08

Perilaku informal

Tidak ada buku aturan terbatas yang menentukan semua tindakan manusia; hal itu tidak membuktikan bahwa perilaku tidak dapat muncul dari mesin.

09

ESP

Turing secara mengejutkan memperlakukan telepati sebagai faktor pengganggu yang mungkin dan membayangkan “ruangan kedap telepati.”

Dari komputabilitas menuju chatbot

Sejarah lengkap Tes Turing

Linimasa ini memisahkan tulisan Turing, eksperimen berikutnya, dan klaim “lulus” modern. Nama yang mirip tidak berarti protokolnya identik.

1936
Bab 01

Model komputasi universal

Makalah Turing tentang bilangan yang dapat dihitung menjelaskan mesin abstrak yang kini disebut mesin Turing. Itu bukan Tes Turing, tetapi menjadi salah satu dasar komputasi serbaguna.

1948
Bab 02

“Mesin Cerdas”

Dalam laporan National Physical Laboratory yang tidak diterbitkan, Turing membahas kecerdasan mesin, pembelajaran, dan mesin yang tidak terorganisasi—gagasan pendahulu penting bagi argumennya kemudian.

1950
Bab 03

Permainan imitasi diterbitkan

Jurnal Mind menerbitkan “Computing Machinery and Intelligence.” Turing mengganti pertanyaan licin “Bisakah mesin berpikir?” dengan permainan imitasi operasional yang dilakukan melalui komunikasi tertulis.

1956
Bab 04

Kecerdasan buatan mendapat nama

Proposal riset musim panas Dartmouth menggunakan istilah “kecerdasan buatan” dan berpendapat bahwa aspek pembelajaran dan kecerdasan, pada prinsipnya, dapat dijelaskan secara presisi untuk sebuah mesin.

1966
Bab 05

ELIZA menunjukkan ilusi percakapan

ELIZA karya Joseph Weizenbaum menggunakan pencocokan pola dan transformasi terprogram. Skrip DOCTOR-nya menunjukkan betapa mudahnya orang mengatribusikan pemahaman pada perilaku dialog yang relatif sederhana.

1972
Bab 06

PARRY menghadapi uji ketakterbedaan

Kenneth Colby dan rekan-rekannya mengevaluasi model proses paranoid dengan meminta penilai membedakan wawancara melalui teletype dengan program dari wawancara dengan pasien.

1980
Bab 07

Keberatan Kamar Tiongkok

John Searle berpendapat bahwa menghasilkan rangkaian simbol yang sesuai belum tentu berarti memahami, sehingga memperjelas perbedaan antara keberhasilan perilaku dan klaim tentang keadaan mental internal.

1990–91
Bab 08

Era Loebner Prize dimulai

Hugh Loebner mendanai kompetisi tahunan yang meniru Tes Turing terbatas. Kompetisi itu memopulerkan gagasan tersebut, tetapi kritikus berpendapat bahwa obrolan singkat dan hadiah mendorong penggunaan trik percakapan.

2014
Bab 09

Eugene Goostman menjadi berita utama—dan kontroversi

Dalam acara University of Reading, bot yang memerankan remaja Ukraina berusia 13 tahun dinilai sebagai manusia oleh 33% penilai. Penyelenggara menyebutnya lulus; banyak peneliti menolak klaim “pertama” tersebut dan aturan 30% yang diadopsi kemudian.

2024
Bab 10

Studi GPT-4 yang dipreregistrasi

Jones dan Bergen melaporkan tes dua pemain yang acak, terkontrol, dan dipreregistrasi: GPT-4 dinilai sebagai manusia dalam 54% percakapan lima menit, dibandingkan 67% untuk saksi manusia dan 22% untuk ELIZA.

2025
Bab 11

Model baru, varian baru

Penelitian lanjutan melaporkan bahwa beberapa model bahasa besar dengan prompt tertentu secara statistik tidak dapat dibedakan dari saksi manusia dalam rancangan lima menit tertentu, sementara riset ACL mengeksplorasi format tes yang lebih panjang dan dinamis.

Saat ini
Bab 12

Tidak ada satu garis akhir resmi

“Tes Turing” kini merujuk pada sekelompok eksperimen perilaku. Hasil bergantung pada model, prompt, orang yang terlibat, kelompok penilai, durasi, antarmuka, tolok pembanding, dan aturan statistik.

Kesimpulan yang jujur

Apakah mesin pernah lulus Tes Turing?

Ya menurut beberapa tes yang didefinisikan; tidak menurut satu standar universal.

Tidak ada otoritas resmi Tes Turing, kelompok penilai tetap, durasi wajib, atau ambang yang diterima secara universal. Setiap klaim harus menyertakan protokolnya.

Bukti awal

PARRY · 1972

Penilai membandingkan wawancara psikiatris melalui teletype dengan simulasi proses paranoid dan pasien nyata. Ini merupakan studi validasi yang terfokus, bukan percakapan umum tanpa batas.

Kelulusan yang diperdebatkan

Eugene Goostman · 2014

Dilaporkan bahwa 33% penilai mengklasifikasikan bot tersebut sebagai manusia dalam obrolan lima menit. Personanya sebagai anak 13 tahun yang bukan penutur asli memberi alasan bagi kesalahan; narasi “kelulusan pertama” banyak diperdebatkan.

Studi terkontrol

GPT-4 · 2024

Dalam studi acak yang dipreregistrasi, GPT-4 dinilai “manusia” dalam 54% sesi, sementara manusia sungguhan mendapat 67%. Hasil ini mendukung ketakterbedaan dalam rancangan dua pemain berdurasi lima menit tersebut.

Cara membaca judul berita: “Mengecoh penilai” saja tidak cukup. Tanyakan: dibandingkan dengan manusia yang mana, berapa lama, dengan prompt apa, dalam berapa banyak percobaan, dan menggunakan uji statistik apa?

Apa yang dapat disembunyikan oleh kelancaran

Apa yang dapat—dan tidak dapat—dibuktikan oleh tes

Tes dapat memberikan bukti tentang…

  • Perilaku percakapan mirip manusia
  • Adaptasi sosial dan linguistik
  • Konsistensi sepanjang interaksi
  • Kemampuan penilai membedakan peserta dalam kondisi yang ditetapkan
  • Perbandingan model tertentu dengan saksi manusia

Dengan sendirinya, tes tidak dapat membuktikan…

  • Pengalaman sadar atau kesadaran diri
  • Kejujuran, akurasi faktual, atau kebijaksanaan
  • Kompetensi umum di luar percakapan
  • Persepsi fisik atau kenangan pribadi yang nyata
  • Keselamatan, status moral, atau kecerdasan setara manusia

Tes memberi keuntungan pada imitasi

Kecerdasan nonmanusia yang sangat mampu dapat gagal karena tidak berpura-pura menjadi manusia; sistem yang dangkal dapat berhasil melalui persona dan taktik mengelak.

Tes ini sarat muatan budaya

Penilai dapat salah mengira dialek, disabilitas, gaya formal, atau tulisan dalam bahasa kedua sebagai perilaku mesin. Kemiripan dengan manusia bukan sasaran yang netral.

Perilaku tidak menentukan mekanisme secara unik

Jawaban yang setara dapat berasal dari proses internal yang berbeda. Kualitas transkrip saja tidak mengungkap bagaimana sistem merepresentasikan atau memahami sesuatu.

Tes ini bukan tolok ukur kemampuan

Evaluasi modern biasanya memisahkan penalaran, pemrograman, faktualitas, ketangguhan, keselamatan, dan keahlian ranah, alih-alih memadatkan semuanya menjadi kemampuan mengecoh.

Panduan lapangan interogator

Pertanyaan yang lebih baik untuk tes langsung

Tidak ada prompt ajaib yang dapat mengungkap mesin. Gunakan pertanyaan bercabang yang menuntut konteks, lalu kembali ke informasi sebelumnya.

01

Jangkar sebuah kenangan

“Gambarkan ruangannya, lalu beri tahu detail apa yang baru Anda sadari setelah masuk.”

Tindak lanjut: ubah waktu atau sudut pandang.
02

Ungkap ambiguitas

Berikan kalimat dengan dua makna yang masuk akal dan tanyakan makna mana yang akan disimpulkan orang yang sedang terburu-buru.

Tindak lanjut: tanyakan konteks apa yang akan membalikkan kesimpulan itu.
03

Uji kontinuitas

Perkenalkan fakta kecil di awal, ganti topik, lalu kemudian ajukan pertanyaan yang bergantung pada fakta tersebut.

Tindak lanjut: pertanyakan inkonsistensi dengan sopan.
04

Gunakan gesekan sosial

Sajikan dilema ketika kejujuran, kebijaksanaan bertutur, loyalitas, dan konsekuensi saling bertentangan.

Tindak lanjut: ubah hubungan antarpihak.
05

Minta transformasi

Minta sebuah lelucon, lalu minta dibuat lebih tidak kentara, lebih pendek, dan sesuai untuk audiens tertentu.

Tindak lanjut: tanyakan mengapa revisi tersebut berhasil.
06

Undang ketidakpastian

Tanyakan sesuatu yang kurang terperinci dan lihat apakah saksi menyadari informasi yang hilang.

Tindak lanjut: berikan satu fakta yang hilang pada satu waktu.

Hindari kesalahan kategori

Tes Turing vs. evaluasi AI lainnya

EvaluasiPertanyaan utamaBukti terkuatTidak menunjukkan secara langsung
Tes TuringDapatkah penilai membedakan percakapan mesin dari percakapan manusia?Interaksi buta ditambah tolok pembanding manusiaKesadaran atau keandalan faktual
Tolok ukur kemampuanDapatkah sistem menyelesaikan kelas tugas yang telah ditetapkan?Item uji yang disisihkan, kontrol kontaminasi, analisis kesalahanKemiripan dengan manusia
Evaluasi keselamatanBagaimana perilaku sistem dalam kondisi berisiko atau adversarial?Model ancaman, red teaming, pemantauan lapanganKecerdasan umum
Tes IQBagaimana kinerja seseorang dibandingkan dengan norma berdasarkan usia?Standardisasi, keandalan, dan validitasKesadaran mesin atau imitasi
Total Tes TuringDapatkah sistem menyamai persepsi, bahasa, dan tindakan fisik manusia?Interaksi multimodal dan robotikMekanisme internal yang unik

Jawaban yang jelas

Pertanyaan yang sering diajukan

Apa itu Tes Turing?

Tes ini adalah pengujian perilaku yang terinspirasi oleh permainan imitasi Alan Turing. Seorang penilai berkomunikasi melalui kanal teks dengan peserta yang identitasnya disembunyikan dan mencoba membedakan mesin dari manusia. Keberhasilan berkaitan dengan perilaku percakapan yang tidak dapat dibedakan dalam kondisi yang dinyatakan—bukan akses langsung ke pikiran atau kesadaran.

Apakah “tes Turin” adalah hal yang sama?

“Tes Turin” adalah salah eja yang umum. Nama yang benar adalah Tes Turing, diambil dari matematikawan Inggris dan pelopor komputasi Alan M. Turing. Turin adalah sebuah kota di Italia.

Apakah laboratorium interaktif di atas merupakan Tes Turing ilmiah yang nyata?

Tidak. Ini adalah simulasi edukatif yang transparan tentang penilaian buta. Eksperimen yang dapat dipertanggungjawabkan memerlukan saksi manusia dan mesin secara langsung atau rekaman yang konsisten, penugasan acak, protokol yang ditetapkan, jumlah penilai yang memadai, hasil yang dipreregistrasi, dan analisis statistik.

Apakah Turing mengatakan bahwa mengecoh 30% penilai berarti mesin lulus?

Bukan sebagai aturan kelulusan universal. Pada 1950, ia memprediksi bahwa sekitar tahun 2000 seorang interogator rata-rata hanya akan memiliki peluang paling tinggi 70% untuk melakukan identifikasi dengan benar setelah lima menit. Acara-acara berikutnya sering menafsirkan ulang hal ini sebagai ambang pengecohan 30%.

Apakah ada AI yang pernah lulus Tes Turing?

Menurut beberapa versi operasional, ya. Namun tidak ada satu versi yang diterima secara universal beserta otoritas atau standarnya. ELIZA, PARRY, peserta Loebner, Eugene Goostman, dan model bahasa modern diuji dengan protokol berbeda, sehingga kata “lulus” selalu harus disertai keterangan.

Apakah kelulusan membuktikan kecerdasan?

Hasil tersebut menunjukkan keberhasilan perilaku percakapan mirip manusia dalam situasi itu. Apakah hal ini layak disebut kecerdasan bergantung pada definisinya. Dengan sendirinya, hasil itu tidak membuktikan kejujuran, keluasan penalaran, kesadaran, emosi, perwujudan fisik, atau kompetensi dunia nyata yang aman.

Apakah kegagalan membuktikan bahwa sistem tidak cerdas?

Tidak. Kalkulator, pembukti teorema, atau sistem ilmiah dapat sangat mampu tanpa meniru percakapan santai manusia. Tes ini menghargai jenis kinerja sosial-linguistik tertentu.

Mengapa percakapannya hanya menggunakan teks?

Pembatas tersebut mencegah penilai menggunakan penampilan, suara, atau bentuk fisik sebagai jalan pintas. Turing membayangkan kanal mirip teleprinter. Teks mengisolasi bukti percakapan, meskipun varian modern terkadang menambahkan penglihatan atau robotika.

Apa itu Total Tes Turing?

Ini adalah perluasan yang muncul kemudian dengan menambahkan persepsi dan interaksi fisik, biasanya mencakup penglihatan dan robotika selain bahasa. Konsep ini tidak boleh disamakan dengan pengaturan hanya-teks dalam makalah Turing tahun 1950.

Pertanyaan seperti apa yang paling efektif?

Pertanyaan lanjutan adaptif bekerja lebih baik daripada daftar teka-teki. Mintalah klarifikasi, kunjungi kembali klaim sebelumnya, masukkan ambiguitas, uji konteks sosial, minta respons kreatif dengan batasan tertentu, dan selidiki kontradiksi. Tidak ada satu pertanyaan yang dapat mengidentifikasi AI modern secara andal.

Bisakah penilai sekadar menanyakan berita terkini atau kenangan pribadi?

Hal itu dapat menciptakan jalan pintas yang tidak adil. Sebuah sistem mungkin sengaja tidak diberi akses penelusuran web, dan manusia mungkin tidak mengetahui berita tersebut. Klaim tentang kenangan pribadi juga dapat dibuat-buat. Protokol yang baik menetapkan pengetahuan yang diizinkan dan mengevaluasi akses yang sebanding.

Mengapa mesin dibandingkan dengan saksi manusia yang nyata?

Manusia menetapkan tolok pembanding kontrol positif. Jika penilai memberi label mesin kepada banyak manusia sungguhan, tugas atau kalibrasi penilai mungkin buruk. “Tingkat dinilai manusia” pada mesin sulit ditafsirkan tanpa tolok pembanding manusia dan peluang acak.

Apakah tes singkat dapat diandalkan?

Sesi singkat memang praktis tetapi lebih mudah dimanipulasi dan mungkin terutama mengukur kesan pertama. Percakapan yang lebih panjang, berulang, adversarial, dan lintas ranah memberikan bukti yang lebih kuat, meski menambah biaya, kelelahan, dan lebih banyak pilihan desain.

Apa itu efek ELIZA?

Ini adalah kecenderungan untuk menganggap adanya pemahaman atau keagenan dari respons komputer di tingkat permukaan. Istilah ini muncul dari reaksi terhadap ELIZA dan tetap relevan ketika keluaran yang lancar mendorong orang menarik kesimpulan melebihi apa yang didukung bukti.

Apakah Tes Turing merupakan tes IQ?

Tidak. Tes IQ membandingkan kinerja pada tugas kognitif terstandar dengan norma berdasarkan usia. Tes Turing mengevaluasi apakah penilai dapat mengidentifikasi mesin percakapan dalam protokol tertentu.

Telusuri klaimnya

Sumber primer dan akademis

Sejarah di atas memprioritaskan makalah asli dan catatan penelitian. Hasil modern disajikan beserta kondisi studinya, bukan dipromosikan sebagai tonggak universal.

Turing (1950), “Computing Machinery and Intelligence”

Makalah primer di jurnal Mind, volume 59, edisi 236, halaman 433–460.

Buka sumber

Arsip Digital Turing

Entri katalog King’s College Cambridge untuk bahan manuskrip Turing.

Buka sumber

Proposal AI Dartmouth

Proposal tahun 1955 untuk proyek riset musim panas 1956 yang memberi nama pada kecerdasan buatan.

Buka sumber

Weizenbaum (1966), ELIZA

Artikel asli di Communications of the ACM yang menjelaskan ELIZA.

Buka sumber

Colby dkk. (1972), studi PARRY

Makalah asli di jurnal Artificial Intelligence tentang uji ketakterbedaan bergaya Turing.

Buka sumber

Stanford Encyclopedia: Tes Turing

Tinjauan akademis tentang interpretasi, keberatan, varian, dan sejarah kompetisi.

Buka sumber

Jones & Bergen (2024)

Studi acak yang dipreregistrasi mengenai ELIZA, GPT-3.5, GPT-4, dan saksi manusia.

Buka sumber

Wu, Wu & Zhao (ACL 2025)

Karya yang ditinjau sejawat yang mengusulkan X-TURING untuk agen dialog jangka lebih panjang.

Buka sumber