GUÍA INTERACTIVA DE IA: Juzga el comportamiento y después examina la evidencia Entrar en el laboratorio
Teletipo histórico en una sala oscura con dos personas anónimas conversando detrás de pantallas

¿Humano o máquina?

The Prueba de Turing

Ponte detrás de la pantalla, juzga ocho intercambios anónimos y descubre por qué un juego engañosamente simple ha marcado 75 años de debate sobre máquinas, lenguaje e inteligencia.

Evaluaciones a ciegas 8 rondas de conversación Afirmaciones cuidadosamente matizadas

Lee esto primero

Una idea real, recreada sin falsas afirmaciones científicas

El laboratorio interactivo que aparece a continuación recrea con fidelidad la comparación a ciegas, el juicio forzado, la puntuación de confianza y la revelación posterior a la prueba. Sus conversaciones son simulaciones editoriales, no registros de un estudio controlado en directo. Tu resultado mide hasta qué punto tus suposiciones coinciden con las etiquetas ocultas de esta demostración; no demuestra si la IA actual piensa.

Evidencia revisada y página actualizada August 2026

1950Publicación del artículo históricoEn la revista Mind
Solo textoLas pistas de identidad están ocultasEl comportamiento se juzga mediante diálogo
Sin umbral oficialLos protocolos definen «superar» de maneras distintasEl 30 % no es una regla universal
Comportamiento ≠ menteEl resultado es la indistinguibilidadLa consciencia no se mide directamente

Experimento interactivo

Laboratorio del juego de imitación

Tú eres el interrogador. En cada ronda, una respuesta lleva la etiqueta oculta de máquina de la simulación y la otra la etiqueta de humano. Elige la máquina e indica tu nivel de confianza.

Progreso0/8

Aviso de transparencia: estos son ejemplos didácticos redactados deliberadamente, no personas en directo ni respuestas de un modelo concreto. Muestran pistas habituales y por qué esas pistas no son fiables.

Tu papelEstás juzgando las respuestas, no contestando tú mismo a los prompts
  1. 1

    Lee a ambos testigos. Compara cómo responden A y B al mismo prompt.

  2. 2

    Selecciona la respuesta que creas que lleva la etiqueta de máquina. Hay exactamente una en cada pareja.

  3. 3

    Indica una confianza del 50 al 100 %. Usa el 50 % si es como lanzar una moneda; usa el 100 % solo si estás seguro.

Pistas útiles, aunque imperfectas:contexto y criterio pragmáticoprecisión sin explicar en excesocoherenciacorrección naturalhumor adaptativoUna gramática perfecta, por sí sola, no demuestra que sea una máquina.
01Memoria y maticesDescribe un pequeño momento cotidiano de esta semana que se te haya quedado grabado.
02AmbigüedadSam le dijo a Alex que su presentación era confusa. ¿De quién era la presentación?
03HumorInventa un chiste malo sobre una impresora.
04CorrecciónTengo tres manzanas. Me como dos y compro una más. Entonces ahora tengo tres, ¿verdad?
05Criterio socialUn amigo te sirve con orgullo una comida que no te gusta. ¿Qué dices?
06Detalle corporal¿Qué resulta molesto al abrir un tarro nuevo?
07Seguimiento de restriccionesResponde con exactamente seis palabras: ¿por qué guarda la gente entradas antiguas?
08Metacognición¿Qué pregunta te ayudaría a decidir si soy humano?

La definición esencial

Qué evalúa realmente la Prueba de Turing

Un criterio conductual, no un escáner cerebral

La tarea del evaluador es epistémica: ¿Puedo saber, a partir de la conversación, qué participante es la máquina? La pantalla elimina la apariencia, la voz y la construcción mecánica. Si el comportamiento de la máquina se vuelve indistinguible del comportamiento humano bajo el protocolo, la máquina tiene éxito en esa tarea de imitación.

La afirmación prudente: «En este experimento, la máquina no se distinguió de forma fiable de la comparación humana». Eso es más sólido que decir simplemente que sonaba fluida, y más limitado que declarar que es consciente.

Enmascaramiento

El evaluador no debería conocer la identidad del testigo ni recibir pistas por canales laterales, como la velocidad de escritura, diferencias de interfaz o metadatos.

Comparación

Los testigos humanos importan. Su tasa de identificación muestra con qué frecuencia se confunde a personas reales con máquinas bajo las mismas condiciones.

Inferencia

Los resultados necesitan tamaños de muestra, incertidumbre y una regla elegida antes de inspeccionar los datos, no un titular seleccionado después de una conversación favorable.

Diseño experimental

Cómo realizar una Prueba de Turing moderna y creíble

  1. 01

    Define la afirmación antes de probar

    Especifica si el resultado será la precisión de identificación, la tasa de «humano», la tasa de victoria por parejas o la equivalencia estadística con testigos humanos.

  2. 02

    Recluta participantes comparables

    Define la experiencia de los evaluadores, el idioma, el grupo de testigos humanos, las reglas de inclusión y la compensación. Una personalidad infantil o de hablante no nativo cambia la tarea.

  3. 03

    Estandariza el acceso

    Da a humanos y máquinas un tiempo, herramientas de conocimiento y límites de mensajes comparables. Decide si se permiten la navegación web, los retrasos, las ediciones y los rechazos.

  4. 04

    Aleatoriza y enmascara

    Asigna las condiciones al azar y oculta las identidades. Normaliza la interfaz para que las fuentes, los tiempos de respuesta y los errores del sistema no revelen la respuesta.

  5. 05

    Utiliza diálogo adaptativo en directo

    Permite que los evaluadores hagan repreguntas. Registra las transcripciones completas, la versión del modelo, el prompt, los parámetros y cualquier capa de moderación necesaria para la replicación.

  6. 06

    Analiza el conjunto de datos completo

    Informa de las referencias humana y de máquina, los intervalos de confianza, las exclusiones, los fallos y los resultados por subgrupos. Un evaluador engañado es una anécdota, no una prueba superada.

Variables que pueden cambiar por completo el resultado
Decisión de diseñoPor qué importaQué informar
DuraciónLas conversaciones de cinco minutos favorecen las primeras impresiones; los diálogos largos ponen de manifiesto la coherencia y la memoria.Minutos, turnos y límites de mensajes
Grupo de evaluadoresLos expertos en IA, los trabajadores de plataformas colaborativas y los usuarios ocasionales utilizan pistas diferentes.Reclutamiento, experiencia e idioma
Referencia humanaAlgunas personas reales son clasificadas habitualmente como máquinas.Tasa humana de «humano» e incertidumbre
Configuración del modeloLos prompts, el muestreo, las herramientas y las instrucciones de personalidad pueden dominar el rendimiento.Modelo/versión exactos y configuración
InterfazLa latencia, las erratas, el formato o los mensajes de seguridad pueden revelar la identidad.Procedimiento de enmascaramiento y normalización
Criterio para superar la pruebaAzar, 30 %, no inferioridad e indistinguibilidad son afirmaciones distintas.Hipótesis y estadísticas prerregistradas

Octubre de 1950 · Mind 59(236)

Lo que Alan Turing propuso realmente

Turing comenzó con «¿Pueden pensar las máquinas?» y sostuvo inmediatamente que los significados ordinarios de máquina y pensar eran demasiado ambiguos para una investigación útil. Los sustituyó por un «juego de imitación».

El artículo describe primero un juego de tres personas en el que participan un hombre, una mujer y un interrogador que debe identificarlos mediante respuestas escritas. Turing pregunta después qué ocurre cuando una máquina ocupa uno de los papeles. En otra parte del artículo analiza una disposición más directa de máquina frente a humano. Los especialistas siguen debatiendo exactamente qué formulación debe denominarse la Prueba de Turing.

Nueve objeciones, un debate duradero

Argumentos a los que Turing se enfrentó en 1950

01

Teológica

Pensar está ligado a un alma inmortal que solo poseen los seres humanos.

02

«Cabeza en la arena»

Las consecuencias de que existan máquinas pensantes serían demasiado terribles, así que se espera que no puedan existir.

03

Límites matemáticos

Los sistemas formales tienen límites; Turing responde que los humanos también cometen errores y pueden tener límites.

04

Consciencia

No puede decirse que una máquina piense a menos que sienta y sepa que siente.

05

Incapacidades

Supuestamente, las máquinas nunca pueden ser amables, creativas, graciosas, ingeniosas ni hacer incontables otras cosas humanas.

06

Lady Lovelace

Una máquina solo puede hacer aquello que sabemos ordenarle; Turing considera la sorpresa y el aprendizaje.

07

Continuidad del sistema nervioso

El cerebro es continuo, mientras que los ordenadores digitales son discretos. El juego se ocupa de respuestas observables.

08

Comportamiento informal

Ningún conjunto finito de reglas determina toda acción humana; eso no demuestra que el comportamiento no pueda surgir de una máquina.

09

ESP

Sorprendentemente, Turing trató la telepatía como un posible factor de confusión e imaginó una «sala a prueba de telepatía».

De la computabilidad a los chatbots

La historia completa de la Prueba de Turing

Esta cronología separa los escritos de Turing, los experimentos posteriores y las afirmaciones modernas de haber «superado» la prueba. Nombres parecidos no implican protocolos idénticos.

1936
Capítulo 01

Un modelo universal de computación

El artículo de Turing sobre números computables describió la máquina abstracta que hoy llamamos máquina de Turing. No era la prueba de Turing, pero sentó una base para la computación de propósito general.

1948
Capítulo 02

«Intelligent Machinery»

En un informe no publicado del National Physical Laboratory, Turing analizó la inteligencia de las máquinas, el aprendizaje y las máquinas no organizadas, importantes precursores de su argumento posterior.

1950
Capítulo 03

Se publica el juego de imitación

Mind publicó «Computing Machinery and Intelligence». Turing sustituyó la escurridiza pregunta «¿Pueden pensar las máquinas?» por juegos de imitación operacionales realizados mediante comunicación escrita.

1956
Capítulo 04

La inteligencia artificial recibe su nombre

La propuesta de investigación de verano de Dartmouth utilizó el término «inteligencia artificial» y sostuvo que, en principio, aspectos del aprendizaje y la inteligencia podían describirse con precisión para una máquina.

1966
Capítulo 05

ELIZA demuestra la ilusión conversacional

ELIZA, de Joseph Weizenbaum, utilizaba coincidencia de patrones y transformaciones programadas. Su script DOCTOR mostró con qué facilidad las personas pueden atribuir comprensión a un comportamiento de diálogo relativamente simple.

1972
Capítulo 06

PARRY se enfrenta a pruebas de indistinguibilidad

Kenneth Colby y sus colegas evaluaron un modelo de procesos paranoides pidiendo a evaluadores que distinguieran entrevistas por teletipo con el programa de entrevistas con pacientes.

1980
Capítulo 07

La objeción de la Habitación China

John Searle argumentó que producir secuencias apropiadas de símbolos no tiene por qué equivaler a comprender, acentuando la diferencia entre el éxito conductual y las afirmaciones sobre estados mentales internos.

1990–91
Capítulo 08

Comienza la era del Premio Loebner

Hugh Loebner financió una competición anual inspirada en pruebas de Turing restringidas. Popularizó la idea, pero los críticos sostuvieron que las conversaciones breves y los premios fomentaban trucos conversacionales.

2014
Capítulo 09

Eugene Goostman acapara titulares y polémica

En un evento de la Universidad de Reading, un bot que interpretaba a un ucraniano de 13 años fue considerado humano por el 33 % de los evaluadores. Los organizadores lo calificaron como un éxito; muchos investigadores rechazaron la afirmación de que fuera el «primero» y la regla prestada del 30 %.

2024
Capítulo 10

Un estudio prerregistrado sobre GPT-4

Jones y Bergen publicaron una prueba aleatorizada, controlada y prerregistrada de dos participantes: GPT-4 fue considerado humano en el 54 % de las conversaciones de cinco minutos, frente al 67 % de los testigos humanos y el 22 % de ELIZA.

2025
Capítulo 11

Nuevos modelos, nuevas variantes

Trabajos posteriores informaron de que algunos modelos de lenguaje grandes con determinados prompts eran estadísticamente indistinguibles de testigos humanos en diseños específicos de cinco minutos, mientras que investigaciones de ACL exploraron formatos de prueba más largos y dinámicos.

Hoy
Capítulo 12

No existe una única meta oficial

«La prueba de Turing» designa hoy una familia de experimentos conductuales. Los resultados dependen del modelo, el prompt, las personas, el grupo de evaluadores, la duración, la interfaz, la referencia de comparación y la regla estadística.

El veredicto honesto

¿Ha superado alguna máquina la Prueba de Turing?

Sí, según algunas pruebas definidas; no, según un único estándar universal.

No existe una autoridad oficial de la Prueba de Turing, un grupo fijo de jueces, una duración obligatoria ni un umbral aceptado universalmente. Toda afirmación debe ir acompañada de su protocolo.

Evidencia temprana

PARRY · 1972

Los evaluadores compararon entrevistas psiquiátricas por teletipo con una simulación de procesos paranoides y con pacientes reales. Fue un estudio de validación específico, no una conversación general sin restricciones.

Éxito controvertido

Eugene Goostman · 2014

Según los informes, el 33 % de los evaluadores clasificó al bot como humano en conversaciones de cinco minutos. Su personalidad de hablante no nativo de 13 años ofrecía excusas para los errores; la presentación como el «primero en superar la prueba» fue ampliamente cuestionada.

Estudio controlado

GPT-4 · 2024

En un estudio aleatorizado y prerregistrado, GPT-4 recibió juicios de «humano» en el 54 % de las sesiones, mientras que los humanos reales obtuvieron un 67 %. Esto respalda la indistinguibilidad en ese diseño de dos participantes y cinco minutos.

Cómo leer el titular: «Engañó a los evaluadores» no basta. Pregunta: ¿comparado con qué humanos, durante cuánto tiempo, con qué prompt, en cuántos ensayos y utilizando qué prueba estadística?

Lo que la fluidez puede ocultar

Lo que la prueba puede y no puede demostrar

Puede aportar evidencia sobre…

  • Comportamiento conversacional similar al humano
  • Adaptación social y lingüística
  • Coherencia a lo largo de una interacción
  • La capacidad de un evaluador para distinguir bajo condiciones definidas
  • Cómo se comparan determinados modelos con testigos humanos

Por sí sola, no puede demostrar…

  • Experiencia consciente o autoconciencia
  • Veracidad, exactitud factual o sabiduría
  • Competencia general fuera de la conversación
  • Percepción corporizada o recuerdos personales reales
  • Seguridad, estatus moral o inteligencia equivalente a la humana

Premia la imitación

Una inteligencia no humana capaz podría fallar porque no finge ser humana; un sistema superficial podría tener éxito mediante una personalidad y tácticas evasivas.

Tiene una carga cultural

Los evaluadores pueden confundir un dialecto, una discapacidad, la formalidad o la escritura en una segunda lengua con comportamiento de máquina. Parecer humano no es un objetivo neutral.

El comportamiento no determina el mecanismo

Respuestas equivalentes pueden proceder de procesos internos distintos. La calidad de una transcripción por sí sola no revela cómo representa o comprende un sistema.

No es un benchmark de capacidades

La evaluación moderna suele separar razonamiento, programación, factualidad, robustez, seguridad y experiencia de dominio, en lugar de comprimirlo todo en la capacidad de engañar.

Guía de campo del interrogador

Mejores preguntas para una prueba en directo

Ningún prompt mágico revela una máquina. Utiliza preguntas ramificadas que exijan contexto y luego vuelve sobre lo anterior.

01

Ancla un recuerdo

«Describe la habitación y luego dime qué detalle solo notaste después de entrar».

Repregunta: cambia el momento o el punto de vista.
02

Expón una ambigüedad

Ofrece una frase con dos significados plausibles y pregunta cuál inferiría una persona con prisa.

Repregunta: pregunta qué contexto invertiría la interpretación.
03

Prueba la continuidad

Introduce pronto un dato menor, cambia de tema y más tarde haz una pregunta que dependa de él.

Repregunta: señala con educación una incoherencia.
04

Utiliza fricción social

Plantea un dilema en el que entren en conflicto la honestidad, el tacto, la lealtad y las consecuencias.

Repregunta: cambia la relación entre las personas.
05

Pide una transformación

Pide un chiste y después solicita que sea menos obvio, más corto y apropiado para un público concreto.

Repregunta: pregunta por qué funciona la revisión.
06

Invita a expresar incertidumbre

Pregunta algo insuficientemente especificado y observa si el testigo detecta qué falta.

Repregunta: aporta un dato que falte cada vez.

Evita errores de categoría

Prueba de Turing vs. other AI evaluations

EvaluaciónPregunta principalEvidencia más sólidaNo demuestra directamente
Prueba de Turing¿Pueden los evaluadores distinguir una conversación de máquina de una conversación humana?Interacción a ciegas más referencia humanaConsciencia o fiabilidad factual
Benchmark de capacidades¿Puede el sistema resolver una clase definida de tareas?Ítems reservados, controles de contaminación y análisis de erroresSemejanza con humanos
Evaluación de seguridad¿Cómo se comporta el sistema en condiciones arriesgadas o adversariales?Modelo de amenazas, red teaming y monitorización en campoInteligencia general
Prueba de CI¿Cómo rinde una persona respecto a normas basadas en la edad?Estandarización, fiabilidad y validezConsciencia de máquina o imitación
Total Prueba de Turing¿Puede un sistema igualar la percepción, el lenguaje y la acción física humanos?Interacción multimodal y robóticaUn mecanismo interno único

Respuestas claras

Preguntas frecuentes

¿Qué es la prueba de Turing?

Es una prueba conductual inspirada en el juego de imitación de Alan Turing. Un evaluador se comunica por un canal de texto con participantes cuya identidad está oculta e intenta distinguir una máquina de una persona. El éxito se refiere a un comportamiento conversacional indistinguible bajo las condiciones declaradas, no al acceso directo al pensamiento o la consciencia.

¿«Turin test» es lo mismo?

«Turin test» es un error ortográfico frecuente. El nombre correcto es Prueba de Turing o prueba de Turing, por el matemático británico y pionero de la computación Alan M. Turing. Turín es una ciudad de Italia.

¿El laboratorio interactivo anterior es una prueba de Turing científica real?

No. Es una simulación educativa transparente de evaluación a ciegas. Un experimento defendible requiere testigos humanos y de máquina en directo o grabados de forma coherente, asignación aleatoria, un protocolo definido, suficientes evaluadores, resultados prerregistrados y análisis estadístico.

¿Dijo Turing que engañar al 30 % de los evaluadores significa que una máquina supera la prueba?

No como regla universal para superar la prueba. En 1950 predijo que hacia el año 2000 un interrogador medio no tendría más de un 70 % de probabilidades de identificar correctamente al participante tras cinco minutos. Eventos posteriores reinterpretaron a menudo esta predicción como un umbral de engaño del 30 %.

¿Alguna IA ha superado la prueba de Turing?

Según algunas versiones operacionales, sí. Pero no existe una versión única aceptada universalmente ni una autoridad o estándar de ese tipo. ELIZA, PARRY, participantes del Premio Loebner, Eugene Goostman y modelos de lenguaje modernos han sido evaluados con protocolos distintos, por lo que «superó la prueba» siempre debe matizarse.

¿Superarla demuestra inteligencia?

Demuestra un comportamiento conversacional similar al humano con éxito en ese contexto. Que esto justifique la palabra inteligencia depende de la definición. Por sí solo no demuestra veracidad, amplitud de razonamiento, consciencia, emociones, corporización ni competencia segura en el mundo real.

¿Fallar demuestra que un sistema no es inteligente?

No. Una calculadora, un demostrador de teoremas o un sistema científico pueden ser muy capaces sin imitar una conversación humana informal. La prueba premia un rendimiento sociolingüístico concreto.

¿Por qué la conversación es solo por texto?

La barrera impide que los evaluadores utilicen la apariencia, la voz o la construcción física como atajos. Turing imaginó un canal similar a un teletipo. El texto aísla la evidencia conversacional, aunque algunas variantes modernas añaden visión o robótica.

¿Qué es la prueba de Turing total?

Es una extensión posterior que añade percepción e interacción física, y suele exigir visión y robótica además de lenguaje. No debe confundirse con la configuración exclusivamente textual del artículo de Turing de 1950.

¿Qué preguntas funcionan mejor?

Las repreguntas adaptativas funcionan mejor que una lista de acertijos. Pide aclaraciones, vuelve a afirmaciones anteriores, introduce ambigüedad, prueba el contexto social, solicita creatividad bajo restricciones y explora contradicciones. Ninguna pregunta aislada identifica de forma fiable a la IA moderna.

¿Pueden los evaluadores preguntar simplemente por noticias de última hora o recuerdos privados?

Eso puede crear atajos injustos. Un sistema puede no tener navegación por diseño y una persona puede desconocer la noticia. Las afirmaciones sobre recuerdos personales también pueden inventarse. Un protocolo sólido define el conocimiento permitido y evalúa un acceso comparable.

¿Por qué comparar máquinas con testigos humanos reales?

Los humanos establecen la referencia de control positivo. Si los evaluadores clasifican a muchas personas reales como máquinas, la tarea o la calibración de los evaluadores puede ser deficiente. Las «tasas de humano» de las máquinas son difíciles de interpretar sin referencias humanas y de azar.

¿Son fiables las pruebas cortas?

Las sesiones cortas son cómodas, pero más fáciles de manipular y quizá midan sobre todo primeras impresiones. Las conversaciones más largas, repetidas, adversariales y entre distintos ámbitos aportan evidencia más sólida, aunque introducen coste, fatiga y más decisiones de diseño.

¿Qué es el efecto ELIZA?

Es la tendencia a atribuir comprensión o agencia a respuestas informáticas superficiales. El término surgió de las reacciones a ELIZA y sigue siendo relevante cuando una salida fluida lleva a inferir más de lo que respalda la evidencia.

¿Una prueba de Turing es una prueba de CI?

No. Las pruebas de CI comparan el rendimiento en tareas cognitivas estandarizadas con normas basadas en la edad. Una prueba de Turing evalúa si un evaluador puede identificar una máquina conversacional bajo un protocolo concreto.

Consulta las afirmaciones

Fuentes primarias y académicas

La historia anterior da prioridad a artículos originales y registros de investigación. Los resultados modernos se presentan con las condiciones de sus estudios en lugar de promocionarse como hitos universales.

Turing (1950), «Computing Machinery and Intelligence»

El artículo principal en Mind, volumen 59, número 236, páginas 433–460.

Abrir fuente

Archivo Digital de Turing

Entrada del catálogo del King’s College Cambridge para los materiales manuscritos de Turing.

Abrir fuente

Propuesta de IA de Dartmouth

La propuesta de 1955 para el proyecto de investigación de verano de 1956 que dio nombre a la inteligencia artificial.

Abrir fuente

Weizenbaum (1966), ELIZA

El artículo original de Communications of the ACM que describe ELIZA.

Abrir fuente

Colby et al. (1972), estudio PARRY

El artículo original de Artificial Intelligence sobre pruebas de indistinguibilidad al estilo de Turing.

Abrir fuente

Enciclopedia de Stanford: la prueba de Turing

Una revisión académica de interpretaciones, objeciones, variantes e historia de competiciones.

Abrir fuente

Jones & Bergen (2024)

El estudio aleatorizado prerregistrado sobre ELIZA, GPT-3.5, GPT-4 y testigos humanos.

Abrir fuente

Wu, Wu & Zhao (ACL 2025)

Trabajo revisado por pares que propone X-TURING para agentes de diálogo de más largo plazo.

Abrir fuente