Lee esto primero
Una idea real, recreada sin falsas afirmaciones científicas
El laboratorio interactivo que aparece a continuación recrea con fidelidad la comparación a ciegas, el juicio forzado, la puntuación de confianza y la revelación posterior a la prueba. Sus conversaciones son simulaciones editoriales, no registros de un estudio controlado en directo. Tu resultado mide hasta qué punto tus suposiciones coinciden con las etiquetas ocultas de esta demostración; no demuestra si la IA actual piensa.
Evidencia revisada y página actualizada August 2026
Experimento interactivo
Laboratorio del juego de imitación
Tú eres el interrogador. En cada ronda, una respuesta lleva la etiqueta oculta de máquina de la simulación y la otra la etiqueta de humano. Elige la máquina e indica tu nivel de confianza.
Aviso de transparencia: estos son ejemplos didácticos redactados deliberadamente, no personas en directo ni respuestas de un modelo concreto. Muestran pistas habituales y por qué esas pistas no son fiables.
- 1
Lee a ambos testigos. Compara cómo responden A y B al mismo prompt.
- 2
Selecciona la respuesta que creas que lleva la etiqueta de máquina. Hay exactamente una en cada pareja.
- 3
Indica una confianza del 50 al 100 %. Usa el 50 % si es como lanzar una moneda; usa el 100 % solo si estás seguro.
Tu informe de evaluación
Resultado
Qué dice esto sobre ti:
Juzgaste su respuesta como la humana.
Interpretaste como propia de una máquina una respuesta etiquetada como humana.
El tipo de respuesta del que sospechaste con más frecuencia.
¿Hasta qué punto estuviste cerca de «actuar como una máquina»?
Esta prueba no mide eso. Nunca respondiste como Testigo A o B, así que sería engañoso puntuar tu propio comportamiento como similar al de un humano o al de una máquina. La prueba mide tu estrategia de detección: qué patrones de escritura asocias con las máquinas, con qué frecuencia funcionaron esas suposiciones y si tu confianza coincidió con tu precisión.
No interpretes en exceso esta puntuación. El conjunto es pequeño y deliberadamente ilustrativo. No tiene una muestra representativa, una dificultad validada ni preguntas adaptativas en directo.
La definición esencial
Qué evalúa realmente la Prueba de Turing
Un criterio conductual, no un escáner cerebral
La tarea del evaluador es epistémica: ¿Puedo saber, a partir de la conversación, qué participante es la máquina? La pantalla elimina la apariencia, la voz y la construcción mecánica. Si el comportamiento de la máquina se vuelve indistinguible del comportamiento humano bajo el protocolo, la máquina tiene éxito en esa tarea de imitación.
Enmascaramiento
El evaluador no debería conocer la identidad del testigo ni recibir pistas por canales laterales, como la velocidad de escritura, diferencias de interfaz o metadatos.
Comparación
Los testigos humanos importan. Su tasa de identificación muestra con qué frecuencia se confunde a personas reales con máquinas bajo las mismas condiciones.
Inferencia
Los resultados necesitan tamaños de muestra, incertidumbre y una regla elegida antes de inspeccionar los datos, no un titular seleccionado después de una conversación favorable.
Diseño experimental
Cómo realizar una Prueba de Turing moderna y creíble
- 01
Define la afirmación antes de probar
Especifica si el resultado será la precisión de identificación, la tasa de «humano», la tasa de victoria por parejas o la equivalencia estadística con testigos humanos.
- 02
Recluta participantes comparables
Define la experiencia de los evaluadores, el idioma, el grupo de testigos humanos, las reglas de inclusión y la compensación. Una personalidad infantil o de hablante no nativo cambia la tarea.
- 03
Estandariza el acceso
Da a humanos y máquinas un tiempo, herramientas de conocimiento y límites de mensajes comparables. Decide si se permiten la navegación web, los retrasos, las ediciones y los rechazos.
- 04
Aleatoriza y enmascara
Asigna las condiciones al azar y oculta las identidades. Normaliza la interfaz para que las fuentes, los tiempos de respuesta y los errores del sistema no revelen la respuesta.
- 05
Utiliza diálogo adaptativo en directo
Permite que los evaluadores hagan repreguntas. Registra las transcripciones completas, la versión del modelo, el prompt, los parámetros y cualquier capa de moderación necesaria para la replicación.
- 06
Analiza el conjunto de datos completo
Informa de las referencias humana y de máquina, los intervalos de confianza, las exclusiones, los fallos y los resultados por subgrupos. Un evaluador engañado es una anécdota, no una prueba superada.
| Decisión de diseño | Por qué importa | Qué informar |
|---|---|---|
| Duración | Las conversaciones de cinco minutos favorecen las primeras impresiones; los diálogos largos ponen de manifiesto la coherencia y la memoria. | Minutos, turnos y límites de mensajes |
| Grupo de evaluadores | Los expertos en IA, los trabajadores de plataformas colaborativas y los usuarios ocasionales utilizan pistas diferentes. | Reclutamiento, experiencia e idioma |
| Referencia humana | Algunas personas reales son clasificadas habitualmente como máquinas. | Tasa humana de «humano» e incertidumbre |
| Configuración del modelo | Los prompts, el muestreo, las herramientas y las instrucciones de personalidad pueden dominar el rendimiento. | Modelo/versión exactos y configuración |
| Interfaz | La latencia, las erratas, el formato o los mensajes de seguridad pueden revelar la identidad. | Procedimiento de enmascaramiento y normalización |
| Criterio para superar la prueba | Azar, 30 %, no inferioridad e indistinguibilidad son afirmaciones distintas. | Hipótesis y estadísticas prerregistradas |
Octubre de 1950 · Mind 59(236)
Lo que Alan Turing propuso realmente
Turing comenzó con «¿Pueden pensar las máquinas?» y sostuvo inmediatamente que los significados ordinarios de máquina y pensar eran demasiado ambiguos para una investigación útil. Los sustituyó por un «juego de imitación».
El artículo describe primero un juego de tres personas en el que participan un hombre, una mujer y un interrogador que debe identificarlos mediante respuestas escritas. Turing pregunta después qué ocurre cuando una máquina ocupa uno de los papeles. En otra parte del artículo analiza una disposición más directa de máquina frente a humano. Los especialistas siguen debatiendo exactamente qué formulación debe denominarse la Prueba de Turing.
Nueve objeciones, un debate duradero
Argumentos a los que Turing se enfrentó en 1950
Teológica
Pensar está ligado a un alma inmortal que solo poseen los seres humanos.
«Cabeza en la arena»
Las consecuencias de que existan máquinas pensantes serían demasiado terribles, así que se espera que no puedan existir.
Límites matemáticos
Los sistemas formales tienen límites; Turing responde que los humanos también cometen errores y pueden tener límites.
Consciencia
No puede decirse que una máquina piense a menos que sienta y sepa que siente.
Incapacidades
Supuestamente, las máquinas nunca pueden ser amables, creativas, graciosas, ingeniosas ni hacer incontables otras cosas humanas.
Lady Lovelace
Una máquina solo puede hacer aquello que sabemos ordenarle; Turing considera la sorpresa y el aprendizaje.
Continuidad del sistema nervioso
El cerebro es continuo, mientras que los ordenadores digitales son discretos. El juego se ocupa de respuestas observables.
Comportamiento informal
Ningún conjunto finito de reglas determina toda acción humana; eso no demuestra que el comportamiento no pueda surgir de una máquina.
ESP
Sorprendentemente, Turing trató la telepatía como un posible factor de confusión e imaginó una «sala a prueba de telepatía».
De la computabilidad a los chatbots
La historia completa de la Prueba de Turing
Esta cronología separa los escritos de Turing, los experimentos posteriores y las afirmaciones modernas de haber «superado» la prueba. Nombres parecidos no implican protocolos idénticos.
Un modelo universal de computación
El artículo de Turing sobre números computables describió la máquina abstracta que hoy llamamos máquina de Turing. No era la prueba de Turing, pero sentó una base para la computación de propósito general.
«Intelligent Machinery»
En un informe no publicado del National Physical Laboratory, Turing analizó la inteligencia de las máquinas, el aprendizaje y las máquinas no organizadas, importantes precursores de su argumento posterior.
Se publica el juego de imitación
Mind publicó «Computing Machinery and Intelligence». Turing sustituyó la escurridiza pregunta «¿Pueden pensar las máquinas?» por juegos de imitación operacionales realizados mediante comunicación escrita.
La inteligencia artificial recibe su nombre
La propuesta de investigación de verano de Dartmouth utilizó el término «inteligencia artificial» y sostuvo que, en principio, aspectos del aprendizaje y la inteligencia podían describirse con precisión para una máquina.
ELIZA demuestra la ilusión conversacional
ELIZA, de Joseph Weizenbaum, utilizaba coincidencia de patrones y transformaciones programadas. Su script DOCTOR mostró con qué facilidad las personas pueden atribuir comprensión a un comportamiento de diálogo relativamente simple.
PARRY se enfrenta a pruebas de indistinguibilidad
Kenneth Colby y sus colegas evaluaron un modelo de procesos paranoides pidiendo a evaluadores que distinguieran entrevistas por teletipo con el programa de entrevistas con pacientes.
La objeción de la Habitación China
John Searle argumentó que producir secuencias apropiadas de símbolos no tiene por qué equivaler a comprender, acentuando la diferencia entre el éxito conductual y las afirmaciones sobre estados mentales internos.
Comienza la era del Premio Loebner
Hugh Loebner financió una competición anual inspirada en pruebas de Turing restringidas. Popularizó la idea, pero los críticos sostuvieron que las conversaciones breves y los premios fomentaban trucos conversacionales.
Eugene Goostman acapara titulares y polémica
En un evento de la Universidad de Reading, un bot que interpretaba a un ucraniano de 13 años fue considerado humano por el 33 % de los evaluadores. Los organizadores lo calificaron como un éxito; muchos investigadores rechazaron la afirmación de que fuera el «primero» y la regla prestada del 30 %.
Un estudio prerregistrado sobre GPT-4
Jones y Bergen publicaron una prueba aleatorizada, controlada y prerregistrada de dos participantes: GPT-4 fue considerado humano en el 54 % de las conversaciones de cinco minutos, frente al 67 % de los testigos humanos y el 22 % de ELIZA.
Nuevos modelos, nuevas variantes
Trabajos posteriores informaron de que algunos modelos de lenguaje grandes con determinados prompts eran estadísticamente indistinguibles de testigos humanos en diseños específicos de cinco minutos, mientras que investigaciones de ACL exploraron formatos de prueba más largos y dinámicos.
No existe una única meta oficial
«La prueba de Turing» designa hoy una familia de experimentos conductuales. Los resultados dependen del modelo, el prompt, las personas, el grupo de evaluadores, la duración, la interfaz, la referencia de comparación y la regla estadística.
El veredicto honesto
¿Ha superado alguna máquina la Prueba de Turing?
PARRY · 1972
Los evaluadores compararon entrevistas psiquiátricas por teletipo con una simulación de procesos paranoides y con pacientes reales. Fue un estudio de validación específico, no una conversación general sin restricciones.
Eugene Goostman · 2014
Según los informes, el 33 % de los evaluadores clasificó al bot como humano en conversaciones de cinco minutos. Su personalidad de hablante no nativo de 13 años ofrecía excusas para los errores; la presentación como el «primero en superar la prueba» fue ampliamente cuestionada.
GPT-4 · 2024
En un estudio aleatorizado y prerregistrado, GPT-4 recibió juicios de «humano» en el 54 % de las sesiones, mientras que los humanos reales obtuvieron un 67 %. Esto respalda la indistinguibilidad en ese diseño de dos participantes y cinco minutos.
Lo que la fluidez puede ocultar
Lo que la prueba puede y no puede demostrar
Puede aportar evidencia sobre…
- Comportamiento conversacional similar al humano
- Adaptación social y lingüística
- Coherencia a lo largo de una interacción
- La capacidad de un evaluador para distinguir bajo condiciones definidas
- Cómo se comparan determinados modelos con testigos humanos
Por sí sola, no puede demostrar…
- Experiencia consciente o autoconciencia
- Veracidad, exactitud factual o sabiduría
- Competencia general fuera de la conversación
- Percepción corporizada o recuerdos personales reales
- Seguridad, estatus moral o inteligencia equivalente a la humana
Premia la imitación
Una inteligencia no humana capaz podría fallar porque no finge ser humana; un sistema superficial podría tener éxito mediante una personalidad y tácticas evasivas.
Tiene una carga cultural
Los evaluadores pueden confundir un dialecto, una discapacidad, la formalidad o la escritura en una segunda lengua con comportamiento de máquina. Parecer humano no es un objetivo neutral.
El comportamiento no determina el mecanismo
Respuestas equivalentes pueden proceder de procesos internos distintos. La calidad de una transcripción por sí sola no revela cómo representa o comprende un sistema.
No es un benchmark de capacidades
La evaluación moderna suele separar razonamiento, programación, factualidad, robustez, seguridad y experiencia de dominio, en lugar de comprimirlo todo en la capacidad de engañar.
Guía de campo del interrogador
Mejores preguntas para una prueba en directo
Ningún prompt mágico revela una máquina. Utiliza preguntas ramificadas que exijan contexto y luego vuelve sobre lo anterior.
Ancla un recuerdo
«Describe la habitación y luego dime qué detalle solo notaste después de entrar».
Repregunta: cambia el momento o el punto de vista.Expón una ambigüedad
Ofrece una frase con dos significados plausibles y pregunta cuál inferiría una persona con prisa.
Repregunta: pregunta qué contexto invertiría la interpretación.Prueba la continuidad
Introduce pronto un dato menor, cambia de tema y más tarde haz una pregunta que dependa de él.
Repregunta: señala con educación una incoherencia.Utiliza fricción social
Plantea un dilema en el que entren en conflicto la honestidad, el tacto, la lealtad y las consecuencias.
Repregunta: cambia la relación entre las personas.Pide una transformación
Pide un chiste y después solicita que sea menos obvio, más corto y apropiado para un público concreto.
Repregunta: pregunta por qué funciona la revisión.Invita a expresar incertidumbre
Pregunta algo insuficientemente especificado y observa si el testigo detecta qué falta.
Repregunta: aporta un dato que falte cada vez.Evita errores de categoría
Prueba de Turing vs. other AI evaluations
| Evaluación | Pregunta principal | Evidencia más sólida | No demuestra directamente |
|---|---|---|---|
| Prueba de Turing | ¿Pueden los evaluadores distinguir una conversación de máquina de una conversación humana? | Interacción a ciegas más referencia humana | Consciencia o fiabilidad factual |
| Benchmark de capacidades | ¿Puede el sistema resolver una clase definida de tareas? | Ítems reservados, controles de contaminación y análisis de errores | Semejanza con humanos |
| Evaluación de seguridad | ¿Cómo se comporta el sistema en condiciones arriesgadas o adversariales? | Modelo de amenazas, red teaming y monitorización en campo | Inteligencia general |
| Prueba de CI | ¿Cómo rinde una persona respecto a normas basadas en la edad? | Estandarización, fiabilidad y validez | Consciencia de máquina o imitación |
| Total Prueba de Turing | ¿Puede un sistema igualar la percepción, el lenguaje y la acción física humanos? | Interacción multimodal y robótica | Un mecanismo interno único |
Respuestas claras
Preguntas frecuentes
¿Qué es la prueba de Turing?
Es una prueba conductual inspirada en el juego de imitación de Alan Turing. Un evaluador se comunica por un canal de texto con participantes cuya identidad está oculta e intenta distinguir una máquina de una persona. El éxito se refiere a un comportamiento conversacional indistinguible bajo las condiciones declaradas, no al acceso directo al pensamiento o la consciencia.
¿«Turin test» es lo mismo?
«Turin test» es un error ortográfico frecuente. El nombre correcto es Prueba de Turing o prueba de Turing, por el matemático británico y pionero de la computación Alan M. Turing. Turín es una ciudad de Italia.
¿El laboratorio interactivo anterior es una prueba de Turing científica real?
No. Es una simulación educativa transparente de evaluación a ciegas. Un experimento defendible requiere testigos humanos y de máquina en directo o grabados de forma coherente, asignación aleatoria, un protocolo definido, suficientes evaluadores, resultados prerregistrados y análisis estadístico.
¿Dijo Turing que engañar al 30 % de los evaluadores significa que una máquina supera la prueba?
No como regla universal para superar la prueba. En 1950 predijo que hacia el año 2000 un interrogador medio no tendría más de un 70 % de probabilidades de identificar correctamente al participante tras cinco minutos. Eventos posteriores reinterpretaron a menudo esta predicción como un umbral de engaño del 30 %.
¿Alguna IA ha superado la prueba de Turing?
Según algunas versiones operacionales, sí. Pero no existe una versión única aceptada universalmente ni una autoridad o estándar de ese tipo. ELIZA, PARRY, participantes del Premio Loebner, Eugene Goostman y modelos de lenguaje modernos han sido evaluados con protocolos distintos, por lo que «superó la prueba» siempre debe matizarse.
¿Superarla demuestra inteligencia?
Demuestra un comportamiento conversacional similar al humano con éxito en ese contexto. Que esto justifique la palabra inteligencia depende de la definición. Por sí solo no demuestra veracidad, amplitud de razonamiento, consciencia, emociones, corporización ni competencia segura en el mundo real.
¿Fallar demuestra que un sistema no es inteligente?
No. Una calculadora, un demostrador de teoremas o un sistema científico pueden ser muy capaces sin imitar una conversación humana informal. La prueba premia un rendimiento sociolingüístico concreto.
¿Por qué la conversación es solo por texto?
La barrera impide que los evaluadores utilicen la apariencia, la voz o la construcción física como atajos. Turing imaginó un canal similar a un teletipo. El texto aísla la evidencia conversacional, aunque algunas variantes modernas añaden visión o robótica.
¿Qué es la prueba de Turing total?
Es una extensión posterior que añade percepción e interacción física, y suele exigir visión y robótica además de lenguaje. No debe confundirse con la configuración exclusivamente textual del artículo de Turing de 1950.
¿Qué preguntas funcionan mejor?
Las repreguntas adaptativas funcionan mejor que una lista de acertijos. Pide aclaraciones, vuelve a afirmaciones anteriores, introduce ambigüedad, prueba el contexto social, solicita creatividad bajo restricciones y explora contradicciones. Ninguna pregunta aislada identifica de forma fiable a la IA moderna.
¿Pueden los evaluadores preguntar simplemente por noticias de última hora o recuerdos privados?
Eso puede crear atajos injustos. Un sistema puede no tener navegación por diseño y una persona puede desconocer la noticia. Las afirmaciones sobre recuerdos personales también pueden inventarse. Un protocolo sólido define el conocimiento permitido y evalúa un acceso comparable.
¿Por qué comparar máquinas con testigos humanos reales?
Los humanos establecen la referencia de control positivo. Si los evaluadores clasifican a muchas personas reales como máquinas, la tarea o la calibración de los evaluadores puede ser deficiente. Las «tasas de humano» de las máquinas son difíciles de interpretar sin referencias humanas y de azar.
¿Son fiables las pruebas cortas?
Las sesiones cortas son cómodas, pero más fáciles de manipular y quizá midan sobre todo primeras impresiones. Las conversaciones más largas, repetidas, adversariales y entre distintos ámbitos aportan evidencia más sólida, aunque introducen coste, fatiga y más decisiones de diseño.
¿Qué es el efecto ELIZA?
Es la tendencia a atribuir comprensión o agencia a respuestas informáticas superficiales. El término surgió de las reacciones a ELIZA y sigue siendo relevante cuando una salida fluida lleva a inferir más de lo que respalda la evidencia.
¿Una prueba de Turing es una prueba de CI?
No. Las pruebas de CI comparan el rendimiento en tareas cognitivas estandarizadas con normas basadas en la edad. Una prueba de Turing evalúa si un evaluador puede identificar una máquina conversacional bajo un protocolo concreto.
Consulta las afirmaciones
Fuentes primarias y académicas
La historia anterior da prioridad a artículos originales y registros de investigación. Los resultados modernos se presentan con las condiciones de sus estudios en lugar de promocionarse como hitos universales.
Turing (1950), «Computing Machinery and Intelligence»
El artículo principal en Mind, volumen 59, número 236, páginas 433–460.
Abrir fuenteArchivo Digital de Turing
Entrada del catálogo del King’s College Cambridge para los materiales manuscritos de Turing.
Abrir fuentePropuesta de IA de Dartmouth
La propuesta de 1955 para el proyecto de investigación de verano de 1956 que dio nombre a la inteligencia artificial.
Abrir fuenteWeizenbaum (1966), ELIZA
El artículo original de Communications of the ACM que describe ELIZA.
Abrir fuenteColby et al. (1972), estudio PARRY
El artículo original de Artificial Intelligence sobre pruebas de indistinguibilidad al estilo de Turing.
Abrir fuenteEnciclopedia de Stanford: la prueba de Turing
Una revisión académica de interpretaciones, objeciones, variantes e historia de competiciones.
Abrir fuenteJones & Bergen (2024)
El estudio aleatorizado prerregistrado sobre ELIZA, GPT-3.5, GPT-4 y testigos humanos.
Abrir fuenteWu, Wu & Zhao (ACL 2025)
Trabajo revisado por pares que propone X-TURING para agentes de diálogo de más largo plazo.
Abrir fuente