GUÍA DE IA BASADA EN LA EVIDENCIA: Evalúa afirmaciones, no lenguaje de marketing Iniciar la prueba de AGI
Laboratorio abstracto de evaluación de IA general conectado a múltiples estaciones de capacidades

Amplitud · aprendizaje · autonomía · robustez

La prueba de AGI

¿Puede un solo sistema aprender, razonar y trabajar en ámbitos desconocidos, o estamos confundiendo un conjunto de habilidades impresionantes con inteligencia general?

10 casos de evidencia Sin certificación falsa Guía respaldada por investigación

Orientación importante

No existe un examen oficial universal de AGI

La AGI es un concepto de investigación con definiciones contrapuestas. Esta página no declara que ningún sistema concreto haya —o no haya— cruzado una meta mágica. La prueba mide con qué rigor interpretas la evidencia de capacidad. Evaluar un sistema real exigiría tareas privadas, referencias humanas, herramientas y costes declarados, pruebas de robustez y replicación independiente.

Evidencia revisada August 2026

Ninguna prueba es suficiente por sí solaLa AGI requiere evidencia convergenteEn amplitud, profundidad y adaptación
General ≠ perfectaLos humanos somos generales, pero faliblesLa fiabilidad sigue siendo esencial
El sistema importaLos modelos pueden usar memoria y herramientasDeclara el límite completo de la evaluación
Capacidad ≠ seguridadPreguntas distintas requieren evidencia propiaLa potencia no garantiza el alineamiento

Laboratorio interactivo de evaluación

Prueba de evidencia sobre AGI

Cada caso describe una afirmación sobre un sistema de IA. Elige la conclusión más defendible, no la más emocionante ni la más escéptica.

Progreso0/10

Qué significan tus respuestas: esta prueba evalúa tu capacidad para valorar evidencia sobre AGI. Una puntuación alta significa que, en estos casos, distinguiste entre logros estrechos, generalización genuina e inferencias no respaldadas. No mide tu CI ni determina si eres una AGI.

Busca evidencia directa

Pregunta qué midió realmente la observación antes de aceptar una afirmación más amplia.

Evita ambos extremos

«Un benchmark demuestra la AGI» y «toda evaluación es inútil» suelen ser afirmaciones demasiado contundentes.

01Validez del benchmarkUn sistema obtiene un 96 % en un conocido benchmark público de razonamiento después de años de debate en internet sobre ese benchmark. ¿Cuál es la conclusión más sólida?
02TransferenciaCon solo dos demostraciones, un sistema aprende a desenvolverse en un entorno desconocido de control visual, infiere el objetivo, se adapta tras fallar y tiene éxito de forma eficiente. ¿Qué respalda esto de manera más directa?
03AmplitudUn agente de programación supera a casi todos los profesionales en tareas de software bien especificadas, pero no puede planificar viajes de forma fiable, interpretar diagramas ni aprender juegos nuevos. ¿Cómo debería clasificarse?
04AutonomíaUn agente completa tareas de investigación de ocho horas utilizando herramientas, pero una persona debe corregirlo cada 30 minutos. ¿Cuál es la interpretación prudente?
05ComunicaciónUn chatbot es considerado humano en conversaciones breves y a ciegas. ¿Qué afirmación sobre AGI se desprende de ello?
06RobustezUn modelo rinde al nivel de un adulto cualificado en seis ámbitos, pero su rendimiento se desploma cuando cambian ligeramente los formatos, las herramientas y la redacción. ¿Qué falta?
07AlcanceUn sistema iguala a humanos cualificados en trabajos cognitivos no físicos, pero no puede manipular objetos. ¿Es AGI?
08Límite del sistemaUn modelo solo tiene éxito cuando está conectado a búsqueda, ejecución de código, memoria y herramientas especializadas. ¿Qué debería indicar una evaluación?
09Estados mentalesUn modelo dice: «Soy consciente y he alcanzado la AGI». ¿Qué demuestra esto?
10ReplicaciónEquipos independientes prerregistran las pruebas, utilizan tareas privadas, comparan con referencias de humanos cualificados, declaran los costes y reproducen resultados amplios. ¿Por qué esto constituye una evidencia más sólida?

Empieza por el término controvertido

¿Qué es la inteligencia artificial general?

Una familia de definiciones, no un concepto definitivamente establecido

La mayoría de las definiciones combinan la generalidad —competencia en una amplia variedad de tareas— con el rendimiento, el aprendizaje y cierto grado de autonomía. La Carta de OpenAI hace hincapié en superar a los humanos en la mayor parte del trabajo con valor económico. El marco «Levels of AGI» de DeepMind separa la amplitud de la profundidad. François Chollet pone el énfasis en la eficiencia de adquisición de habilidades ante tareas nuevas.

Buena práctica: no preguntes únicamente «¿Es AGI?». Pregunta: «¿Según qué definición operacional, en qué tareas, respecto a qué percentil humano, con qué herramientas y costes, y con qué tasa de intervención?»

Un objetivo multidimensional

Seis dimensiones que una afirmación de AGI debería superar

Amplitudmuchos ámbitos
Profundidadnivel relativo a humanos
Aprendizajehabilidades nuevas con eficiencia
Transferenciausar el conocimiento en otros contextos
Robustezresistir cambios y ataques
Autonomíacompletar tareas largas

Rendimiento sin generalidad

Los motores de ajedrez y los sistemas de predicción de estructuras proteicas pueden ser sobrehumanos en un ámbito sin convertirse en AGI.

Generalidad sin perfección

Los humanos transferimos capacidades entre ámbitos pese a cometer errores. Exigir una perfección literal establece un listón superior al de la inteligencia general humana.

Capacidad sin eficiencia

Un resultado puede cambiar de significado si, para cada tarea, consume enormes cantidades de cómputo, tiempo o asistencia humana.

Más allá de una etiqueta de sí o no

La AGI como niveles de amplitud y rendimiento

Un marco influyente trata la capacidad como una matriz. «General» abarca una amplia variedad de tareas no físicas; el rendimiento se compara con el de adultos cualificados.

Rendimiento
Estrecha
General
Interpretación
Emergente
Cierta competencia útil en tareas
Capacidad desigual en muchas tareas
En conjunto, por debajo de la competencia de un adulto cualificado
Competente
Al menos al nivel mediano de un adulto cualificado en una tarea delimitada
AGI competenteAl menos al nivel mediano de un adulto cualificado en una amplia variedad de tareas
Requiere amplitud y un rendimiento fiable
Experta
Al menos en el percentil 90 en una tarea delimitada
AGI experta en una amplia variedad de tareas
Una afirmación mucho más contundente para el conjunto de la economía
Sobrehumana
Supera a todos los humanos en un ámbito
Supera ampliamente a todos los humanos
Entra en el terreno de la ASI

Herramientas de medición

Ningún benchmark representa la mente completa

Abstracción novedosa

ARC-AGI

Evalúa la inducción de reglas con pocos ejemplos y la eficiencia de adquisición de habilidades en tareas visuales desconocidas. Es valioso para medir la adaptación fluida, pero no constituye una prueba completa del lenguaje, la capacidad de agencia ni el mundo real.

Trabajo de largo horizonte

Evaluaciones de agentes

Miden si los sistemas pueden planificar, usar herramientas, recuperarse de errores y finalizar proyectos a lo largo de horizontes temporales cada vez mayores. Los resultados dependen mucho del andamiaje y del entorno.

Conocimiento amplio

Conjuntos de exámenes

Cubren muchas disciplinas de forma eficiente, pero pueden premiar el conocimiento almacenado, la habilidad para hacer exámenes y la exposición previa más que el aprendizaje rápido.

Advertencia sobre la saturación de benchmarks: cuando una prueba se convierte en un objetivo, los desarrolladores optimizan para ella. Mantén conjuntos de reserva privados, rota las tareas, audita la contaminación y conserva grupos humanos de comparación significativos.

La escala de la evidencia

¿Qué haría convincente una afirmación de AGI?

1DemostraciónComportamiento interesante, fácil de seleccionar
2Benchmark públicoComparable, pero susceptible a exposición previa
3Evaluación privadaTareas nuevas y acceso controlado
4Referencia de humanos cualificadosAmplitud, tiempo, herramientas y costes equiparados
5Replicación independienteEvidencia auditable, robusta y adversarial
  1. 01

    Predefine el límite del sistema

    El modelo, la memoria, la búsqueda, la ejecución de código, la robótica, los prompts y la asistencia humana cuentan.

  2. 02

    Muestrea el universo de tareas

    Una afirmación amplia necesita tareas representativas, no una selección a medida de los mejores resultados.

  3. 03

    Evalúa el aprendizaje novedoso

    Mide con qué rapidez el sistema adquiere habilidades para las que no pudo prepararse durante el entrenamiento.

  4. 04

    Mide la fiabilidad

    Importan el éxito medio, los fallos catastróficos, la calibración, la recuperación y los cambios de distribución.

  5. 05

    Equipara las condiciones humanas

    Compara el tiempo, las herramientas, las instrucciones, los incentivos y el acceso a material de referencia.

  6. 06

    Separa la capacidad de la seguridad

    Después de mostrar lo que un sistema puede hacer, evalúa si sigue siendo controlable y beneficioso.

De la imitación a la adaptación

Breve historia de la idea de AGI

1950
Hito 01

Turing replantea la inteligencia de las máquinas

El juego de imitación situó el comportamiento observable en el centro, pero la imitación conversacional nunca llegó a constituir una definición completa de inteligencia general.

1956
Hito 02

La IA se convierte en un campo de investigación

La propuesta de Dartmouth sostuvo que el aprendizaje y la inteligencia podrían describirse con suficiente precisión como para que las máquinas los simularan.

1980s
Hito 03

Los sistemas expertos dejan al descubierto el problema de la estrechez

El alto rendimiento en ámbitos delimitados mostró que una gran especialización podía ser poderosa sin ser general ni adaptable.

1997–2016
Hito 04

Hitos sobrehumanos de IA estrecha

Deep Blue, Watson y AlphaGo superaron a humanos muy capaces en tareas específicas, aunque seguían sin parecerse a una persona con capacidad general.

2019
Hito 05

ARC se centra en la eficiencia de adquisición de habilidades

François Chollet propuso medir la inteligencia por la eficiencia con la que los sistemas adquieren nuevas habilidades e introdujo el Abstraction and Reasoning Corpus (ARC).

2023
Hito 06

Marco de niveles de AGI

Investigadores de Google DeepMind propusieron clasificar los sistemas tanto por la profundidad de su rendimiento como por la amplitud de las tareas, desde emergentes hasta sobrehumanos.

2024–26
Hito 07

Evolucionan los benchmarks de razonamiento y agentes

ARC-AGI y las evaluaciones de agentes de largo horizonte ponen cada vez más a prueba la adaptación, el uso de herramientas y el aprendizaje interactivo, mientras la saturación y la contaminación de los benchmarks siguen siendo motivos de preocupación.

Hoy
Hito 08

No existe una certificación universal

La AGI sigue siendo un concepto controvertido. Cualquier afirmación seria debe indicar su definición, alcance, referencia humana, límite del sistema y estándar de evidencia.

Realidades difíciles

Por qué es difícil medir la AGI

Universo de tareas sin definir

«Todas las tareas cognitivas» no constituye una muestra finita ni neutral. Las decisiones económicas y culturales determinan qué se incluye.

Opacidad del entrenamiento

Sin saber qué vio un sistema, es difícil separar la recuperación y la memorización del aprendizaje nuevo.

Límite cambiante del sistema

Las herramientas y el andamiaje pueden transformar el rendimiento. Las afirmaciones sobre el modelo aislado y sobre el sistema completo responden a preguntas distintas.

Referencia humana cambiante

El rendimiento humano depende de la experiencia, la motivación, el tiempo, la colaboración y el acceso a herramientas.

Una evidencia sólida puede mostrar

  • Rendimiento amplio respecto a grupos humanos definidos
  • Aprendizaje rápido en tareas privadas y nuevas
  • Transferencia robusta y autonomía de largo horizonte
  • Costes, intervenciones y modos de fallo conocidos

Una etiqueta de AGI no puede demostrar automáticamente

  • Consciencia o estatus moral
  • Alineamiento con valores humanos
  • Ausencia de errores catastróficos
  • Competencia equivalente en cualquier contexto físico

Respuestas claras

Preguntas frecuentes sobre AGI

¿Qué significan las siglas AGI?

Artificial general intelligence, es decir, inteligencia artificial general. Suele referirse a una IA con competencia amplia y adaptable en muchas tareas, en lugar de un rendimiento excepcional en un único ámbito estrecho. Las definiciones difieren en cuanto a la autonomía, la corporización y el nivel humano exigido.

¿Existe una prueba oficial única de AGI?

No. No existe un examen ni un umbral autorizado universalmente. Los investigadores utilizan conjuntos de benchmarks, referencias humanas, aprendizaje de tareas nuevas, evaluaciones de agentes y marcos que combinan amplitud y rendimiento.

¿Esta página comprueba si un modelo real es AGI?

No. La sección interactiva evalúa tu capacidad para interpretar afirmaciones basadas en evidencia. Certificar un sistema real exigiría acceso a dicho sistema, evaluaciones privadas, condiciones documentadas y replicación independiente.

¿Se ha alcanzado la AGI?

No existe consenso porque las definiciones y los umbrales difieren. Las afirmaciones contundentes deberían identificar la definición operacional exacta en lugar de tratar la AGI como un acontecimiento binario aceptado universalmente.

¿Puede un solo benchmark demostrar la AGI?

Ningún benchmark por sí solo abarca la amplitud, la robustez, la eficiencia de aprendizaje, la autonomía y la fiabilidad en el mundo real que suelen asociarse con la AGI. Un benchmark puede aportar evidencia importante sobre un componente.

¿Superar la prueba de Turing equivale a ser AGI?

No. Una prueba de Turing mide la indistinguibilidad conversacional bajo un protocolo. Las afirmaciones sobre AGI suelen referirse a una competencia, aprendizaje y transferencia más amplios.

¿La AGI tiene que ser consciente?

No según la mayoría de las definiciones operacionales de capacidad. La consciencia es una cuestión científica y filosófica distinta que sigue sin resolverse.

¿La AGI necesita un cuerpo robótico?

Depende de la definición. Algunos marcos se centran explícitamente en tareas cognitivas no físicas; otros sostienen que una generalidad similar a la humana requiere percepción y acción en el mundo físico.

¿Qué es la contaminación de un benchmark?

Se produce cuando las tareas de evaluación o variantes muy próximas aparecen en los datos de entrenamiento, ajuste o desarrollo de prompts, de modo que una puntuación alta puede reflejar exposición previa en vez de generalización a problemas realmente nuevos.

¿Cuál es la diferencia entre un modelo y un agente?

Un modelo transforma entradas en salidas. Un sistema agéntico puede combinar un modelo con memoria, bucles de planificación, herramientas, datos externos y la capacidad de realizar acciones a lo largo del tiempo.

¿Qué viene después de la AGI?

La superinteligencia artificial, o ASI, es un nivel hipotético en el que una inteligencia de máquina de amplio alcance supera ampliamente la capacidad humana en la mayoría o prácticamente todos los ámbitos cognitivos relevantes.

¿Puede una AGI ser segura pero poco fiable?

La seguridad y la fiabilidad se solapan, pero no son idénticas. Un sistema puede estar alineado en sus intenciones y aun así cometer muchos errores, o ser técnicamente capaz y fiable mientras persigue objetivos perjudiciales. Ambas cuestiones requieren evidencia específica.

Consulta el marco

Fuentes primarias y de investigación

OpenAI Charter

Una destacada definición económica: sistemas altamente autónomos que superan a los humanos en la mayor parte del trabajo con valor económico.

Abrir fuente

Google DeepMind: niveles de AGI

Un marco basado en la profundidad del rendimiento y la amplitud de las capacidades.

Abrir fuente

Chollet: sobre la medición de la inteligencia

Define la inteligencia en torno a la eficiencia de adquisición de habilidades e introduce ARC.

Abrir fuente

Repositorio ARC-AGI

Tareas, métodos y documentación oficiales del Abstraction and Reasoning Corpus.

Abrir fuente

ARC-AGI-3

Benchmark interactivo de razonamiento para exploración, adquisición de objetivos y modelos adaptativos del mundo.

Abrir fuente

Índice de IA de Stanford

Evidencia anual sobre capacidades de IA, tendencias de benchmarks, inversión, políticas e impactos.

Abrir fuente

Marco de gestión de riesgos de IA del NIST

Un marco estructurado para gobernar, mapear, medir y gestionar los riesgos de la IA.

Abrir fuente

Turing (1950)

El artículo original sobre el juego de imitación y el argumento fundacional acerca de la inteligencia de las máquinas.

Abrir fuente