Orientación importante
No existe un examen oficial universal de AGI
La AGI es un concepto de investigación con definiciones contrapuestas. Esta página no declara que ningún sistema concreto haya —o no haya— cruzado una meta mágica. La prueba mide con qué rigor interpretas la evidencia de capacidad. Evaluar un sistema real exigiría tareas privadas, referencias humanas, herramientas y costes declarados, pruebas de robustez y replicación independiente.
Evidencia revisada August 2026
Laboratorio interactivo de evaluación
Prueba de evidencia sobre AGI
Cada caso describe una afirmación sobre un sistema de IA. Elige la conclusión más defendible, no la más emocionante ni la más escéptica.
Qué significan tus respuestas: esta prueba evalúa tu capacidad para valorar evidencia sobre AGI. Una puntuación alta significa que, en estos casos, distinguiste entre logros estrechos, generalización genuina e inferencias no respaldadas. No mide tu CI ni determina si eres una AGI.
Pregunta qué midió realmente la observación antes de aceptar una afirmación más amplia.
«Un benchmark demuestra la AGI» y «toda evaluación es inútil» suelen ser afirmaciones demasiado contundentes.
Tu perfil como evaluador
Qué significa realmente este resultado
No certifica ningún sistema de IA como AGI. Evaluaste afirmaciones ficticias sobre evidencia; no se puso a prueba ningún modelo real.
Empieza por el término controvertido
¿Qué es la inteligencia artificial general?
Una familia de definiciones, no un concepto definitivamente establecido
La mayoría de las definiciones combinan la generalidad —competencia en una amplia variedad de tareas— con el rendimiento, el aprendizaje y cierto grado de autonomía. La Carta de OpenAI hace hincapié en superar a los humanos en la mayor parte del trabajo con valor económico. El marco «Levels of AGI» de DeepMind separa la amplitud de la profundidad. François Chollet pone el énfasis en la eficiencia de adquisición de habilidades ante tareas nuevas.
Un objetivo multidimensional
Seis dimensiones que una afirmación de AGI debería superar
Rendimiento sin generalidad
Los motores de ajedrez y los sistemas de predicción de estructuras proteicas pueden ser sobrehumanos en un ámbito sin convertirse en AGI.
Generalidad sin perfección
Los humanos transferimos capacidades entre ámbitos pese a cometer errores. Exigir una perfección literal establece un listón superior al de la inteligencia general humana.
Capacidad sin eficiencia
Un resultado puede cambiar de significado si, para cada tarea, consume enormes cantidades de cómputo, tiempo o asistencia humana.
Más allá de una etiqueta de sí o no
La AGI como niveles de amplitud y rendimiento
Un marco influyente trata la capacidad como una matriz. «General» abarca una amplia variedad de tareas no físicas; el rendimiento se compara con el de adultos cualificados.
Herramientas de medición
Ningún benchmark representa la mente completa
ARC-AGI
Evalúa la inducción de reglas con pocos ejemplos y la eficiencia de adquisición de habilidades en tareas visuales desconocidas. Es valioso para medir la adaptación fluida, pero no constituye una prueba completa del lenguaje, la capacidad de agencia ni el mundo real.
Evaluaciones de agentes
Miden si los sistemas pueden planificar, usar herramientas, recuperarse de errores y finalizar proyectos a lo largo de horizontes temporales cada vez mayores. Los resultados dependen mucho del andamiaje y del entorno.
Conjuntos de exámenes
Cubren muchas disciplinas de forma eficiente, pero pueden premiar el conocimiento almacenado, la habilidad para hacer exámenes y la exposición previa más que el aprendizaje rápido.
La escala de la evidencia
¿Qué haría convincente una afirmación de AGI?
- 01
Predefine el límite del sistema
El modelo, la memoria, la búsqueda, la ejecución de código, la robótica, los prompts y la asistencia humana cuentan.
- 02
Muestrea el universo de tareas
Una afirmación amplia necesita tareas representativas, no una selección a medida de los mejores resultados.
- 03
Evalúa el aprendizaje novedoso
Mide con qué rapidez el sistema adquiere habilidades para las que no pudo prepararse durante el entrenamiento.
- 04
Mide la fiabilidad
Importan el éxito medio, los fallos catastróficos, la calibración, la recuperación y los cambios de distribución.
- 05
Equipara las condiciones humanas
Compara el tiempo, las herramientas, las instrucciones, los incentivos y el acceso a material de referencia.
- 06
Separa la capacidad de la seguridad
Después de mostrar lo que un sistema puede hacer, evalúa si sigue siendo controlable y beneficioso.
De la imitación a la adaptación
Breve historia de la idea de AGI
Turing replantea la inteligencia de las máquinas
El juego de imitación situó el comportamiento observable en el centro, pero la imitación conversacional nunca llegó a constituir una definición completa de inteligencia general.
La IA se convierte en un campo de investigación
La propuesta de Dartmouth sostuvo que el aprendizaje y la inteligencia podrían describirse con suficiente precisión como para que las máquinas los simularan.
Los sistemas expertos dejan al descubierto el problema de la estrechez
El alto rendimiento en ámbitos delimitados mostró que una gran especialización podía ser poderosa sin ser general ni adaptable.
Hitos sobrehumanos de IA estrecha
Deep Blue, Watson y AlphaGo superaron a humanos muy capaces en tareas específicas, aunque seguían sin parecerse a una persona con capacidad general.
ARC se centra en la eficiencia de adquisición de habilidades
François Chollet propuso medir la inteligencia por la eficiencia con la que los sistemas adquieren nuevas habilidades e introdujo el Abstraction and Reasoning Corpus (ARC).
Marco de niveles de AGI
Investigadores de Google DeepMind propusieron clasificar los sistemas tanto por la profundidad de su rendimiento como por la amplitud de las tareas, desde emergentes hasta sobrehumanos.
Evolucionan los benchmarks de razonamiento y agentes
ARC-AGI y las evaluaciones de agentes de largo horizonte ponen cada vez más a prueba la adaptación, el uso de herramientas y el aprendizaje interactivo, mientras la saturación y la contaminación de los benchmarks siguen siendo motivos de preocupación.
No existe una certificación universal
La AGI sigue siendo un concepto controvertido. Cualquier afirmación seria debe indicar su definición, alcance, referencia humana, límite del sistema y estándar de evidencia.
Realidades difíciles
Por qué es difícil medir la AGI
Universo de tareas sin definir
«Todas las tareas cognitivas» no constituye una muestra finita ni neutral. Las decisiones económicas y culturales determinan qué se incluye.
Opacidad del entrenamiento
Sin saber qué vio un sistema, es difícil separar la recuperación y la memorización del aprendizaje nuevo.
Límite cambiante del sistema
Las herramientas y el andamiaje pueden transformar el rendimiento. Las afirmaciones sobre el modelo aislado y sobre el sistema completo responden a preguntas distintas.
Referencia humana cambiante
El rendimiento humano depende de la experiencia, la motivación, el tiempo, la colaboración y el acceso a herramientas.
Una evidencia sólida puede mostrar
- Rendimiento amplio respecto a grupos humanos definidos
- Aprendizaje rápido en tareas privadas y nuevas
- Transferencia robusta y autonomía de largo horizonte
- Costes, intervenciones y modos de fallo conocidos
Una etiqueta de AGI no puede demostrar automáticamente
- Consciencia o estatus moral
- Alineamiento con valores humanos
- Ausencia de errores catastróficos
- Competencia equivalente en cualquier contexto físico
Respuestas claras
Preguntas frecuentes sobre AGI
¿Qué significan las siglas AGI?
Artificial general intelligence, es decir, inteligencia artificial general. Suele referirse a una IA con competencia amplia y adaptable en muchas tareas, en lugar de un rendimiento excepcional en un único ámbito estrecho. Las definiciones difieren en cuanto a la autonomía, la corporización y el nivel humano exigido.
¿Existe una prueba oficial única de AGI?
No. No existe un examen ni un umbral autorizado universalmente. Los investigadores utilizan conjuntos de benchmarks, referencias humanas, aprendizaje de tareas nuevas, evaluaciones de agentes y marcos que combinan amplitud y rendimiento.
¿Esta página comprueba si un modelo real es AGI?
No. La sección interactiva evalúa tu capacidad para interpretar afirmaciones basadas en evidencia. Certificar un sistema real exigiría acceso a dicho sistema, evaluaciones privadas, condiciones documentadas y replicación independiente.
¿Se ha alcanzado la AGI?
No existe consenso porque las definiciones y los umbrales difieren. Las afirmaciones contundentes deberían identificar la definición operacional exacta en lugar de tratar la AGI como un acontecimiento binario aceptado universalmente.
¿Puede un solo benchmark demostrar la AGI?
Ningún benchmark por sí solo abarca la amplitud, la robustez, la eficiencia de aprendizaje, la autonomía y la fiabilidad en el mundo real que suelen asociarse con la AGI. Un benchmark puede aportar evidencia importante sobre un componente.
¿Superar la prueba de Turing equivale a ser AGI?
No. Una prueba de Turing mide la indistinguibilidad conversacional bajo un protocolo. Las afirmaciones sobre AGI suelen referirse a una competencia, aprendizaje y transferencia más amplios.
¿La AGI tiene que ser consciente?
No según la mayoría de las definiciones operacionales de capacidad. La consciencia es una cuestión científica y filosófica distinta que sigue sin resolverse.
¿La AGI necesita un cuerpo robótico?
Depende de la definición. Algunos marcos se centran explícitamente en tareas cognitivas no físicas; otros sostienen que una generalidad similar a la humana requiere percepción y acción en el mundo físico.
¿Qué es la contaminación de un benchmark?
Se produce cuando las tareas de evaluación o variantes muy próximas aparecen en los datos de entrenamiento, ajuste o desarrollo de prompts, de modo que una puntuación alta puede reflejar exposición previa en vez de generalización a problemas realmente nuevos.
¿Cuál es la diferencia entre un modelo y un agente?
Un modelo transforma entradas en salidas. Un sistema agéntico puede combinar un modelo con memoria, bucles de planificación, herramientas, datos externos y la capacidad de realizar acciones a lo largo del tiempo.
¿Qué viene después de la AGI?
La superinteligencia artificial, o ASI, es un nivel hipotético en el que una inteligencia de máquina de amplio alcance supera ampliamente la capacidad humana en la mayoría o prácticamente todos los ámbitos cognitivos relevantes.
¿Puede una AGI ser segura pero poco fiable?
La seguridad y la fiabilidad se solapan, pero no son idénticas. Un sistema puede estar alineado en sus intenciones y aun así cometer muchos errores, o ser técnicamente capaz y fiable mientras persigue objetivos perjudiciales. Ambas cuestiones requieren evidencia específica.
Consulta el marco
Fuentes primarias y de investigación
OpenAI Charter
Una destacada definición económica: sistemas altamente autónomos que superan a los humanos en la mayor parte del trabajo con valor económico.
Abrir fuenteGoogle DeepMind: niveles de AGI
Un marco basado en la profundidad del rendimiento y la amplitud de las capacidades.
Abrir fuenteChollet: sobre la medición de la inteligencia
Define la inteligencia en torno a la eficiencia de adquisición de habilidades e introduce ARC.
Abrir fuenteRepositorio ARC-AGI
Tareas, métodos y documentación oficiales del Abstraction and Reasoning Corpus.
Abrir fuenteARC-AGI-3
Benchmark interactivo de razonamiento para exploración, adquisición de objetivos y modelos adaptativos del mundo.
Abrir fuenteÍndice de IA de Stanford
Evidencia anual sobre capacidades de IA, tendencias de benchmarks, inversión, políticas e impactos.
Abrir fuenteMarco de gestión de riesgos de IA del NIST
Un marco estructurado para gobernar, mapear, medir y gestionar los riesgos de la IA.
Abrir fuenteTuring (1950)
El artículo original sobre el juego de imitación y el argumento fundacional acerca de la inteligencia de las máquinas.
Abrir fuente
