Repère essentiel
Il n’existe pas d’examen AGI officiellement reconnu partout
L’AGI est un concept de recherche aux définitions concurrentes. Cette page ne déclare pas qu’un système nommé a — ou n’a pas — franchi une ligne d’arrivée magique. Le test mesure avec quelle rigueur vous interprétez les preuves de capacités. L’évaluation d’un système réel nécessiterait des tâches privées, des références humaines, la divulgation des outils et des coûts, des tests de robustesse et une réplication indépendante.
Preuves réexaminées 08/2026
Laboratoire interactif d’évaluation
Test des preuves sur l’AGI
Chaque cas présente une affirmation au sujet d’un système d’IA. Choisissez la conclusion la plus défendable — pas la plus spectaculaire ni la plus sceptique.
Ce que signifient vos réponses : ce test évalue votre maîtrise de l’analyse des preuves sur l’AGI. Un score élevé signifie que, dans ces cas, vous avez su distinguer une réussite étroite, une véritable généralisation et une inférence non étayée. Il ne mesure ni votre QI ni le fait que vous soyez une AGI.
Demandez-vous ce que l’observation a réellement mesuré avant d’accepter une affirmation plus large.
« Un benchmark prouve l’AGI » et « toute évaluation est inutile » sont généralement deux affirmations excessives.
Votre profil d’évaluateur
Ce que ce résultat signifie réellement
Il ne certifie pas qu’un système d’IA est une AGI. Vous avez évalué des énoncés de preuve fictifs ; aucun modèle réel n’a été testé.
Commencez par le terme contesté
Qu’est-ce que l’intelligence artificielle générale ?
Une famille de définitions, pas un objet définitivement établi
La plupart des définitions combinent généralité — la compétence sur un large éventail de tâches — avec la performance, l’apprentissage et un certain degré d’autonomie. La charte d’OpenAI met l’accent sur le fait de surpasser les humains dans la plupart des tâches ayant une valeur économique. Le cadre « Levels of AGI » de DeepMind distingue l’étendue de la profondeur. François Chollet insiste sur l’efficacité de l’acquisition de compétences sur des tâches inédites.
Une cible multidimensionnelle
Six dimensions auxquelles une affirmation d’AGI devrait résister
Performance sans généralité
Les moteurs d’échecs et les systèmes de prédiction de structures protéiques peuvent être surhumains dans un domaine sans devenir des AGI.
Généralité sans perfection
Les humains transfèrent leurs compétences d’un domaine à l’autre malgré leurs erreurs. Exiger une perfection absolue fixe une barre plus haute que celle de l’intelligence générale humaine.
Capacité sans efficacité
Un résultat peut changer de sens s’il exige, pour chaque tâche, d’énormes ressources de calcul, beaucoup de temps ou une assistance humaine importante.
Au-delà d’une étiquette oui/non
L’AGI comme niveaux d’étendue et de performance
Un cadre influent représente les capacités sous forme de matrice. « Général » couvre un large éventail de tâches non physiques ; les performances sont comparées à celles d’adultes qualifiés.
Boîte à outils de mesure
Aucun benchmark ne résume l’esprit tout entier
ARC-AGI
Évalue l’induction de règles à partir de quelques exemples et l’efficacité de l’acquisition de compétences sur des tâches visuelles inédites. Utile pour mesurer l’adaptation fluide, mais incomplet pour tester le langage, l’agentivité ou le monde réel.
Évaluations d’agents
Mesurent si les systèmes savent planifier, utiliser des outils, se remettre d’erreurs et terminer des projets sur des horizons temporels croissants. Les résultats dépendent fortement de l’échafaudage logiciel et de l’environnement.
Batteries d’examens
Couvrent efficacement de nombreuses disciplines, mais peuvent davantage récompenser les connaissances mémorisées, l’aptitude à passer des tests et l’exposition préalable que l’apprentissage rapide.
L’échelle des preuves
Qu’est-ce qui rendrait une affirmation d’AGI convaincante ?
- 01
Prédéfinir le périmètre du système
Le modèle, la mémoire, la recherche, l’exécution de code, la robotique, les prompts et l’assistance humaine comptent tous.
- 02
Échantillonner l’univers des tâches
Une affirmation générale exige des tâches représentatives, pas une sélection de démonstrations choisies pour impressionner.
- 03
Tester l’apprentissage inédit
Mesurez la rapidité avec laquelle le système acquiert des compétences auxquelles il ne pouvait pas se préparer pendant l’entraînement.
- 04
Mesurer la fiabilité
Le taux de réussite moyen, les défaillances catastrophiques, la calibration, la récupération et les changements de distribution comptent tous.
- 05
Aligner les conditions humaines
Comparez le temps, les outils, les consignes, les incitations et l’accès aux documents de référence.
- 06
Distinguer les capacités de la sécurité
Après avoir montré ce qu’un système peut faire, vérifiez s’il reste contrôlable et bénéfique.
De l’imitation à l’adaptation
Brève histoire de l’idée d’AGI
Turing reformule la question de l’intelligence des machines
Le jeu de l’imitation a placé le comportement observable au centre, mais l’imitation conversationnelle n’est jamais devenue une définition complète de l’intelligence générale.
L’IA devient un domaine de recherche
La proposition de Dartmouth avançait que l’apprentissage et l’intelligence pouvaient être décrits avec suffisamment de précision pour que des machines puissent les simuler.
Les systèmes experts révèlent le problème de l’étroitesse
Des performances élevées dans des domaines délimités ont montré qu’une expertise pouvait être puissante sans être générale ni adaptable.
Jalons de capacités étroites surhumaines
Deep Blue, Watson et AlphaGo ont dépassé des humains très performants sur des tâches précises, tout en restant très différents d’une personne dotée de capacités générales.
ARC cible l’efficacité de l’acquisition de compétences
François Chollet a proposé de mesurer l’intelligence par l’efficacité avec laquelle les systèmes acquièrent de nouvelles compétences, en introduisant l’Abstraction and Reasoning Corpus.
Cadre des niveaux d’AGI
Des chercheurs de Google DeepMind ont proposé de classer les systèmes selon la profondeur de leurs performances et l’étendue des tâches, du niveau émergent au niveau surhumain.
Les benchmarks de raisonnement et d’agents évoluent
ARC-AGI et les évaluations d’agents sur de longues durées testent de plus en plus l’adaptation, l’usage d’outils et l’apprentissage interactif, tandis que la saturation et la contamination des benchmarks restent préoccupantes.
Il n’existe aucune certification universelle
L’AGI reste un concept débattu. Toute affirmation sérieuse doit préciser sa définition, son périmètre, sa référence humaine, les limites du système et le niveau de preuve exigé.
Réalités difficiles
Pourquoi mesurer l’AGI est difficile
Univers des tâches mal défini
« Toutes les tâches cognitives » ne constituent pas un échantillon fini et neutre. Les choix économiques et culturels déterminent ce qui est pris en compte.
Opacité de l’entraînement
Sans savoir ce qu’un système a vu, il est difficile de distinguer la récupération d’informations et la mémorisation d’un véritable nouvel apprentissage.
Périmètre du système changeant
Les outils et les échafaudages peuvent transformer les performances. Les affirmations portant sur le modèle seul et celles portant sur le système complet répondent à des questions différentes.
Référence humaine changeante
Les performances humaines dépendent de l’expertise, de la motivation, du temps, de la collaboration et de l’accès aux outils.
Des preuves solides peuvent montrer
- Des performances étendues par rapport à un groupe humain défini
- Un apprentissage rapide sur des tâches privées et inédites
- Un transfert robuste et une autonomie sur de longues durées
- Des coûts, interventions et modes de défaillance connus
L’étiquette AGI ne permet pas, à elle seule, d’établir
- La conscience ou le statut moral
- L’alignement sur les valeurs humaines
- L’absence d’erreurs catastrophiques
- Une compétence égale dans tous les contextes physiques
Réponses claires
Questions fréquentes sur l’AGI
Que signifie AGI ?
Artificial General Intelligence, soit « intelligence artificielle générale ». Le terme désigne généralement une IA dotée de compétences étendues et adaptables sur de nombreuses tâches, plutôt que de performances exceptionnelles dans un seul domaine étroit. Les définitions divergent sur l’autonomie, l’incarnation et le niveau humain requis.
Existe-t-il un test AGI officiel unique ?
Non. Il n’existe ni examen ni seuil universellement reconnu. Les chercheurs utilisent des ensembles de benchmarks, des références humaines, l’apprentissage de tâches inédites, des évaluations d’agents et des cadres combinant étendue et niveau de performance.
Cette page vérifie-t-elle si un modèle réel est une AGI ?
Non. La section interactive teste votre capacité à interpréter des affirmations fondées sur des preuves. Certifier un système réel nécessiterait d’y avoir accès, de mener des évaluations privées, de documenter les conditions et d’obtenir une réplication indépendante.
L’AGI a-t-elle été atteinte ?
Il n’existe pas de consensus, car les définitions et les seuils diffèrent. Les affirmations fortes devraient préciser la définition opérationnelle exacte, plutôt que de traiter l’AGI comme un événement binaire faisant universellement consensus.
Un seul benchmark peut-il prouver l’AGI ?
Aucun benchmark unique ne couvre l’étendue, la robustesse, l’efficacité de l’apprentissage, l’autonomie et la fiabilité dans le monde réel généralement associées à l’AGI. Un benchmark peut apporter des éléments importants sur une composante donnée.
Réussir le test de Turing équivaut-il à l’AGI ?
Non. Un test de Turing mesure l’indiscernabilité conversationnelle dans le cadre d’un protocole. Les affirmations sur l’AGI portent généralement sur des compétences plus larges, l’apprentissage et le transfert.
Une AGI doit-elle être consciente ?
Pas selon la plupart des définitions opérationnelles fondées sur les capacités. La conscience est une question scientifique et philosophique distincte, qui reste irrésolue.
Une AGI a-t-elle besoin d’un corps robotique ?
Cela dépend de la définition. Certains cadres se concentrent explicitement sur les tâches cognitives non physiques ; d’autres estiment qu’une généralité comparable à celle de l’humain exige perception et action dans le monde physique.
Qu’est-ce que la contamination d’un benchmark ?
Elle survient lorsque des tâches d’évaluation, ou des variantes très proches, se retrouvent dans les données d’entraînement, d’ajustement ou de mise au point des prompts ; un score élevé peut alors refléter une exposition antérieure plutôt qu’une généralisation à des problèmes réellement nouveaux.
Quelle est la différence entre un modèle et un agent ?
Un modèle transforme des entrées en sorties. Un système agentique peut associer un modèle à une mémoire, des boucles de planification, des outils, des données externes et la capacité d’agir dans la durée.
Qu’y a-t-il après l’AGI ?
La superintelligence artificielle, ou ASI, est un niveau hypothétique où une intelligence artificielle générale dépasserait largement les capacités humaines dans la plupart, voire la quasi-totalité, des domaines cognitifs pertinents.
Une AGI peut-elle être sûre mais peu fiable ?
Sécurité et fiabilité se recoupent sans être identiques. Un système peut être aligné dans ses intentions tout en étant sujet aux erreurs, ou être techniquement performant et fiable tout en poursuivant des objectifs nuisibles. Les deux dimensions nécessitent des preuves spécifiques.
Remonter aux fondements
Sources primaires et travaux de recherche
Charte d’OpenAI
Une définition économique souvent citée : des systèmes hautement autonomes surpassant les humains dans la plupart des tâches ayant une valeur économique.
Ouvrir la sourceGoogle DeepMind : niveaux d’AGI
Un cadre fondé sur la profondeur des performances et l’étendue des capacités.
Ouvrir la sourceChollet : On the Measure of Intelligence
Définit l’intelligence autour de l’efficacité de l’acquisition de compétences et introduit ARC.
Ouvrir la sourceDépôt ARC-AGI
Tâches, méthodes et documentation officielles de l’Abstraction and Reasoning Corpus.
Ouvrir la sourceARC-AGI-3
Benchmark de raisonnement interactif portant sur l’exploration, l’acquisition d’objectifs et les modèles adaptatifs du monde.
Ouvrir la sourceIndice de l’IA de Stanford
Données annuelles sur les capacités de l’IA, l’évolution des benchmarks, les investissements, les politiques publiques et les impacts.
Ouvrir la sourceCadre de gestion des risques liés à l’IA du NIST
Un cadre structuré pour gouverner, cartographier, mesurer et gérer les risques liés à l’IA.
Ouvrir la sourceTuring (1950)
L’article original sur le jeu de l’imitation et l’argument fondateur concernant l’intelligence des machines.
Ouvrir la source
