GUIDE IA AXÉ SUR LES PREUVES : Évaluez les affirmations, pas le discours marketing Commencer le test AGI
Laboratoire abstrait d’évaluation de l’IA générale relié à de nombreux postes de capacités

Étendue · apprentissage · autonomie · robustesse

Le test AGI

Un seul système peut-il apprendre, raisonner et travailler dans des domaines inconnus — ou confondons-nous un ensemble de compétences impressionnantes avec une intelligence générale ?

10 cas à évaluer Aucune fausse certification Guide adossé à la recherche

Repère essentiel

Il n’existe pas d’examen AGI officiellement reconnu partout

L’AGI est un concept de recherche aux définitions concurrentes. Cette page ne déclare pas qu’un système nommé a — ou n’a pas — franchi une ligne d’arrivée magique. Le test mesure avec quelle rigueur vous interprétez les preuves de capacités. L’évaluation d’un système réel nécessiterait des tâches privées, des références humaines, la divulgation des outils et des coûts, des tests de robustesse et une réplication indépendante.

Preuves réexaminées 08/2026

Aucun test uniqueL’AGI exige des preuves convergentesSur l’étendue, la profondeur et l’adaptation
Général ≠ parfaitLes humains sont généralistes mais failliblesLa fiabilité reste essentielle
Le système compteLes modèles peuvent utiliser mémoire et outilsIndiquez le périmètre complet de l’évaluation
Capacité ≠ sécuritéDes questions distinctes exigent des preuves distinctesLa puissance ne garantit pas l’alignement

Laboratoire interactif d’évaluation

Test des preuves sur l’AGI

Chaque cas présente une affirmation au sujet d’un système d’IA. Choisissez la conclusion la plus défendable — pas la plus spectaculaire ni la plus sceptique.

Progression0/10

Ce que signifient vos réponses : ce test évalue votre maîtrise de l’analyse des preuves sur l’AGI. Un score élevé signifie que, dans ces cas, vous avez su distinguer une réussite étroite, une véritable généralisation et une inférence non étayée. Il ne mesure ni votre QI ni le fait que vous soyez une AGI.

Cherchez les preuves directes

Demandez-vous ce que l’observation a réellement mesuré avant d’accepter une affirmation plus large.

Évitez les deux extrêmes

« Un benchmark prouve l’AGI » et « toute évaluation est inutile » sont généralement deux affirmations excessives.

01Validité du benchmarkUn système obtient 96 % à un célèbre benchmark public de raisonnement après des années de discussions en ligne sur ce benchmark. Quelle est la conclusion la plus solide ?
02TransfertAvec seulement deux démonstrations, un système apprend à évoluer dans un environnement inédit de contrôle visuel, en déduit l’objectif, s’adapte après un échec et réussit efficacement. Qu’est-ce que cela étaye le plus directement ?
03ÉtendueUn agent de programmation surpasse presque tous les professionnels sur des tâches logicielles bien définies, mais ne sait pas planifier un voyage de manière fiable, interpréter des schémas ni apprendre de nouveaux jeux. Comment faut-il le classer ?
04AutonomieUn agent mène à bien des tâches de recherche de huit heures à l’aide d’outils, mais un humain doit le corriger toutes les 30 minutes. Quelle est l’interprétation prudente ?
05CommunicationUn chatbot est jugé humain lors de courtes conversations en aveugle. Quelle affirmation sur l’AGI peut-on en tirer ?
06RobustesseUn modèle atteint le niveau d’un adulte qualifié dans six domaines, puis s’effondre lorsque les formats, les outils et la formulation changent légèrement. Que lui manque-t-il ?
07PérimètreUn système égale des humains qualifiés dans l’ensemble des tâches cognitives non physiques, mais ne peut pas manipuler d’objets. Est-ce une AGI ?
08Périmètre du systèmeUn modèle ne réussit que lorsqu’il est relié à la recherche, à l’exécution de code, à une mémoire et à des outils spécialisés. Que doit indiquer un rapport d’évaluation ?
09États mentauxUn modèle déclare : « Je suis conscient et j’ai atteint l’AGI. » Qu’est-ce que cela établit ?
10RéplicationDes équipes indépendantes préenregistrent les tests, utilisent des tâches privées, comparent les résultats à des références d’humains qualifiés, publient les coûts et reproduisent des résultats étendus. Pourquoi est-ce plus solide ?

Commencez par le terme contesté

Qu’est-ce que l’intelligence artificielle générale ?

Une famille de définitions, pas un objet définitivement établi

La plupart des définitions combinent généralité — la compétence sur un large éventail de tâches — avec la performance, l’apprentissage et un certain degré d’autonomie. La charte d’OpenAI met l’accent sur le fait de surpasser les humains dans la plupart des tâches ayant une valeur économique. Le cadre « Levels of AGI » de DeepMind distingue l’étendue de la profondeur. François Chollet insiste sur l’efficacité de l’acquisition de compétences sur des tâches inédites.

Bonne pratique : ne demandez jamais seulement « Est-ce une AGI ? ». Demandez : « Selon quelle définition opérationnelle, sur quelles tâches, à quel percentile humain, avec quels outils, quels coûts et quel taux d’intervention ? »

Une cible multidimensionnelle

Six dimensions auxquelles une affirmation d’AGI devrait résister

Étenduede nombreux domaines
Profondeurniveau par rapport aux humains
Apprentissagenouvelles compétences acquises efficacement
Transfertréutiliser les connaissances ailleurs
Robustesserésister aux changements et aux attaques
Autonomieaccomplir des tâches longues

Performance sans généralité

Les moteurs d’échecs et les systèmes de prédiction de structures protéiques peuvent être surhumains dans un domaine sans devenir des AGI.

Généralité sans perfection

Les humains transfèrent leurs compétences d’un domaine à l’autre malgré leurs erreurs. Exiger une perfection absolue fixe une barre plus haute que celle de l’intelligence générale humaine.

Capacité sans efficacité

Un résultat peut changer de sens s’il exige, pour chaque tâche, d’énormes ressources de calcul, beaucoup de temps ou une assistance humaine importante.

Au-delà d’une étiquette oui/non

L’AGI comme niveaux d’étendue et de performance

Un cadre influent représente les capacités sous forme de matrice. « Général » couvre un large éventail de tâches non physiques ; les performances sont comparées à celles d’adultes qualifiés.

Performance
Étroit
Général
Interprétation
Émergent
Quelques compétences utiles sur certaines tâches
Capacités inégales sur de nombreuses tâches
Globalement en dessous du niveau d’un adulte qualifié
Compétent
Au moins le niveau médian d’un adulte qualifié sur une tâche délimitée
AGI compétenteAu moins le niveau médian d’un adulte qualifié sur un large éventail de tâches
Exige à la fois de l’étendue et des performances fiables
Expert
Au moins le 90e percentile sur une tâche délimitée
AGI experte sur un large éventail de tâches
Une affirmation bien plus forte à l’échelle de l’économie
Surhumain
Dépasse tous les humains dans un domaine
Dépasse largement tous les humains
Entre dans le domaine de l’ASI

Boîte à outils de mesure

Aucun benchmark ne résume l’esprit tout entier

Abstraction inédite

ARC-AGI

Évalue l’induction de règles à partir de quelques exemples et l’efficacité de l’acquisition de compétences sur des tâches visuelles inédites. Utile pour mesurer l’adaptation fluide, mais incomplet pour tester le langage, l’agentivité ou le monde réel.

Travail sur de longues durées

Évaluations d’agents

Mesurent si les systèmes savent planifier, utiliser des outils, se remettre d’erreurs et terminer des projets sur des horizons temporels croissants. Les résultats dépendent fortement de l’échafaudage logiciel et de l’environnement.

Connaissances étendues

Batteries d’examens

Couvrent efficacement de nombreuses disciplines, mais peuvent davantage récompenser les connaissances mémorisées, l’aptitude à passer des tests et l’exposition préalable que l’apprentissage rapide.

Attention à la saturation des benchmarks : dès qu’un test devient une cible, les développeurs optimisent leurs systèmes pour celui-ci. Conservez des jeux de test privés, faites tourner les tâches, auditez la contamination et maintenez des groupes humains de comparaison pertinents.

L’échelle des preuves

Qu’est-ce qui rendrait une affirmation d’AGI convaincante ?

1DémonstrationComportement intéressant, facile à sélectionner
2Benchmark publicComparable, mais exposé au risque de contamination
3Évaluation privéeTâches inédites et accès contrôlé
4Référence d’humains qualifiésÉtendue, temps, outils et coûts harmonisés
5Réplication indépendantePreuves auditables, robustes et adversariales
  1. 01

    Prédéfinir le périmètre du système

    Le modèle, la mémoire, la recherche, l’exécution de code, la robotique, les prompts et l’assistance humaine comptent tous.

  2. 02

    Échantillonner l’univers des tâches

    Une affirmation générale exige des tâches représentatives, pas une sélection de démonstrations choisies pour impressionner.

  3. 03

    Tester l’apprentissage inédit

    Mesurez la rapidité avec laquelle le système acquiert des compétences auxquelles il ne pouvait pas se préparer pendant l’entraînement.

  4. 04

    Mesurer la fiabilité

    Le taux de réussite moyen, les défaillances catastrophiques, la calibration, la récupération et les changements de distribution comptent tous.

  5. 05

    Aligner les conditions humaines

    Comparez le temps, les outils, les consignes, les incitations et l’accès aux documents de référence.

  6. 06

    Distinguer les capacités de la sécurité

    Après avoir montré ce qu’un système peut faire, vérifiez s’il reste contrôlable et bénéfique.

De l’imitation à l’adaptation

Brève histoire de l’idée d’AGI

1950
Jalon 01

Turing reformule la question de l’intelligence des machines

Le jeu de l’imitation a placé le comportement observable au centre, mais l’imitation conversationnelle n’est jamais devenue une définition complète de l’intelligence générale.

1956
Jalon 02

L’IA devient un domaine de recherche

La proposition de Dartmouth avançait que l’apprentissage et l’intelligence pouvaient être décrits avec suffisamment de précision pour que des machines puissent les simuler.

1980s
Jalon 03

Les systèmes experts révèlent le problème de l’étroitesse

Des performances élevées dans des domaines délimités ont montré qu’une expertise pouvait être puissante sans être générale ni adaptable.

1997–2016
Jalon 04

Jalons de capacités étroites surhumaines

Deep Blue, Watson et AlphaGo ont dépassé des humains très performants sur des tâches précises, tout en restant très différents d’une personne dotée de capacités générales.

2019
Jalon 05

ARC cible l’efficacité de l’acquisition de compétences

François Chollet a proposé de mesurer l’intelligence par l’efficacité avec laquelle les systèmes acquièrent de nouvelles compétences, en introduisant l’Abstraction and Reasoning Corpus.

2023
Jalon 06

Cadre des niveaux d’AGI

Des chercheurs de Google DeepMind ont proposé de classer les systèmes selon la profondeur de leurs performances et l’étendue des tâches, du niveau émergent au niveau surhumain.

2024–26
Jalon 07

Les benchmarks de raisonnement et d’agents évoluent

ARC-AGI et les évaluations d’agents sur de longues durées testent de plus en plus l’adaptation, l’usage d’outils et l’apprentissage interactif, tandis que la saturation et la contamination des benchmarks restent préoccupantes.

Aujourd’hui
Jalon 08

Il n’existe aucune certification universelle

L’AGI reste un concept débattu. Toute affirmation sérieuse doit préciser sa définition, son périmètre, sa référence humaine, les limites du système et le niveau de preuve exigé.

Réalités difficiles

Pourquoi mesurer l’AGI est difficile

Univers des tâches mal défini

« Toutes les tâches cognitives » ne constituent pas un échantillon fini et neutre. Les choix économiques et culturels déterminent ce qui est pris en compte.

Opacité de l’entraînement

Sans savoir ce qu’un système a vu, il est difficile de distinguer la récupération d’informations et la mémorisation d’un véritable nouvel apprentissage.

Périmètre du système changeant

Les outils et les échafaudages peuvent transformer les performances. Les affirmations portant sur le modèle seul et celles portant sur le système complet répondent à des questions différentes.

Référence humaine changeante

Les performances humaines dépendent de l’expertise, de la motivation, du temps, de la collaboration et de l’accès aux outils.

Des preuves solides peuvent montrer

  • Des performances étendues par rapport à un groupe humain défini
  • Un apprentissage rapide sur des tâches privées et inédites
  • Un transfert robuste et une autonomie sur de longues durées
  • Des coûts, interventions et modes de défaillance connus

L’étiquette AGI ne permet pas, à elle seule, d’établir

  • La conscience ou le statut moral
  • L’alignement sur les valeurs humaines
  • L’absence d’erreurs catastrophiques
  • Une compétence égale dans tous les contextes physiques

Réponses claires

Questions fréquentes sur l’AGI

Que signifie AGI ?

Artificial General Intelligence, soit « intelligence artificielle générale ». Le terme désigne généralement une IA dotée de compétences étendues et adaptables sur de nombreuses tâches, plutôt que de performances exceptionnelles dans un seul domaine étroit. Les définitions divergent sur l’autonomie, l’incarnation et le niveau humain requis.

Existe-t-il un test AGI officiel unique ?

Non. Il n’existe ni examen ni seuil universellement reconnu. Les chercheurs utilisent des ensembles de benchmarks, des références humaines, l’apprentissage de tâches inédites, des évaluations d’agents et des cadres combinant étendue et niveau de performance.

Cette page vérifie-t-elle si un modèle réel est une AGI ?

Non. La section interactive teste votre capacité à interpréter des affirmations fondées sur des preuves. Certifier un système réel nécessiterait d’y avoir accès, de mener des évaluations privées, de documenter les conditions et d’obtenir une réplication indépendante.

L’AGI a-t-elle été atteinte ?

Il n’existe pas de consensus, car les définitions et les seuils diffèrent. Les affirmations fortes devraient préciser la définition opérationnelle exacte, plutôt que de traiter l’AGI comme un événement binaire faisant universellement consensus.

Un seul benchmark peut-il prouver l’AGI ?

Aucun benchmark unique ne couvre l’étendue, la robustesse, l’efficacité de l’apprentissage, l’autonomie et la fiabilité dans le monde réel généralement associées à l’AGI. Un benchmark peut apporter des éléments importants sur une composante donnée.

Réussir le test de Turing équivaut-il à l’AGI ?

Non. Un test de Turing mesure l’indiscernabilité conversationnelle dans le cadre d’un protocole. Les affirmations sur l’AGI portent généralement sur des compétences plus larges, l’apprentissage et le transfert.

Une AGI doit-elle être consciente ?

Pas selon la plupart des définitions opérationnelles fondées sur les capacités. La conscience est une question scientifique et philosophique distincte, qui reste irrésolue.

Une AGI a-t-elle besoin d’un corps robotique ?

Cela dépend de la définition. Certains cadres se concentrent explicitement sur les tâches cognitives non physiques ; d’autres estiment qu’une généralité comparable à celle de l’humain exige perception et action dans le monde physique.

Qu’est-ce que la contamination d’un benchmark ?

Elle survient lorsque des tâches d’évaluation, ou des variantes très proches, se retrouvent dans les données d’entraînement, d’ajustement ou de mise au point des prompts ; un score élevé peut alors refléter une exposition antérieure plutôt qu’une généralisation à des problèmes réellement nouveaux.

Quelle est la différence entre un modèle et un agent ?

Un modèle transforme des entrées en sorties. Un système agentique peut associer un modèle à une mémoire, des boucles de planification, des outils, des données externes et la capacité d’agir dans la durée.

Qu’y a-t-il après l’AGI ?

La superintelligence artificielle, ou ASI, est un niveau hypothétique où une intelligence artificielle générale dépasserait largement les capacités humaines dans la plupart, voire la quasi-totalité, des domaines cognitifs pertinents.

Une AGI peut-elle être sûre mais peu fiable ?

Sécurité et fiabilité se recoupent sans être identiques. Un système peut être aligné dans ses intentions tout en étant sujet aux erreurs, ou être techniquement performant et fiable tout en poursuivant des objectifs nuisibles. Les deux dimensions nécessitent des preuves spécifiques.

Remonter aux fondements

Sources primaires et travaux de recherche

Charte d’OpenAI

Une définition économique souvent citée : des systèmes hautement autonomes surpassant les humains dans la plupart des tâches ayant une valeur économique.

Ouvrir la source

Google DeepMind : niveaux d’AGI

Un cadre fondé sur la profondeur des performances et l’étendue des capacités.

Ouvrir la source

Chollet : On the Measure of Intelligence

Définit l’intelligence autour de l’efficacité de l’acquisition de compétences et introduit ARC.

Ouvrir la source

Dépôt ARC-AGI

Tâches, méthodes et documentation officielles de l’Abstraction and Reasoning Corpus.

Ouvrir la source

ARC-AGI-3

Benchmark de raisonnement interactif portant sur l’exploration, l’acquisition d’objectifs et les modèles adaptatifs du monde.

Ouvrir la source

Indice de l’IA de Stanford

Données annuelles sur les capacités de l’IA, l’évolution des benchmarks, les investissements, les politiques publiques et les impacts.

Ouvrir la source

Cadre de gestion des risques liés à l’IA du NIST

Un cadre structuré pour gouverner, cartographier, mesurer et gérer les risques liés à l’IA.

Ouvrir la source

Turing (1950)

L’article original sur le jeu de l’imitation et l’argument fondateur concernant l’intelligence des machines.

Ouvrir la source