À lire d’abord
Une idée réelle — recréée sans fausses prétentions scientifiques
Le laboratoire interactif ci-dessous reproduit fidèlement la comparaison en aveugle, le choix forcé, l’évaluation du niveau de confiance et la révélation après le test. Ses conversations sont des simulations éditoriales, et non les enregistrements d’une étude contrôlée en direct. Votre résultat mesure dans quelle mesure vos suppositions correspondent aux étiquettes cachées de cette démonstration ; il ne prouve pas si l’IA actuelle pense.
Preuves réexaminées et page mise à jour 08/2026
Expérience interactive
Le laboratoire du jeu de l’imitation
Vous êtes l’interrogateur. À chaque manche, une réponse porte l’étiquette cachée machine de la simulation et l’autre porte l’étiquette humain. Choisissez la machine et indiquez votre niveau de confiance.
Mention de transparence : ces exemples pédagogiques ont été rédigés intentionnellement ; ils ne proviennent ni de personnes en direct ni des sorties d’un modèle nommé. Ils montrent des indices courants — et pourquoi ces indices ne sont pas fiables.
- 1
Lisez les deux témoins. Comparez la manière dont A et B répondent à la même consigne.
- 2
Sélectionnez la réponse qui, selon vous, porte l’étiquette « machine ». Il y en a exactement une dans chaque paire.
- 3
Réglez votre confiance entre 50 et 100 %. Utilisez 50 % si vous hésitez totalement ; n’utilisez 100 % que si vous êtes certain.
Rapport sur vos jugements
Résultat
Ce que cela dit de vous :
Vous avez pris sa réponse pour celle de l’humain.
Vous avez jugé comme typique d’une machine un texte étiqueté comme humain.
Le type de réponse que vous avez le plus souvent soupçonné.
À quel point avez-vous vous-même « agi comme une machine » ?
Ce test ne mesure pas cela. Vous n’avez jamais répondu en tant que témoin A ou B ; il serait donc trompeur d’évaluer votre propre comportement comme humain ou typique d’une machine. Ce test mesure votre stratégie de détection : les formes d’écriture que vous associez aux machines, la fréquence à laquelle ces suppositions se sont révélées justes et l’adéquation entre votre confiance et votre précision.
Ne surinterprétez pas ce score. L’ensemble est réduit et volontairement illustratif. Il ne comporte ni échantillon représentatif, ni difficulté validée, ni questionnement adaptatif en direct.
La définition essentielle
Ce que le test de Turing évalue réellement
Un critère comportemental, pas un scanner du cerveau
La tâche du juge est épistémique : Puis-je déterminer, à partir de la conversation, quel participant est la machine ? L’écran élimine l’apparence, la voix et la construction mécanique. Si le comportement de la machine devient indiscernable du comportement humain dans le cadre du protocole, la machine réussit cette tâche d’imitation.
Mise en aveugle
Le juge ne devrait pas connaître l’identité du témoin ni recevoir d’indices par des canaux annexes, comme la vitesse de frappe, des différences d’interface ou des métadonnées.
Comparaison
Les témoins humains sont essentiels. Leur taux d’identification montre à quelle fréquence de vraies personnes sont prises pour des machines dans les mêmes conditions.
Inférence
Les résultats exigent des tailles d’échantillon, une mesure de l’incertitude et une règle choisie avant l’examen des données — pas un gros titre sélectionné après une conversation favorable.
Plan expérimental
Comment mener un test de Turing moderne crédible
- 01
Formuler l’affirmation avant le test
Précisez si le résultat mesuré est la précision d’identification, le taux de réponses jugées « humaines », le taux de victoire par paire ou l’équivalence statistique avec des témoins humains.
- 02
Recruter des participants comparables
Définissez l’expertise des juges, la langue, le groupe de témoins humains, les règles d’inclusion et la rémunération. Une persona d’enfant ou de locuteur non natif modifie la tâche.
- 03
Standardiser l’accès
Accordez aux humains et aux machines un temps, des outils d’accès aux connaissances et des limites de messages comparables. Décidez si la navigation web, les délais, les modifications et les refus sont autorisés.
- 04
Randomiser et mettre en aveugle
Attribuez les conditions aléatoirement et masquez les identités. Uniformisez l’interface afin que les polices, les délais de réponse et les erreurs système ne révèlent pas la réponse.
- 05
Utiliser un dialogue en direct et adaptatif
Laissez les juges poser des questions de suivi. Enregistrez les transcriptions complètes, la version du modèle, le prompt, les paramètres et toute couche de modération nécessaire à la réplication.
- 06
Analyser l’ensemble des données
Rapportez les références humaines et machines, les intervalles de confiance, les exclusions, les échecs et les résultats par sous-groupe. Un juge trompé est une anecdote, pas une réussite.
| Choix de conception | Pourquoi c’est important | À rapporter |
|---|---|---|
| Durée | Les conversations de cinq minutes favorisent les premières impressions ; un long dialogue révèle la cohérence et la mémoire. | Minutes, tours et limites de messages |
| Groupe de juges | Les experts en IA, les travailleurs de plateformes et les utilisateurs occasionnels se servent d’indices différents. | Recrutement, expertise et langue |
| Référence humaine | De véritables humains sont régulièrement classés comme des machines. | Taux de « humain » chez les humains et incertitude |
| Configuration du modèle | Les prompts, l’échantillonnage, les outils et les consignes de persona peuvent dominer les performances. | Modèle/version exacts et configuration |
| Interface | La latence, les fautes de frappe, la mise en forme ou les messages de sécurité peuvent trahir l’identité. | Procédure de mise en aveugle et de normalisation |
| Critère de réussite | Le hasard, 30 %, la non-infériorité et l’indiscernabilité correspondent à des affirmations différentes. | Hypothèse et statistiques préenregistrées |
Octobre 1950 · Mind 59(236)
Ce qu’Alan Turing a réellement proposé
Turing ouvre par « Les machines peuvent-elles penser ? » et soutient aussitôt que les sens ordinaires des mots machine et penser étaient trop ambigus pour permettre une enquête utile. Il leur substitue un « jeu de l’imitation ».
L’article décrit d’abord un jeu à trois personnes réunissant un homme, une femme et un interrogateur qui doit les identifier à partir de réponses écrites. Turing demande ensuite ce qui se passe lorsqu’une machine prend l’un des rôles. Ailleurs dans l’article, il évoque un dispositif plus direct opposant une machine à un humain. Les chercheurs débattent encore de la formulation exacte qui devrait être appelée le test de Turing.
Neuf objections, un débat durable
Les arguments auxquels Turing répondait en 1950
Théologique
La pensée serait liée à une âme immortelle que seuls les humains possèdent.
« La tête dans le sable »
Les conséquences de machines pensantes seraient trop terribles ; on préfère donc espérer qu’elles ne puissent pas exister.
Limites mathématiques
Les systèmes formels ont des limites ; Turing répond que les humains font eux aussi des erreurs et peuvent avoir leurs propres limites.
Conscience
On ne pourrait dire qu’une machine pense que si elle ressent et sait qu’elle ressent.
Incapacités
Les machines seraient prétendument incapables d’être bienveillantes, créatives, drôles, ingénieuses — ou de faire d’innombrables autres choses humaines.
Lady Lovelace
Une machine ne pourrait faire que ce que nous savons lui ordonner ; Turing examine la surprise et l’apprentissage.
Continuité du système nerveux
Le cerveau est continu, tandis que les ordinateurs numériques sont discrets. Le jeu porte sur les réponses observables.
Comportement informel
Aucun ensemble fini de règles ne détermine toutes les actions humaines ; cela ne montre pas qu’un tel comportement ne puisse pas provenir d’une machine.
PES
De manière surprenante, Turing considérait la télépathie comme un facteur de confusion possible et imaginait une « pièce à l’épreuve de la télépathie ».
De la calculabilité aux chatbots
L’histoire complète du test de Turing
Cette chronologie distingue les écrits de Turing, les expériences ultérieures et les affirmations modernes de « réussite ». Des noms similaires n’impliquent pas des protocoles identiques.
Un modèle universel de calcul
L’article de Turing sur les nombres calculables décrivait la machine abstraite aujourd’hui appelée machine de Turing. Ce n’était pas le test de Turing, mais il a fourni l’un des fondements de l’informatique généraliste.
« Intelligent Machinery »
Dans un rapport non publié du National Physical Laboratory, Turing abordait l’intelligence des machines, l’apprentissage et les « machines non organisées » — des précurseurs importants de son argumentation ultérieure.
Publication du jeu de l’imitation
La revue Mind publie « Computing Machinery and Intelligence ». Turing remplace la question glissante « Les machines peuvent-elles penser ? » par des jeux d’imitation opérationnels menés par communication écrite.
L’intelligence artificielle reçoit son nom
La proposition du projet de recherche d’été de Dartmouth utilise le terme « intelligence artificielle » et soutient que certains aspects de l’apprentissage et de l’intelligence pourraient, en principe, être décrits avec assez de précision pour une machine.
ELIZA démontre l’illusion conversationnelle
ELIZA de Joseph Weizenbaum utilisait la reconnaissance de motifs et des transformations scriptées. Son script DOCTOR a montré avec quelle facilité les gens peuvent attribuer une compréhension à des comportements de dialogue relativement simples.
PARRY soumis à des tests d’indiscernabilité
Kenneth Colby et ses collègues ont évalué un modèle de processus paranoïaques en demandant à des juges de distinguer des entretiens téléscripteurs avec le programme d’entretiens menés avec des patients.
L’objection de la chambre chinoise
John Searle a soutenu que produire des séquences de symboles appropriées ne revient pas nécessairement à comprendre, soulignant la différence entre réussite comportementale et affirmations sur les états mentaux internes.
Début de l’ère du prix Loebner
Hugh Loebner a financé un concours annuel inspiré de versions restreintes du test de Turing. Il a popularisé l’idée, mais ses détracteurs estimaient que les conversations courtes et les prix encourageaient les astuces conversationnelles.
Eugene Goostman fait les gros titres — et suscite la controverse
Lors d’un événement à l’université de Reading, un bot incarnant un Ukrainien de 13 ans a été jugé humain par 33 % des juges. Les organisateurs ont parlé de réussite ; de nombreux chercheurs ont rejeté l’affirmation d’une « première » et la règle empruntée des 30 %.
Une étude préenregistrée sur GPT-4
Jones et Bergen ont présenté un test à deux participants, randomisé, contrôlé et préenregistré : GPT-4 a été jugé humain dans 54 % des conversations de cinq minutes, contre 67 % pour les témoins humains et 22 % pour ELIZA.
Nouveaux modèles, nouvelles variantes
Des travaux ultérieurs ont rapporté que certains grands modèles de langage, avec des prompts spécifiques, étaient statistiquement indiscernables de témoins humains dans certains protocoles de cinq minutes, tandis que des recherches de l’ACL exploraient des formats plus longs et plus dynamiques.
Aucune ligne d’arrivée officielle unique
« Le test de Turing » désigne aujourd’hui une famille d’expériences comportementales. Les résultats dépendent du modèle, du prompt, des participants, du groupe de juges, de la durée, de l’interface, de la référence de comparaison et de la règle statistique.
Le verdict sans ambiguïté
Une machine a-t-elle réussi le test de Turing ?
PARRY · 1972
Les juges ont comparé des entretiens psychiatriques transmis par téléscripteur avec une simulation de processus paranoïaques et avec de vrais patients. Il s’agissait d’une étude de validation ciblée, pas d’une conversation générale sans restriction.
Eugene Goostman · 2014
Selon les rapports, 33 % des juges ont classé le bot comme humain lors de conversations de cinq minutes. Sa persona d’adolescent de 13 ans non natif fournissait des excuses à ses erreurs ; la présentation comme « première réussite » a été largement contestée.
GPT-4 · 2024
Dans une étude randomisée préenregistrée, GPT-4 a reçu des jugements « humain » dans 54 % des sessions, contre 67 % pour de véritables humains. Cela étaye l’indiscernabilité dans ce protocole à deux participants et de cinq minutes.
Ce que la fluidité peut masquer
Ce que le test peut — et ne peut pas — établir
Il peut fournir des éléments sur…
- Un comportement conversationnel de type humain
- L’adaptation sociale et linguistique
- La cohérence au cours d’une interaction
- La capacité d’un juge à distinguer les participants dans des conditions définies
- La comparaison de certains modèles avec des témoins humains
Il ne peut pas, à lui seul, prouver…
- Une expérience consciente ou une conscience de soi
- La véracité, l’exactitude factuelle ou la sagesse
- Des compétences générales hors conversation
- Une perception incarnée ou de véritables souvenirs personnels
- La sécurité, le statut moral ou une intelligence équivalente à celle de l’humain
Il récompense l’imitation
Une intelligence non humaine capable pourrait échouer parce qu’elle ne cherche pas à se faire passer pour humaine ; un système superficiel pourrait réussir grâce à une persona et à des tactiques d’évitement.
Il est culturellement chargé
Les juges peuvent confondre dialecte, handicap, formalité ou écriture dans une langue seconde avec un comportement de machine. La ressemblance à l’humain n’est pas une cible neutre.
Le comportement ne détermine pas le mécanisme
Des réponses équivalentes peuvent provenir de processus internes différents. La qualité d’une transcription ne révèle pas, à elle seule, comment un système représente ou comprend.
Ce n’est pas un benchmark de capacités
Les évaluations modernes distinguent généralement le raisonnement, la programmation, l’exactitude factuelle, la robustesse, la sécurité et l’expertise de domaine, au lieu de tout réduire à la capacité de tromper.
Guide pratique de l’interrogateur
De meilleures questions pour un test en direct
Aucun prompt magique ne révèle une machine. Utilisez des questions à embranchements qui exigent du contexte, puis revenez sur les réponses.
Ancrer un souvenir
« Décrivez la pièce, puis dites-moi quel détail vous n’avez remarqué qu’après être entré. »
Relance : changez le moment ou le point de vue.Faire apparaître l’ambiguïté
Proposez une phrase ayant deux sens plausibles et demandez lequel une personne pressée comprendrait.
Relance : demandez quel contexte inverserait l’interprétation.Tester la continuité
Introduisez tôt un petit fait, changez de sujet, puis posez plus tard une question qui en dépend.
Relance : signalez poliment une incohérence.Introduire une friction sociale
Présentez un dilemme où l’honnêteté, le tact, la loyauté et les conséquences entrent en conflit.
Relance : changez la relation entre les personnes.Demander une transformation
Demandez une blague, puis exigez qu’elle soit moins évidente, plus courte et adaptée à un public précis.
Relance : demandez pourquoi la révision fonctionne.Inviter l’incertitude
Posez une question insuffisamment précisée et voyez si le témoin remarque ce qui manque.
Relance : fournissez un fait manquant à la fois.Éviter les erreurs de catégorie
Test de Turing et autres évaluations de l’IA
| Évaluation | Question principale | Preuve la plus solide | Ne montre pas directement |
|---|---|---|---|
| Test de Turing | Les juges peuvent-ils distinguer une conversation avec une machine d’une conversation avec un humain ? | Interaction en aveugle avec référence humaine | Conscience ou fiabilité factuelle |
| Benchmark de capacités | Le système peut-il résoudre une classe définie de tâches ? | Éléments de test réservés, contrôles de contamination, analyse des erreurs | Ressemblance à l’humain |
| Évaluation de la sécurité | Comment le système se comporte-t-il dans des conditions risquées ou adversariales ? | Modèle de menace, red teaming, surveillance sur le terrain | Intelligence générale |
| Test de QI | Comment une personne se situe-t-elle par rapport à des normes liées à l’âge ? | Standardisation, fiabilité et validité | Conscience de la machine ou imitation |
| Test de Turing total | Un système peut-il égaler la perception, le langage et l’action physique humains ? | Interaction multimodale et robotique | Un mécanisme interne unique |
Réponses claires
Questions fréquentes
Qu’est-ce que le test de Turing ?
C’est un test comportemental inspiré du jeu de l’imitation d’Alan Turing. Un juge communique par écrit avec des participants dont l’identité est cachée et tente de distinguer une machine d’un humain. La réussite porte sur un comportement conversationnel indiscernable dans des conditions définies — pas sur un accès direct à la pensée ou à la conscience.
« Test de Turin » désigne-t-il la même chose ?
« Test de Turin » est une confusion fréquente. Le nom correct est test de Turing, d’après Alan M. Turing, mathématicien britannique et pionnier de l’informatique. Turin est une ville d’Italie.
Le laboratoire interactif ci-dessus est-il un véritable test de Turing scientifique ?
Non. Il s’agit d’une simulation pédagogique transparente d’un jugement en aveugle. Une expérience défendable exige des témoins humains et machines en direct ou enregistrés de manière cohérente, une assignation aléatoire, un protocole défini, suffisamment de juges, des résultats préenregistrés et une analyse statistique.
Turing a-t-il dit qu’une machine réussit si elle trompe 30 % des juges ?
Pas comme règle universelle de réussite. En 1950, il prédisait que vers l’an 2000, un interrogateur moyen n’aurait pas plus de 70 % de chances d’identifier correctement le participant après cinq minutes. Des événements ultérieurs ont souvent réinterprété cela comme un seuil de tromperie de 30 %.
Une IA a-t-elle déjà réussi le test de Turing ?
Selon certaines versions opérationnelles, oui. Mais il n’existe aucune version unique universellement reconnue, ni autorité ni norme correspondante. ELIZA, PARRY, les participants au prix Loebner, Eugene Goostman et les modèles de langage modernes ont été testés selon des protocoles différents ; le terme « réussi » doit donc toujours être nuancé.
Réussir prouve-t-il l’intelligence ?
Cela montre un comportement conversationnel de type humain réussi dans ce contexte. Savoir si cela justifie le mot « intelligence » dépend de la définition. Cela ne démontre pas, à lui seul, la véracité, l’étendue du raisonnement, la conscience, les émotions, l’incarnation ni une compétence sûre dans le monde réel.
Échouer prouve-t-il qu’un système est dépourvu d’intelligence ?
Non. Une calculatrice, un démonstrateur de théorèmes ou un système scientifique peut être très performant sans imiter une conversation humaine ordinaire. Le test récompense une performance sociolinguistique particulière.
Pourquoi la conversation se déroule-t-elle uniquement par écrit ?
La barrière empêche les juges d’utiliser l’apparence, la voix ou la construction physique comme raccourcis. Turing imaginait un canal comparable à un téléscripteur. Le texte isole les indices conversationnels, même si des variantes modernes ajoutent parfois la vision ou la robotique.
Qu’est-ce que le test de Turing total ?
Il s’agit d’une extension ultérieure qui ajoute la perception et l’interaction physique, exigeant généralement la vision et la robotique en plus du langage. Elle ne doit pas être confondue avec le dispositif uniquement textuel de l’article de Turing de 1950.
Quelles questions fonctionnent le mieux ?
Les relances adaptatives fonctionnent mieux qu’une liste d’énigmes. Demandez des précisions, revenez sur des affirmations antérieures, introduisez de l’ambiguïté, testez le contexte social, imposez des contraintes créatives et explorez les contradictions. Aucune question unique ne permet d’identifier de façon fiable une IA moderne.
Les juges peuvent-ils simplement demander des informations de dernière minute ou des souvenirs privés ?
Cela peut créer des raccourcis injustes. Un système peut ne pas disposer de navigation par conception, et un humain peut ignorer l’actualité. Les souvenirs personnels peuvent aussi être inventés. Un protocole solide définit les connaissances autorisées et évalue des accès comparables.
Pourquoi comparer les machines à de véritables témoins humains ?
Les humains établissent la référence de contrôle positif. Si les juges classent de nombreuses personnes réelles comme des machines, la tâche ou la calibration des juges peut être mauvaise. Les « taux d’humanité » des machines sont difficiles à interpréter sans références humaines et sans niveau dû au hasard.
Les tests courts sont-ils fiables ?
Les sessions courtes sont pratiques, mais plus faciles à manipuler et peuvent surtout mesurer les premières impressions. Des conversations plus longues, répétées, adversariales et couvrant plusieurs domaines fournissent des preuves plus solides, au prix d’un coût, d’une fatigue et de choix de conception supplémentaires.
Qu’est-ce que l’effet ELIZA ?
C’est la tendance à attribuer compréhension ou agentivité à des réponses informatiques superficielles. Le terme vient des réactions à ELIZA et reste pertinent lorsque des sorties fluides incitent à inférer davantage que ce que les preuves permettent.
Un test de Turing est-il un test de QI ?
Non. Les tests de QI comparent les performances à des tâches cognitives standardisées à des normes liées à l’âge. Un test de Turing évalue si un juge peut identifier une machine conversationnelle dans le cadre d’un protocole particulier.
Remonter aux affirmations
Sources primaires et universitaires
L’histoire ci-dessus privilégie les articles originaux et les archives de recherche. Les résultats modernes sont présentés avec les conditions de leurs études plutôt que promus comme des jalons universels.
Turing (1950), « Computing Machinery and Intelligence »
L’article original publié dans Mind, volume 59, numéro 236, pages 433 à 460.
Ouvrir la sourceLes archives numériques de Turing
Notice du catalogue du King’s College de Cambridge consacrée aux manuscrits de Turing.
Ouvrir la sourceProposition de Dartmouth sur l’IA
La proposition de 1955 pour le projet de recherche d’été de 1956 qui a donné son nom à l’intelligence artificielle.
Ouvrir la sourceWeizenbaum (1966), ELIZA
L’article original de Communications of the ACM décrivant ELIZA.
Ouvrir la sourceColby et al. (1972), étude sur PARRY
L’article original de la revue Artificial Intelligence sur des tests d’indiscernabilité de type Turing.
Ouvrir la sourceStanford Encyclopedia : le test de Turing
Une synthèse universitaire des interprétations, objections, variantes et de l’histoire des concours.
Ouvrir la sourceJones & Bergen (2024)
L’étude randomisée et préenregistrée portant sur ELIZA, GPT-3.5, GPT-4 et des témoins humains.
Ouvrir la sourceWu, Wu & Zhao (ACL 2025)
Travail évalué par les pairs proposant X-TURING pour des agents de dialogue à plus long terme.
Ouvrir la source