Læs dette først
En virkelig idé – genskabt uden falske videnskabelige påstande
Det interaktive laboratorium nedenfor genskaber præcist blind sammenligning, tvungen vurdering, sikkerhedsvurdering og afsløring efter testen. Samtalerne er redaktionelle simulationer, ikke optagelser fra et live kontrolleret studie. Dit resultat måler, hvor godt dine gæt stemmer overens med de skjulte etiketter i denne demonstration; det beviser ikke, om nutidens AI tænker.
Evidens gennemgået og side opdateret August 2026
Interaktivt eksperiment
Laboratoriet for imitationsspillet
Du er afhøreren. I hver runde bærer ét svar simulationens skjulte maskine-etiket, og det andet bærer menneske-etiketten. Vælg maskinen, og angiv din sikkerhed.
Ærlighedsmærkat: Dette er bevidst skrevne undervisningseksempler, ikke levende personer eller output fra en navngiven model. De viser almindelige spor – og hvorfor disse spor er upålidelige.
- 1
Læs begge vidner. Sammenlign, hvordan A og B håndterer den samme prompt.
- 2
Vælg det svar, du mener bærer maskine-etiketten. Der er præcis én i hvert par.
- 3
Angiv sikkerhed fra 50–100 %. Brug 50 % ved rent gæt; brug kun 100 %, hvis du føler dig sikker.
Din vurderingsrapport
Resultat
Hvad dette siger om dig:
Du bedømte dens svar som det menneskelige.
Du behandlede menneskemærket tekst som maskinagtig.
Den slags svar, du oftest mistænkte.
Hvor tæt var du på at “opføre dig som en maskine”?
Det måler denne test ikke. Du svarede aldrig som Vidne A eller B, så det ville være misvisende at bedømme din egen adfærd som menneskelig eller maskinagtig. Den måler din detektionsstrategi: hvilke skrivemønstre du forbinder med maskiner, hvor ofte antagelserne virkede, og om din sikkerhed stemte overens med din nøjagtighed.
Overfortolk ikke denne score. Sættet er lille og bevidst illustrativt. Det har intet repræsentativt udvalg, ingen valideret sværhedsgrad og ingen live adaptiv udspørgen.
Den centrale definition
Hvad Turing-testen faktisk tester
Et adfærdskriterium, ikke en hjerneskanning
Dommerens opgave er epistemisk: Kan jeg ud fra samtalen afgøre, hvilken deltager der er maskinen? Skærmen fjerner udseende, stemme og mekanisk konstruktion. Hvis maskinens adfærd bliver uadskillelig fra menneskelig adfærd under protokollen, lykkes maskinen med denne imitationsopgave.
Blindning
Dommeren bør ikke kende vidnets identitet eller modtage sidespor som skrivehastighed, forskelle i grænsefladen eller metadata.
Sammenligning
Menneskelige vidner er vigtige. Deres identifikationsrate viser, hvor ofte virkelige mennesker forveksles med maskiner under de samme betingelser.
Slutning
Resultater kræver stikprøvestørrelser, usikkerhed og en regel valgt før gennemgangen – ikke en overskrift valgt efter en gunstig samtale.
Eksperimentel grundplan
Sådan gennemfører du en troværdig moderne Turing-test
- 01
Skriv påstanden før testen
Angiv, om udfaldet er identifikationsnøjagtighed, “menneske”-rate, parvis vinderrate eller statistisk ækvivalens med menneskelige vidner.
- 02
Rekruttér sammenlignelige deltagere
Definér dommernes ekspertise, sprog, puljen af menneskelige vidner, inklusionsregler og kompensation. En børnepersona eller en persona med andetsprog ændrer opgaven.
- 03
Standardisér adgang
Giv mennesker og maskiner sammenlignelig tid, vidensværktøjer og beskedgrænser. Afgør, om webbrowsing, forsinkelser, redigeringer og afvisninger er tilladt.
- 04
Randomisér og blind
Tildel betingelser tilfældigt og skjul identiteter. Normalisér grænsefladen, så skrifttyper, svartiming og systemfejl ikke afslører svaret.
- 05
Brug live, adaptiv dialog
Lad dommerne stille opfølgende spørgsmål. Registrér komplette udskrifter, modelversion, prompt, parametre og eventuelle moderationslag, der er nødvendige for replikation.
- 06
Analysér hele datasættet
Rapportér baselines for mennesker og maskiner, konfidensintervaller, eksklusioner, fejl og resultater for undergrupper. Én narret dommer er en anekdote, ikke en beståelse.
| Designvalg | Hvorfor det betyder noget | Rapportér det |
|---|---|---|
| Varighed | Fem minutter lange chats belønner førstehåndsindtryk; lange dialoger afslører konsistens og hukommelse. | Minutter, ture og beskedgrænser |
| Dommergruppe | AI-eksperter, crowdworkers og almindelige brugere anvender forskellige spor. | Rekruttering, ekspertise og sprog |
| Menneskelig baseline | Nogle virkelige mennesker klassificeres rutinemæssigt som maskiner. | Menneskelig “menneske”-rate og usikkerhed |
| Modelopsætning | Prompts, sampling, værktøjer og personainstruktioner kan dominere præstationen. | Præcis model/version og opsætning |
| Grænseflade | Forsinkelse, slåfejl, formatering eller sikkerhedsbeskeder kan afsløre identiteten. | Procedure for blinding og normalisering |
| Beståelseskriterium | Tilfældighed, 30 %, non-inferiority og uadskillelighed er forskellige påstande. | Forhåndsregistreret hypotese og statistik |
Oktober 1950 · Mind 59(236)
Hvad Alan Turing faktisk foreslog
Turing åbnede med “Kan maskiner tænke?” og argumenterede straks for, at de almindelige betydninger af maskine og tænke var for tvetydige til en nyttig undersøgelse. Han erstattede spørgsmålet med et “imitationsspil”.
Artiklen beskriver først et spil med tre personer – en mand, en kvinde og en afhører – hvor afhøreren skal identificere dem gennem skriftlige svar. Turing spørger derefter, hvad der sker, når en maskine overtager den ene rolle. Andre steder i artiklen diskuterer han en mere direkte opsætning med maskine mod menneske. Forskere diskuterer stadig præcis, hvilken formulering der bør kaldes den Turing-test.
Ni indvendinger, én vedvarende debat
Argumenter Turing tog op i 1950
Teologisk
Tænkning er knyttet til en udødelig sjæl, som kun mennesker besidder.
“Hovedet i sandet”
Konsekvenserne af tænkende maskiner ville være for frygtelige, så man håber, at de ikke kan eksistere.
Matematiske grænser
Formelle systemer har grænser; Turing svarer, at mennesker også begår fejl og kan have grænser.
Bevidsthed
En maskine kan ikke siges at tænke, medmindre den føler og ved, at den føler.
Begrænsninger
Maskiner kan angiveligt aldrig være venlige, kreative, humoristiske, opfindsomme – eller gøre utallige andre menneskelige ting.
Lady Lovelace
En maskine kan kun gøre det, vi ved, hvordan vi skal beordre den til; Turing overvejer overraskelse og læring.
Nervesystemets kontinuitet
Hjernen er kontinuerlig, mens digitale computere er diskrete. Spillet handler om observerbare svar.
Uformel adfærd
Ingen endelig regelbog bestemmer alle menneskelige handlinger; det viser ikke, at adfærd ikke kan opstå fra en maskine.
ESP
Turing behandlede overraskende telepati som en mulig forstyrrende faktor og forestillede sig et “telepatisikret rum”.
Fra beregnelighed til chatbots
Hele Turing-testens historie
Denne tidslinje adskiller Turings skrifter, senere eksperimenter og moderne påstande om “beståelse”. Lignende navne indebærer ikke identiske protokoller.
En universel model for beregning
Turings artikel om beregnelige tal beskrev den abstrakte maskine, der nu kaldes en Turing-maskine. Det var ikke Turing-testen, men den lagde et fundament for generel databehandling.
“Intelligent Machinery”
I en upubliceret rapport fra National Physical Laboratory diskuterede Turing maskinintelligens, læring og uorganiserede maskiner – vigtige forløbere for hans senere argument.
Imitationsspillet udgives
Tidsskriftet Mind udgav “Computing Machinery and Intelligence”. Turing erstattede det glidende spørgsmål “Kan maskiner tænke?” med operationelle imitationsspil gennem skriftlig kommunikation.
Kunstig intelligens får et navn
Forslaget til sommerforskningsprojektet i Dartmouth brugte betegnelsen “kunstig intelligens” og argumenterede for, at aspekter af læring og intelligens i princippet kunne beskrives præcist for en maskine.
ELIZA demonstrerer samtalens illusion
Joseph Weizenbaums ELIZA brugte mønstergenkendelse og scriptede transformationer. DOCTOR-scriptet viste, hvor let mennesker kan tillægge relativt enkel dialogadfærd forståelse.
PARRY møder tests af uadskillelighed
Kenneth Colby og kolleger evaluerede en model af paranoide processer ved at bede dommere skelne mellem teletypeinterviews med programmet og interviews med patienter.
Indvendingen om det kinesiske rum
John Searle argumenterede for, at produktion af passende symbolsekvenser ikke nødvendigvis er det samme som forståelse, hvilket skærpede forskellen mellem adfærdsmæssig succes og påstande om indre mentale tilstande.
Loebner Prize-æraen begynder
Hugh Loebner finansierede en årlig konkurrence modelleret efter begrænsede Turing-tests. Den gjorde idéen kendt, men kritikere mente, at korte chats og præmier tilskyndede til samtaletricks.
Eugene Goostman skaber overskrifter – og strid
Ved et arrangement på University of Reading blev en bot, der fremstillede sig som en 13-årig ukrainer, bedømt som menneskelig af 33 % af dommerne. Arrangørerne kaldte det en beståelse; mange forskere afviste påstanden om den “første” beståelse og den lånte 30 %-regel.
Et forhåndsregistreret GPT-4-studie
Jones og Bergen rapporterede en randomiseret, kontrolleret og forhåndsregistreret test med to deltagere: GPT-4 blev bedømt som menneskelig i 54 % af fem minutter lange samtaler, mod 67 % for menneskelige vidner og 22 % for ELIZA.
Nye modeller, nye varianter
Opfølgende arbejde rapporterede, at nogle promptede store sprogmodeller var statistisk uadskillelige fra menneskelige vidner i bestemte fem-minutters designs, mens ACL-forskning undersøgte længere og mere dynamiske testformater.
Ingen enkelt officiel målstreg
“Turing-testen” betegner nu en familie af adfærdseksperimenter. Resultaterne afhænger af modellen, prompten, personerne, dommergruppen, varigheden, grænsefladen, sammenligningsbaselinen og den statistiske regel.
Den ærlige konklusion
Har en maskine bestået Turing-testen?
PARRY · 1972
Dommerne sammenlignede teletypebaserede psykiatriske interviews med en simulation af paranoide processer og virkelige patienter. Det var et fokuseret valideringsstudie, ikke ubegrænset generel samtale.
Eugene Goostman · 2014
33 % af dommerne klassificerede efter sigende botten som menneskelig i fem minutter lange chats. Dens persona som 13-årig ikke-modersmålstalende gav undskyldninger for fejl; fremstillingen som den “første beståelse” blev bredt anfægtet.
GPT-4 · 2024
I et forhåndsregistreret randomiseret studie blev GPT-4 bedømt som “menneskelig” i 54 % af sessionerne, mens virkelige mennesker fik 67 %. Det understøtter uadskillelighed i netop dette fem-minutters design med to deltagere.
Hvad flydende sprog kan skjule
Hvad testen kan – og ikke kan – fastslå
Den kan give evidens om…
- Menneskelignende samtaleadfærd
- Social og sproglig tilpasning
- Konsistens gennem en interaktion
- En dommers evne til at skelne under definerede betingelser
- Hvordan bestemte modeller klarer sig i forhold til menneskelige vidner
Den kan ikke i sig selv bevise…
- Bevidst oplevelse eller selvbevidsthed
- Sandfærdighed, faktuel nøjagtighed eller visdom
- Generel kompetence uden for samtale
- Kropslig perception eller virkelige personlige minder
- Sikkerhed, moralsk status eller intelligens på menneskeligt niveau
Den belønner imitation
En kapabel ikke-menneskelig intelligens kan fejle, fordi den ikke foregiver at være menneske; et overfladisk system kan lykkes gennem persona og undvigende taktikker.
Den er kulturelt ladet
Dommere kan forveksle dialekt, handicap, formalitet eller andetsprogsskrivning med maskinadfærd. Menneskelighed er ikke et neutralt mål.
Adfærd underbestemmer mekanismen
Ækvivalente svar kan komme fra forskellige interne processer. Kvaliteten af udskriften alene afslører ikke, hvordan et system repræsenterer eller forstår.
Den er ikke et kapacitetsbenchmark
Moderne evaluering adskiller normalt ræsonnement, programmering, faktualitet, robusthed, sikkerhed og domæneekspertise i stedet for at presse alt sammen til bedrag.
Afhørerens feltguide
Bedre spørgsmål til en live test
Ingen magisk prompt afslører en maskine. Brug forgrenede spørgsmål, der kræver kontekst, og vend derefter tilbage.
Forankr et minde
“Beskriv rummet, og fortæl så, hvilken detalje du først lagde mærke til efter at være kommet ind.”
Opfølgning: Skift tidspunkt eller synsvinkel.Afslør tvetydighed
Giv en sætning med to plausible betydninger, og spørg, hvilken en travl person sandsynligvis ville udlede.
Opfølgning: Spørg, hvilken kontekst der ville vende fortolkningen.Test kontinuitet
Introducér en mindre detalje tidligt, skift emne, og stil senere et spørgsmål, der afhænger af den.
Opfølgning: Udfordr høfligt en inkonsistens.Brug social friktion
Præsenter et dilemma, hvor ærlighed, takt, loyalitet og konsekvenser er i konflikt.
Opfølgning: Ændr relationen.Bed om transformation
Bed om en vittighed, og gør den derefter mindre oplagt, kortere og passende til en bestemt målgruppe.
Opfølgning: Spørg, hvorfor revisionen virker.Invitér usikkerhed
Spørg om noget underbestemt, og se, om vidnet bemærker, hvad der mangler.
Opfølgning: Giv én manglende oplysning ad gangen.Undgå kategorifejl
Turing-testen kontra andre AI-evalueringer
| Evaluering | Primært spørgsmål | Stærkeste evidens | Viser ikke direkte |
|---|---|---|---|
| Turing-test | Kan dommere skelne maskinsamtale fra menneskelig samtale? | Blindet interaktion plus menneskelig baseline | Bevidsthed eller faktuel pålidelighed |
| Kapacitetsbenchmark | Kan systemet løse en defineret klasse af opgaver? | Holdout-opgaver, kontaminationskontrol, fejlanalyse | Menneskelighed |
| Sikkerhedsevaluering | Hvordan opfører systemet sig under risikable eller adversariale betingelser? | Trusselsmodel, red teaming, feltovervågning | Generel intelligens |
| IQ-test | Hvordan præsterer en person i forhold til aldersbaserede normer? | Standardisering, pålidelighed og validitet | Maskinbevidsthed eller imitation |
| Total Turing-test | Kan et system matche menneskelig perception, sprog og fysisk handling? | Multimodal og robotbaseret interaktion | En unik intern mekanisme |
Klare svar
Ofte stillede spørgsmål
Hvad er Turing-testen?
Det er en adfærdstest inspireret af Alan Turings imitationsspil. En dommer kommunikerer gennem en tekstkanal med skjulte deltagere og forsøger at skelne en maskine fra et menneske. Succes handler om samtaleadfærd, der ikke kan skelnes fra menneskers under de angivne betingelser – ikke om direkte adgang til tanker eller bevidsthed.
Er “Turin test” det samme?
“Turin test” er en almindelig stavefejl. Navnet er Turing-testen efter den britiske matematiker og computerpioner Alan M. Turing. Turin er en by i Italien.
Er det interaktive laboratorium ovenfor en rigtig videnskabelig Turing-test?
Nej. Det er en gennemsigtig undervisningssimulation af blindet bedømmelse. Et forsvarligt eksperiment kræver live eller konsekvent optagede menneskelige og maskinelle vidner, tilfældig tildeling, en defineret protokol, tilstrækkeligt mange dommere, forhåndsregistrerede udfald og statistisk analyse.
Sagde Turing, at en maskine består, hvis den narrer 30 % af dommerne?
Ikke som en universel beståelsesregel. I 1950 forudsagde han, at en gennemsnitlig afhører omkring år 2000 ikke ville have mere end 70 % chance for korrekt identifikation efter fem minutter. Senere begivenheder omfortolkede ofte dette som en tærskel på 30 % for at narre dommerne.
Har nogen AI bestået Turing-testen?
Under nogle operationelle versioner, ja. Der findes dog ingen enkelt universelt accepteret version med en sådan myndighed eller standard. ELIZA, PARRY, Loebner-deltagere, Eugene Goostman og moderne sprogmodeller er blevet testet under forskellige protokoller, så “bestået” skal altid kvalificeres.
Beviser en beståelse intelligens?
Det viser vellykket menneskelignende samtaleadfærd i den situation. Om det retfærdiggør ordet intelligens, afhænger af definitionen. Det demonstrerer ikke i sig selv sandfærdighed, bredde i ræsonnement, bevidsthed, følelser, kropsliggørelse eller sikker kompetence i den virkelige verden.
Beviser det, at et system er uintelligent, hvis det ikke består?
Nej. En lommeregner, teorembeviser eller et videnskabeligt system kan være yderst kapabelt uden at efterligne uformel menneskelig samtale. Testen belønner en bestemt social og sproglig præstation.
Hvorfor er samtalen kun tekstbaseret?
Barrieren forhindrer dommerne i at bruge udseende, stemme eller fysisk konstruktion som genveje. Turing forestillede sig en teletype-lignende kanal. Tekst isolerer samtaleevidensen, selv om moderne varianter nogle gange tilføjer syn eller robotik.
Hvad er den totale Turing-test?
Det er en senere udvidelse, der tilføjer perception og fysisk interaktion og typisk kræver syn og robotik ud over sprog. Den bør ikke forveksles med den rent tekstbaserede opsætning i Turings artikel fra 1950.
Hvilke spørgsmål virker bedst?
Adaptive opfølgende spørgsmål virker bedre end en liste af gåder. Bed om afklaring, vend tilbage til tidligere påstande, introducér tvetydighed, test social kontekst, bed om kreativ overholdelse af begrænsninger og undersøg modsigelser. Intet enkelt spørgsmål identificerer moderne AI pålideligt.
Kan dommere bare spørge om seneste nyt eller private minder?
Det kan skabe urimelige genveje. Et system kan være designet uden browsing, og et menneske kender måske ikke nyheden. Påstande om personlige minder kan også opdigtes. En solid protokol definerer tilladt viden og vurderer sammenlignelig adgang.
Hvorfor sammenligne maskiner med virkelige menneskelige vidner?
Mennesker etablerer den positive kontrolbaseline. Hvis dommere mærker mange virkelige mennesker som maskiner, kan opgaven eller dommernes kalibrering være dårlig. Andelen af maskiner, der klassificeres som “mennesker”, er svær at fortolke uden menneskelige baselines og en tilfældighedsbaseline.
Er korte tests pålidelige?
Korte sessioner er praktiske, men lettere at manipulere og måler måske mest førstehåndsindtryk. Længere, gentagne, adversariale samtaler på tværs af domæner giver stærkere evidens, men medfører omkostninger, træthed og flere designvalg.
Hvad er ELIZA-effekten?
Det er tendensen til at læse forståelse eller handlekraft ind i overfladiske computersvar. Betegnelsen opstod fra reaktioner på ELIZA og er stadig relevant, når flydende output får mennesker til at slutte mere, end evidensen understøtter.
Er en Turing-test en IQ-test?
Nej. IQ-tests sammenligner præstation på standardiserede kognitive opgaver med aldersbaserede normer. En Turing-test vurderer, om en dommer kan identificere en samtalemaskine under en bestemt protokol.
Følg påstandenes kilder
Primære og akademiske kilder
Historien ovenfor prioriterer originale artikler og forskningsregistre. Moderne resultater angives med deres studiebetingelser i stedet for at blive fremstillet som universelle milepæle.
Turing (1950), “Computing Machinery and Intelligence”
Den primære artikel i Mind, bind 59, nummer 236, side 433–460.
Åbn kildeThe Turing Digital Archive
King’s College Cambridges katalogpost for Turings manuskriptmateriale.
Åbn kildeDartmouth AI proposal
Forslaget fra 1955 til sommerforskningsprojektet i 1956, som gav kunstig intelligens sit navn.
Åbn kildeWeizenbaum (1966), ELIZA
Den oprindelige artikel i Communications of the ACM, der beskriver ELIZA.
Åbn kildeColby et al. (1972), PARRY study
Den oprindelige artikel i Artificial Intelligence om Turing-lignende tests af uadskillelighed.
Åbn kildeStanford Encyclopedia: Turing-testen
En akademisk oversigt over fortolkninger, indvendinger, varianter og konkurrencehistorie.
Åbn kildeJones & Bergen (2024)
Det forhåndsregistrerede randomiserede studie af ELIZA, GPT-3.5, GPT-4 og menneskelige vidner.
Åbn kildeWu, Wu & Zhao (ACL 2025)
Fagfællebedømt arbejde, der foreslår X-TURING til dialogagenter over længere tid.
Åbn kilde