Läs detta först
En verklig idé—återskapad utan falska vetenskapliga påståenden
Det interaktiva labbet nedan återskapar på ett korrekt sätt blind jämförelse, tvingad bedömning, konfidensgradering och avslöjande efter testet. Samtalen är redaktionella simuleringar, inte dokumentation från en levande kontrollerad studie. Ditt resultat mäter hur väl dina gissningar stämmer med de dolda etiketterna i denna demonstration; det bevisar inte om dagens AI tänker.
Evidensen granskad och sidan uppdaterad August 2026
Interaktivt experiment
Labbet för imitationsspelet
Du är utfrågaren. I varje runda bär ett svar simuleringens dolda etikett maskin och det andra etiketten människa. Välj maskinen och ange hur säker du är.
Ärlighetsmärkning: detta är avsiktligt skrivna undervisningsexempel, inte levande personer eller utdata från en namngiven modell. De visar vanliga ledtrådar—och varför dessa ledtrådar är opålitliga.
- 1
Läs båda vittnena. Jämför hur A och B hanterar samma prompt.
- 2
Välj det svar som du tror bär maskinetiketten. Det finns exakt ett i varje par.
- 3
Ange säkerhet från 50–100 %. Använd 50 % för en ren gissning; använd 100 % endast om du känner dig helt säker.
Din bedömningsrapport
Resultat
Vad detta säger om dig:
Du bedömde dess svar som det mänskliga.
Du bedömde text märkt som mänsklig som maskinlik.
Den typ av svar du oftast misstänkte.
Hur nära var du att “bete dig som en maskin”?
Det mäter inte det här testet. Du svarade aldrig som Vittne A eller B, så det vore missvisande att bedöma ditt eget beteende som människolikt eller maskinlikt. Testet mäter din detektionsstrategi: vilka skrivmönster du förknippar med maskiner, hur ofta de antagandena fungerade och om din säkerhet motsvarade din träffsäkerhet.
Övertolka inte resultatet. Materialet är litet och avsiktligt illustrativt. Det saknar representativt urval, validerad svårighetsgrad och levande adaptiv utfrågning.
Den centrala definitionen
Vad Turingtestet faktiskt testar
Ett beteendekriterium, inte en hjärnskanning
Domarens uppgift är epistemisk: Kan jag avgöra vilken deltagare som är maskinen utifrån samtalet? Skärmen tar bort utseende, röst och mekanisk konstruktion. Om maskinens beteende blir oskiljbart från mänskligt beteende under protokollet lyckas maskinen med den imitationsuppgiften.
Blindning
Domaren ska inte känna till vittnets identitet eller få sidokanalsledtrådar som skrivhastighet, skillnader i gränssnitt eller metadata.
Jämförelse
Mänskliga vittnen spelar roll. Deras identifieringsfrekvens visar hur ofta verkliga människor misstas för maskiner under samma villkor.
Slutsatsdragning
Resultat kräver urvalsstorlekar, osäkerhet och en regel som valts före granskningen—inte en rubrik som väljs efter ett gynnsamt samtal.
Experimentell plan
Så genomför du ett trovärdigt modernt Turingtest
- 01
Skriv ned påståendet före testet
Ange om utfallet är identifieringsträffsäkerhet, “människa”-frekvens, parvis vinstfrekvens eller statistisk likvärdighet med mänskliga vittnen.
- 02
Rekrytera jämförbara deltagare
Definiera domarnas expertis, språk, poolen av mänskliga vittnen, inklusionsregler och ersättning. En barnpersona eller andraspråkspersona förändrar uppgiften.
- 03
Standardisera åtkomsten
Ge människor och maskiner jämförbar tid, kunskapsverktyg och meddelandegränser. Bestäm om webbsökning, fördröjningar, redigeringar och avböjanden är tillåtna.
- 04
Randomisera och blinda
Tilldela villkor slumpmässigt och dölj identiteter. Normalisera gränssnittet så att typsnitt, svarstider och systemfel inte avslöjar svaret.
- 05
Använd levande, adaptiv dialog
Låt domarna ställa följdfrågor. Spara fullständiga utskrifter, modellversion, prompt, parametrar och eventuellt modereringslager som behövs för replikation.
- 06
Analysera hela datamängden
Redovisa mänskliga och maskinella baslinjer, konfidensintervall, exkluderingar, misslyckanden och resultat för undergrupper. En lurad domare är en anekdot, inte ett godkänt resultat.
| Designval | Varför det spelar roll | Redovisa detta |
|---|---|---|
| Varaktighet | Femminuterschattar belönar första intryck; långa dialoger blottlägger konsekvens och minne. | Minuter, turer och meddelandegränser |
| Domarpool | AI-experter, crowdsourcingarbetare och vanliga användare använder olika ledtrådar. | Rekrytering, expertis och språk |
| Mänsklig baslinje | Vissa verkliga människor klassificeras regelbundet som maskiner. | Människors “människa”-frekvens och osäkerhet |
| Modellkonfiguration | Promptar, sampling, verktyg och personainstruktioner kan dominera prestationen. | Exakt modell/version och konfiguration |
| Gränssnitt | Latens, skrivfel, formatering eller säkerhetsmeddelanden kan avslöja identiteten. | Procedur för blindning och normalisering |
| Godkännandekriterium | Slump, 30 %, non-inferiority och oskiljbarhet är olika påståenden. | Förregistrerad hypotes och statistik |
Oktober 1950 · Mind 59(236)
Vad Alan Turing faktiskt föreslog
Turing inledde med “Kan maskiner tänka?” och hävdade omedelbart att de vardagliga betydelserna av maskin och tänka var för tvetydiga för en användbar undersökning. Han ersatte frågan med ett “imitationsspel”.
Artikeln beskriver först ett spel med tre personer: en man, en kvinna och en utfrågare som måste identifiera dem genom skriftliga svar. Turing frågar sedan vad som händer när en maskin tar en av rollerna. På andra ställen i artikeln diskuterar han ett mer direkt upplägg mellan maskin och människa. Forskare diskuterar fortfarande exakt vilken formulering som bör kallas det Turingtestet.
Nio invändningar, en varaktig debatt
Argument som Turing bemötte 1950
Teologisk
Tänkande är knutet till en odödlig själ som endast människor har.
“Huvudet i sanden”
Konsekvenserna av tänkande maskiner skulle vara alltför fruktansvärda, så man hoppas att de inte kan existera.
Matematiska gränser
Formella system har gränser; Turing svarar att människor också gör fel och kan ha gränser.
Medvetande
En maskin kan inte sägas tänka om den inte känner och vet att den känner.
Oförmågor
Maskiner påstås aldrig kunna vara vänliga, kreativa, humoristiska, uppfinningsrika—eller göra otaliga andra mänskliga saker.
Lady Lovelace
En maskin kan bara göra det vi vet hur vi ska beordra den att göra; Turing diskuterar överraskning och inlärning.
Nervsystemets kontinuitet
Hjärnan är kontinuerlig medan digitala datorer är diskreta. Spelet handlar om observerbara svar.
Informellt beteende
Ingen ändlig regelbok bestämmer alla mänskliga handlingar; det visar inte att beteende inte kan uppstå från en maskin.
ESP
Turing behandlade överraskande nog telepati som en möjlig störfaktor och föreställde sig ett “telepatisäkert rum”.
Från beräkningsbarhet till chattbotar
Turingtestets fullständiga historia
Den här tidslinjen skiljer Turings skrifter, senare experiment och moderna påståenden om “godkänt”. Liknande namn innebär inte identiska protokoll.
En universell modell för beräkning
Turings artikel om beräkningsbara tal beskrev den abstrakta maskin som nu kallas en Turingmaskin. Det var inte Turingtestet, men den lade en grund för generell databehandling.
“Intelligent Machinery”
I en opublicerad rapport från National Physical Laboratory diskuterade Turing maskinintelligens, inlärning och oorganiserade maskiner—viktiga föregångare till hans senare resonemang.
Imitationsspelet publiceras
Tidskriften Mind publicerade “Computing Machinery and Intelligence”. Turing ersatte den svårfångade frågan “Kan maskiner tänka?” med operationella imitationsspel som genomfördes via skriftlig kommunikation.
Artificiell intelligens får ett namn
Dartmouthförslaget för sommarforskning använde termen “artificiell intelligens” och hävdade att aspekter av inlärning och intelligens i princip kunde beskrivas tillräckligt exakt för en maskin.
ELIZA visar samtalets illusion
Joseph Weizenbaums ELIZA använde mönstermatchning och skriptade omvandlingar. Dess DOCTOR-skript visade hur lätt människor kan tillskriva förståelse åt relativt enkelt dialogbeteende.
PARRY möter test av oskiljbarhet
Kenneth Colby och kollegor utvärderade en modell av paranoida processer genom att be domare skilja maskinskrivna intervjuer med programmet från intervjuer med patienter.
Invändningen om det kinesiska rummet
John Searle hävdade att produktion av lämpliga symbolsekvenser inte behöver innebära förståelse, vilket skärpte skillnaden mellan beteendemässig framgång och påståenden om inre mentala tillstånd.
Loebner Prize-eran börjar
Hugh Loebner finansierade en årlig tävling modellerad efter begränsade Turingtest. Den gjorde idén känd för allmänheten, men kritiker menade att korta chattar och priser uppmuntrade samtalsknep.
Eugene Goostman skapar rubriker—och debatt
Vid ett evenemang på University of Reading bedömdes en bot som spelade en 13-årig ukrainare som mänsklig av 33 % av domarna. Arrangörerna kallade det godkänt; många forskare avvisade påståendet om det “första” godkännandet och den lånade 30 %-regeln.
En förregistrerad GPT-4-studie
Jones och Bergen rapporterade ett randomiserat, kontrollerat och förregistrerat tvåpartstest: GPT-4 bedömdes som mänsklig i 54 % av femminuterssamtalen, jämfört med 67 % för mänskliga vittnen och 22 % för ELIZA.
Nya modeller, nya varianter
Uppföljande arbete rapporterade att vissa promptade stora språkmodeller var statistiskt oskiljbara från mänskliga vittnen i specifika femminutersupplägg, medan ACL-forskning utforskade längre och mer dynamiska testformat.
Ingen enda officiell mållinje
“Turingtestet” betecknar nu en familj av beteendeexperiment. Resultaten beror på modell, prompt, människor, domarpool, varaktighet, gränssnitt, jämförelsebaslinje och statistisk regel.
Den ärliga slutsatsen
Har en maskin klarat Turingtestet?
PARRY · 1972
Domare jämförde maskinskrivna psykiatriska intervjuer med en simulering av paranoida processer och verkliga patienter. Det var en fokuserad valideringsstudie, inte obegränsat allmänt samtal.
Eugene Goostman · 2014
33 % av domarna uppges ha klassificerat boten som mänsklig i femminuterschattar. Dess persona som 13-årig person med språket som andraspråk gav ursäkter för misstag; inramningen som “första godkännandet” ifrågasattes brett.
GPT-4 · 2024
I en förregistrerad randomiserad studie fick GPT-4 bedömningen “människa” i 54 % av sessionerna, medan verkliga människor fick 67 %. Det stöder oskiljbarhet i just det tvåpartsupplägget på fem minuter.
Vad flyt kan dölja
Vad testet kan—och inte kan—fastställa
Det kan ge evidens om…
- Människoliknande samtalsbeteende
- Social och språklig anpassning
- Konsekvens genom en interaktion
- En domares förmåga att skilja åt under definierade villkor
- Hur specifika modeller jämförs med mänskliga vittnen
Det kan inte i sig bevisa…
- Medveten upplevelse eller självmedvetande
- Sanningsenlighet, faktamässig korrekthet eller visdom
- Generell kompetens utanför samtal
- Kroppsligt förankrad perception eller verkliga personliga minnen
- Säkerhet, moralisk status eller intelligens motsvarande människans
Det belönar imitation
En kapabel icke-mänsklig intelligens kan misslyckas eftersom den inte låtsas vara människa; ett ytligt system kan lyckas genom en persona och undvikande taktik.
Det är kulturellt laddat
Domare kan missta dialekt, funktionsnedsättning, formalitet eller andraspråksskrivande för maskinbeteende. Människolikhet är inget neutralt mål.
Beteende underbestämmer mekanismen
Likvärdiga svar kan komma från olika interna processer. Kvaliteten på en samtalsutskrift avslöjar inte i sig hur ett system representerar eller förstår.
Det är inget riktmärke för förmåga
Modern utvärdering skiljer vanligtvis resonerande, kodning, faktamässig korrekthet, robusthet, säkerhet och domänexpertis åt i stället för att pressa samman allt till vilseledning.
Utfrågarens fälthandbok
Bättre frågor för ett levande test
Ingen magisk prompt avslöjar en maskin. Använd förgrenande frågor som kräver kontext och återkom sedan.
Förankra ett minne
“Beskriv rummet och berätta sedan vilken detalj du lade märke till först efter att du kom in.”
Följdfråga: ändra tidpunkt eller perspektiv.Blottlägg tvetydighet
Ge en mening med två rimliga betydelser och fråga vilken en stressad person skulle tolka in.
Följdfråga: fråga vilken kontext som skulle vända tolkningen.Testa kontinuitet
Introducera ett mindre faktum tidigt, byt ämne och ställ senare en fråga som beror på det.
Följdfråga: ifrågasätt en inkonsekvens artigt.Använd social friktion
Presentera ett dilemma där ärlighet, takt, lojalitet och konsekvenser står i konflikt.
Följdfråga: ändra relationen.Begär omformning
Be om ett skämt och gör det sedan mindre uppenbart, kortare och lämpligt för en specifik publik.
Följdfråga: fråga varför revideringen fungerar.Bjud in osäkerhet
Fråga något underspecificerat och se om vittnet märker vad som saknas.
Följdfråga: lägg till ett saknat faktum i taget.Undvik kategorifel
Turingtestet jämfört med andra AI-utvärderingar
| Utvärdering | Huvudfråga | Starkaste evidens | Visar inte direkt |
|---|---|---|---|
| Turingtestet | Kan domare skilja maskinsamtal från mänskliga samtal? | Blindad interaktion plus mänsklig baslinje | Medvetande eller faktamässig tillförlitlighet |
| Förmågeriktmärke | Kan systemet lösa en definierad klass av uppgifter? | Undanhållna uppgifter, kontaminationskontroller, felanalys | Människolikhet |
| Säkerhetsutvärdering | Hur beter sig systemet under riskfyllda eller adversariella förhållanden? | Hotmodell, red teaming, övervakning i drift | Generell intelligens |
| IQ-test | Hur presterar en person relativt åldersbaserade normer? | Standardisering, tillförlitlighet och validitet | Maskinmedvetande eller imitation |
| Totalt Turingtest | Kan ett system matcha mänsklig perception, språk och fysisk handling? | Multimodal och robotisk interaktion | En unik intern mekanism |
Tydliga svar
Vanliga frågor
Vad är Turingtestet?
Det är ett beteendetest inspirerat av Alan Turings imitationsspel. En domare kommunicerar via en textkanal med dolda deltagare och försöker skilja en maskin från en människa. Framgång handlar om oskiljbart samtalsbeteende under angivna villkor—inte om direkt tillgång till tankar eller medvetande.
Är “Turin test” samma sak?
“Turin test” är en vanlig felstavning. Namnet är Turingtestet, efter den brittiske matematikern och datorpionjären Alan M. Turing. Turin är en stad i Italien.
Är det interaktiva labbet ovan ett riktigt vetenskapligt Turingtest?
Nej. Det är en transparent utbildningssimulering av blindad bedömning. Ett försvarbart experiment kräver levande eller konsekvent inspelade mänskliga och maskinella vittnen, slumpmässig tilldelning, ett definierat protokoll, tillräckligt många domare, förregistrerade utfall och statistisk analys.
Sa Turing att en maskin klarar testet om den lurar 30 % av domarna?
Inte som en universell godkännanderegel. År 1950 förutspådde han att en genomsnittlig utfrågare omkring år 2000 inte skulle ha mer än 70 % chans att identifiera rätt efter fem minuter. Senare evenemang tolkade ofta om detta som en tröskel på 30 % vilseledning.
Har någon AI klarat Turingtestet?
Enligt vissa operationella versioner, ja. För en enda universellt accepterad version finns ingen sådan myndighet eller standard. ELIZA, PARRY, Loebner-deltagare, Eugene Goostman och moderna språkmodeller har testats under olika protokoll, så “klarat” måste alltid kvalificeras.
Bevisar ett godkänt resultat intelligens?
Det visar framgångsrikt människoliknande samtalsbeteende i den miljön. Om det motiverar ordet intelligens beror på definitionen. Det visar inte i sig sanningsenlighet, bredd i resonerandet, medvetande, känslor, kroppslig förankring eller säker kompetens i verkligheten.
Bevisar ett misslyckande att ett system är ointelligent?
Nej. En miniräknare, teorembevisare eller ett vetenskapligt system kan vara mycket kapabelt utan att imitera vardagligt mänskligt samtal. Testet belönar en särskild sociolingvistisk prestation.
Varför är samtalet endast textbaserat?
Barriären hindrar domare från att använda utseende, röst eller fysisk konstruktion som genvägar. Turing föreställde sig en teleprinterliknande kanal. Text isolerar samtalsevidens, även om moderna varianter ibland lägger till syn eller robotik.
Vad är det totala Turingtestet?
Det är en senare utvidgning som lägger till perception och fysisk interaktion och vanligtvis kräver syn och robotik utöver språk. Det ska inte förväxlas med det textbaserade upplägget i Turings artikel från 1950.
Vilka frågor fungerar bäst?
Adaptiva följdfrågor fungerar bättre än en lista med gåtor. Be om förtydliganden, återvänd till tidigare påståenden, introducera tvetydighet, testa social kontext, be om kreativ efterlevnad av begränsningar och undersök motsägelser. Ingen enskild fråga identifierar modern AI tillförlitligt.
Kan domare bara fråga om senaste nytt eller privata minnen?
Det kan skapa orättvisa genvägar. Ett system kan sakna webbsökning avsiktligt, och en människa kanske inte känner till nyheterna. Påståenden om personliga minnen kan också fabriceras. Ett välutformat protokoll definierar tillåten kunskap och utvärderar jämförbar åtkomst.
Varför jämföra maskiner med verkliga mänskliga vittnen?
Människor etablerar baslinjen för den positiva kontrollen. Om domare märker många verkliga människor som maskiner kan uppgiften eller domarkalibreringen vara dålig. Maskiners “människofrekvens” är svår att tolka utan mänskliga baslinjer och slumpbaslinjer.
Är korta tester tillförlitliga?
Korta sessioner är praktiska men lättare att manipulera och kan främst mäta första intryck. Längre, upprepade, motståndsinriktade och domänöverskridande samtal ger starkare evidens men medför kostnad, trötthet och fler designval.
Vad är ELIZA-effekten?
Det är tendensen att läsa in förståelse eller agentskap i ytliga datorsvar. Begreppet uppstod ur reaktioner på ELIZA och är fortfarande relevant när flytande utdata får människor att dra slutsatser som går längre än evidensen stöder.
Är ett Turingtest ett IQ-test?
Nej. IQ-test jämför prestation på standardiserade kognitiva uppgifter med åldersbaserade normer. Ett Turingtest utvärderar om en domare kan identifiera en samtalande maskin under ett visst protokoll.
Spåra påståendena
Primära och vetenskapliga källor
Historiken ovan prioriterar originalartiklar och forskningsdokumentation. Moderna resultat anges tillsammans med studievillkoren i stället för att framställas som universella milstolpar.
Turing (1950), “Computing Machinery and Intelligence”
Den ursprungliga artikeln i Mind, volym 59, nummer 236, sidorna 433–460.
Öppna källanThe Turing Digital Archive
King’s College Cambridges katalogpost för Turings manuskriptmaterial.
Öppna källanDartmouthförslaget om AI
Förslaget från 1955 till sommarforskningsprojektet 1956 som gav artificiell intelligens sitt namn.
Öppna källanWeizenbaum (1966), ELIZA
Den ursprungliga artikeln i Communications of the ACM som beskriver ELIZA.
Öppna källanColby m.fl. (1972), PARRY-studien
Den ursprungliga artikeln i Artificial Intelligence om test av oskiljbarhet av Turingtyp.
Öppna källanStanford Encyclopedia: Turingtestet
En vetenskaplig översikt över tolkningar, invändningar, varianter och tävlingshistoria.
Öppna källanJones & Bergen (2024)
Den förregistrerade randomiserade studien av ELIZA, GPT-3.5, GPT-4 och mänskliga vittnen.
Öppna källanWu, Wu & Zhao (ACL 2025)
Kollegialt granskad forskning som föreslår X-TURING för dialogagenter över längre tid.
Öppna källan