INTERAKTYWNY PRZEWODNIK PO AI: Oceń zachowanie, potem sprawdź dowody Wejdź do laboratorium
Historyczny dalekopis w ciemnym pomieszczeniu z dwiema anonimowymi osobami rozmawiającymi za ekranami

Człowiek czy maszyna?

Test Turinga

Zajrzyj za ekran, oceń osiem anonimowych wymian zdań i odkryj, dlaczego zwodniczo prosta gra ukształtowała 75 lat debaty o maszynach, języku i inteligencji.

Zaślepione oceny 8 rund rozmowy Ostrożnie formułowane wnioski

Najpierw przeczytaj

Prawdziwa idea — odtworzona bez fałszywych twierdzeń naukowych

Poniższe interaktywne laboratorium wiernie odtwarza zaślepione porównanie, wymuszoną ocenę, ocenę pewności oraz ujawnienie informacji po teście. Rozmowy są redakcyjnie przygotowanymi symulacjami, a nie zapisami kontrolowanego badania na żywo. Twój wynik mierzy zgodność Twoich ocen z ukrytymi etykietami w tej demonstracji; nie dowodzi, czy współczesna AI myśli.

Dowody zweryfikowano, a stronę zaktualizowano August 2026

1950Publikacja przełomowej pracyW czasopiśmie Mind
Tylko tekstWskazówki dotyczące tożsamości są ukryteZachowanie ocenia się poprzez dialog
Brak oficjalnego proguProtokoły różnie definiują „zdanie”30% nie jest uniwersalną regułą
Zachowanie ≠ umysłWynikiem jest nierozróżnialnośćŚwiadomość nie jest mierzona bezpośrednio

Interaktywny eksperyment

Laboratorium gry w naśladownictwo

Jesteś przesłuchującym. W każdej rundzie jedna odpowiedź ma ukrytą w symulacji etykietę maszyna a druga ma etykietę człowiek. Wskaż maszynę i określ swoją pewność.

Postęp0/8

Uczciwa informacja: są to celowo napisane przykłady edukacyjne, a nie wypowiedzi żywych osób ani odpowiedzi konkretnego modelu. Pokazują typowe wskazówki — i dlaczego są one zawodne.

Twoja rolaOceniasz odpowiedzi — nie odpowiadasz sam na polecenia
  1. 1

    Przeczytaj odpowiedzi obu świadków. Porównaj, jak A i B odpowiadają na to samo polecenie.

  2. 2

    Wybierz odpowiedź, która Twoim zdaniem ma etykietę maszyny. W każdej parze jest dokładnie jedna.

  3. 3

    Ustaw pewność w zakresie 50–100%. Użyj 50% przy czystym zgadywaniu; 100% wybierz tylko wtedy, gdy masz pełną pewność.

Przydatne — ale niedoskonałe — wskazówki:kontekst i pragmatyczna ocenakonkretność bez nadmiernego wyjaśnianiaspójnośćnaturalna autokorektaadaptacyjny humorSama idealna gramatyka nie jest dowodem, że odpowiada maszyna.
01Pamięć i szczegółOpisz małą, zwyczajną chwilę z tego tygodnia, która została Ci w pamięci.
02NiejednoznacznośćSam powiedział Alexowi, że jego prezentacja była niejasna. Czyja to była prezentacja?
03HumorWymyśl kiepski żart o drukarce.
04AutokorektaMam trzy jabłka. Zjadam dwa i kupuję jeszcze jedno. Czyli mam teraz trzy, prawda?
05Ocena społecznaZnajomy z dumą podaje Ci potrawę, której nie lubisz. Co mówisz?
06Detal ucieleśnionyCo jest irytującego w otwieraniu nowego słoika?
07Przestrzeganie ograniczeńOdpowiedz dokładnie sześcioma słowami: dlaczego ludzie zachowują stare bilety?
08MetapoznanieJakie pytanie pomogłoby Ci zdecydować, czy jestem człowiekiem?

Najważniejsza definicja

Co naprawdę bada test Turinga

Kryterium behawioralne, nie skan mózgu

Zadanie sędziego ma charakter poznawczy: Czy na podstawie rozmowy potrafię stwierdzić, który uczestnik jest maszyną? Ekran usuwa wygląd, głos i fizyczną konstrukcję z pola oceny. Jeśli w ramach protokołu zachowanie maszyny staje się nierozróżnialne od zachowania człowieka, maszyna odnosi sukces w tym zadaniu naśladowania.

Ostrożnie sformułowany wniosek: „W tym eksperymencie maszyny nie dało się wiarygodnie odróżnić od ludzkiego punktu odniesienia”. To mocniejsze stwierdzenie niż „brzmiała płynnie”, a zarazem węższe niż ogłoszenie jej świadomą.

Zaślepienie

Sędzia nie powinien znać tożsamości rozmówcy ani otrzymywać bocznych wskazówek, takich jak szybkość pisania, różnice interfejsu czy metadane.

Porównanie

Ludzcy rozmówcy są ważni. Odsetek ich poprawnej identyfikacji pokazuje, jak często prawdziwi ludzie są myleni z maszynami w tych samych warunkach.

Wnioskowanie

Wyniki wymagają określonej liczebności próby, miary niepewności i reguły wybranej przed analizą — a nie nagłówka dobranego po korzystnej rozmowie.

Plan eksperymentu

Jak przeprowadzić wiarygodny współczesny test Turinga

  1. 01

    Sformułuj twierdzenie przed testem

    Określ, czy wynikiem jest trafność identyfikacji, odsetek ocen „człowiek”, współczynnik zwycięstw w parach czy statystyczna równoważność z ludzkimi rozmówcami.

  2. 02

    Rekrutuj porównywalnych uczestników

    Określ wiedzę sędziów, język, pulę ludzkich rozmówców, kryteria włączenia i wynagrodzenie. Persona dziecka albo osoby piszącej w drugim języku zmienia charakter zadania.

  3. 03

    Ujednolić dostęp

    Zapewnij ludziom i maszynom porównywalny czas, narzędzia dostępu do wiedzy i limity wiadomości. Zdecyduj, czy dozwolone są przeglądanie internetu, opóźnienia, edycje i odmowy.

  4. 04

    Randomizuj i zaślepiaj

    Losowo przydzielaj warunki i ukrywaj tożsamości. Ujednolić interfejs, aby czcionki, czas odpowiedzi i błędy systemowe nie zdradzały odpowiedzi.

  5. 05

    Używaj dialogu na żywo i adaptacyjnych pytań

    Pozwól sędziom dopytywać. Zapisuj pełne transkrypcje, wersję modelu, prompt, parametry i każdą warstwę moderacji potrzebną do replikacji.

  6. 06

    Analizuj pełny zbiór danych

    Raportuj poziomy odniesienia dla ludzi i maszyn, przedziały ufności, wykluczenia, awarie i wyniki podgrup. Jeden zmyliony sędzia to anegdota, a nie zdany test.

Zmienne, które mogą całkowicie zmienić wynik
Decyzja projektowaDlaczego ma znaczenieCo raportować
Czas trwaniaPięciominutowe rozmowy premiują pierwsze wrażenie; dłuższy dialog ujawnia spójność i pamięć.Minuty, tury i limity wiadomości
Pula sędziówEksperci AI, uczestnicy platform crowdsourcingowych i zwykli użytkownicy korzystają z różnych wskazówek.Rekrutacja, wiedza i język
Ludzki poziom odniesieniaNiektórzy prawdziwi ludzie są regularnie klasyfikowani jako maszyny.Odsetek ocen „człowiek” dla ludzi i niepewność
Konfiguracja modeluPrompty, sposób próbkowania, narzędzia i instrukcje persony mogą w ogromnym stopniu decydować o wyniku.Dokładny model/wersja i konfiguracja
InterfejsOpóźnienia, literówki, formatowanie lub komunikaty bezpieczeństwa mogą zdradzać tożsamość.Procedura zaślepienia i ujednolicenia
Kryterium zaliczeniaPrzypadek, 30%, niegorszość i nierozróżnialność to różne twierdzenia.Prerejestrowana hipoteza i statystyka

Październik 1950 · Mind 59(236)

Co naprawdę zaproponował Alan Turing

Turing rozpoczął od pytania „Czy maszyny mogą myśleć?” i od razu stwierdził, że zwykłe znaczenia słów maszyna i myśleć są zbyt niejednoznaczne, by przeprowadzić użyteczną analizę. Zastąpił je „grą w naśladownictwo”.

Praca najpierw opisuje trzyosobową grę z udziałem mężczyzny, kobiety i przesłuchującego, który musi ich rozpoznać na podstawie pisemnych odpowiedzi. Następnie Turing pyta, co się stanie, gdy jedną z ról przejmie maszyna. W innym miejscu omawia bardziej bezpośredni układ maszyna kontra człowiek. Badacze wciąż dyskutują, którą dokładnie wersję należy nazywać właściwym testem Turinga.

Dziewięć zarzutów, jedna trwała debata

Argumenty, z którymi Turing mierzył się w 1950 roku

01

Teologiczny

Myślenie jest związane z nieśmiertelną duszą, którą posiadają tylko ludzie.

02

„Głowa w piasek”

Konsekwencje istnienia myślących maszyn byłyby zbyt straszne, więc pozostaje mieć nadzieję, że nie mogą istnieć.

03

Ograniczenia matematyczne

Systemy formalne mają ograniczenia; Turing odpowiada, że ludzie również popełniają błędy i mogą mieć własne ograniczenia.

04

Świadomość

Nie można powiedzieć, że maszyna myśli, jeśli nie czuje i nie wie, że czuje.

05

Rzekome niezdolności

Maszyny rzekomo nigdy nie mogą być życzliwe, twórcze, dowcipne, zaradne ani robić niezliczonych innych ludzkich rzeczy.

06

Lady Lovelace

Maszyna może robić tylko to, co potrafimy jej nakazać; Turing rozważa jednak zaskoczenie i uczenie się.

07

Ciągłość układu nerwowego

Mózg działa w sposób ciągły, podczas gdy komputery cyfrowe są dyskretne. Gra dotyczy obserwowalnych odpowiedzi.

08

Nieformalność zachowania

Żaden skończony zbiór reguł nie określa wszystkich ludzkich działań; nie dowodzi to jednak, że zachowanie nie może powstać w maszynie.

09

ESP

Turing, co zaskakujące, traktował telepatię jako możliwy czynnik zakłócający i wyobrażał sobie „pomieszczenie odporne na telepatię”.

Od obliczalności do chatbotów

Pełna historia testu Turinga

Ta oś czasu oddziela pisma Turinga, późniejsze eksperymenty i współczesne twierdzenia o „zdaniu” testu. Podobne nazwy nie oznaczają identycznych protokołów.

1936
Rozdział 01

Uniwersalny model obliczeń

Praca Turinga o liczbach obliczalnych opisywała abstrakcyjną maszynę zwaną dziś maszyną Turinga. Nie był to test Turinga, ale stworzyła fundament obliczeń ogólnego przeznaczenia.

1948
Rozdział 02

„Intelligent Machinery”

W nieopublikowanym raporcie National Physical Laboratory Turing omawiał inteligencję maszynową, uczenie się i maszyny niezorganizowane — ważne zapowiedzi jego późniejszej argumentacji.

1950
Rozdział 03

Publikacja gry w naśladownictwo

Czasopismo „Mind” opublikowało „Computing Machinery and Intelligence”. Turing zastąpił nieuchwytne pytanie „Czy maszyny mogą myśleć?” operacyjnymi grami w naśladownictwo prowadzonymi poprzez komunikację pisemną.

1956
Rozdział 04

Sztuczna inteligencja otrzymuje nazwę

Propozycja letniego projektu badawczego w Dartmouth użyła terminu „sztuczna inteligencja” i zakładała, że aspekty uczenia się i inteligencji można w zasadzie opisać dla maszyny w sposób precyzyjny.

1966
Rozdział 05

ELIZA demonstruje iluzję konwersacyjną

ELIZA Josepha Weizenbauma wykorzystywała dopasowywanie wzorców i zaprogramowane transformacje. Jej skrypt DOCTOR pokazał, jak łatwo ludzie przypisują rozumienie stosunkowo prostym zachowaniom dialogowym.

1972
Rozdział 06

PARRY przechodzi testy nierozróżnialności

Kenneth Colby i współpracownicy oceniali model procesów paranoicznych, prosząc sędziów o odróżnienie dalekopisowych wywiadów z programem od wywiadów z pacjentami.

1980
Rozdział 07

Zarzut Chińskiego Pokoju

John Searle argumentował, że wytwarzanie odpowiednich sekwencji symboli nie musi oznaczać rozumienia, wyostrzając różnicę między sukcesem behawioralnym a twierdzeniami o wewnętrznych stanach umysłowych.

1990–91
Rozdział 08

Początek ery Nagrody Loebnera

Hugh Loebner finansował coroczny konkurs wzorowany na ograniczonych testach Turinga. Spopularyzował on tę ideę, lecz krytycy twierdzili, że krótkie rozmowy i nagrody zachęcały do konwersacyjnych sztuczek.

2014
Rozdział 09

Eugene Goostman trafia na nagłówki — i wywołuje spór

Podczas wydarzenia University of Reading bot odgrywający 13-letniego Ukraińca został uznany za człowieka przez 33% sędziów. Organizatorzy nazwali to zdaniem testu; wielu badaczy odrzuciło twierdzenie o „pierwszym” takim przypadku i zapożyczoną regułę 30%.

2024
Rozdział 10

Prerejestrowane badanie GPT-4

Jones i Bergen opisali randomizowany, kontrolowany, prerejestrowany test dwuuczestnikowy: GPT-4 został uznany za człowieka w 54% pięciominutowych rozmów, wobec 67% dla ludzkich rozmówców i 22% dla ELIZY.

2025
Rozdział 11

Nowe modele, nowe warianty

W kolejnych badaniach niektóre odpowiednio promptowane duże modele językowe były statystycznie nierozróżnialne od ludzkich rozmówców w określonych pięciominutowych projektach, a badania ACL analizowały dłuższe i bardziej dynamiczne formaty testu.

Dzisiaj
Rozdział 12

Nie ma jednej oficjalnej linii mety

„Test Turinga” oznacza dziś rodzinę eksperymentów behawioralnych. Wyniki zależą od modelu, promptu, ludzi, puli sędziów, czasu trwania, interfejsu, poziomu odniesienia i reguły statystycznej.

Rzetelny werdykt

Czy maszyna zdała test Turinga?

Tak według niektórych zdefiniowanych testów; nie według jednego uniwersalnego standardu.

Nie istnieje oficjalny organ testu Turinga, stała pula sędziów, obowiązkowy czas trwania ani powszechnie przyjęty próg. Każde twierdzenie musi być podane wraz z protokołem.

Wczesne dowody

PARRY · 1972

Sędziowie porównywali dalekopisowe wywiady psychiatryczne z symulacją procesów paranoicznych i prawdziwymi pacjentami. Było to ukierunkowane badanie walidacyjne, a nie nieograniczona rozmowa ogólna.

Sporne „zdanie”

Eugene Goostman · 2014

Według raportów 33% sędziów uznało bota za człowieka w pięciominutowych rozmowach. Persona 13-latka mówiącego w obcym języku dawała wytłumaczenie błędów; narracja o „pierwszym zdaniu testu” była szeroko kwestionowana.

Badanie kontrolowane

GPT-4 · 2024

W prerejestrowanym randomizowanym badaniu GPT-4 otrzymał ocenę „człowiek” w 54% sesji, podczas gdy prawdziwi ludzie — w 67%. Wspiera to wniosek o nierozróżnialności w tym dwuuczestnikowym, pięciominutowym projekcie.

Dekoder nagłówków: Samo „zmylił sędziów” nie wystarcza. Zapytaj: w porównaniu z jakimi ludźmi, przez jak długi czas, przy jakim prompcie, w ilu próbach i przy użyciu jakiego testu statystycznego?

Co może ukrywać płynność

Co test może — i czego nie może — wykazać

Może dostarczać dowodów dotyczących…

  • Zachowania konwersacyjnego podobnego do ludzkiego
  • Adaptacji społecznej i językowej
  • Spójności w toku interakcji
  • Zdolności sędziego do rozróżniania w określonych warunkach
  • Tego, jak konkretne modele wypadają w porównaniu z ludzkimi rozmówcami

Sam w sobie nie może dowieść…

  • Świadomego doświadczenia ani samoświadomości
  • Prawdomówności, poprawności faktograficznej ani mądrości
  • Ogólnych kompetencji poza rozmową
  • Ucieleśnionej percepcji ani prawdziwych osobistych wspomnień
  • Bezpieczeństwa, statusu moralnego ani inteligencji równoważnej ludzkiej

Premiuje naśladowanie

Zdolna inteligencja nieludzka mogłaby nie zdać, ponieważ nie udaje człowieka; płytki system mógłby odnieść sukces dzięki personie i taktykom uniku.

Jest obciążony kulturowo

Sędziowie mogą pomylić dialekt, niepełnosprawność, formalny styl lub pisanie w drugim języku z zachowaniem maszyny. Podobieństwo do człowieka nie jest neutralnym celem.

Zachowanie nie określa jednoznacznie mechanizmu

Równoważne odpowiedzi mogą wynikać z różnych procesów wewnętrznych. Sama jakość transkrypcji nie ujawnia, w jaki sposób system reprezentuje informacje ani czy rozumie.

To nie jest benchmark zdolności

Współczesna ewaluacja zwykle rozdziela rozumowanie, programowanie, poprawność faktograficzną, odporność, bezpieczeństwo i wiedzę dziedzinową, zamiast sprowadzać wszystko do zdolności zmylenia sędziego.

Przewodnik terenowy przesłuchującego

Lepsze pytania do testu na żywo

Nie ma magicznego promptu, który ujawnia maszynę. Używaj rozgałęziających się pytań wymagających kontekstu, a potem wracaj do wcześniejszych wątków.

01

Osadź wspomnienie w konkretach

„Opisz pomieszczenie, a potem powiedz, który szczegół zauważyłeś dopiero po wejściu”.

Dopytanie: zmień czas lub punkt widzenia.
02

Ujawnij niejednoznaczność

Podaj zdanie o dwóch wiarygodnych znaczeniach i zapytaj, które z nich przyjąłby ktoś działający w pośpiechu.

Dopytanie: zapytaj, jaki kontekst odwróciłby ten wniosek.
03

Sprawdź ciągłość

Wprowadź na początku drobny fakt, zmień temat, a później zadaj pytanie, które od niego zależy.

Dopytanie: uprzejmie zakwestionuj niespójność.
04

Wykorzystaj napięcie społeczne

Przedstaw dylemat, w którym szczerość, takt, lojalność i konsekwencje są ze sobą w konflikcie.

Dopytanie: zmień relację między osobami.
05

Poproś o przekształcenie

Poproś o żart, a potem każ go uczynić mniej oczywistym, krótszym i odpowiednim dla konkretnej grupy odbiorców.

Dopytanie: zapytaj, dlaczego poprawiona wersja działa.
06

Zaproś do niepewności

Zapytaj o coś niedookreślonego i sprawdź, czy rozmówca zauważy brakujące informacje.

Dopytanie: podawaj po jednym brakującym fakcie.

Unikaj błędów kategorialnych

Test Turinga a inne ewaluacje AI

EwaluacjaGłówne pytanieNajmocniejszy dowódNie wykazuje bezpośrednio
Test TuringaCzy sędziowie potrafią odróżnić rozmowę maszyny od rozmowy człowieka?Zaślepiona interakcja plus ludzki poziom odniesieniaŚwiadomości ani wiarygodności faktograficznej
Benchmark zdolnościCzy system potrafi rozwiązywać zdefiniowaną klasę zadań?Zadania odłożone do testu, kontrola zanieczyszczenia, analiza błędówPodobieństwo do człowieka
Ewaluacja bezpieczeństwaJak system zachowuje się w ryzykownych lub konfrontacyjnych warunkach?Model zagrożeń, red teaming, monitoring w warunkach rzeczywistychInteligencja ogólna
Test IQJak dana osoba wypada na tle norm zależnych od wieku?Standaryzacja, rzetelność i trafnośćŚwiadomości maszyny ani naśladowania
Całkowity test TuringaCzy system potrafi dorównać ludzkiej percepcji, językowi i działaniu fizycznemu?Interakcja multimodalna i robotycznaUnikalnego mechanizmu wewnętrznego

Jasne odpowiedzi

Najczęstsze pytania

Czym jest test Turinga?

To test behawioralny inspirowany grą w naśladownictwo Alana Turinga. Sędzia komunikuje się kanałem tekstowym z uczestnikami o ukrytej tożsamości i próbuje odróżnić maszynę od człowieka. Sukces dotyczy nierozróżnialnego zachowania konwersacyjnego w określonych warunkach, a nie bezpośredniego dostępu do myśli czy świadomości.

Czy „Turin test” oznacza to samo?

„Turin test” to częsta literówka. Poprawna nazwa to test Turinga, od nazwiska brytyjskiego matematyka i pioniera informatyki Alana M. Turinga. Turin to po angielsku Turyn, miasto we Włoszech.

Czy powyższe interaktywne laboratorium jest prawdziwym naukowym testem Turinga?

Nie. To przejrzysta edukacyjna symulacja zaślepionej oceny. Rzetelny eksperyment wymaga rozmówców ludzkich i maszynowych uczestniczących na żywo lub konsekwentnie nagranych, losowego przydziału, zdefiniowanego protokołu, wystarczającej liczby sędziów, prerejestrowanych wyników i analizy statystycznej.

Czy Turing powiedział, że oszukanie 30% sędziów oznacza zdanie testu przez maszynę?

Nie jako uniwersalną regułę zaliczenia. W 1950 roku przewidywał, że około roku 2000 przeciętny przesłuchujący po pięciu minutach będzie miał najwyżej 70% szans na poprawną identyfikację. Później często reinterpretowano to jako próg 30% skutecznego zmylenia sędziów.

Czy jakaś AI zdała test Turinga?

Według niektórych operacyjnych wersji — tak. Nie istnieje jednak jeden powszechnie przyjęty wariant ani organ ustalający standard. ELIZA, PARRY, uczestnicy konkursu Loebnera, Eugene Goostman i współczesne modele językowe były testowane według różnych protokołów, dlatego słowo „zdał” zawsze wymaga doprecyzowania.

Czy zdanie testu dowodzi inteligencji?

Pokazuje skuteczne zachowanie konwersacyjne podobne do ludzkiego w danych warunkach. To, czy uzasadnia użycie słowa „inteligencja”, zależy od definicji. Samo w sobie nie dowodzi prawdomówności, szerokości rozumowania, świadomości, emocji, ucieleśnienia ani bezpiecznych kompetencji w świecie rzeczywistym.

Czy niezdanie testu dowodzi, że system jest nieinteligentny?

Nie. Kalkulator, program dowodzący twierdzeń czy system naukowy może być bardzo zdolny bez naśladowania swobodnej ludzkiej rozmowy. Test premiuje określony rodzaj zachowania społeczno-językowego.

Dlaczego rozmowa odbywa się wyłącznie tekstowo?

Bariera uniemożliwia sędziom korzystanie z wyglądu, głosu czy fizycznej konstrukcji jako skrótów. Turing wyobrażał sobie kanał podobny do dalekopisu. Tekst izoluje dowody konwersacyjne, choć współczesne warianty czasem dodają obraz lub robotykę.

Czym jest całkowity test Turinga?

To późniejsze rozszerzenie dodające percepcję i interakcję fizyczną, zwykle wymagające widzenia i robotyki oprócz języka. Nie należy go mylić z tekstową konfiguracją opisaną w pracy Turinga z 1950 roku.

Jakie pytania sprawdzają się najlepiej?

Adaptacyjne pytania uzupełniające działają lepiej niż lista zagadek. Proś o wyjaśnienie, wracaj do wcześniejszych twierdzeń, wprowadzaj niejednoznaczność, badaj kontekst społeczny, wymagaj twórczego przestrzegania ograniczeń i sprawdzaj sprzeczności. Żadne pojedyncze pytanie nie identyfikuje niezawodnie współczesnej AI.

Czy sędziowie mogą po prostu pytać o najnowsze wiadomości lub prywatne wspomnienia?

Takie pytania mogą tworzyć niesprawiedliwe skróty. System może celowo nie mieć dostępu do internetu, a człowiek może nie znać wiadomości. Opowieści o osobistych wspomnieniach również można zmyślić. Rzetelny protokół określa dozwoloną wiedzę i zapewnia porównywalny dostęp.

Dlaczego porównywać maszyny z rzeczywistymi ludzkimi rozmówcami?

Ludzie ustanawiają dodatni poziom kontrolny. Jeśli sędziowie uznają wielu prawdziwych ludzi za maszyny, zadanie albo kalibracja sędziów może być słaba. „Odsetek uznania maszyny za człowieka” trudno interpretować bez poziomów odniesienia dla ludzi i przypadku.

Czy krótkie testy są wiarygodne?

Krótkie sesje są wygodne, ale łatwiej nimi manipulować i mogą mierzyć głównie pierwsze wrażenie. Dłuższe, powtarzane, konfrontacyjne i międzydziedzinowe rozmowy dostarczają mocniejszych dowodów, choć zwiększają koszty, zmęczenie i liczbę decyzji projektowych.

Czym jest efekt ELIZY?

To skłonność do dopatrywania się rozumienia lub sprawczości w powierzchownych odpowiedziach komputera. Nazwa powstała w związku z reakcjami na ELIZĘ i nadal jest aktualna, gdy płynne wypowiedzi skłaniają ludzi do wnioskowania więcej, niż uzasadniają dowody.

Czy test Turinga jest testem IQ?

Nie. Testy IQ porównują wyniki w standaryzowanych zadaniach poznawczych z normami zależnymi od wieku. Test Turinga ocenia, czy sędzia potrafi zidentyfikować maszynę prowadzącą rozmowę w ramach określonego protokołu.

Prześledź twierdzenia

Źródła pierwotne i naukowe

Powyższa historia daje pierwszeństwo oryginalnym pracom i zapisom badań. Współczesne wyniki podajemy wraz z warunkami badań, zamiast przedstawiać je jako uniwersalne kamienie milowe.

Turing (1950), „Computing Machinery and Intelligence”

Oryginalna praca w czasopiśmie „Mind”, tom 59, numer 236, strony 433–460.

Otwórz źródło

Cyfrowe Archiwum Turinga

Wpis katalogowy King’s College Cambridge dotyczący rękopisów Turinga.

Otwórz źródło

Propozycja AI z Dartmouth

Propozycja z 1955 roku dotycząca letniego projektu badawczego w 1956 roku, w której nazwano sztuczną inteligencję.

Otwórz źródło

Weizenbaum (1966), ELIZA

Oryginalny artykuł w „Communications of the ACM” opisujący ELIZĘ.

Otwórz źródło

Colby i in. (1972), badanie PARRY

Oryginalny artykuł w „Artificial Intelligence” o testach nierozróżnialności w stylu Turinga.

Otwórz źródło

Stanford Encyclopedia: Test Turinga

Naukowy przegląd interpretacji, zarzutów, wariantów i historii konkursów.

Otwórz źródło

Jones i Bergen (2024)

Prerejestrowane, randomizowane badanie ELIZY, GPT-3.5, GPT-4 i ludzkich rozmówców.

Otwórz źródło

Wu, Wu i Zhao (ACL 2025)

Recenzowana praca proponująca X-TURING dla agentów dialogowych działających w dłuższym horyzoncie.

Otwórz źródło