ИНТЕРАКТИВНЫЙ ГИД ПО ИИ: Сначала оцените поведение, затем изучите доказательства Войти в лабораторию
Исторический телетайп в темной комнате, где два анонимных участника разговаривают за ширмами

Человек или машина?

Тьюринг-тест

Зайдите за ширму, оцените восемь анонимных диалогов и узнайте, почему обманчиво простая игра уже 75 лет формирует дискуссию о машинах, языке и интеллекте.

Слепые оценки 8 раундов разговора Утверждения с точными оговорками

Сначала прочитайте это

Реальная идея — воссозданная без псевдонаучных заявлений

Интерактивная лаборатория ниже точно воспроизводит слепое сравнение, обязательный выбор, оценку уверенности и раскрытие после теста. Диалоги здесь — редакционные симуляции, а не записи живого контролируемого исследования. Ваш результат показывает, насколько ваши догадки совпадают со скрытыми метками в этой демонстрации; он не доказывает, способен ли современный ИИ мыслить.

Доказательства проверены, страница обновлена 08.2026

1950Опубликована знаковая статьяВ журнале Mind
Только текстПодсказки о личности скрытыПоведение оценивается по диалогу
Нет официального порогаПротоколы по-разному определяют «прохождение»30% — не универсальный закон
Поведение ≠ сознаниеРезультат — неразличимостьСознание напрямую не измеряется

Интерактивный эксперимент

Лаборатория игры в имитацию

Вы — интервьюер. В каждом раунде один ответ имеет скрытую в симуляции метку «машина», а другой — метку «человек». Выберите машину и укажите свою уверенность.

Прогресс0/8

Честная маркировка: это специально написанные учебные примеры, а не реальные люди и не ответы конкретной модели. Они показывают распространенные подсказки — и почему им нельзя полностью доверять.

Ваша рольВы оцениваете ответы, а не отвечаете на вопросы сами
  1. 1

    Прочитайте ответы обоих участников. Сравните, как A и B отвечают на один и тот же запрос.

  2. 2

    Выберите ответ, который, по вашему мнению, имеет метку машины. В каждой паре такая метка ровно одна.

  3. 3

    Укажите уверенность от 50 до 100%. Ставьте 50%, если это чистая догадка, и 100% — только если полностью уверены.

Полезные, но несовершенные подсказки:контекст и прагматическое суждениеконкретность без чрезмерных объясненийпоследовательностьестественная самокоррекцияадаптивный юморИдеальная грамматика сама по себе не доказывает, что перед вами машина.
01Память и деталиОпишите небольшой обычный момент этой недели, который почему-то вам запомнился.
02ДвусмысленностьСэм сказал Алексу, что его презентация была непонятной. Чья это была презентация?
03ЮморПридумайте плохую шутку про принтер.
04СамокоррекцияУ меня три яблока. Я съедаю два и покупаю еще одно. Значит, теперь у меня снова три, верно?
05Социальное суждениеДруг с гордостью подает блюдо, которое вам не нравится. Что вы скажете?
06Телесная детальЧто раздражает при открывании новой банки?
07Следование ограничениямОтветьте ровно шестью словами: зачем люди хранят старые билеты?
08МетапознаниеКакой вопрос помог бы вам решить, человек ли я?

Ключевое определение

Что на самом деле проверяет Тьюринг-тест

Поведенческий критерий, а не сканирование мозга

Задача судьи — эпистемическая: Могу ли я по разговору понять, кто из участников — машина? Ширма скрывает внешность, голос и физическую конструкцию. Если в рамках протокола поведение машины становится неотличимым от человеческого, машина успешно выполняет эту задачу имитации.

Точная формулировка: «В этом эксперименте машину не удавалось надежно отличить от человека из группы сравнения». Это сильнее, чем просто сказать, что она говорила бегло, и уже, чем объявить ее сознательной.

Ослепление

Судья не должен знать личность участника или получать побочные подсказки вроде скорости набора, различий интерфейса или метаданных.

Сравнение

Люди-собеседники важны. Частота их правильной идентификации показывает, как часто реальных людей принимают за машины в тех же условиях.

Вывод

Для результатов нужны размер выборки, оценка неопределенности и правило, выбранное заранее, а не заголовок, придуманный после удачного разговора.

Схема эксперимента

Как провести надежный современный Тьюринг-тест

  1. 01

    Сформулируйте утверждение до тестирования

    Заранее укажите, что считается результатом: точность идентификации, доля ответов «человек», доля побед в попарном сравнении или статистическая эквивалентность людям-собеседникам.

  2. 02

    Наберите сопоставимых участников

    Определите опыт судей, язык, пул людей-собеседников, правила включения и вознаграждение. Образ ребенка или человека, говорящего на неродном языке, меняет задачу.

  3. 03

    Стандартизируйте доступ

    Дайте людям и машинам сопоставимое время, инструменты доступа к знаниям и лимиты сообщений. Определите, разрешены ли веб-поиск, задержки, редактирование и отказы.

  4. 04

    Рандомизируйте и ослепляйте

    Случайно распределяйте условия и скрывайте личности. Нормализуйте интерфейс, чтобы шрифты, время ответа и системные ошибки не раскрывали правильный ответ.

  5. 05

    Используйте живой адаптивный диалог

    Позволяйте судьям задавать уточняющие вопросы. Записывайте полные диалоги, версию модели, промпт, параметры и любые уровни модерации, необходимые для воспроизведения.

  6. 06

    Анализируйте полный набор данных

    Сообщайте базовые показатели людей и машин, доверительные интервалы, исключения, сбои и результаты подгрупп. Один обманутый судья — это отдельный случай, а не прохождение теста.

Переменные, способные полностью изменить результат
Проектное решениеПочему это важноУкажите в отчете
ДлительностьПятиминутные чаты вознаграждают первое впечатление; длинный диалог лучше выявляет последовательность и память.Минуты, ходы и лимиты сообщений
Состав судейЭксперты по ИИ, участники краудсорсинга и обычные пользователи ориентируются на разные признаки.Набор, опыт и язык
Человеческий базовый уровеньНекоторых реальных людей регулярно классифицируют как машины.Доля людей, признанных людьми, и неопределенность
Настройка моделиПромпты, сэмплирование, инструменты и инструкции по образу могут определять результат.Точная модель/версия и настройка
ИнтерфейсЗадержка, опечатки, форматирование или сообщения безопасности могут выдать личность.Процедура ослепления и нормализации
Критерий прохожденияСлучайность, 30%, не меньшая эффективность и неразличимость — это разные утверждения.Предварительно зарегистрированные гипотеза и статистика

Октябрь 1950 · Mind 59(236)

Что на самом деле предложил Алан Тьюринг

Тьюринг начал с вопроса «Могут ли машины мыслить?» и сразу же отметил, что обычные значения слова «машина» и «мыслить» слишком двусмысленны для полезного исследования. Вместо этого он предложил «игру в имитацию».

Сначала в статье описывается игра для трех человек: мужчины, женщины и интервьюера, который должен определить их по письменным ответам. Затем Тьюринг спрашивает, что произойдет, если одну роль займет машина. В другой части статьи он обсуждает более прямое сравнение машины и человека. Исследователи до сих пор спорят, какую именно формулировку следует считать настоящим Тьюринг-тестом.

Девять возражений, один долгий спор

Аргументы, с которыми Тьюринг спорил в 1950 году

01

Теологическое

Мышление связано с бессмертной душой, которой обладают только люди.

02

«Голова в песке»

Последствия появления мыслящих машин были бы слишком ужасны, поэтому хочется надеяться, что они невозможны.

03

Математические ограничения

Формальные системы имеют ограничения; Тьюринг отвечает, что люди тоже ошибаются и также могут иметь пределы.

04

Сознание

Нельзя сказать, что машина мыслит, если она не чувствует и не знает, что чувствует.

05

Ограниченные способности

Якобы машины никогда не смогут быть добрыми, творческими, смешными, находчивыми — или делать бесчисленное множество других человеческих вещей.

06

Леди Лавлейс

Машина может делать только то, что мы умеем ей приказать; Тьюринг рассматривает неожиданность и обучение.

07

Непрерывность нервной системы

Мозг непрерывен, а цифровые компьютеры дискретны. Игра касается наблюдаемых ответов.

08

Неформализуемое поведение

Никакой конечный набор правил не определяет все человеческие действия; из этого не следует, что такое поведение не может возникнуть у машины.

09

Экстрасенсорное восприятие

Тьюринг, что удивительно, рассматривал телепатию как возможный мешающий фактор и представлял «комнату, защищенную от телепатии».

От вычислимости к чат-ботам

Полная история Тьюринг-теста

Эта хронология разделяет работы Тьюринга, более поздние эксперименты и современные заявления о «прохождении». Похожие названия не означают одинаковые протоколы.

1936
Глава 01

Универсальная модель вычислений

В работе Тьюринга о вычислимых числах была описана абстрактная машина, которую теперь называют машиной Тьюринга. Это еще не был Тьюринг-тест, но работа заложила основу вычислений общего назначения.

1948
Глава 02

«Интеллектуальные машины»

В неопубликованном отчете Национальной физической лаборатории Тьюринг рассуждал о машинном интеллекте, обучении и неорганизованных машинах — важных предшественниках его более поздней аргументации.

1950
Глава 03

Публикуется игра в имитацию

Журнал Mind опубликовал «Computing Machinery and Intelligence». Тьюринг заменил расплывчатый вопрос «Могут ли машины мыслить?» операционными играми в имитацию, проводимыми посредством письменного общения.

1956
Глава 04

Искусственный интеллект получает свое название

В предложении Дартмутского летнего исследовательского проекта был использован термин «искусственный интеллект» и утверждалось, что аспекты обучения и интеллекта в принципе можно достаточно точно описать для машины.

1966
Глава 05

ELIZA демонстрирует иллюзию разговора

ELIZA Джозефа Вейценбаума использовала сопоставление шаблонов и заданные преобразования. Сценарий DOCTOR показал, насколько легко люди приписывают понимание относительно простому диалоговому поведению.

1972
Глава 06

PARRY проходит проверки на неразличимость

Кеннет Колби и его коллеги оценивали модель параноидальных процессов, предлагая судьям отличить телетайпные интервью с программой от интервью с пациентами.

1980
Глава 07

Аргумент «китайской комнаты»

Джон Серл утверждал, что создание подходящих последовательностей символов не обязательно означает понимание, тем самым заострив различие между поведенческим успехом и утверждениями о внутренних психических состояниях.

1990–91
Глава 08

Начинается эпоха премии Лёбнера

Хью Лёбнер финансировал ежегодный конкурс по образцу ограниченных Тьюринг-тестов. Это популяризировало идею, но критики утверждали, что короткие чаты и призы поощряли разговорные уловки.

2014
Глава 09

Eugene Goostman: громкие заголовки и спор

На мероприятии Университета Рединга бота, изображавшего 13-летнего украинца, 33% судей приняли за человека. Организаторы назвали это прохождением; многие исследователи отвергли заявление о «первом» прохождении и заимствованное правило 30%.

2024
Глава 10

Предварительно зарегистрированное исследование GPT-4

Джонс и Берген сообщили о рандомизированном контролируемом предварительно зарегистрированном двухстороннем тесте: в 54% пятиминутных разговоров GPT-4 принимали за человека, по сравнению с 67% для людей-собеседников и 22% для ELIZA.

2025
Глава 11

Новые модели, новые варианты

В последующих работах сообщалось, что некоторые большие языковые модели с определенными промптами статистически неотличимы от людей-собеседников в конкретных пятиминутных схемах, а исследования ACL изучали более длинные и динамичные форматы теста.

Сегодня
Глава 12

Единой официальной финишной черты нет

«Тьюринг-тест» теперь обозначает семейство поведенческих экспериментов. Результаты зависят от модели, промпта, людей, состава судей, длительности, интерфейса, базы сравнения и статистического правила.

Взвешенный вывод

Проходила ли машина Тьюринг-тест?

Да — по некоторым определенным тестам; нет — по единому универсальному стандарту.

Нет официального органа Тьюринг-теста, фиксированного состава судей, обязательной длительности или общепринятого порога. К каждому утверждению должен прилагаться его протокол.

Ранние свидетельства

PARRY · 1972

Судьи сравнивали телетайпные психиатрические интервью с симуляцией параноидальных процессов и с реальными пациентами. Это было узконаправленное валидационное исследование, а не неограниченный общий разговор.

Спорное прохождение

Eugene Goostman · 2014

По сообщениям, в пятиминутных чатах 33% судей классифицировали бота как человека. Образ 13-летнего носителя неродного языка давал объяснение ошибкам; формулировка о «первом прохождении» широко оспаривалась.

Контролируемое исследование

GPT-4 · 2024

В предварительно зарегистрированном рандомизированном исследовании GPT-4 получал оценку «человек» в 54% сессий, а реальные люди — в 67%. Это подтверждает неразличимость в рамках именно этой пятиминутной двухсторонней схемы.

Как читать заголовки: «Обманул судей» — недостаточно. Спросите: с какими людьми сравнивали, как долго, с каким промптом, в скольких испытаниях и с каким статистическим тестом?

Что может скрывать беглость речи

Что тест может — и не может — установить

Он может дать доказательства относительно…

  • Человекоподобного разговорного поведения
  • Социальной и языковой адаптации
  • Последовательности в ходе взаимодействия
  • Способности судьи различать участников в заданных условиях
  • Того, как конкретные модели соотносятся с людьми-собеседниками

Сам по себе он не может доказать…

  • Сознательный опыт или самосознание
  • Правдивость, фактическую точность или мудрость
  • Общую компетентность за пределами разговора
  • Воплощенное восприятие или реальные личные воспоминания
  • Безопасность, моральный статус или интеллект, эквивалентный человеческому

Он вознаграждает имитацию

Способный нечеловеческий интеллект может провалиться, потому что не притворяется человеком; поверхностная система может добиться успеха за счет образа и уклончивых приемов.

Он культурно обусловлен

Судьи могут принять диалект, особенности здоровья, формальность или письмо на неродном языке за машинное поведение. Человекоподобие — не нейтральная цель.

Поведение не определяет внутренний механизм однозначно

Одинаковые по качеству ответы могут возникать из разных внутренних процессов. Одно лишь качество диалога не показывает, как система представляет информацию или понимает ее.

Это не бенчмарк способностей

Современная оценка обычно разделяет рассуждение, программирование, фактическую точность, устойчивость, безопасность и предметную экспертизу, а не сводит все к способности обмануть судью.

Полевое руководство интервьюера

Лучшие вопросы для живого теста

Волшебного промпта, разоблачающего машину, нет. Используйте ветвящиеся вопросы, требующие контекста, а затем возвращайтесь к сказанному раньше.

01

Привяжите воспоминание к деталям

«Опишите комнату, а затем скажите, какую деталь вы заметили только после того, как вошли».

Уточнение: измените время или точку зрения.
02

Выявите двусмысленность

Предложите предложение с двумя правдоподобными значениями и спросите, какое из них выбрал бы человек, отвечающий в спешке.

Уточнение: спросите, какой контекст изменил бы вывод на противоположный.
03

Проверьте непрерывность контекста

В начале сообщите небольшой факт, смените тему, а позже задайте вопрос, зависящий от этого факта.

Уточнение: вежливо укажите на несоответствие.
04

Используйте социальное напряжение

Предложите дилемму, в которой честность, такт, лояльность и последствия вступают в конфликт.

Уточнение: измените отношения между участниками.
05

Попросите преобразовать ответ

Попросите шутку, затем сделайте ее менее очевидной, короче и подходящей для конкретной аудитории.

Уточнение: спросите, почему новая версия работает лучше.
06

Создайте неопределенность

Задайте недоопределенный вопрос и посмотрите, заметит ли участник, чего не хватает.

Уточнение: добавляйте по одному недостающему факту за раз.

Не смешивайте разные категории

Тьюринг-тест и другие оценки ИИ

ОценкаГлавный вопросСамое сильное доказательствоНапрямую не показывает
Тьюринг-тестМогут ли судьи отличить разговор с машиной от разговора с человеком?Слепое взаимодействие плюс человеческий базовый уровеньСознание или фактическую надежность
Бенчмарк способностейМожет ли система решать определенный класс задач?Отложенные задания, контроль загрязнения данных, анализ ошибокЧеловекоподобие
Оценка безопасностиКак система ведет себя в рискованных или состязательных условиях?Модель угроз, красная команда, мониторинг в эксплуатацииОбщий интеллект
IQ-тестКак человек выполняет задачи относительно возрастных норм?Стандартизация, надежность и валидностьСознание машины или имитация
Полный Тьюринг-тестМожет ли система соответствовать человеку по восприятию, языку и физическим действиям?Мультимодальное и роботизированное взаимодействиеУникальный внутренний механизм

Ясные ответы

Частые вопросы

Что такое Тьюринг-тест?

Это поведенческий тест, вдохновленный игрой Алана Тьюринга в имитацию. Судья общается через текстовый канал со скрытыми участниками и пытается отличить машину от человека. Успех означает неразличимое разговорное поведение в заданных условиях, а не прямой доступ к мыслям или сознанию.

«Turin test» — это то же самое?

«Turin test» — распространенная опечатка. Правильное название — Turing Test («Тьюринг-тест»), в честь британского математика и пионера вычислительной техники Алана М. Тьюринга. Turin — это Турин, город в Италии.

Интерактивная лаборатория выше — настоящий научный Тьюринг-тест?

Нет. Это прозрачная образовательная симуляция слепого судейства. Для обоснованного эксперимента нужны живые или единообразно записанные участники-люди и машины, случайное распределение, определенный протокол, достаточное число судей, предварительно зарегистрированные исходы и статистический анализ.

Говорил ли Тьюринг, что обман 30% судей означает прохождение теста машиной?

Не как универсальное правило прохождения. В 1950 году он предположил, что примерно к 2000 году средний интервьюер после пяти минут разговора будет иметь не более 70% шансов на правильную идентификацию. Позднее это часто переосмысливали как порог обмана в 30%.

Проходил ли какой-нибудь ИИ Тьюринг-тест?

В некоторых операционных версиях — да. Но единой общепринятой версии, органа или стандарта не существует. ELIZA, PARRY, участники премии Лёбнера, Eugene Goostman и современные языковые модели тестировались по разным протоколам, поэтому слово «прошел» всегда требует уточнения.

Доказывает ли прохождение интеллект?

Оно показывает успешное человекоподобное разговорное поведение в данных условиях. Можно ли называть это интеллектом, зависит от определения. Само по себе прохождение не доказывает правдивость, широту рассуждений, сознание, эмоции, воплощенность или безопасную компетентность в реальном мире.

Доказывает ли провал, что система неразумна?

Нет. Калькулятор, система доказательства теорем или научная система могут быть очень способными, не имитируя обычный человеческий разговор. Тест оценивает конкретный социально-языковой тип поведения.

Почему разговор ведется только текстом?

Барьер не позволяет судьям использовать внешность, голос или физическую конструкцию как подсказки. Тьюринг представлял канал вроде телетайпа. Текст изолирует разговорные свидетельства, хотя современные варианты иногда добавляют зрение или робототехнику.

Что такое Полный Тьюринг-тест?

Это более позднее расширение, добавляющее восприятие и физическое взаимодействие; обычно оно требует зрения и робототехники наряду с языком. Его не следует путать с текстовой схемой из работы Тьюринга 1950 года.

Какие вопросы работают лучше всего?

Адаптивные уточняющие вопросы работают лучше списка загадок. Просите уточнения, возвращайтесь к прежним утверждениям, вводите двусмысленность, проверяйте социальный контекст, просите творчески соблюдать ограничения и исследуйте противоречия. Ни один отдельный вопрос не выявляет современный ИИ надежно.

Могут ли судьи просто спрашивать о свежих новостях или личных воспоминаниях?

Это может создать нечестные короткие пути. У системы по замыслу может не быть доступа к интернету, а человек может не знать новостей. Заявления о личных воспоминаниях тоже можно выдумать. Хороший протокол определяет допустимые знания и обеспечивает сопоставимый доступ.

Зачем сравнивать машины с реальными людьми-собеседниками?

Люди задают базовый уровень положительного контроля. Если судьи называют машинами многих реальных людей, задача или калибровка судей может быть плохой. Долю ответов машины, принятых за человеческие, трудно интерпретировать без человеческого уровня и уровня случайности.

Надежны ли короткие тесты?

Короткие сессии удобны, но их легче обыграть, и они могут в основном измерять первое впечатление. Более длинные, повторяющиеся, состязательные и междоменные разговоры дают более сильные доказательства, хотя повышают стоимость, утомляемость и число проектных решений.

Что такое эффект ELIZA?

Это склонность видеть понимание или агентность в поверхностных компьютерных ответах. Название возникло из реакций на ELIZA и остается актуальным, когда беглый текст побуждает людей делать выводы шире, чем позволяют доказательства.

Тьюринг-тест — это IQ-тест?

Нет. IQ-тесты сравнивают выполнение стандартизированных когнитивных задач с возрастными нормами. Тьюринг-тест оценивает, может ли судья выявить разговорную машину в рамках конкретного протокола.

Проследить основания утверждений

Первоисточники и научные материалы

В истории выше приоритет отдан оригинальным работам и исследовательским материалам. Современные результаты приводятся вместе с условиями исследований, а не объявляются универсальными вехами.

Тьюринг (1950), «Computing Machinery and Intelligence»

Основная статья в журнале Mind, том 59, выпуск 236, страницы 433–460.

Открыть источник

Цифровой архив Тьюринга

Запись каталога King’s College Cambridge с рукописными материалами Тьюринга.

Открыть источник

Дартмутское предложение по ИИ

Предложение 1955 года для летнего исследовательского проекта 1956 года, в котором искусственный интеллект получил свое название.

Открыть источник

Вейценбаум (1966), ELIZA

Оригинальная статья в Communications of the ACM с описанием ELIZA.

Открыть источник

Колби и др. (1972), исследование PARRY

Оригинальная статья в Artificial Intelligence о тестах на неразличимость в стиле Тьюринг-теста.

Открыть источник

Стэнфордская энциклопедия: Тьюринг-тест

Научный обзор интерпретаций, возражений, вариантов и истории соревнований.

Открыть источник

Джонс и Берген (2024)

Предварительно зарегистрированное рандомизированное исследование ELIZA, GPT-3.5, GPT-4 и людей-собеседников.

Открыть источник

У, У и Чжао (ACL 2025)

Рецензируемая работа, предлагающая X-TURING для диалоговых агентов с более длинным горизонтом.

Открыть источник