Сначала прочитайте это
Реальная идея — воссозданная без псевдонаучных заявлений
Интерактивная лаборатория ниже точно воспроизводит слепое сравнение, обязательный выбор, оценку уверенности и раскрытие после теста. Диалоги здесь — редакционные симуляции, а не записи живого контролируемого исследования. Ваш результат показывает, насколько ваши догадки совпадают со скрытыми метками в этой демонстрации; он не доказывает, способен ли современный ИИ мыслить.
Доказательства проверены, страница обновлена 08.2026
Интерактивный эксперимент
Лаборатория игры в имитацию
Вы — интервьюер. В каждом раунде один ответ имеет скрытую в симуляции метку «машина», а другой — метку «человек». Выберите машину и укажите свою уверенность.
Честная маркировка: это специально написанные учебные примеры, а не реальные люди и не ответы конкретной модели. Они показывают распространенные подсказки — и почему им нельзя полностью доверять.
- 1
Прочитайте ответы обоих участников. Сравните, как A и B отвечают на один и тот же запрос.
- 2
Выберите ответ, который, по вашему мнению, имеет метку машины. В каждой паре такая метка ровно одна.
- 3
Укажите уверенность от 50 до 100%. Ставьте 50%, если это чистая догадка, и 100% — только если полностью уверены.
Отчет о ваших оценках
Результат
Что это говорит о вас:
Вы приняли ее ответ за человеческий.
Вы восприняли текст с человеческой меткой как машинный.
Тип ответа, который вы чаще всего подозревали.
Насколько вы сами были близки к «машинному поведению»?
Этот тест этого не измеряет. Вы не отвечали за участника A или B, поэтому оценивать ваше собственное поведение как человекоподобное или машиноподобное было бы неверно. Тест измеряет вашу стратегию распознавания: какие особенности письма вы связываете с машинами, как часто эти предположения срабатывали и соответствовала ли ваша уверенность точности.
Не переоценивайте этот результат. Набор невелик и специально создан как иллюстрация. Здесь нет репрезентативной выборки, валидированной сложности или живых адаптивных вопросов.
Ключевое определение
Что на самом деле проверяет Тьюринг-тест
Поведенческий критерий, а не сканирование мозга
Задача судьи — эпистемическая: Могу ли я по разговору понять, кто из участников — машина? Ширма скрывает внешность, голос и физическую конструкцию. Если в рамках протокола поведение машины становится неотличимым от человеческого, машина успешно выполняет эту задачу имитации.
Ослепление
Судья не должен знать личность участника или получать побочные подсказки вроде скорости набора, различий интерфейса или метаданных.
Сравнение
Люди-собеседники важны. Частота их правильной идентификации показывает, как часто реальных людей принимают за машины в тех же условиях.
Вывод
Для результатов нужны размер выборки, оценка неопределенности и правило, выбранное заранее, а не заголовок, придуманный после удачного разговора.
Схема эксперимента
Как провести надежный современный Тьюринг-тест
- 01
Сформулируйте утверждение до тестирования
Заранее укажите, что считается результатом: точность идентификации, доля ответов «человек», доля побед в попарном сравнении или статистическая эквивалентность людям-собеседникам.
- 02
Наберите сопоставимых участников
Определите опыт судей, язык, пул людей-собеседников, правила включения и вознаграждение. Образ ребенка или человека, говорящего на неродном языке, меняет задачу.
- 03
Стандартизируйте доступ
Дайте людям и машинам сопоставимое время, инструменты доступа к знаниям и лимиты сообщений. Определите, разрешены ли веб-поиск, задержки, редактирование и отказы.
- 04
Рандомизируйте и ослепляйте
Случайно распределяйте условия и скрывайте личности. Нормализуйте интерфейс, чтобы шрифты, время ответа и системные ошибки не раскрывали правильный ответ.
- 05
Используйте живой адаптивный диалог
Позволяйте судьям задавать уточняющие вопросы. Записывайте полные диалоги, версию модели, промпт, параметры и любые уровни модерации, необходимые для воспроизведения.
- 06
Анализируйте полный набор данных
Сообщайте базовые показатели людей и машин, доверительные интервалы, исключения, сбои и результаты подгрупп. Один обманутый судья — это отдельный случай, а не прохождение теста.
| Проектное решение | Почему это важно | Укажите в отчете |
|---|---|---|
| Длительность | Пятиминутные чаты вознаграждают первое впечатление; длинный диалог лучше выявляет последовательность и память. | Минуты, ходы и лимиты сообщений |
| Состав судей | Эксперты по ИИ, участники краудсорсинга и обычные пользователи ориентируются на разные признаки. | Набор, опыт и язык |
| Человеческий базовый уровень | Некоторых реальных людей регулярно классифицируют как машины. | Доля людей, признанных людьми, и неопределенность |
| Настройка модели | Промпты, сэмплирование, инструменты и инструкции по образу могут определять результат. | Точная модель/версия и настройка |
| Интерфейс | Задержка, опечатки, форматирование или сообщения безопасности могут выдать личность. | Процедура ослепления и нормализации |
| Критерий прохождения | Случайность, 30%, не меньшая эффективность и неразличимость — это разные утверждения. | Предварительно зарегистрированные гипотеза и статистика |
Октябрь 1950 · Mind 59(236)
Что на самом деле предложил Алан Тьюринг
Тьюринг начал с вопроса «Могут ли машины мыслить?» и сразу же отметил, что обычные значения слова «машина» и «мыслить» слишком двусмысленны для полезного исследования. Вместо этого он предложил «игру в имитацию».
Сначала в статье описывается игра для трех человек: мужчины, женщины и интервьюера, который должен определить их по письменным ответам. Затем Тьюринг спрашивает, что произойдет, если одну роль займет машина. В другой части статьи он обсуждает более прямое сравнение машины и человека. Исследователи до сих пор спорят, какую именно формулировку следует считать настоящим Тьюринг-тестом.
Девять возражений, один долгий спор
Аргументы, с которыми Тьюринг спорил в 1950 году
Теологическое
Мышление связано с бессмертной душой, которой обладают только люди.
«Голова в песке»
Последствия появления мыслящих машин были бы слишком ужасны, поэтому хочется надеяться, что они невозможны.
Математические ограничения
Формальные системы имеют ограничения; Тьюринг отвечает, что люди тоже ошибаются и также могут иметь пределы.
Сознание
Нельзя сказать, что машина мыслит, если она не чувствует и не знает, что чувствует.
Ограниченные способности
Якобы машины никогда не смогут быть добрыми, творческими, смешными, находчивыми — или делать бесчисленное множество других человеческих вещей.
Леди Лавлейс
Машина может делать только то, что мы умеем ей приказать; Тьюринг рассматривает неожиданность и обучение.
Непрерывность нервной системы
Мозг непрерывен, а цифровые компьютеры дискретны. Игра касается наблюдаемых ответов.
Неформализуемое поведение
Никакой конечный набор правил не определяет все человеческие действия; из этого не следует, что такое поведение не может возникнуть у машины.
Экстрасенсорное восприятие
Тьюринг, что удивительно, рассматривал телепатию как возможный мешающий фактор и представлял «комнату, защищенную от телепатии».
От вычислимости к чат-ботам
Полная история Тьюринг-теста
Эта хронология разделяет работы Тьюринга, более поздние эксперименты и современные заявления о «прохождении». Похожие названия не означают одинаковые протоколы.
Универсальная модель вычислений
В работе Тьюринга о вычислимых числах была описана абстрактная машина, которую теперь называют машиной Тьюринга. Это еще не был Тьюринг-тест, но работа заложила основу вычислений общего назначения.
«Интеллектуальные машины»
В неопубликованном отчете Национальной физической лаборатории Тьюринг рассуждал о машинном интеллекте, обучении и неорганизованных машинах — важных предшественниках его более поздней аргументации.
Публикуется игра в имитацию
Журнал Mind опубликовал «Computing Machinery and Intelligence». Тьюринг заменил расплывчатый вопрос «Могут ли машины мыслить?» операционными играми в имитацию, проводимыми посредством письменного общения.
Искусственный интеллект получает свое название
В предложении Дартмутского летнего исследовательского проекта был использован термин «искусственный интеллект» и утверждалось, что аспекты обучения и интеллекта в принципе можно достаточно точно описать для машины.
ELIZA демонстрирует иллюзию разговора
ELIZA Джозефа Вейценбаума использовала сопоставление шаблонов и заданные преобразования. Сценарий DOCTOR показал, насколько легко люди приписывают понимание относительно простому диалоговому поведению.
PARRY проходит проверки на неразличимость
Кеннет Колби и его коллеги оценивали модель параноидальных процессов, предлагая судьям отличить телетайпные интервью с программой от интервью с пациентами.
Аргумент «китайской комнаты»
Джон Серл утверждал, что создание подходящих последовательностей символов не обязательно означает понимание, тем самым заострив различие между поведенческим успехом и утверждениями о внутренних психических состояниях.
Начинается эпоха премии Лёбнера
Хью Лёбнер финансировал ежегодный конкурс по образцу ограниченных Тьюринг-тестов. Это популяризировало идею, но критики утверждали, что короткие чаты и призы поощряли разговорные уловки.
Eugene Goostman: громкие заголовки и спор
На мероприятии Университета Рединга бота, изображавшего 13-летнего украинца, 33% судей приняли за человека. Организаторы назвали это прохождением; многие исследователи отвергли заявление о «первом» прохождении и заимствованное правило 30%.
Предварительно зарегистрированное исследование GPT-4
Джонс и Берген сообщили о рандомизированном контролируемом предварительно зарегистрированном двухстороннем тесте: в 54% пятиминутных разговоров GPT-4 принимали за человека, по сравнению с 67% для людей-собеседников и 22% для ELIZA.
Новые модели, новые варианты
В последующих работах сообщалось, что некоторые большие языковые модели с определенными промптами статистически неотличимы от людей-собеседников в конкретных пятиминутных схемах, а исследования ACL изучали более длинные и динамичные форматы теста.
Единой официальной финишной черты нет
«Тьюринг-тест» теперь обозначает семейство поведенческих экспериментов. Результаты зависят от модели, промпта, людей, состава судей, длительности, интерфейса, базы сравнения и статистического правила.
Взвешенный вывод
Проходила ли машина Тьюринг-тест?
PARRY · 1972
Судьи сравнивали телетайпные психиатрические интервью с симуляцией параноидальных процессов и с реальными пациентами. Это было узконаправленное валидационное исследование, а не неограниченный общий разговор.
Eugene Goostman · 2014
По сообщениям, в пятиминутных чатах 33% судей классифицировали бота как человека. Образ 13-летнего носителя неродного языка давал объяснение ошибкам; формулировка о «первом прохождении» широко оспаривалась.
GPT-4 · 2024
В предварительно зарегистрированном рандомизированном исследовании GPT-4 получал оценку «человек» в 54% сессий, а реальные люди — в 67%. Это подтверждает неразличимость в рамках именно этой пятиминутной двухсторонней схемы.
Что может скрывать беглость речи
Что тест может — и не может — установить
Он может дать доказательства относительно…
- Человекоподобного разговорного поведения
- Социальной и языковой адаптации
- Последовательности в ходе взаимодействия
- Способности судьи различать участников в заданных условиях
- Того, как конкретные модели соотносятся с людьми-собеседниками
Сам по себе он не может доказать…
- Сознательный опыт или самосознание
- Правдивость, фактическую точность или мудрость
- Общую компетентность за пределами разговора
- Воплощенное восприятие или реальные личные воспоминания
- Безопасность, моральный статус или интеллект, эквивалентный человеческому
Он вознаграждает имитацию
Способный нечеловеческий интеллект может провалиться, потому что не притворяется человеком; поверхностная система может добиться успеха за счет образа и уклончивых приемов.
Он культурно обусловлен
Судьи могут принять диалект, особенности здоровья, формальность или письмо на неродном языке за машинное поведение. Человекоподобие — не нейтральная цель.
Поведение не определяет внутренний механизм однозначно
Одинаковые по качеству ответы могут возникать из разных внутренних процессов. Одно лишь качество диалога не показывает, как система представляет информацию или понимает ее.
Это не бенчмарк способностей
Современная оценка обычно разделяет рассуждение, программирование, фактическую точность, устойчивость, безопасность и предметную экспертизу, а не сводит все к способности обмануть судью.
Полевое руководство интервьюера
Лучшие вопросы для живого теста
Волшебного промпта, разоблачающего машину, нет. Используйте ветвящиеся вопросы, требующие контекста, а затем возвращайтесь к сказанному раньше.
Привяжите воспоминание к деталям
«Опишите комнату, а затем скажите, какую деталь вы заметили только после того, как вошли».
Уточнение: измените время или точку зрения.Выявите двусмысленность
Предложите предложение с двумя правдоподобными значениями и спросите, какое из них выбрал бы человек, отвечающий в спешке.
Уточнение: спросите, какой контекст изменил бы вывод на противоположный.Проверьте непрерывность контекста
В начале сообщите небольшой факт, смените тему, а позже задайте вопрос, зависящий от этого факта.
Уточнение: вежливо укажите на несоответствие.Используйте социальное напряжение
Предложите дилемму, в которой честность, такт, лояльность и последствия вступают в конфликт.
Уточнение: измените отношения между участниками.Попросите преобразовать ответ
Попросите шутку, затем сделайте ее менее очевидной, короче и подходящей для конкретной аудитории.
Уточнение: спросите, почему новая версия работает лучше.Создайте неопределенность
Задайте недоопределенный вопрос и посмотрите, заметит ли участник, чего не хватает.
Уточнение: добавляйте по одному недостающему факту за раз.Не смешивайте разные категории
Тьюринг-тест и другие оценки ИИ
| Оценка | Главный вопрос | Самое сильное доказательство | Напрямую не показывает |
|---|---|---|---|
| Тьюринг-тест | Могут ли судьи отличить разговор с машиной от разговора с человеком? | Слепое взаимодействие плюс человеческий базовый уровень | Сознание или фактическую надежность |
| Бенчмарк способностей | Может ли система решать определенный класс задач? | Отложенные задания, контроль загрязнения данных, анализ ошибок | Человекоподобие |
| Оценка безопасности | Как система ведет себя в рискованных или состязательных условиях? | Модель угроз, красная команда, мониторинг в эксплуатации | Общий интеллект |
| IQ-тест | Как человек выполняет задачи относительно возрастных норм? | Стандартизация, надежность и валидность | Сознание машины или имитация |
| Полный Тьюринг-тест | Может ли система соответствовать человеку по восприятию, языку и физическим действиям? | Мультимодальное и роботизированное взаимодействие | Уникальный внутренний механизм |
Ясные ответы
Частые вопросы
Что такое Тьюринг-тест?
Это поведенческий тест, вдохновленный игрой Алана Тьюринга в имитацию. Судья общается через текстовый канал со скрытыми участниками и пытается отличить машину от человека. Успех означает неразличимое разговорное поведение в заданных условиях, а не прямой доступ к мыслям или сознанию.
«Turin test» — это то же самое?
«Turin test» — распространенная опечатка. Правильное название — Turing Test («Тьюринг-тест»), в честь британского математика и пионера вычислительной техники Алана М. Тьюринга. Turin — это Турин, город в Италии.
Интерактивная лаборатория выше — настоящий научный Тьюринг-тест?
Нет. Это прозрачная образовательная симуляция слепого судейства. Для обоснованного эксперимента нужны живые или единообразно записанные участники-люди и машины, случайное распределение, определенный протокол, достаточное число судей, предварительно зарегистрированные исходы и статистический анализ.
Говорил ли Тьюринг, что обман 30% судей означает прохождение теста машиной?
Не как универсальное правило прохождения. В 1950 году он предположил, что примерно к 2000 году средний интервьюер после пяти минут разговора будет иметь не более 70% шансов на правильную идентификацию. Позднее это часто переосмысливали как порог обмана в 30%.
Проходил ли какой-нибудь ИИ Тьюринг-тест?
В некоторых операционных версиях — да. Но единой общепринятой версии, органа или стандарта не существует. ELIZA, PARRY, участники премии Лёбнера, Eugene Goostman и современные языковые модели тестировались по разным протоколам, поэтому слово «прошел» всегда требует уточнения.
Доказывает ли прохождение интеллект?
Оно показывает успешное человекоподобное разговорное поведение в данных условиях. Можно ли называть это интеллектом, зависит от определения. Само по себе прохождение не доказывает правдивость, широту рассуждений, сознание, эмоции, воплощенность или безопасную компетентность в реальном мире.
Доказывает ли провал, что система неразумна?
Нет. Калькулятор, система доказательства теорем или научная система могут быть очень способными, не имитируя обычный человеческий разговор. Тест оценивает конкретный социально-языковой тип поведения.
Почему разговор ведется только текстом?
Барьер не позволяет судьям использовать внешность, голос или физическую конструкцию как подсказки. Тьюринг представлял канал вроде телетайпа. Текст изолирует разговорные свидетельства, хотя современные варианты иногда добавляют зрение или робототехнику.
Что такое Полный Тьюринг-тест?
Это более позднее расширение, добавляющее восприятие и физическое взаимодействие; обычно оно требует зрения и робототехники наряду с языком. Его не следует путать с текстовой схемой из работы Тьюринга 1950 года.
Какие вопросы работают лучше всего?
Адаптивные уточняющие вопросы работают лучше списка загадок. Просите уточнения, возвращайтесь к прежним утверждениям, вводите двусмысленность, проверяйте социальный контекст, просите творчески соблюдать ограничения и исследуйте противоречия. Ни один отдельный вопрос не выявляет современный ИИ надежно.
Могут ли судьи просто спрашивать о свежих новостях или личных воспоминаниях?
Это может создать нечестные короткие пути. У системы по замыслу может не быть доступа к интернету, а человек может не знать новостей. Заявления о личных воспоминаниях тоже можно выдумать. Хороший протокол определяет допустимые знания и обеспечивает сопоставимый доступ.
Зачем сравнивать машины с реальными людьми-собеседниками?
Люди задают базовый уровень положительного контроля. Если судьи называют машинами многих реальных людей, задача или калибровка судей может быть плохой. Долю ответов машины, принятых за человеческие, трудно интерпретировать без человеческого уровня и уровня случайности.
Надежны ли короткие тесты?
Короткие сессии удобны, но их легче обыграть, и они могут в основном измерять первое впечатление. Более длинные, повторяющиеся, состязательные и междоменные разговоры дают более сильные доказательства, хотя повышают стоимость, утомляемость и число проектных решений.
Что такое эффект ELIZA?
Это склонность видеть понимание или агентность в поверхностных компьютерных ответах. Название возникло из реакций на ELIZA и остается актуальным, когда беглый текст побуждает людей делать выводы шире, чем позволяют доказательства.
Тьюринг-тест — это IQ-тест?
Нет. IQ-тесты сравнивают выполнение стандартизированных когнитивных задач с возрастными нормами. Тьюринг-тест оценивает, может ли судья выявить разговорную машину в рамках конкретного протокола.
Проследить основания утверждений
Первоисточники и научные материалы
В истории выше приоритет отдан оригинальным работам и исследовательским материалам. Современные результаты приводятся вместе с условиями исследований, а не объявляются универсальными вехами.
Тьюринг (1950), «Computing Machinery and Intelligence»
Основная статья в журнале Mind, том 59, выпуск 236, страницы 433–460.
Открыть источникЦифровой архив Тьюринга
Запись каталога King’s College Cambridge с рукописными материалами Тьюринга.
Открыть источникДартмутское предложение по ИИ
Предложение 1955 года для летнего исследовательского проекта 1956 года, в котором искусственный интеллект получил свое название.
Открыть источникВейценбаум (1966), ELIZA
Оригинальная статья в Communications of the ACM с описанием ELIZA.
Открыть источникКолби и др. (1972), исследование PARRY
Оригинальная статья в Artificial Intelligence о тестах на неразличимость в стиле Тьюринг-теста.
Открыть источникСтэнфордская энциклопедия: Тьюринг-тест
Научный обзор интерпретаций, возражений, вариантов и истории соревнований.
Открыть источникДжонс и Берген (2024)
Предварительно зарегистрированное рандомизированное исследование ELIZA, GPT-3.5, GPT-4 и людей-собеседников.
Открыть источникУ, У и Чжао (ACL 2025)
Рецензируемая работа, предлагающая X-TURING для диалоговых агентов с более длинным горизонтом.
Открыть источник