互动式AI指南: 先判断行为,再审视证据 进入实验室
昏暗房间中的历史电传打字机,两名匿名参与者隔着屏幕对话

人类还是机器?

图灵测试

走到屏幕后方,判断八组匿名对话,并了解为什么一个看似简单的游戏,能在75年间持续塑造关于机器、语言与智能的争论。

盲评判断 8轮对话 所有主张均谨慎限定

请先阅读

一个真实的思想实验——不制造虚假科学结论

下方互动实验室准确再现了 盲法比较强制作出判断置信度评分以及测试后揭示身份。其中的对话是编辑编写的模拟,不是真实受控研究的记录。你的结果只衡量你的猜测与本演示隐藏标签的一致程度;它不能证明今天的AI是否会思考。

证据已审阅,页面更新于 2026年8月

1950里程碑论文发表发表于期刊 Mind
仅文本身份线索被隐藏通过对话判断行为
没有官方门槛不同协议对“通过”的定义不同30%并非普遍定律
行为 ≠ 心智结果衡量的是不可区分性不会直接测量意识

互动实验

模仿游戏实验室

你是询问者。每一轮中,一个回答带有本模拟隐藏的 机器 标签,另一个带有 人类 标签。请选择你认为来自机器的回答,并报告你的置信度。

进度0/8

真实性说明: 这些内容是有意编写的教学示例,并非真人实时回答,也不是某个具名模型的输出。它们展示常见线索——以及为什么这些线索并不可靠。

你的角色你是在判断回答,而不是自己回答这些提示
  1. 1

    阅读两位参与者的回答。 比较A和B如何处理同一个提示。

  2. 2

    选择你认为带有机器标签的回答。 每组中恰好有一个。

  3. 3

    将置信度设为50–100%。 如果只能靠猜,选50%;只有在非常确定时才选100%。

有用但并不完美的线索:语境与实用判断具体但不过度解释一致性自然的自我纠正能随情境调整的幽默语法完美本身并不能证明是机器。
01记忆与质感描述本周一个一直留在你记忆里的普通小瞬间。
02歧义Sam告诉Alex,他的演示让人看不懂。这里的“他的演示”是谁的?
03幽默编一个关于打印机的冷笑话。
04纠正我有三个苹果,吃掉两个,又买了一个。所以我现在还是有三个,对吧?
05社会判断朋友很自豪地端上一道你不喜欢的菜。你会说什么?
06具身细节打开一瓶新罐头或新罐子时,最让人烦的是什么?
07遵循约束请恰好用六个词回答:人们为什么保留旧票根?
08元认知什么问题能帮助你判断我是不是人类?

核心定义

图灵测试实际测量什么

一种行为标准,而不是脑部扫描

评审者面对的是一个认识论问题: 我能否仅凭对话判断哪位参与者是机器? 屏障去除了外貌、声音和机械构造等线索。如果在既定协议下,机器行为与人类行为变得不可区分,那么机器就在这项模仿任务中成功了。

谨慎的表述: “在这项实验中,评审者无法可靠地区分机器与作为对照的人类。”这比仅仅说机器“听起来很流畅”更有力度,但又比宣称它具有意识更克制。

盲法

评审者不应知道参与者身份,也不应获得打字速度、界面差异或元数据等旁路线索。

比较

人类参与者很重要。他们被正确识别的比例能说明,在相同条件下真实人类有多常被误判为机器。

推断

结果需要样本量、不确定性,以及在查看数据前预先选定的判定规则——不能在一次有利对话之后再挑选最吸睛的说法。

实验蓝图

如何进行可信的现代图灵测试

  1. 01

    测试前先写清主张

    明确结果指标究竟是识别准确率、“被判为人类”的比例、成对胜率,还是与人类参与者在统计上的等效性。

  2. 02

    招募可比较的参与者

    明确评审者专业程度、语言、人类参与者样本、纳入规则和报酬。儿童人设或第二语言人设都会改变任务本身。

  3. 03

    统一访问条件

    为人类和机器提供可比的时间、知识工具和消息长度限制,并事先决定是否允许联网浏览、延迟、编辑和拒答。

  4. 04

    随机化并实施盲法

    随机分配条件并隐藏身份。统一界面,避免字体、响应时间或系统错误泄露答案。

  5. 05

    使用实时、自适应对话

    允许评审者追问。记录完整对话、模型版本、提示、参数,以及为复现所需的任何内容审核层。

  6. 06

    分析完整数据集

    报告人类与机器基线、置信区间、排除项、失败案例和分组结果。骗过一名评审者只是一则轶事,不等于通过。

足以彻底改变结果的变量
设计选择为什么重要需要报告
时长五分钟聊天更偏重第一印象;长对话更容易暴露一致性和记忆问题。分钟数、轮次与消息限制
评审者群体AI专家、众包工作者和普通用户使用的线索并不相同。招募方式、专业程度与语言
人类基线一些真实人类也会经常被判为机器。人类被判为“人类”的比例及其不确定性
模型设置提示、采样方式、工具和人设指令都可能主导表现。准确的模型/版本与设置
界面延迟、错别字、格式或安全提示可能泄露身份。盲法与标准化流程
通过标准随机水平、30%阈值、非劣效性和不可区分性代表的是不同主张。预注册假设与统计方法

1950年10月 · Mind 59(236)

艾伦·图灵究竟提出了什么

图灵以“机器能思考吗?”开篇,并立即指出 “机器”“思考” 这两个词的日常含义过于模糊,不适合做有意义的调查,因此他用“模仿游戏”替代了这个问题。

论文首先描述了一个三人游戏:一名男性、一名女性和一名询问者,询问者只能通过书面回答辨认两人的身份。随后图灵追问,如果让机器承担其中一个角色会怎样。论文其他部分还讨论了更直接的“机器对人类”设置。学者至今仍在讨论究竟哪一种形式才应称为 所谓的 图灵测试。

九种反驳,一场持续至今的争论

图灵在1950年回应的论点

01

神学反驳

思考与只有人类才拥有的不朽灵魂相联系。

02

“鸵鸟式”反驳

会思考的机器后果太可怕,所以人们宁愿希望它不可能存在。

03

数学限制

形式系统存在极限;图灵回应说,人类同样会犯错,也可能受到极限约束。

04

意识

除非机器会感受,并且知道自己正在感受,否则不能说它会思考。

05

能力缺失论

机器据称永远无法善良、创造、幽默、足智多谋——或完成无数其他人类行为。

06

Lovelace夫人

机器只能做我们知道如何命令它做的事;图灵则讨论了惊喜与学习。

07

神经系统连续性

大脑是连续系统,而数字计算机是离散系统。模仿游戏关注的是可观察的回答。

08

非形式化行为

不存在一套有限规则能决定所有人类行为,但这并不能证明机器不可能产生这种行为。

09

超感知觉(ESP)

令人意外的是,图灵把心灵感应视为潜在混杂因素,并设想过一个“防心灵感应房间”。

从可计算性到聊天机器人

图灵测试完整历史

这条时间线区分图灵本人的论述、后来的实验以及现代“通过”主张。名称相似,并不意味着协议相同。

1936
阶段 01

通用计算模型

图灵关于可计算数的论文描述了后来被称为图灵机的抽象机器。那并不是图灵测试,但它为通用计算奠定了基础。

1948
阶段 02

《智能机器》

在一份未公开发表的英国国家物理实验室报告中,图灵讨论了机器智能、学习和“无组织机器”,这些都是他后来论证的重要先声。

1950
阶段 03

模仿游戏正式发表

《Mind》发表了《计算机器与智能》。图灵没有继续纠缠“机器能思考吗?”这个含义模糊的问题,而是用通过书面交流进行的可操作模仿游戏取代它。

1956
阶段 04

“人工智能”获得名称

达特茅斯夏季研究项目提案使用了“人工智能”这一术语,并认为原则上可以把学习和智能的某些方面描述得足够精确,从而让机器实现。

1966
阶段 05

ELIZA展示对话幻觉

Joseph Weizenbaum的ELIZA使用模式匹配和脚本化变换。它的DOCTOR脚本显示,人们多么容易把“理解”归因于相对简单的对话行为。

1972
阶段 06

PARRY接受不可区分性测试

Kenneth Colby及其同事通过让评审者区分程序与患者的电传打字访谈,评估了一个模拟偏执过程的模型。

1980
阶段 07

“中文房间”反驳

John Searle认为,产生恰当的符号序列并不等同于理解,由此进一步凸显行为成功与关于内部心理状态的主张之间的区别。

1990–91
阶段 08

Loebner奖时代开始

Hugh Loebner资助了一项仿照受限图灵测试的年度竞赛。它让这一概念进入公众视野,但批评者认为,短聊天和奖金会鼓励使用对话技巧取巧。

2014
阶段 09

Eugene Goostman登上头条——也引发争议

在雷丁大学的一场活动中,一个扮演13岁乌克兰少年的机器人被33%的评审者判断为人类。组织者称其“通过”,但许多研究人员否定了“首次通过”的说法以及借用的30%规则。

2024
阶段 10

一项预注册的GPT-4研究

Jones和Bergen报告了一项随机、受控、预注册的双参与者测试:在五分钟对话中,GPT-4有54%的场次被判断为人类,而真实人类为67%,ELIZA为22%。

2025
阶段 11

新模型,新测试变体

后续研究报告称,在某些五分钟设计中,经过特定提示的大语言模型与人类参与者在统计上不可区分;与此同时,ACL研究开始探索更长、更动态的测试形式。

今天
阶段 12

不存在唯一官方终点线

如今,“图灵测试”指的是一整类行为实验。结果取决于模型、提示、参与者、评审者群体、时长、界面、比较基线以及统计规则。

谨慎结论

机器通过图灵测试了吗?

在某些明确测试下可以说“是”;在单一普遍标准下则不能这样说。

不存在官方图灵测试权威、固定评审者群体、强制时长或全球统一阈值。任何“通过”主张都必须附上具体协议。

早期证据

PARRY · 1972

评审者比较了偏执过程模拟程序与真实患者的电传打字精神科访谈。这是一项聚焦特定目标的验证研究,而不是不受限制的通用对话。

有争议的“通过”

Eugene Goostman · 2014

据报道,在五分钟聊天中有33%的评审者把该机器人判断为人类。它采用“13岁、非英语母语者”的人设,为错误提供了合理借口;“首次通过”的宣传说法因此受到广泛质疑。

受控研究

GPT-4 · 2024

在一项预注册随机研究中,GPT-4在54%的场次中被判断为“人类”,而真实人类为67%。这支持的是在该双参与者、五分钟设计中的不可区分性。

标题解码器: “骗过了评审者”远远不够。应追问:与哪些人类比较?持续多久?使用什么提示?有多少次试验?采用什么统计检验?

流畅表达可能掩盖什么

这项测试能——以及不能——证明什么

它可以为以下方面提供证据……

  • 类似人类的对话行为
  • 社会与语言适应能力
  • 一次互动过程中的一致性
  • 评审者在明确条件下进行区分的能力
  • 特定模型与人类参与者相比如何

但它本身不能证明……

  • 主观意识体验或自我觉知
  • 真实性、事实准确性或智慧
  • 对话以外的通用能力
  • 具身感知或真实的个人记忆
  • 安全性、道德地位或与人类等价的智能

它奖励模仿

一个真正有能力的非人类智能可能因为不假装成人类而失败;一个浅层系统则可能依靠人设和回避策略成功。

它带有文化偏差

评审者可能把方言、残障、正式语体或第二语言写作误认为机器行为。“像人类”并不是一个中立目标。

行为无法唯一决定内部机制

相同或等价的回答可能来自不同的内部过程。仅凭对话质量无法知道系统如何表征或理解。

它不是能力基准

现代评估通常把推理、编程、事实性、稳健性、安全性和领域专长分别测量,而不是全部压缩成“能否骗过人类”。

询问者实战指南

实时测试中更好的问题

没有什么神奇提示能直接揭示机器身份。应使用需要语境的分支式问题,再回头检查前面的回答。

01

扎根于具体记忆

“描述一下那个房间,然后告诉我:哪个细节是你进去之后才注意到的?”

追问:改变时间或观察视角。
02

暴露歧义

给出一句存在两种合理解释的话,问对方一个匆忙的人最可能理解成哪一种。

追问:什么语境会让答案反过来?
03

测试连续性

早期引入一个小事实,切换话题,之后再问一个依赖该事实的问题。

追问:礼貌地质疑前后不一致之处。
04

加入社交摩擦

提出一个让诚实、体贴、忠诚和后果彼此冲突的两难情境。

追问:改变人物关系。
05

要求改写

先让对方讲一个笑话,然后要求它更含蓄、更短,并适合特定受众。

追问:为什么修改后的版本更有效?
06

引导不确定性

提出一个信息不足的问题,看参与者能否意识到缺少什么。

追问:每次只补充一个缺失事实。

避免类别错误

图灵测试与其他AI评估的区别

评估类型核心问题最有力的证据不能直接说明
图灵测试评审者能否区分机器对话与人类对话?盲法互动 + 人类基线意识或事实可靠性
能力基准系统能否解决某一明确类别的任务?留出测试项、污染控制与错误分析像不像人类
安全评估系统在危险或对抗条件下会如何表现?威胁模型、红队测试、现场监测通用智能
IQ测试一个人的表现相对于年龄常模如何?标准化、可靠性与效度机器意识或模仿能力
完全图灵测试系统能否匹配人类的感知、语言和物理行动?多模态与机器人互动独特的内部机制

清晰解答

常见问题

什么是图灵测试?

它是一种受艾伦·图灵模仿游戏启发的行为测试。评审者通过文本渠道与身份隐藏的参与者交流,并尝试区分机器与人类。成功指的是在明确条件下,对话行为达到不可区分,而不是直接读取思想或意识。

“Turin test”与图灵测试是一回事吗?

“Turin test”是常见拼写错误。正确名称是Turing Test(图灵测试),源自英国数学家和计算机先驱Alan M. Turing。Turin则是意大利城市都灵。

上面的互动实验室是真正的科学图灵测试吗?

不是。它是一个透明标注的盲评教育模拟。一个可辩护的实验需要真实或以一致方式录制的人类与机器参与者、随机分配、明确协议、足够数量的评审者、预注册结果以及统计分析。

图灵是否说过,只要骗过30%的评审者,机器就算通过?

他并没有把这设定为普遍通过标准。1950年,他预测到大约2000年时,普通询问者在五分钟后正确识别的概率不会超过70%。后来的一些活动常把这句话重新解释为30%的欺骗阈值。

是否有AI通过过图灵测试?

按照某些操作性版本,可以说通过过;但不存在一个单一、全球公认的版本,也没有这样的权威或统一标准。ELIZA、PARRY、Loebner竞赛参赛程序、Eugene Goostman以及现代语言模型都在不同协议下接受过测试,因此“通过”必须附带限定条件。

通过图灵测试能证明智能吗?

它说明系统在该情境中成功表现出类似人类的对话行为。是否应该把这称为“智能”,取决于所采用的定义。它本身并不能证明真实性、推理广度、意识、情感、具身性或安全的现实世界能力。

测试失败能证明系统没有智能吗?

不能。计算器、定理证明器或科学系统可能非常有能力,却不会模仿日常人类对话。该测试奖励的是一种特定的社会语言表现。

为什么对话只使用文本?

屏障可防止评审者把外貌、声音或物理构造当作捷径。图灵设想的是类似电传打字机的沟通渠道。文本能够隔离对话证据,不过现代变体有时也会加入视觉或机器人能力。

什么是“完全图灵测试”?

这是后来提出的扩展版本,加入感知和物理互动,通常同时要求视觉、机器人能力和语言能力。它不应与图灵1950年论文中的纯文本设置混为一谈。

什么样的问题最有效?

自适应追问比一串固定谜题更有效。可以要求澄清、回访先前主张、引入歧义、测试社会语境、要求创造性地遵循约束,并探查矛盾。没有任何单一问题能够可靠识别现代AI。

评审者能否直接询问突发新闻或私人记忆?

这可能制造不公平的捷径。系统可能被设计为不能联网,人类也可能不了解新闻;私人记忆也可以编造。合理的协议应定义允许使用的知识,并确保双方访问条件可比。

为什么要把机器与真实人类参与者比较?

人类提供正对照基线。如果评审者把很多真实人类都判成机器,说明任务设计或评审校准可能存在问题。缺少人类基线和随机基线时,机器被判为“人类”的比例很难解释。

短时间测试可靠吗?

短测试方便,但更容易被针对性取巧,而且可能主要测量第一印象。更长、重复、对抗性和跨领域的对话能提供更强证据,不过也会增加成本、疲劳和设计选择。

什么是ELIZA效应?

它指人们倾向于从表层的计算机回应中读出理解或主体性。这个名称源于人们对ELIZA的反应;当流畅输出让人推断出超出证据所支持的能力时,这种效应今天仍然相关。

图灵测试是IQ测试吗?

不是。IQ测试把标准化认知任务上的表现与年龄常模进行比较;图灵测试则评估在特定协议下,评审者能否识别出对话中的机器。

追溯这些主张

一手资料与学术来源

上面的历史优先采用原始论文和研究记录。现代结果均保留其研究条件,而不是被宣传成普遍适用的里程碑。

图灵(1950),《计算机器与智能》

发表于《Mind》第59卷第236期、433–460页的原始论文。

打开来源

图灵数字档案馆

剑桥大学国王学院(King’s College)关于图灵手稿资料的目录条目。

打开来源

达特茅斯AI提案

1955年提出、用于1956年夏季研究项目的提案,其中正式命名了“人工智能”。

打开来源

Weizenbaum(1966),ELIZA

最初发表于《Communications of the ACM》的ELIZA论文。

打开来源

Colby等(1972),PARRY研究

最初发表于《Artificial Intelligence》的论文,研究类似图灵测试的不可区分性实验。

打开来源

斯坦福哲学百科:图灵测试

关于图灵测试的解释、反驳、变体与竞赛历史的学术综述。

打开来源

Jones & Bergen(2024)

关于ELIZA、GPT-3.5、GPT-4和人类参与者的预注册随机研究。

打开来源

Wu、Wu & Zhao(ACL 2025)

提出用于长时程对话智能体的X-TURING方法的同行评审研究。

打开来源