参考指南: 负责任地理解 IQ 分数 分数计算器
钟形曲线、IQ 分数标记与抽象认知网络

完整分数参考

IQ 测试量表

一份完整实用指南,涵盖 IQ 范围、百分位、标准差、分数换算、置信区间、主要测试体系、历史、公平性,以及一个分数可以和不可以说明什么。

均值 100,标准差 15 百分位与稀有度 公平且审慎的解释

什么是 IQ 测试量表?

IQ 分数通常是基于常模的标准分。 它描述一个人在一组标准化认知任务上的表现,与按年龄划分的参照群体相比如何。在最常见的现代量表中,均值为 100,标准差为 15。

这个数字不是答对题目的百分比,不是固定不变的“智力总量”,也不是衡量个人价值的直接指标。专业报告应说明具体测试及版本、常模群体、百分位排名、置信区间、效度考虑,以及整体和具体分数模式。

本指南解释评分体系和负责任的解读方式,不会复制保密测试题、答案或受保护的施测规则。

最后更新: August 2026

100 常用 IQ 均值 常模量表的中点
15 常用 IQ 标准差 常见综合分的一个标准差
第 50 百分位 IQ 100 对应的百分位 理想模型中的中位数
约第 98 百分位 IQ 130 对应的百分位 高于均值两个标准差

IQ 分数、百分位与量表换算器

输入分数并选择报告中注明的量表。计算器会估算 z 分数、百分位、稀有度,以及若干常见标准分体系中的对应值。

输入报告中的分数

这只是正态分布估算,并非正式分数报告。具体测试的查表值、上限、常模和取整规则可能不同。

估算位置

第 84 百分位 较高平均范围
z 分数+1.00
稀有度约每 6 人中有 1 人达到或超过此水平
IQ,标准差 15115
IQ,标准差 16116
卡特尔量表,标准差 24124
T 分数60

IQ 分数范围完整图表

描述性标签只是惯例,并非诊断。出版方和专业人员可能采用不同名称、界限或置信区间规则。对于报告所载分数,应以原始报告为首要依据。

IQ 范围 估算 z 分数 估算百分位 常用术语 解释说明
130 及以上 +2.00 或更高 约第 98 百分位及以上 很高/极高 在平均数 100、标准差 15 的量表上约为最高 2%。
120–129 +1.33 至 +1.93 约第 91–97 百分位 高/很高 显著高于常模平均数。
110–119 +0.67 至 +1.27 约第 75–90 百分位 较高平均 高于参照群体中间的一半。
90–109 −0.67 至 +0.60 约第 25–73 百分位 平均 许多报告使用的宽泛中间区间。
80–89 −1.33 至 −0.73 约第 9–23 百分位 较低平均 低于中间区间,但并不构成诊断。
70–79 −2.00 至 −1.40 约第 2–8 百分位 很低 应结合置信区间、适应功能和背景解释。
69 及以下 低于 −2.00 约第 2 百分位及以下 极端低 仅凭 IQ 分数不能认定智力障碍。
以 100 为中心并显示标准差区间的 IQ 钟形曲线
理想正态分布。正式测试常模采用离散换算,可能与这条曲线略有差异。

68–95–99.7 法则

约 68% 的正态分布位于均值上下一个标准差内,即 IQ 大约 85–115。

约 95% 位于上下两个标准差内,即 IQ 大约 70–130。

约 99.7% 位于上下三个标准差内,即 IQ 大约 55–145。

解释分布尾部时需要格外谨慎。 极端分数依据的常模个案较少,也更容易受下限、上限和较大实际不确定性的影响。

IQ 百分位与稀有度

百分位排名表示常模群体中,分数等于或低于某一结果的人所占百分比。百分位不是等距量表:第 50 与第 60 百分位之间的差异,在心理测量意义上并不等同于第 90 与第 100 百分位之间的差异。

85约第 16 百分位
100第 50 百分位
115约第 84 百分位
120约第 91 百分位
130约第 98 百分位
145约第 99.87 百分位
IQ(标准差 15) z 分数 估算百分位 分布尾部的估算稀有度
55 −3.00 第 0.13 百分位 约每 741 人中有 1 人达到或低于该水平
60 −2.67 第 0.38 百分位 约每 261 人中有 1 人达到或低于该水平
65 −2.33 第 0.98 百分位 约每 102 人中有 1 人达到或低于该水平
70 −2.00 第 2.28 百分位 约每 44 人中有 1 人达到或低于该水平
75 −1.67 第 4.78 百分位 约每 21 人中有 1 人达到或低于该水平
80 −1.33 第 9.12 百分位 约每 11 人中有 1 人达到或低于该水平
85 −1.00 第 15.87 百分位 约每 6 人中有 1 人达到或低于该水平
90 −0.67 第 25.25 百分位 约每 4 人中有 1 人达到或低于该水平
95 −0.33 第 36.94 百分位 约每 3 人中有 1 人达到或低于该水平
100 0.00 第 50 百分位 中位数
105 +0.33 第 63.06 百分位 约每 3 人中有 1 人达到或超过该水平
110 +0.67 第 74.75 百分位 约每 4 人中有 1 人达到或超过该水平
115 +1.00 第 84.13 百分位 约每 6 人中有 1 人达到或超过此水平
120 +1.33 第 90.88 百分位 约每 11 人中有 1 人达到或超过该水平
125 +1.67 第 95.22 百分位 约每 21 人中有 1 人达到或超过该水平
130 +2.00 第 97.72 百分位 约每 44 人中有 1 人达到或超过该水平
135 +2.33 第 99.02 百分位 约每 102 人中有 1 人达到或超过该水平
140 +2.67 第 99.62 百分位 约每 261 人中有 1 人达到或超过该水平
145 +3.00 第 99.87 百分位 约每 741 人中有 1 人达到或超过该水平

稀有度估算假设理想正态分布,并已取整。不要把它当作精确人口数量或临床阈值。

IQ 量表与标准分之间的换算

不同评分体系之间最稳妥的桥梁是 z 分数。先把原始分数表示为距离其均值多少个标准差,再按目标量表的均值和标准差重新构成分数。

z =(分数 − 均值)÷ 标准差 目标分数 = 目标均值 +(z × 目标标准差)

计算示例:第 98 百分位

约位于 +2 个标准差的分数,其 z 分数约为 2.00。换算后分别为 130 在标准差 15 的 IQ 量表上, 132 在标准差 16 的 IQ 量表上, 148 在标准差 24 的卡特尔式量表上,以及 70 在 T 分数量表上。

因此,数值更大并不一定表示百分位更高。量表分布的宽度决定最终显示的数字。

相同百分位在不同标准分量表上的对应值
对应值只是数学估算。真实测试的常模、构念、上限和换算表可能不同。
100 / 15

现代 IQ 标准分数

平均数 100、标准差 15。这是韦克斯勒、斯坦福—比奈及许多其他当代认知综合分数最常见的惯例。

+2 SD = 130
100 / 16

旧式 SD=16 IQ 量表

一些历史测验和旧表使用标准差 16。分数必须结合测验名称和版本解释。

+2 SD = 132
100 / 24

卡特尔式 IQ 量表

一种更宽的量表,过去有时用于高 IQ 场景。同一百分位会产生看起来大得多的数字。

+2 SD = 148
50 / 10

T 分数

心理学中广泛使用的标准分数体系。平均数为 50,每 10 分等于一个标准差。

+2 SD = 70
10 / 3

分测验量表分

许多个别施测的认知分测验在合成为综合分数前,使用平均数 10、标准差 3 的量尺。

+2 SD = 16
0 / 1

z 分数

通用统计量尺。z 分数表示结果高于或低于平均数多少个标准差。

+2 SD = z 2,00
数学换算不等于测试换算。 两套测验可能把同一个人置于不同百分位,因为它们测量的能力、使用的常模、分数上限和施测条件均可能不同。

如何正确解释 IQ 分数

应把 IQ 结果视为整个评估论证的一部分。分数应服务于真实问题,例如教育规划、诊断澄清或材料证明,并与个人史、观察、其他测试及日常功能结合。

1

注明测试

准确记录测验组合、版本、语言、年龄常模和施测日期。

2

检查效度

审查投入程度、标准化、便利措施、健康、注意力、语言和感官可及性。

3

使用区间

解释置信区间,而不是只盯着一个获得分。

4

阅读能力结构

比较总分、指数和分测验的整体模式,不要过度解读细小差异。

5

联系现实生活

询问结果是否与学校、工作、沟通和日常功能中的表现一致。

6

后续行动

优先制定实际建议、支持措施和后续问题。

置信区间与测量误差

任何获得分都不可能绝对精确。临床专业人员会使用测试的测量标准误来构建置信区间。例如,若 IQ 100 的标准误为 3 分,估算的 95% 区间约为 94–106。实际标准误会因测试、分数和年龄而异。

最佳实践: 应表述为“获得分为 100,置信区间见报告”,而不是把 100 当作精确且永久不变的数值。

相同的总 IQ 可能掩盖不同的能力结构

示例结构 A

言语推理105
视觉空间103
流体推理101
工作记忆99
加工速度97

各项表现相对均衡,均在平均值附近。

示例结构 B

言语推理125
视觉空间112
流体推理115
工作记忆88
加工速度84

显著的优势与弱项可能使单一总分缺乏代表性。

以上能力结构仅为讲解而虚构,并非取自真实测试记录。

IQ 与认知能力测试的主要类型

“IQ 测试”是一个总称。不同测验组合在适用年龄、时长、理论、语言要求、施测方式、分数结构和用途上各不相同。分数不能脱离产生它的测量工具来解释。

韦克斯勒量表

按年龄划分、个别施测的测验系列,通常报告总体综合分数以及领域和分测验分数。

WAIS、WISC 与 WPPSI

斯坦福—比奈量表

源自比奈—西蒙传统的广泛个别智力测验系列,通过言语和非言语路径得到主要因素分数及全量表分数。

斯坦福—比奈智力量表

伍德科克—约翰逊认知测验系列

围绕广泛和狭义认知能力组织的灵活测验系列,常与学业成绩评估配合使用。

WJ 认知与学业系统

考夫曼测验系列

儿童工具或简式测量,可侧重加工、已获知识、非言语表现或高效筛查。

KABC 与考夫曼简式测量

非言语推理测量

减少口语要求,更侧重视觉推理、模式或非言语问题解决;“非言语”不代表不受文化影响。

瑞文、Leiter 及类似测验

团体能力测验

同时对大量学生施测,用于筛查或项目决定。它们不能自动与个别临床 IQ 评估互换。

学校筛查测验系列

个别临床测试与团体筛查

个别评估

  • 一名测评者与一名受测者
  • 标准化的提示、计时和行为观察
  • 通常会生成领域与分测验能力结构
  • 可与访谈及其他临床资料结合

团体或在线筛查

  • 可高效地同时测量多人
  • 通常提供较少的个体观察
  • 可能只估算较窄范围的能力
  • 可能不满足证明材料或诊断要求

IQ 分数的用途,以及单凭分数无法决定什么

教育规划

结合学业成绩、课堂证据和干预历史,了解认知优势与需要。

天赋识别

为当地项目标准提供补充证据,通常还会结合学业、创造力或教师资料。

临床评估

在更广泛的神经发育、精神科、神经科或医学评估中描述认知能力结构。

残障证明

与功能证据和接收机构要求结合时,可为相关决定提供支持。

研究

研究认知发展、群体模式、干预效果及其与其他结果的关系。

个人澄清

当评估目的明确且由合格专业人员解释时,帮助个人理解自身能力结构。

分数可以提供以下证据

  • 在标准化条件下完成所测认知任务的表现
  • 与按年龄划分的常模群体相比所处的相对位置
  • 整体及特定领域的优势或弱项
  • 需要进一步评估或支持的问题

仅凭分数无法确定

  • ADHD、自闭症、阅读障碍或其他诊断
  • 缺少适应行为证据时的智力障碍
  • 创造力、智慧、道德、动机或未来成功
  • 个人学习能力或价值的固定上限

IQ 量表的历史

这段历史在科学上影响深远,在伦理上也极为复杂。智力测试最初源于识别教育需求,后来却卷入大规模分类、优生学、移民政策和种族等级制度。现代实践必须正视这段历史,同时更严格地落实效度、公平与负责任使用标准。

1884

高尔顿人体测量实验室

弗朗西斯·高尔顿在早期测量个体差异的尝试中测量感觉敏锐度、反应时和身体特征。

1890

“心理测验”进入心理学

詹姆斯·麦基恩·卡特尔用“心理测验”一词描述一组强调感觉和动作表现的测验。

1905

比奈—西蒙初步量表

阿尔弗雷德·比奈和西奥多·西蒙发布了一组实用任务,用于识别可能需要教育支持的儿童。该量表尚未产生现代离差 IQ。

1908–1911

年龄水平与心理年龄

修订版按儿童通常能完成任务的年龄进行分组,从而支持心理年龄估计概念。

1912

斯特恩提出智商

威廉·斯特恩描述了心理年龄与实际年龄之间的比值;后来的使用者将该比值乘以 100。

1916

斯坦福修订版

刘易斯·特曼将比奈—西蒙方法改编并在美国标准化,帮助 IQ 一词普及。

1917–1918

陆军甲种与乙种测验

第一次世界大战期间,团体测验以前所未有的规模使用。这既展示了行政覆盖能力,也暴露出语言、教育和公平方面的重大问题。

1939

韦克斯勒—贝尔维尤与离差分数

戴维·韦克斯勒推出成人测验组合,将个人与同龄人比较,并综合多种任务,而不再仅依赖比率 IQ。

1984

弗林效应得到记录

詹姆斯·弗林的研究引起人们对测验表现代际变化及常模老化问题的关注。

当今

能力轮廓、不确定性与背景

现代解释强调最新常模、多个认知领域、置信区间、公平、适应功能和分数用途。

比率智商与离差智商

历史上的比率智商
心理年龄 ÷ 实足年龄 × 100。这种方法不适合作为通用成人量表,因为心理年龄的增长不会在一生中持续保持线性。
现代离差智商
表示个人表现偏离同龄群体均值多少的标准分。均值通常为 100,标准差通常为 15。
为什么需要更新常模
语言、教育、人口结构、测试熟悉度和总体表现会改变。更新常模可减少把当代受测者与过时参照群体比较的风险。

公平、文化、语言与测试条件

公平测试并不是假装情境不存在,而是需要有证据证明,对目标用途和目标受测者而言,分数解释是有效的;同时还要认真考虑无障碍、语言、机会、残障、施测过程和后果。

睡眠与疲劳

严重疲劳会降低注意、工作记忆、速度和坚持性。

健康与疼痛

疾病、疼痛、神经系统状况和药物作用都会改变表现。

语言熟练度

使用不熟练的语言施测会影响说明理解、言语任务、与施测者的互动,甚至非言语任务表现。

视力、听力与动作可及性

感觉或动作要求可能压低分数,除非事先考虑并记录相关可及性需求。

焦虑与动机

测验焦虑、参与度低、完美主义或害怕失败都会影响速度和准确性。

教育与机会

正规教育、读写能力、丰富化经历以及对形式问题解决的熟悉度都会影响许多测验表现。

文化与经历

测验中的知识、沟通风格和隐含假设,对不同受测者未必同样熟悉。

先前接触

重测或练习相似材料会产生练习效应,尤其在间隔较短时。

测验条件

干扰、技术不良、时间压力、施测者行为和非标准施测都会产生影响。

个体化解释至关重要。 群体平均值不能诊断个体,也不能为针对种族、族裔、国籍、性别、残障、收入、居住环境或语言背景的刻板印象辩护。

便利措施与程序修改

某些便利措施能在保持目标构念不变的同时改善可及性;另一些修改则会改变任务,使标准常模可能不再准确适用。报告应记录改动内容、改动原因,以及修改如何影响解释。

高分、天赋与低分解释

高分与天赋识别

不存在统一的“天赋 IQ”。许多项目使用最高几个百分位附近的门槛,但当地定义、认可测试、年龄限制、分数时效、置信区间和所需辅助证据各不相同。门萨要求在获认可、正确施测且受监督的测试中进入最高 2%,并非采用一个统一 IQ 数值。

优先看百分位。 “在获认可测试中达到或超过第 98 百分位”比假定所有量表都采用同一个分数门槛更清楚。

低分与智力障碍

AAIDD 将智力障碍定义为智力功能和适应行为存在显著限制,并始于发展期。获得分约为或低于 70 时,可能需要开展审慎评估,但不能仅凭这个数字作出诊断。

  • 审查置信区间与测试效度。
  • 评估概念性、社会性和实践性适应技能。
  • 通过个人史与记录确认问题始于发展期。
  • 考虑语言、文化、残障、教育与可及性。
  • 关注所需支持,而不是把一个人简化为一个分数。

在线 IQ 测试:怎样才更可信?

在线施测并不自动意味着无效,面对面施测也不自动意味着质量很高。关键问题是标准化、常模、安全、身份核验、环境、无障碍、信度、效度与恰当解释。

较好的迹象

  • 明确说明测试目的和目标年龄范围
  • 透明说明常模样本与发布日期
  • 提供信度与效度证据
  • 提供百分位和置信信息
  • 需要证明材料时采用安全且受监督的施测
  • 明确说明限制与隐私做法

警示信号

  • 保证得到天才分数或即时诊断
  • 没有测试名称、常模或技术文档
  • 分数主要被设计用于诱导付款或分享结果
  • 用极少题目给出不切实际的高精度结果
  • 泄露或复制专业测试内容
  • 声称分数永久不变且能完整定义个人
不要用受保护的测试题进行练习。 接触真实题目、答案或高度相似的仿制内容,可能使未来结果失效,并损害测试公平与安全。

关于 IQ 量表的常见迷思

迷思

“百分位就是答对题目的百分比。”

百分位是常模群体中的排名。第 75 百分位不代表答对了 75% 的题。

迷思

“IQ 130 在每种测验中意义完全相同。”

量尺、常模、版本、置信区间和构念范围都不同。百分位和测验名称非常重要。

迷思

“一个数字能揭示所有类型的智力。”

IQ 测验抽样测量特定认知表现,并不能全面测量创造力、智慧、实际判断、动机、品格或专业能力。

迷思

“高分保证成功。”

现实结果取决于测验表现以外的许多个人、社会、教育、健康和机会因素。

迷思

“低分证明智力障碍。”

诊断要求在发展期出现智力功能和适应行为方面的限制。

迷思

“非言语测验不受文化影响。”

这类测验减少语言要求,但熟悉度、教育、视觉经验、动机和测验背景仍会影响表现。

迷思

“在线小测验等同于临床 IQ 测验。”

大多数在线小测验缺乏受控施测、安全材料、扎实常模和专业解释。

迷思

“学习泄露题目可以提高有效分数。”

使用受保护测验材料练习会威胁标准化、效度、公平及其未来临床用途。

迷思

“所得分数完全精确。”

每个测验分数都包含测量误差。报告应提供置信区间并讨论效度。

IQ 测试量表常见问题

平均 IQ 分数是多少?

在最常见的现代量表中,常模平均数为 100。接近 100 表示在按年龄划分的参照群体中心附近,而不是答对题目的百分比。

IQ 的标准差是多少?

许多当前智力综合分数使用标准差 15。一些历史测验或体系使用 16、24 或其他数值,因此测验名称和版本很重要。

IQ 115 位于哪个百分位?

在平均数 100、标准差 15 的正态量表上,115 高于平均数一个标准差,约位于第 84 百分位。

IQ 130 位于哪个百分位?

在平均数 100、标准差 15 的量表上,130 高于平均数两个标准差,约位于第 98 百分位。正式测验表可能采用不同舍入方式。

分数 100 恰好位于第 50 百分位吗?

在理想正态模型中是的。正式常模表可能使用离散分数转换和舍入,因此报告中可能显示相邻百分位。

为什么同一百分位可以对应不同 IQ 数字?

不同计分体系使用不同标准差。第 98 百分位大约对应 SD 15 量表的 130、SD 16 量表的 132,以及 SD 24 量表的 148。

什么是 z 分数?

z 分数表示结果高于或低于平均数多少个标准差。在 SD 15 的 IQ 量表上,z = (IQ − 100) ÷ 15。

什么是置信区间?

围绕所得分数、用于表达测量不确定性的范围。95% 区间比 90% 区间更宽,应结合测验手册和转介背景解释。

IQ 相同的两个人能力可以不同吗?

可以。一个人可能在多个领域表现均衡,另一个人可能言语推理很强,但加工速度或工作记忆较低。相同总分可概括不同的能力模式。

多少 IQ 算智力资优?

没有统一定义。有些项目使用约第 95、97 或 98 百分位;另一些则综合能力、学业成绩、创造力、教师证据和当地标准。

多少 IQ 能获得门萨资格?

门萨将资格定义为在获认可且正确施测、监考的智力测验中达到前 2%。具体数字取决于测验及其量尺。

IQ 低于 70 就能诊断智力障碍吗?

不是。智力障碍要求在智力功能和适应性行为方面存在显著限制,且起始于发育期。临床人员会综合考虑分数、置信区间、效度以及多种证据来源。

IQ 会随时间变化吗?

分数可能因发育、健康、教育、干预、测试条件、测量误差、练习效应和常模更新而变化。变化的幅度及其意义需要专业解读。

在线 IQ 测试有多准确?

质量差异很大。设计良好的在线研究或筛查工具或许能估计某些能力,但无人监督的测验通常无法替代标准化的专业评估或正式证明文件。

可以把旧分数换算成现代 IQ 吗?

如果已知原始量表的平均数和标准差,可以估算等效百分位;但这无法校正陈旧常模、不同构念、测验上限、版本差异或施测条件。

IQ 与指数分数有什么区别?

总体 IQ 综合分数概括受测者在所选任务上的广泛表现。指数分数则概括较窄的领域,例如言语理解、流体推理、视觉空间能力、工作记忆或加工速度,具体取决于所用测验。

为什么极端 IQ 分数的精确度较低?

常模样本在分布两端的人数较少,测验上限可能压缩表现,而原始分数的微小变化可能造成标准分数的较大差异。无论极高还是极低的数值,都应谨慎解读。

应该直接比较不同测验的分数吗?

只能谨慎比较。先比较百分位及其置信区间,再考虑所测构念、常模、年龄范围、版本、施测方式和各测验的用途。

IQ 量表术语表

适应性行为

日常生活中使用的概念性、社会性和实用性技能。这一方面在智力障碍评估中至关重要。

年龄常模

由同龄或年龄非常接近的人组成的比较群体。

综合分数

将多个分测验的表现合并后形成的标准分数。

置信区间

表示所得结果周围不确定性的分数范围。

离差智商

表示与同龄组平均水平相距多远的标准分数,通常采用平均数为 100 的量表。

下限

测验能够作出有意义区分的最低水平。

上限

测验能够作出有意义区分的最高水平。

FSIQ

全量表 IQ,即特定测验体系对广泛认知功能的总体综合估计。

指数分数

代表某一认知领域而非整套测验的综合分数。

常模

用于把原始表现换算为可解释分数的参照数据。

百分位排名

常模群体中分数等于或低于某一结果者所占的百分比,具体取整方式依测验而定。

练习效应

因熟悉或先前接触而产生的提高,而非目标能力的真实改变。

原始分数

通过常模表换算前获得的初始分数或得分点。

信度

分数在特定条件下的一致性或精确性。

测量标准误

对测量不精确所导致的预期分数变异的估计。

效度

支持为特定目的解释和使用分数的证据。

z 分数

平均数为 0、标准差为 1 的标准化数值。

专业与原始资料

图片来源: 阿尔弗雷德·比奈肖像及 1917 年美国陆军测试照片属公有领域。戴维·韦克斯勒照片由纽约大学医学院提供,并以 CC BY 4.0 许可使用。来源和许可页面可通过 Wikimedia Commons 查看。