专业指南: 了解标准化 IQ 测验 比较测验
代表韦克斯勒智力测验的抽象脑网络、分数轮廓和几何图形

完整实用指南

韦克斯勒 IQ 测验

全面了解 WAIS-5、WISC-V 和 WPPSI-IV:年龄范围、指数分数、百分位、历史、用途、局限、测验日准备,以及如何阅读专业报告。

年龄 2 岁 6 个月至 90 岁 11 个月 分数与百分位 测验的合乎伦理使用指南

什么是韦克斯勒 IQ 测验?

“韦克斯勒测验”并不是单一测验。 它是一套按年龄划分、由合格心理学家或具备相应资质的其他专业人员个别施测的智力量表。目前美国主要版本包括:面向幼儿的 WPPSI-IV、面向学龄儿童的 WISC-V,以及面向较大青少年和成人的 WAIS-5。

韦克斯勒评估提供的不只是一个数字。它可以给出全量表 IQ、描述广泛认知领域的指数分数、分测验量表分、百分位排名、置信区间,以及个人应对结构化任务方式的行为观察。最有用的解释会把这些结果与转介原因、发展和教育史、语言、残障、健康、行为及现实生活功能联系起来。

本页介绍这些测验,但不会复制受保护的题目、答案或安全测验材料。

最后更新: August 2026

100 综合分数常用平均数 参照群体平均数
15 综合分数常用标准差 一个标准差
10 分测验量表分常用平均数 分测验标准差通常为 3
3 按年龄划分的主要测验家族 WPPSI、WISC 与 WAIS

WAIS、WISC 还是 WPPSI:应使用哪种韦克斯勒测验?

受测者年龄是起点,但年龄范围重叠并不意味着选择可以自动完成。心理学家还可能考虑转介问题、预计能力水平、语言、注意、动作技能、发展水平、疲劳、既往测验,以及接收报告的学校、机构或组织的具体要求。

WPPSI-IV

学龄前和小学低年级儿童

韦克斯勒幼儿及学龄初期智力量表——第四版

年龄2 岁 6 个月–7 岁 7 个月
美国版2012

采用适合发育阶段、为年幼儿童设计的任务;两个主要年龄组使用不同的分测验要求。

典型核心用时: 核心分测验约 30–60 分钟,取决于年龄

出版商官方信息

WISC-V

学龄儿童和青少年

韦克斯勒儿童智力量表——第五版

年龄6 岁–16 岁 11 个月
美国版2014

可得出全量表 IQ、五项主要指数分数,以及在临床上有用时提供附加或补充分数。

典型核心用时: 核心分测验约 60 分钟;更完整的测验组合需要更长时间

出版商官方信息

WAIS-5

较大年龄的青少年和成人

韦克斯勒成人智力量表——第五版

年龄16 岁–90 岁 11 个月
美国版2024

当前美国成人版采用更新后的常模、五个主要认知领域和多项附加指数,以支持更有针对性的解释。

典型核心用时: 7 个分测验组成的 FSIQ 约需 45 分钟;10 个主要指数分测验约需 60 分钟

出版商官方信息
国际版本可能不同。 美国以外的年龄范围、出版年份、语言版本、常模样本和分数名称可能有所不同。请确认你所在国家使用的版本,以及接收机构认可的版本。

韦克斯勒 IQ 测验测量什么?

现代韦克斯勒解释围绕多个广泛认知领域展开。五领域结构在 WISC-V 和 WAIS-5 中尤其明显。具体分测验和指数会因版本与年龄而异,并非所有施测的分测验都计入全量表 IQ。

VCI — 言语理解

运用已学语言进行推理、解释概念、理解言语关系并提取词汇知识。

可能受到语言接触、教育、听力、表达性语言能力和文化经验影响。

VSI — 视觉空间

分析视觉细节、理解部分与整体的关系,并在头脑中构建或组织空间信息。

表现可能受到视力、动作要求、对材料不熟悉或时间压力影响。

FRI — 流体推理

在新问题中发现规则、关系、模式以及数量或概念原理。

反映结构化推理任务中的表现,而不是现实世界中所有形式的创造力或问题解决能力。

WMI — 工作记忆

在头脑中保持信息、进行心理重组,并维持足够长时间的注意力以作出准确回应。

可能受到注意力、焦虑、疲劳、听力、语言、药物、疼痛和测试时状态影响。

PSI — 加工速度

在时间限制内快速而准确地扫描、辨别和记录简单视觉信息。

动作速度、视力、完美主义、谨慎的工作风格、注意力以及对限时任务的熟悉程度都可能产生影响。

什么是分测验?

分测验是一组较短的任务,用来抽样测量某一类表现。根据版本不同,任务可能包括解释言语关系、解决视觉或数量模式、记忆并重新排列信息、搭建图案,或高效完成简单视觉作业。施测者会遵循标准化说明、时间、起始点、倒退规则、停止规则和计分标准。

由于这些材料受保密和版权保护,负责任的教育页面不应发布真实题目、答案、计分规则,或专门用于训练受测者的高度仿制题。

测验安全性很重要。 寻找泄露题目或用真实材料练习,可能使结果无效、造成不公平优势、损害未来的临床用途,并违反专业或出版商规定。

韦克斯勒 IQ 分数、百分位与标准差如何运作

综合分数通常经过标准化,使常模平均数为 100、标准差为 15。分测验量表分通常以平均数 10、标准差 3 表示。这样的转换使不同年龄的表现能够在同一量尺上比较。

显示 IQ 分数从 55 到 145、以 100 为中心的钟形曲线
示意性正态曲线换算。正式报告使用具体测验的常模表和舍入规则。

分数的三种表达方式

标准分数: 转换后的 IQ 或指数数字,例如 100 或 115。

百分位排名: 在按年龄建立的常模群体中的相对位置。第 84 百分位表示高于约 84% 的比较群体。

置信区间: 用于表达测量不确定性的范围。报告分数是估计值,并非绝对精确的数字。

示例: 综合分数 115 约高于平均数一个标准差,大致位于第 84 百分位。这并不意味着答对了 115 道题。
综合分数 近似 z 分数 估算百分位 常用描述
130 及以上 +2.00 或更高 第 98 百分位及以上 很高/极高
120–129 +1.33 至 +1.93 第 91–97 百分位 高/很高
110–119 +0.67 至 +1.27 第 75–90 百分位 较高平均
90–109 −0.67 至 +0.60 第 25–73 百分位 平均
80–89 −1.33 至 −0.73 第 9–23 百分位 较低平均
70–79 −2.00 至 −1.40 第 2–8 百分位 非常低/临界范围
69 及以下 低于 −2.00 约第 2 百分位及以下 极端低

描述性标签会因版本、报告软件、司法辖区和专业传统而异。应使用实际报告中印出的术语,不要把本表当作诊断分类系统。

为什么全量表 IQ 不总能说明全部情况

FSIQ 汇总特定分测验,但 FSIQ 相同的两个人可能具有非常不同的能力轮廓。一人可能在所有领域表现一致;另一人可能言语推理很强,但加工速度或工作记忆明显较低。其临床意义取决于差异的大小、罕见程度和可靠性、行为观察、功能史,以及总分是否足以代表整体轮廓。

若版本、转介问题和专业判断支持,也可能讨论一般能力指数、认知效能指数,以及非言语指数或降低动作要求的指数等附加综合分数。这些分数并不会自动取代 FSIQ。

如何阅读韦克斯勒测验报告

一份好的报告会说明要回答的问题,而不仅是一串数字。可分层阅读:

第 1 层

转介问题与背景

为什么提出测验申请?哪些发展、教育、医疗、语言和既往测验信息相关?

第 2 层

效度与行为

受测者的参与程度是否足够?是否存在感觉、动作、注意、焦虑、疲劳、用药或技术方面的问题?

第 3 层

FSIQ 与指数

出现了怎样的总体水平和模式?FSIQ 是否被认为具有代表性?置信区间有多宽?

第 4 层

分测验模式

哪些特定任务组相对较强或较弱?这些差异是否罕见到值得解释?

第 5 层

综合解释

认知结果与学业成绩、适应功能、注意、记忆、语言和现实生活证据如何相互印证?

第 6 层

建议

哪些实际支持、后续评估、合理便利、干预或教育策略有充分依据?

反馈会谈中值得提出的问题

  • 全量表 IQ 是否被认为有效并能代表此人的整体能力轮廓?
  • 哪些差异在统计上较为罕见,哪些在常模样本中很常见?
  • 注意、语言、焦虑、疲劳、疼痛、用药、视力、听力或动作要求可能在多大程度上影响结果?
  • 这些发现与学校、工作和日常生活中的实际困难有何关系?
  • 哪些建议优先级最高?由谁负责实施?

韦克斯勒测验用于什么?

学习与学校规划

常与学业成就测验配合使用,以了解优势、困难、资格问题和教学需要。

资优评估

可以为资优项目决策提供依据,但不同项目对可接受测验、分数门槛、截止日期和所需文件的规定各不相同。

神经心理评估

可作为更广泛测验组合的一部分,用于考察注意力、记忆、语言、执行功能、运动技能和情绪因素。

临床问题澄清

在临床人员评估发育、精神、神经或医学问题时,帮助描绘认知画像。

残障证明

与病史、功能证据、学业成就或适应性测量及接收机构要求结合时,可用于支持证明文件。

个人认知画像

成年人有时会为自我了解、教育规划,或取得某机构认可的证明文件而接受测试。

标准化施测 年龄常模 置信区间 结合背景解释 实用建议

仅靠该测验无法确定的事项

该测验可以为以下方面提供证据

  • 广泛认知功能及特定领域表现
  • 标准化条件下的相对优势与弱项
  • 需要进一步评估的问题
  • 与其他数据整合后形成教育或临床建议

该测验不能单独证明

  • ADHD、自闭症、阅读障碍或其他学习障碍
  • 在没有适应功能证据的情况下证明智力障碍
  • 未来成功、品格、创造力、智慧或动机
  • 一个人的自我价值或固定不变的终身潜能

专业韦克斯勒评估期间会发生什么?

  1. 转介与初次访谈
    临床专业人员会明确测验需要支持的决策,并审查相关病史、记录和既往评估。
  2. 选择测验
    心理学家选择适当的版本、年龄范围、语言、补充测量工具及合理便利。
  3. 标准化施测
    任务在受控环境中个别实施,并按需要安排休息和进行行为观察。
  4. 计分
    依据年龄常模将原始分数转换为分测验量表分、指数分数、百分位和置信区间。
  5. 解释
    施测者评估一致性、有意义的差异、基础率、效度、背景因素及其与其他数据的关系。
  6. 反馈与报告
    用实用语言说明结果,并提供符合转介目的的建议和文档。

如何准备,而不去“背测验”

  • 正常睡眠和进食;避免空腹、极度疲劳或匆忙赶到。
  • 携带平时使用的眼镜、助听器和其他辅助设备。
  • 除非开药医生与施测者另有共同安排,否则照常遵循用药指导。
  • 告知施测者任何可能影响表现的疾病、睡眠不足、疼痛、恐慌、近期创伤、物质使用、重大语言问题或其他情况。
  • 对儿童,可简单说明此次到访:他们会和心理学家一起进行各种思考活动,有些容易,有些具有挑战性。
  • 不要以达到某个分数为条件许诺奖励,也不要让受测者接触真实测验题目。

韦克斯勒智力量表的历史

戴维·韦克斯勒在 1955 年测验演示期间坐在桌前
戴维·韦克斯勒在 1955 年的一次测验演示中。纽约大学医学院;图片由 Wikimedia Commons 按 CC BY 4.0 许可分发。
1939

韦克斯勒–贝尔维智力量表

戴维·韦克斯勒推出了一套成人测验组合,将言语与非言语任务结合,并用基于年龄的常模比较成人,而不是只依赖心理年龄比率。

1949

首版 WISC

韦克斯勒儿童智力量表把这一方法调整用于学龄儿童。

1955

首版 WAIS

韦克斯勒成人智力量表取代了早期贝尔维版本,并成为主要成人智力测量工具。

1967

首版 WPPSI

幼儿及学龄初期量表把这一测验体系扩展到更年幼的儿童。

1974–2008

重大修订与常模更新

WISC-R、WISC-III、WISC-IV、WAIS-R、WAIS-III 和 WAIS-IV 更新了内容、常模、计分模型及临床解释。

2012

WPPSI-IV

第四版幼儿量表引入了修订后的年龄适配任务,并扩展了分数解释。

2014

WISC-V

第五版儿童量表围绕五个主要领域组织解释:言语理解、视觉空间、流体推理、工作记忆和加工速度。

2024

WAIS-5

美国成人量表第五版引入了更新常模、五项主要指数分数、更精简的 FSIQ 施测流程,以及更丰富的附加指数。

为什么韦克斯勒方法影响深远

早期比率 IQ 方法将“心理年龄”与实际年龄比较。韦克斯勒强调按年龄参照的离差分数,以及抽样多种表现形式的测验组合,而不是把智力简化为一种任务。后续修订逐步从旧有的言语—操作二分法转向更细致的指数分数和当代心理测量模型。

之所以需要修订,是因为语言、教育、技术、人口构成、测验熟悉度和群体表现都会随时间变化。更新常模有助于降低用过时比较群体解释当代受测者的风险。

公平、文化、语言与残障

任何认知测验都离不开背景。专业实践必须关注测验对特定用途和特定受测者是否有效。这包括语言熟练度、教育机会、文化经历、社会经济条件、感觉或动作障碍、神经多样性、健康、疲劳、焦虑、创伤、测验熟悉度,以及所作决定的后果。

语言与双语评估

使用不熟练的语言施测,可能降低语言介导任务的表现,也会改变整套测验中的说明理解、与施测者的互动及作答质量。胜任的评估者会考虑语言史和熟练度,在有合适版本时选择相应版本,并且不会把临时口译视为等同于标准化施测。

残障与合理便利

有些便利措施能提高可及性,但也会改变标准程序。报告应注明所作调整、解释使用理由,并说明其对结果解释的影响。目的不是强迫每个人跨越同样的障碍,而是在尽可能保持标准化的同时,对转介问题获得最有效的答案。

分数始终与评估背景相关。 不应根据种族、族裔、性别、居住地区、收入、残障或国籍,用一个分数对个人作刻板判断。群体统计不能替代个体评估。

如何选择合格的施测者

  • 核实其当前专业资质,以及你所在司法辖区要求的心理学执照。
  • 询问临床专业人员多常评估相关年龄组和转介问题。
  • 确认使用的版本是否合适,以及学校、项目、法院、机构或接收组织是否认可。
  • 询问费用是否包括初次访谈、施测、计分、反馈、书面报告、记录审查、学校咨询和后续服务。
  • 讨论语言、文化、残障可及性、远程测验、用药、睡眠、听力、视力、动作问题及既往接触测验材料的情况。
  • 避免选择保证目标 IQ、声称凭一个分数即可诊断,或在施测与解释不足的情况下出具报告的服务者。

费用、保险与学校测验

费用取决于地区、临床人员训练、测验组合、复杂程度、报告长度和目的。聚焦智力的评估通常没有心理教育或神经心理评估那么广泛。保险覆盖各不相同,且常取决于医疗必要性;资优测验和个人兴趣测验往往需要自费。

公立学校可能依据教育法律评估符合条件的学生,但学校评估服务于教育决策,未必采用家庭偏好的测验组合或私人报告格式。在支付私人测验费用前,应先确认必须作出什么决定,以及实际需要哪些文件。

常见问题

韦克斯勒测验等同于 IQ 测试吗?

韦克斯勒量表是专业智力测验,可得出通常称为 IQ 的总体分数,以及领域和分测验分数。其覆盖范围更广,标准化程度也比普通在线 IQ 测验严谨得多。

不同年龄应使用哪一种韦克斯勒测验?

在当前美国版本中,WPPSI-IV 适用于 2 岁 6 个月至 7 岁 7 个月,WISC-V 适用于 6 岁至 16 岁 11 个月,WAIS-5 适用于 16 岁至 90 岁 11 个月。在年龄重叠区间,需要根据转介问题、能力水平、语言、注意力和测验要求作出临床判断。

韦克斯勒 IQ 的平均分是多少?

综合分数通常标准化为平均数 100、标准差 15。这意味着常模样本中的大多数人得分接近 100,但任何分数都应结合置信区间和受测者的完整画像进行解释。

IQ 115 代表什么?

在平均数 100、标准差 15 的量表上,115 比平均数高一个标准差,约处于第 84 百分位。准确百分位和描述标签应以正式报告为准。

可以自己在线完成 WAIS、WISC 或 WPPSI 吗?

不可以。这些是受限的专业测验,须由合格专业人员在标准化条件下施测。某些情况下可以远程施测,但仍需训练有素的主试、安全的材料、合适的技术和临床判断。

可以为韦克斯勒测验备考吗?

不应使用受保护的测验内容进行练习。最佳准备很普通:保证睡眠和进食,带上所需眼镜或助听设备,除非临床人员另有指示,否则按医嘱服用处方药,并告知主试任何可能影响表现的因素。

这项测验能诊断 ADHD、自闭症、阅读障碍或学习障碍吗?

单凭它不能。韦克斯勒测验可能揭示有助于更广泛评估的模式,但诊断或教育资格通常还需要访谈、病史、观察、学业成就测验、行为评定、适应性功能信息和其他工具。

这项测验能诊断智力障碍吗?

智力障碍诊断要求有证据表明智力功能和适应性功能存在显著限制,且起始于发育期。仅凭 IQ 分数并不足够。

为什么全量表 IQ 有时会产生误导?

当各指数分数差异显著时,一个总体分数可能掩盖重要的优势和困难。心理学家会判断 FSIQ 是否适合解释,并在适当时讨论附加综合分数或领域分数。

百分位与答对百分比有什么区别?

百分位是相对于常模群体的排名。第 75 百分位表示表现等于或高于约 75% 的比较群体,并不表示答对了 75% 的题目。

韦克斯勒测验多久可以重测一次?

不存在适用于所有目的的统一间隔。重复测试可能产生练习效应,必须具有临床理由。学校、机构和组织可能各自规定结果有效期;因此,重测前应咨询评估者和接收机构。

完整评估需要多长时间?

核心认知测验通常约需 45–60 分钟,但初始访谈、休息、附加分测验、学业成就测验、行为测量、反馈会谈和报告撰写,可能使完整评估持续数小时或分多次进行。

韦克斯勒 IQ 测试费用是多少?

费用因地区、临床人员、目的、测验组合、报告长度、反馈服务和保险条款而差异很大。聚焦 IQ 的评估通常比完整心理教育或神经心理评估便宜。请索取书面服务项目和费用明细。

韦克斯勒分数在不同语言和文化中都有效吗?

语言、文化、教育、文化适应、残障以及对测试的熟悉程度都会影响表现。评估者应选择适当版本或语言版本,只在专业上合适时使用合格口译人员,记录所有调整,并谨慎解释结果。

家长或家人可以旁观测试吗?

通常不可以,因为旁观者可能改变行为、破坏标准化并暴露受保护材料。出于残障、安全、发育或法律原因,有时可以考虑例外,但如何维护测验效度和安全性由心理学家决定。

韦克斯勒测验术语表

综合分数

将多个分测验表现合并后形成的标准分数。FSIQ 和指数分数都属于综合分数。

置信区间

所得分数周围用于表达测量不确定性的范围。真实分数不被假定与报告中的单一数值完全相同。

FSIQ

全量表 IQ,即依据一组选定分测验对广泛总体智力功能作出的估计。

指数分数

概括某一认知领域表现的综合分数,例如言语理解或工作记忆。

常模

来自标准化样本的参照数据,用于将受测者与同龄或年龄接近者进行比较。

百分位排名

常模群体中分数等于或低于某一分数者所占的百分比,同时应注意具体测验的取整规则和专用表格。

原始分数

分测验通过年龄常模表换算前获得的初始数值。

量表分数

常模化的分测验分数。韦克斯勒分测验通常采用平均数 10、标准差 3 的量表。

标准分数

经过转换、具有指定平均数和标准差的分数,可用于跨年龄和不同测量工具进行比较。

测量标准误

对测量不精确所导致的预期分数变异的估计,用于构建置信区间。

基础率

某种分数差异或模式在常模样本或相关临床样本中出现的频率。

练习效应

由于先前接触、熟悉、记忆或学习而导致的分数提高,而不是潜在能力的真实变化。

专业与原始资料

本独立教育指南与 Pearson 无关联,也未获其认可。WAIS、WISC、WPPSI、Q-interactive 和 Q-global 均为各自权利人的商标。测验内容和计分材料属于专有且受限资料。