以证据为先的AI指南: 检验主张,而不是营销话术 开始AGI测试
连接多个能力站点的抽象通用AI评估实验室

广度 · 学习 · 自主性 · 稳健性

AGI测试

一个系统能否在陌生领域中学习、推理并完成工作——还是我们把一组令人印象深刻的技能误认为了通用智能?

10个证据案例 不提供虚假认证 基于研究的指南

重要说明

不存在普遍认可的官方AGI考试

AGI是一个存在多种竞争性定义的研究概念。 本页面不会宣称任何具名系统已经或尚未跨过某条神奇的终点线。测试衡量的是你解读能力证据时有多谨慎。真正的系统评估需要私有任务、人类基线、公开工具与成本、稳健性测试以及独立复现。

证据已审阅 2026年8月

不存在单一决定性测试AGI需要多方面证据相互印证覆盖广度、深度与适应能力
通用 ≠ 完美人类具有通用性,但也会犯错可靠性依然不可或缺
完整系统很重要模型可以使用记忆和工具应报告完整的评估边界
能力 ≠ 安全不同问题需要不同证据强大并不保证对齐

互动评估实验室

AGI证据测试

每个案例都描述了一项关于AI系统的主张。请选择 最站得住脚的结论——不是最激动人心的,也不是最怀疑一切的答案。

进度0/10

你的答案代表什么: 这里测试的是你评估AGI证据的素养。高分意味着,在这些案例中你能区分狭义成就、真正的泛化与缺乏依据的推断。它既不衡量你的IQ,也不判断你是不是AGI。

寻找直接证据

在接受更宽泛的结论之前,先问清观察结果实际测量了什么。

避免两个极端

“一个基准就能证明AGI”和“所有评估都毫无用处”通常都过于绝对。

01基准有效性某系统在一个著名的公开推理基准上取得96%的成绩,而该基准已在网上被讨论多年。最有力的结论是什么?
02迁移能力仅凭两个示例,一个系统就学会了陌生的视觉控制环境,推断出目标,在失败后调整策略并高效成功。这最直接支持什么结论?
03能力广度一个编程智能体在定义明确的软件任务上胜过几乎所有专业人士,却无法可靠地规划旅行、解读图表或学习新游戏。应如何分类?
04自主性一个智能体能够使用工具完成八小时的研究任务,但每30分钟都需要人类纠正一次。应如何谨慎解读?
05沟通能力一个聊天机器人在短时间的盲测对话中被判断为人类。由此可以得出什么AGI结论?
06稳健性一个模型在六个领域达到熟练成年人的水平,但当格式、工具和措辞稍有变化时性能就崩溃。它缺少什么?
07适用范围一个系统在非物理认知工作上可与熟练人类相匹敌,却无法操控物体。它算AGI吗?
08系统边界一个模型只有连接搜索、代码执行、记忆和专业工具时才能成功。评估报告应当说明什么?
09心理状态一个模型说:“我有意识,而且已经实现AGI。”这能证明什么?
10重复验证独立团队预先注册测试,使用私有任务,与熟练人类基线比较,披露成本,并复现广泛结果。为什么这种证据更强?

先从有争议的词开始

什么是人工通用智能?

它是一组定义,而不是一个已经定型的对象

大多数定义都结合了 通用性——即在广泛任务上的胜任能力——以及 表现水平学习能力,以及一定程度的 自主性。OpenAI宪章强调在大多数具有经济价值的工作上胜过人类。DeepMind的“AGI等级”框架将能力广度与深度分开。François Chollet则强调在新任务上的技能获取效率。

最佳做法: 不要只问“它是不是AGI?”而要问:“依据哪一种操作性定义?覆盖哪些任务?达到人类哪个百分位?使用哪些工具?成本和人工介入率是多少?”

一个多维目标

一项AGI主张应经受住的六个维度

广度多个领域
深度相对于人类的水平
学习高效获得新技能
迁移把知识用于其他情境
稳健性经受变化与攻击
自主性完成长时程任务

高表现但不通用

国际象棋引擎和蛋白质结构系统可以在某一领域达到超人水平,却并不会因此成为AGI。

通用但不完美

人类虽然会犯错,却能跨领域迁移。如果要求字面意义上的完美,门槛反而高于人类通用智能。

有能力但效率低

如果每项任务都消耗巨量算力、时间或人工协助,同一个结果的意义可能完全不同。

超越“是/否”标签

用广度与表现等级理解AGI

一个有影响力的框架把能力视为矩阵。“通用”覆盖广泛的非物理任务;表现则与熟练成年人进行比较。

表现等级
狭义
通用
解读
初现级
在部分任务上具备有用能力
在许多任务上能力不均衡
总体低于熟练成年人
胜任级
在有限任务上至少达到熟练成年人的中位水平
胜任级AGI在广泛任务上至少达到熟练成年人的中位水平
需要同时具备广度和可靠表现
专家级
在有限任务上至少达到第90百分位
在广泛任务上达到专家级的AGI
这是强得多的全经济范围主张
超人级
在一个领域超过所有人类
在广泛领域超过所有人类
进入ASI范畴

测量工具箱

没有哪个基准能代表整个心智能力

新颖抽象推理

ARC-AGI

聚焦陌生视觉任务中的少样本规则归纳与技能获取效率。它对衡量流体式适应很有价值,但并不是语言、智能体能力或现实世界能力的完整测试。

长时程工作

智能体评估

衡量系统能否规划、使用工具、从错误中恢复,并在越来越长的时间跨度上完成项目。结果高度依赖脚手架和环境。

广泛知识

考试型基准组合

能够高效覆盖多个学科,但可能更多奖励已有知识、应试技巧和先前接触,而不是快速学习。

基准饱和警告: 一旦测试本身成为优化目标,开发者就会针对它进行优化。应保留私有留出集、轮换任务、审计污染,并维持有意义的人类比较组。

证据阶梯

什么样的证据才能让AGI主张具有说服力?

1演示行为有趣,但容易被精心挑选
2公开基准可比较,但容易受先前曝光影响
3私有评估新任务与受控访问
4熟练人类基线广度、时间、工具和成本相匹配
5独立复现可审计、稳健并经受对抗性检验的证据
  1. 01

    预先定义系统边界

    模型、记忆、搜索、代码执行、机器人、提示和人工协助都应计入。

  2. 02

    对任务空间进行抽样

    宽泛主张需要具有代表性的任务,而不是精挑细选的高光合集。

  3. 03

    测试新任务学习

    衡量系统获取那些无法在训练阶段提前准备的新技能有多快。

  4. 04

    衡量可靠性

    平均成功率、灾难性失败、校准、恢复能力和分布变化都很重要。

  5. 05

    匹配人类条件

    比较时间、工具、指令、激励以及参考资料访问条件。

  6. 06

    把能力与安全分开

    证明系统能做什么之后,还要测试它是否仍然可控并能带来益处。

从模仿到适应

AGI概念简史

1950
里程碑 01

图灵重新框定机器智能问题

模仿游戏把可观察行为置于核心位置,但对话模仿从未成为通用智能的完整定义。

1956
里程碑 02

AI成为一个研究领域

达特茅斯提案认为,学习和智能或许可以被精确描述到足以让机器模拟的程度。

1980年代
里程碑 03

专家系统暴露狭窄性问题

在边界明确的领域取得高水平表现说明,专业能力可以非常强大,却未必通用或具有适应性。

1997–2016
里程碑 04

狭义超人能力的重要里程碑

深蓝、Watson和AlphaGo在特定任务上超越顶尖人类,但仍与具备通用能力的人不同。

2019
里程碑 05

ARC聚焦技能获取效率

François Chollet提出通过系统获取新技能的效率来衡量智能,并引入“抽象与推理语料库”(ARC)。

2023
里程碑 06

AGI等级框架

Google DeepMind研究人员提出同时依据能力深度和任务广度对系统分类,从初现级一直到超人级。

2024–26
里程碑 07

推理与智能体基准不断演进

ARC-AGI和长时程智能体评估越来越多地测试适应、工具使用和交互式学习,同时基准饱和与污染仍是重要问题。

今天
里程碑 08

不存在通用认证标准

AGI仍是一个存在争议的概念。任何严肃主张都必须明确其定义、范围、人类基线、系统边界和证据标准。

必须面对的事实

为什么AGI难以测量

任务空间没有明确边界

“所有认知任务”并不是一个有限且中立的样本。经济和文化选择会影响哪些任务被纳入。

训练数据不透明

如果不知道系统曾经看过什么,就很难区分检索与记忆和真正的新学习。

不断变化的系统边界

工具和脚手架可以彻底改变表现。纯模型主张与完整系统主张回答的是不同问题。

不断变化的人类基线

人类表现取决于专业程度、动机、时间、协作以及工具访问。

强证据可以说明

  • 相对于明确人群的广泛表现
  • 在私有新任务上的快速学习
  • 稳健迁移和长时程自主性
  • 已知成本、人工介入和失败模式

一个AGI标签不能自动说明

  • 意识或道德地位
  • 与人类价值观对齐
  • 不存在灾难性错误
  • 在每种物理情境中都同样胜任

清晰解答

AGI常见问题

AGI代表什么?

AGI即人工通用智能(Artificial General Intelligence)。它通常指在许多任务上具备广泛、可适应能力的AI,而不是只在某个狭窄领域表现卓越。不同定义对自主性、具身性以及所要求的人类能力水平有不同要求。

是否存在唯一官方的AGI测试?

没有。不存在普遍授权的考试或统一阈值。研究人员会使用基准组合、人类基线、新任务学习、智能体评估,以及同时考虑广度和表现水平的框架。

这个页面能测试某个真实模型是否属于AGI吗?

不能。互动部分测试的是你解读证据主张的能力。要认证一个真实系统,需要能够访问该系统,使用私有评估,记录测试条件,并进行独立复现。

AGI已经实现了吗?

目前没有共识,因为定义和阈值并不一致。严肃的主张应明确具体的操作性定义,而不是把AGI当成一个所有人都认同的二元事件。

单个基准能证明AGI吗?

单一基准无法覆盖通常与AGI相关的能力广度、稳健性、学习效率、自主性和现实世界可靠性。一个基准可以为其中某一方面提供重要证据。

通过图灵测试就等于AGI吗?

不等于。图灵测试是在特定协议下衡量对话上的不可区分性;AGI主张通常涉及更广泛的能力、学习和迁移。

AGI必须具有意识吗?

按照大多数基于能力的操作性定义,并不要求。意识是另一个尚未解决的科学与哲学问题。

AGI需要机器人身体吗?

取决于定义。有些框架明确聚焦非物理认知任务;另一些观点则认为,类似人类的通用性需要在物理世界中具备感知与行动能力。

什么是基准污染?

当评估任务或高度相似的变体进入训练、调优或提示开发数据时,就会发生基准污染。此时高分可能反映的是先前接触,而不是真正面对新问题时的泛化能力。

模型和智能体有什么区别?

模型把输入映射为输出。智能体系统则可能把模型与记忆、规划循环、工具、外部数据以及持续采取行动的能力组合起来。

AGI之后是什么?

人工超级智能(ASI)是假设中的更高层级:机器在大多数或几乎所有相关认知领域都广泛地大幅超过人类能力。

AGI可能安全但不可靠吗?

安全性与可靠性存在重叠,但并不相同。一个系统可能目标对齐却容易出错,也可能技术能力强且运行可靠,却追求有害目标。两者都需要专门证据。

追溯框架依据

一手资料与研究来源

OpenAI宪章

一个具有代表性的经济学定义:高度自主的系统在大多数具有经济价值的工作上胜过人类。

打开来源

Google DeepMind:AGI等级

一个依据能力表现深度与广度构建的框架。

打开来源

Chollet:《论智能的度量》

围绕技能获取效率定义智能,并提出ARC。

打开来源

ARC-AGI代码库

“抽象与推理语料库”的官方任务、方法和文档。

打开来源

ARC-AGI-3

用于探索、目标获取和自适应世界模型的交互式推理基准。

打开来源

斯坦福AI指数

关于AI能力、基准趋势、投资、政策和影响的年度证据汇总。

打开来源

NIST AI风险管理框架

用于治理、识别、衡量和管理AI风险的结构化框架。

打开来源

Turing(1950)

关于模仿游戏的原始论文,也是机器智能讨论的奠基性论述。

打开来源