重要说明
不存在普遍认可的官方AGI考试
AGI是一个存在多种竞争性定义的研究概念。 本页面不会宣称任何具名系统已经或尚未跨过某条神奇的终点线。测试衡量的是你解读能力证据时有多谨慎。真正的系统评估需要私有任务、人类基线、公开工具与成本、稳健性测试以及独立复现。
证据已审阅 2026年8月
互动评估实验室
AGI证据测试
每个案例都描述了一项关于AI系统的主张。请选择 最站得住脚的结论——不是最激动人心的,也不是最怀疑一切的答案。
你的答案代表什么: 这里测试的是你评估AGI证据的素养。高分意味着,在这些案例中你能区分狭义成就、真正的泛化与缺乏依据的推断。它既不衡量你的IQ,也不判断你是不是AGI。
在接受更宽泛的结论之前,先问清观察结果实际测量了什么。
“一个基准就能证明AGI”和“所有评估都毫无用处”通常都过于绝对。
你的评估者画像
这个结果真正意味着什么
它不会认证任何AI系统为AGI。 你评估的是虚构的证据陈述;没有测试任何真实模型。
先从有争议的词开始
什么是人工通用智能?
它是一组定义,而不是一个已经定型的对象
大多数定义都结合了 通用性——即在广泛任务上的胜任能力——以及 表现水平、学习能力,以及一定程度的 自主性。OpenAI宪章强调在大多数具有经济价值的工作上胜过人类。DeepMind的“AGI等级”框架将能力广度与深度分开。François Chollet则强调在新任务上的技能获取效率。
一个多维目标
一项AGI主张应经受住的六个维度
高表现但不通用
国际象棋引擎和蛋白质结构系统可以在某一领域达到超人水平,却并不会因此成为AGI。
通用但不完美
人类虽然会犯错,却能跨领域迁移。如果要求字面意义上的完美,门槛反而高于人类通用智能。
有能力但效率低
如果每项任务都消耗巨量算力、时间或人工协助,同一个结果的意义可能完全不同。
超越“是/否”标签
用广度与表现等级理解AGI
一个有影响力的框架把能力视为矩阵。“通用”覆盖广泛的非物理任务;表现则与熟练成年人进行比较。
测量工具箱
没有哪个基准能代表整个心智能力
ARC-AGI
聚焦陌生视觉任务中的少样本规则归纳与技能获取效率。它对衡量流体式适应很有价值,但并不是语言、智能体能力或现实世界能力的完整测试。
智能体评估
衡量系统能否规划、使用工具、从错误中恢复,并在越来越长的时间跨度上完成项目。结果高度依赖脚手架和环境。
考试型基准组合
能够高效覆盖多个学科,但可能更多奖励已有知识、应试技巧和先前接触,而不是快速学习。
证据阶梯
什么样的证据才能让AGI主张具有说服力?
- 01
预先定义系统边界
模型、记忆、搜索、代码执行、机器人、提示和人工协助都应计入。
- 02
对任务空间进行抽样
宽泛主张需要具有代表性的任务,而不是精挑细选的高光合集。
- 03
测试新任务学习
衡量系统获取那些无法在训练阶段提前准备的新技能有多快。
- 04
衡量可靠性
平均成功率、灾难性失败、校准、恢复能力和分布变化都很重要。
- 05
匹配人类条件
比较时间、工具、指令、激励以及参考资料访问条件。
- 06
把能力与安全分开
证明系统能做什么之后,还要测试它是否仍然可控并能带来益处。
从模仿到适应
AGI概念简史
图灵重新框定机器智能问题
模仿游戏把可观察行为置于核心位置,但对话模仿从未成为通用智能的完整定义。
AI成为一个研究领域
达特茅斯提案认为,学习和智能或许可以被精确描述到足以让机器模拟的程度。
专家系统暴露狭窄性问题
在边界明确的领域取得高水平表现说明,专业能力可以非常强大,却未必通用或具有适应性。
狭义超人能力的重要里程碑
深蓝、Watson和AlphaGo在特定任务上超越顶尖人类,但仍与具备通用能力的人不同。
ARC聚焦技能获取效率
François Chollet提出通过系统获取新技能的效率来衡量智能,并引入“抽象与推理语料库”(ARC)。
AGI等级框架
Google DeepMind研究人员提出同时依据能力深度和任务广度对系统分类,从初现级一直到超人级。
推理与智能体基准不断演进
ARC-AGI和长时程智能体评估越来越多地测试适应、工具使用和交互式学习,同时基准饱和与污染仍是重要问题。
不存在通用认证标准
AGI仍是一个存在争议的概念。任何严肃主张都必须明确其定义、范围、人类基线、系统边界和证据标准。
必须面对的事实
为什么AGI难以测量
任务空间没有明确边界
“所有认知任务”并不是一个有限且中立的样本。经济和文化选择会影响哪些任务被纳入。
训练数据不透明
如果不知道系统曾经看过什么,就很难区分检索与记忆和真正的新学习。
不断变化的系统边界
工具和脚手架可以彻底改变表现。纯模型主张与完整系统主张回答的是不同问题。
不断变化的人类基线
人类表现取决于专业程度、动机、时间、协作以及工具访问。
强证据可以说明
- 相对于明确人群的广泛表现
- 在私有新任务上的快速学习
- 稳健迁移和长时程自主性
- 已知成本、人工介入和失败模式
一个AGI标签不能自动说明
- 意识或道德地位
- 与人类价值观对齐
- 不存在灾难性错误
- 在每种物理情境中都同样胜任
清晰解答
AGI常见问题
AGI代表什么?
AGI即人工通用智能(Artificial General Intelligence)。它通常指在许多任务上具备广泛、可适应能力的AI,而不是只在某个狭窄领域表现卓越。不同定义对自主性、具身性以及所要求的人类能力水平有不同要求。
是否存在唯一官方的AGI测试?
没有。不存在普遍授权的考试或统一阈值。研究人员会使用基准组合、人类基线、新任务学习、智能体评估,以及同时考虑广度和表现水平的框架。
这个页面能测试某个真实模型是否属于AGI吗?
不能。互动部分测试的是你解读证据主张的能力。要认证一个真实系统,需要能够访问该系统,使用私有评估,记录测试条件,并进行独立复现。
AGI已经实现了吗?
目前没有共识,因为定义和阈值并不一致。严肃的主张应明确具体的操作性定义,而不是把AGI当成一个所有人都认同的二元事件。
单个基准能证明AGI吗?
单一基准无法覆盖通常与AGI相关的能力广度、稳健性、学习效率、自主性和现实世界可靠性。一个基准可以为其中某一方面提供重要证据。
通过图灵测试就等于AGI吗?
不等于。图灵测试是在特定协议下衡量对话上的不可区分性;AGI主张通常涉及更广泛的能力、学习和迁移。
AGI必须具有意识吗?
按照大多数基于能力的操作性定义,并不要求。意识是另一个尚未解决的科学与哲学问题。
AGI需要机器人身体吗?
取决于定义。有些框架明确聚焦非物理认知任务;另一些观点则认为,类似人类的通用性需要在物理世界中具备感知与行动能力。
什么是基准污染?
当评估任务或高度相似的变体进入训练、调优或提示开发数据时,就会发生基准污染。此时高分可能反映的是先前接触,而不是真正面对新问题时的泛化能力。
模型和智能体有什么区别?
模型把输入映射为输出。智能体系统则可能把模型与记忆、规划循环、工具、外部数据以及持续采取行动的能力组合起来。
AGI之后是什么?
人工超级智能(ASI)是假设中的更高层级:机器在大多数或几乎所有相关认知领域都广泛地大幅超过人类能力。
AGI可能安全但不可靠吗?
安全性与可靠性存在重叠,但并不相同。一个系统可能目标对齐却容易出错,也可能技术能力强且运行可靠,却追求有害目标。两者都需要专门证据。
追溯框架依据
一手资料与研究来源
OpenAI宪章
一个具有代表性的经济学定义:高度自主的系统在大多数具有经济价值的工作上胜过人类。
打开来源Google DeepMind:AGI等级
一个依据能力表现深度与广度构建的框架。
打开来源Chollet:《论智能的度量》
围绕技能获取效率定义智能,并提出ARC。
打开来源ARC-AGI代码库
“抽象与推理语料库”的官方任务、方法和文档。
打开来源ARC-AGI-3
用于探索、目标获取和自适应世界模型的交互式推理基准。
打开来源斯坦福AI指数
关于AI能力、基准趋势、投资、政策和影响的年度证据汇总。
打开来源NIST AI风险管理框架
用于治理、识别、衡量和管理AI风险的结构化框架。
打开来源Turing(1950)
关于模仿游戏的原始论文,也是机器智能讨论的奠基性论述。
打开来源
