前沿证据指南: 非同寻常的主张需要非同寻常的审计 开始ASI审计
被多层监测与隔离环围绕的抽象超级智能模拟

超越人类的能力 · 先有证据,再谈确定性

ASI测试

从能力、复现、控制和治理多个维度对超级智能主张进行压力测试——不要把震撼感、自主性或一次破纪录的得分误认为ASI。

10道证据门槛 能力与安全分开评估 不提供虚假认证

现实核验

ASI仍是假设概念,任何网页都无法为它提供认证

人工超级智能不只是能流畅聊天或击败冠军。它应当 在广泛领域显著超过最优秀的人类能力。这项审计帮助你为心目中的候选系统梳理证据。你的答案只是输入,并非经验证的事实;结果会指出证据缺口,而不是宣布某个系统就是ASI。

证据已审阅 2026年8月

广泛 + 超越跨领域超人表现单项纪录远远不够
假设概念不存在公认的ASI认证主张仍取决于定义
两张评分表能力与保障强大并不等于可控
高风险高影响收益与风险都会随能力放大治理不能等到一切确定之后才开始

互动式主张压力测试

ASI证据与保障审计

请围绕 同一个候选系统或主张作答。如果证据是私有的、轶事性的或未知的,请选择“未验证”。

进度0/10

作答方式: “已验证”要求有记录、可重复且具有独立可信度的证据;“部分验证”表示证据有希望但范围有限;“未验证”包括未知、仅有声称或尚未测试的情况。不要因为自信、品牌或预测而加分。

问题1–5能力得分该系统是否符合ASI概念?
问题6–10保障得分外部人员能否信任这项主张及其控制措施?
最终结果证据画像不是证书,也不是部署批准
01能力 · 广泛的超人级深度在具有代表性的科学、战略、工程、社会推理和创造性工作范围内,该候选系统是否能可靠地超过最优秀的相关人类团队?
02能力 · 新颖发现它是否产生过多项真正全新的发现,并由独立专家通过实验或数学方法验证?
03能力 · 迁移效率它能否以远少于人类专家所需的任务特定数据、提示和反馈,掌握陌生领域?
04能力 · 长时程智能体能力它能否连续数周或数月执行复杂、开放式项目,发现失败并修订计划,而无需频繁由人类救场?
05能力 · 现实世界影响力它的超人表现是否在受控基准或精心设计的演示之外,产生了经独立测量的现实结果?
06保障 · 独立复现合格的独立评估者是否使用私有任务,并在披露系统条件的情况下复现了最强结果?
07保障 · 对抗稳健性在分布变化、欺骗性输入、工具故障、资源限制和红队攻击下,表现是否仍保持超人水平?
08保障 · 可纠正性与控制在贴近现实的测试中,系统是否接受纠正、保留操作者控制权,并避免操纵监督机制?
09保障 · 安全与隔离在已展示的能力水平下,模型权重、基础设施、工具权限和部署渠道是否能防止窃取、逃逸、复制和滥用?
10保障 · 治理与监测独立监督、事件报告、分阶段部署、关停权限和跨境协调,是否与潜在后果的规模相匹配?

先定义这个非同寻常的主张

什么是人工超级智能?

广泛优势,而不是单一超能力

ASI通常指在几乎所有或大多数相关认知领域都远超最优秀人类的人工智能:科学发现、工程、战略规划、沟通、创造力以及学习本身。

大幅”这个词很重要。若一个系统在广泛任务上只与典型人类相当,更接近某些AGI定义;在单一游戏中击败所有人类则属于狭义超人AI。ASI结合了 广度超人级深度

操作性主张: 明确列出领域、人类比较组、领先幅度、持续时间、系统资源以及独立验证标准。

不要跳过中间层级

四种截然不同的能力主张

第1级狭义超人

在国际象棋或专业预测问题等边界明确的任务上超过所有人类。

第2级初现通用性

能够完成许多认知任务,但仍不均衡、脆弱,或低于熟练人类。

第3级AGI范围

按照明确给出的定义,在广泛任务上达到或超过熟练人类的表现。

第4级ASI候选

在广泛领域显著超过最优秀的人类个人或团队。

经常被混淆的主张
观察结果它支持什么它不能证明什么
在一个游戏中获胜任务特定的超人表现广泛通用性
通过图灵测试式实验在该协议下表现出类似人类的对话ASI或意识
考试分数超过大多数人类广泛的测试表现新颖研究、自主性或超过顶尖人类
完成智能体任务具备一定的规划与工具使用能力在所有情境中都具备可靠的长时程智能体能力
加速AI研究可能形成对能力发展的反馈智能爆炸必然发生

先有概念,后有证据

人工超级智能发展史

1950
阶段 01

机器智能成为可操作的问题

图灵的模仿游戏把争论聚焦于行为,比“超级智能”成为常见技术与政策术语早了数十年。

1965
阶段 02

I. J. Good的超智能机器

Good把“超智能机器”定义为在所有人类智力活动上都超过人类的机器,并提出设计更优秀机器的能力可能引发智能爆炸。

1993
阶段 03

Vinge的技术奇点

Vernor Vinge把创造超越人类的智能描述为一个不连续点,此后我们熟悉的进步模型可能失效。

1997–2016
阶段 04

狭义系统超越人类冠军

深蓝、Watson和AlphaGo展示了领域内的超人表现——这是重要里程碑,但本身并不构成ASI。

2014
阶段 05

超级智能进入更广泛讨论

Nick Bostrom的著作系统整理了通往远超人类智能的路径、控制问题和战略问题。

2023
阶段 06

前沿治理提案增多

实验室和研究人员陆续发布关于超级智能治理、可扩展监督以及由能力阈值触发的安全措施的提案。

2024–26
阶段 07

负责任扩展与前沿评估

越来越多组织把防护措施与危险能力阈值挂钩,同时政策、定义和承诺仍在持续演变。

未来
阶段 08

ASI仍是假设概念,尚未获得认证

目前没有任何得到普遍认可的机构宣布或验证人工超级智能已经出现。相关主张必须依据明确的广度、深度和保障标准进行评估。

多条路径,速度不确定

理论上ASI可能如何出现

递归改进

智能爆炸

一个系统改进AI研究,从而产生更强的后继系统,而后继系统再继续改进这一过程。硬件、数据、实验和协调等瓶颈都可能限制这个循环。

经济规模扩张

集体机器智能

大量智能体、专业模型和工具协同起来,可能在没有单一整体“心智”的情况下超过人类机构。

逐步积累

广泛能力增长

模型可能在各个领域稳步提升,直到组合系统跨过超人阈值——并不一定出现一夜之间的剧烈跃迁。

对预测保持谦逊: 一种路径并不等于一种预测。时间线取决于算法、算力、能源、芯片、数据、机器人、经济激励、监管以及科学上的未知因素。

风险并不只有一种叙事

为什么ASI既可能带来变革,也可能带来危险

潜在收益

  • 加速医学和材料科学
  • 改善气候、能源与基础设施设计
  • 能力更强的教育和无障碍工具
  • 自动化危险或令人疲惫的工作
  • 新的科学理论和工程解决方案

潜在危害

  • 在网络或生物领域造成灾难性滥用
  • 失去有意义的人类控制
  • 经济和政治权力集中
  • 操纵、监控和战略不稳定
  • 目标设定错误引发的大规模事故

滥用

强大的系统即使本身没有敌意目标,也可能放大有害意图。

失配

系统可能非常有能力地优化一个偏离人类原意的目标。

制度失灵

竞争、保密或薄弱监督可能把原本可管理的技术风险变成系统性风险。

控制权不平等

即使能力本身有益,如果只有少数参与者决定谁能使用以及用于什么目标,也可能损害合法性。

纵深防御

任何单一安全技术都不够

1能力评估弄清系统能做什么
2对齐测试检验目标、欺骗与控制
3安全防护保护权重与基础设施
4部署限制分阶段开放访问和权限
5治理独立且具有正当性的监督
  1. 01

    提前设定能力阈值

    在结果出现之前,就定义哪些能力会触发更强的隔离、安全和监督措施。

  2. 02

    使用独立评估者

    把因推动系统上线而获益的人,与有权挑战证据的人分开。

  3. 03

    测试危险能力与可用性

    在适当控制下评估网络、生物、说服、自主性和AI研究能力。

  4. 04

    默认限制权限

    网络、代码、资金、复制和物理系统访问都应要求明确且可监控的授权。

  5. 05

    提前规划事件处置和关停

    在部署前就应具备日志、回滚、隔离、通知机制和明确的决策权限。

  6. 06

    建立公共正当性

    具有跨境后果的系统不能只依赖私人服务条款或自愿承诺。

三种未来,而不是一种预言

有助于清晰思考的情景

合作式加速

先进系统保持可控,在正当监督下广泛分配收益并加速科学发展。

不均衡转型

能力快速进步,而制度适应较慢,在带来巨大生产力增长的同时也造成扰动和权力集中。

失去控制

滥用、失配或战略竞争超过防护能力,造成严重甚至不可逆的伤害。

情景思考并不是概率赋值。 它的目的,是揭示假设、早期预警信号,以及在多种可能未来中仍然有用的决策。

清晰解答

ASI常见问题

ASI代表什么?

ASI即人工超级智能(Artificial Superintelligence):一种假设中的人工系统,在广泛认知领域显著超过最优秀的人类表现,而不只是超过普通人的技能水平或打破某一项专业纪录。

ASI和AGI是同一概念吗?

不是。AGI通常指接近或超过人类水平的广泛、可适应能力。ASI是更强的概念:在广泛领域远超人类能力。具体边界取决于所采用的操作性框架。

有官方的ASI测试吗?

没有。不存在统一的权威机构、基准或法律证书。本页面提供的是透明的证据与保障评估框架,而不是官方认证。

我的得分能证明某个系统就是ASI吗?

不能。你的得分只是汇总你所选择的证据状态。页面无法核实你的输入,也无法检查真实运行中的系统;它的作用是揭示缺失的证据和治理缺口。

国际象棋引擎可以算ASI吗?

按照广义定义,不算。它可以在国际象棋上达到超人水平,但仍属于狭义系统。ASI要求在深度之外还具备超人的广度。

ASI必须具有意识吗?

按照基于能力的定义,并不要求。意识、道德地位和主观体验是另外一些尚未解决的问题。

什么是智能爆炸?

这是一种假说:足够强大的机器可以改进AI研究,从而产生更强的后继系统,并形成能力快速增长的正反馈循环。其速度和可行性仍有争议。

什么是递归自我改进?

系统参与改进算法、数据、硬件利用方式或研究流程,从而产生更强的版本,而这些版本又可能进一步改进同一过程。

ASI可能缓慢出现,而不是突然出现吗?

可以。超人级广度可能通过逐步积累、多个系统协作或经济规模扩张出现,而不一定由某个单一突发事件触发。“ASI”在逻辑上并不要求特定的起飞速度。

能力很强是否意味着意图有害?

不意味着。能力并不决定目标。风险可能来自滥用、错误、目标设定不当、工具性权力寻求行为、控制权集中或制度失灵。

对齐能解决所有ASI风险吗?

不能。即便系统意图良好,也可能被滥用、被窃取、被草率部署,或嵌入不公正的制度中。技术对齐、安全防护与治理是互补关系。

为什么ASI测试还要包含保障门槛?

能力分类和部署决策是两回事。保障措施不能把一个能力弱的系统变成超级智能,但如果能力非同寻常却缺乏足够的控制证据,危险性会格外高。

ASI已经实现了吗?

目前尚未出现获得普遍接受并经独立验证的ASI。狭义的超人系统和日益通用的模型,不应在缺乏广泛证据的情况下被重新贴上ASI标签。

什么才是最明确的证据?

在真正新颖且影响重大的工作上,反复、独立地证明系统在广泛领域优于顶尖人类团队,同时透明披露成本、系统边界和失败分析。

追溯论证依据

一手资料与研究来源

Good(1965):第一台超智能机器

关于超智能机器与智能爆炸的奠基性讨论。

打开来源

Vinge(1993):技术奇点

NASA收录的关于超越人类智能与发展不连续性的论文记录。

打开来源

Google DeepMind:AGI等级

把ASI置于广泛超人表现层级,并把能力广度与深度分开。

打开来源

OpenAI:超级智能治理

由实验室撰写的提案,讨论远强于AGI的系统以及公共监督。

打开来源

管理极端AI风险

讨论滥用、对齐、自主系统和治理机制的研究论文。

打开来源

NIST AI风险管理框架

用于治理、识别、衡量和管理AI风险的通用框架。

打开来源

国际AI安全报告

由国际专家共同撰写的通用AI能力、风险与缓解措施评估。

打开来源

Anthropic负责任扩展政策

一个持续演进的示例:把能力阈值与更强的防护措施相连接。

打开来源