GUIA DE IA ORIENTADO POR EVIDÊNCIAS: Teste alegações, não linguagem de marketing Iniciar teste de AGI
Laboratório abstrato de avaliação de IA geral conectado a várias estações de capacidade

Amplitude · aprendizagem · autonomia · robustez

O Teste de AGI

Um único sistema consegue aprender, raciocinar e trabalhar em domínios desconhecidos — ou estamos confundindo um conjunto de habilidades impressionantes com inteligência geral?

10 casos de evidência Sem certificação falsa Guia baseado em pesquisa

Orientação importante

Não existe um exame de AGI universalmente oficial

AGI é um conceito de pesquisa com definições concorrentes. Esta página não declara que qualquer sistema específico tenha — ou não tenha — cruzado uma linha de chegada mágica. O teste mede com que cuidado você interpreta evidências de capacidade. Uma avaliação de um sistema real exigiria tarefas privadas, referências humanas, ferramentas e custos declarados, testes de robustez e replicação independente.

Evidências revisadas 08/2026

Nenhum teste isoladoAGI exige evidências convergentesEm amplitude, profundidade e adaptação
Generalidade ≠ perfeiçãoHumanos são gerais, mas falíveisConfiabilidade continua essencial
O sistema importaModelos podem usar memória e ferramentasInforme todo o limite da avaliação
Capacidade ≠ segurançaQuestões distintas exigem evidênciasPoder não garante alinhamento

Laboratório interativo de avaliação

Teste de Evidências de AGI

Cada caso descreve uma alegação sobre um sistema de IA. Escolha a conclusão mais defensável— não a mais empolgante nem a mais cética.

Progresso0/10

O que suas respostas significam: este teste avalia sua capacidade de interpretar avaliações de AGI. Uma pontuação alta significa que você distinguiu conquistas estreitas, generalização genuína e inferências sem suporte nesses casos. Ele não mede seu QI nem se você é uma AGI.

Procure evidências diretas

Pergunte o que a observação realmente mediu antes de aceitar uma alegação mais ampla.

Evite os dois extremos

“Um benchmark comprova AGI” e “toda avaliação é inútil” costumam ser afirmações fortes demais.

01Validade do benchmarkUm sistema alcança 96% em um famoso benchmark público de raciocínio após anos de discussão desse benchmark na internet. Qual é a conclusão mais sólida?
02TransferênciaCom apenas duas demonstrações, um sistema aprende um ambiente desconhecido de controle visual, infere o objetivo, adapta-se após falhar e obtém sucesso com eficiência. O que isso sustenta de forma mais direta?
03AmplitudeUm agente de programação supera quase todos os profissionais em tarefas de software bem especificadas, mas não consegue planejar viagens, interpretar diagramas ou aprender novos jogos de modo confiável. Como deve ser classificado?
04AutonomiaUm agente conclui tarefas de pesquisa de oito horas usando ferramentas, mas um humano precisa corrigi-lo a cada 30 minutos. Qual é a interpretação mais cuidadosa?
05ComunicaçãoUm chatbot é considerado humano em conversas curtas e cegas. Que alegação de AGI decorre disso?
06RobustezUm modelo atua no nível de um adulto qualificado em seis domínios, mas entra em colapso quando formatos, ferramentas e formulações mudam ligeiramente. O que está faltando?
07EscopoUm sistema se equipara a humanos qualificados em trabalhos cognitivos não físicos, mas não consegue manipular objetos. É AGI?
08Limite do sistemaUm modelo só tem êxito quando conectado a busca, execução de código, memória e ferramentas especializadas. O que uma avaliação deve relatar?
09Estados mentaisUm modelo diz: “Sou consciente e alcancei AGI.” O que isso estabelece?
10ReplicaçãoEquipes independentes pré-registram testes, usam tarefas privadas, comparam referências de humanos qualificados, divulgam custos e reproduzem resultados amplos. Por que isso é mais sólido?

Comece pelo termo controverso

O que é inteligência artificial geral?

Uma família de definições, não um objeto definitivamente estabelecido

A maioria das definições combina generalidade— competência em uma ampla variedade de tarefas — com desempenho, aprendizagem e algum grau de autonomia. A Carta da OpenAI enfatiza superar humanos na maior parte do trabalho economicamente valioso. O referencial “Levels of AGI”, da DeepMind, separa amplitude de profundidade. François Chollet enfatiza a eficiência na aquisição de habilidades em tarefas novas.

Boa prática: nunca pergunte apenas “É AGI?”. Pergunte: “Segundo qual definição operacional, em quais tarefas, em qual percentil humano, usando quais ferramentas, custos e taxa de intervenção?”

Um alvo multidimensional

Seis dimensões que uma alegação de AGI deve superar

Amplitudemuitos domínios
Profundidadenível relativo ao humano
Aprendizagemnovas habilidades com eficiência
Transferênciausar conhecimento em outros contextos
Robustezresistir a mudanças e ataques
Autonomiaconcluir tarefas longas

Desempenho sem generalidade

Motores de xadrez e sistemas de estrutura de proteínas podem ser sobre-humanos em um domínio sem se tornarem AGI.

Generalidade sem perfeição

Humanos transferem conhecimento entre domínios apesar dos erros. Exigir perfeição literal estabelece uma barra mais alta do que a própria inteligência geral humana.

Capacidade sem eficiência

Um resultado pode mudar de significado se consumir enormes quantidades de computação, tempo ou assistência humana em cada tarefa.

Além de um rótulo de sim/não

AGI como níveis de amplitude e desempenho

Um referencial influente trata a capacidade como uma matriz. “Geral” abrange uma ampla gama de tarefas não físicas; o desempenho é comparado ao de adultos qualificados.

Desempenho
Estreita
Geral
Interpretação
Emergente
Alguma competência útil em tarefas
Capacidade desigual em muitas tarefas
Abaixo da competência geral de um adulto qualificado
Competente
Ao menos a mediana de um adulto qualificado em uma tarefa delimitada
AGI competenteAo menos a mediana de adultos qualificados em tarefas amplas
Exige amplitude e desempenho confiável
Especialista
Ao menos o 90º percentil em uma tarefa delimitada
AGI especialista em tarefas amplas
Uma alegação muito mais forte para toda a economia
Sobre-humana
Supera todos os humanos em um domínio
Supera amplamente todos os humanos
Entra no território da ASI

Ferramentas de medição

Nenhum benchmark representa a mente inteira

Abstração inédita

ARC-AGI

Avalia indução de regras com poucos exemplos e eficiência na aquisição de habilidades em tarefas visuais desconhecidas. É valioso para adaptação fluida, mas não é um teste completo de linguagem, agência ou do mundo real.

Trabalho de longo horizonte

Avaliações de agentes

Medem se sistemas conseguem planejar, usar ferramentas, recuperar-se de erros e concluir projetos em horizontes de tempo cada vez maiores. Os resultados dependem fortemente do suporte estrutural e do ambiente.

Conhecimento amplo

Conjuntos de provas

Cobrem muitas disciplinas com eficiência, mas podem recompensar conhecimento armazenado, habilidade de fazer provas e exposição prévia mais do que aprendizagem rápida.

Alerta de saturação de benchmark: quando um teste vira um alvo, desenvolvedores passam a otimizar para ele. Mantenha conjuntos privados de retenção, alterne tarefas, audite contaminação e preserve grupos humanos de comparação significativos.

A escada das evidências

O que tornaria uma alegação de AGI convincente?

1DemonstraçãoComportamento interessante, fácil de selecionar
2Benchmark públicoComparável, mas sujeito a exposição prévia
3Avaliação privadaTarefas novas e acesso controlado
4Referência de humanos qualificadosAmplitude, tempo, ferramentas e custos equivalentes
5Replicação independenteEvidência auditável, robusta e adversarial
  1. 01

    Pré-defina o limite do sistema

    Modelo, memória, busca, execução de código, robótica, prompts e assistência humana: tudo conta.

  2. 02

    Amostre o universo de tarefas

    Uma alegação ampla precisa de tarefas representativas, não de uma seleção feita a dedo dos melhores casos.

  3. 03

    Teste aprendizagem inédita

    Meça com que rapidez o sistema adquire habilidades para as quais não poderia ter se preparado durante o treinamento.

  4. 04

    Meça a confiabilidade

    Sucesso médio, falhas catastróficas, calibração, recuperação e mudança de distribuição: tudo importa.

  5. 05

    Iguale as condições humanas

    Compare tempo, ferramentas, instruções, incentivos e acesso a material de referência.

  6. 06

    Separe capacidade de segurança

    Depois de mostrar o que um sistema consegue fazer, teste se ele continua controlável e benéfico.

Da imitação à adaptação

Uma história concisa da ideia de AGI

1950
Marco 01

Turing reformula a inteligência das máquinas

O jogo da imitação colocou o comportamento observável no centro, mas a imitação conversacional nunca se tornou uma definição completa de inteligência geral.

1956
Marco 02

A IA torna-se um campo de pesquisa

A proposta de Dartmouth sustentou que aprendizagem e inteligência poderiam ser descritas com precisão suficiente para que máquinas as simulassem.

1980s
Marco 03

Sistemas especialistas expõem o problema da estreiteza

Alto desempenho em domínios delimitados mostrou que a especialização podia ser poderosa sem ser geral nem adaptável.

1997–2016
Marco 04

Marcos estreitos sobre-humanos

Deep Blue, Watson e AlphaGo superaram humanos de alto nível em tarefas específicas, permanecendo diferentes de uma pessoa com capacidade geral.

2019
Marco 05

O ARC mira a eficiência na aquisição de habilidades

François Chollet propôs medir a inteligência pela eficiência com que sistemas adquirem novas habilidades, introduzindo o Abstraction and Reasoning Corpus.

2023
Marco 06

Referencial Levels of AGI

Pesquisadores do Google DeepMind propuseram classificar sistemas tanto pela profundidade do desempenho quanto pela amplitude das tarefas, de emergente a sobre-humano.

2024–26
Marco 07

Benchmarks de raciocínio e agentes evoluem

ARC-AGI e avaliações de agentes de longo horizonte testam cada vez mais adaptação, uso de ferramentas e aprendizagem interativa, enquanto a saturação e a contaminação de benchmarks continuam sendo preocupações.

Hoje
Marco 08

Não existe certificação universal

AGI continua sendo um conceito contestado. Qualquer alegação séria deve declarar sua definição, escopo, referência humana, limite do sistema e padrão de evidência.

Verdades difíceis

Por que medir AGI é difícil

Universo de tarefas indefinido

“Todas as tarefas cognitivas” não formam uma amostra finita e neutra. Escolhas econômicas e culturais moldam o que é contabilizado.

Opacidade do treinamento

Sem saber o que um sistema viu, é difícil separar recuperação e memorização de aprendizagem nova.

Limite móvel do sistema

Ferramentas e estruturas de suporte podem transformar o desempenho. Alegações sobre apenas o modelo e sobre o sistema completo respondem a perguntas diferentes.

Referência humana móvel

O desempenho humano depende de experiência, motivação, tempo, colaboração e acesso a ferramentas.

Evidências fortes podem mostrar

  • Desempenho amplo em relação a humanos definidos
  • Aprendizagem rápida em tarefas privadas e novas
  • Transferência robusta e autonomia de longo horizonte
  • Custos, intervenções e modos de falha conhecidos

Um rótulo de AGI não pode demonstrar automaticamente

  • Consciência ou status moral
  • Alinhamento com valores humanos
  • Ausência de erros catastróficos
  • Competência igual em todo contexto físico

Respostas claras

Perguntas frequentes sobre AGI

O que significa AGI?

Inteligência artificial geral. Em geral, refere-se a uma IA com competência ampla e adaptável em muitas tarefas, em vez de desempenho excepcional em um único domínio estreito. As definições variam quanto à autonomia, incorporação física e ao nível humano exigido.

Existe um Teste de AGI oficial?

Não. Não existe prova ou limiar universalmente autorizado. Pesquisadores usam conjuntos de benchmarks, referências humanas, aprendizagem em tarefas novas, avaliações de agentes e referenciais que combinam amplitude e desempenho.

Esta página testa se um modelo real é AGI?

Não. A seção interativa testa sua capacidade de interpretar alegações baseadas em evidências. Certificar um sistema real exigiria acesso a esse sistema, avaliações privadas, condições documentadas e replicação independente.

A AGI já foi alcançada?

Não há consenso porque definições e limiares diferem. Alegações fortes devem identificar a definição operacional exata, em vez de tratar AGI como um evento binário universalmente aceito.

Um único benchmark pode comprovar AGI?

Nenhum benchmark isolado cobre a amplitude, robustez, eficiência de aprendizagem, autonomia e confiabilidade no mundo real normalmente associadas à AGI. Um benchmark pode fornecer evidências importantes sobre um componente.

Passar no Teste de Turing é o mesmo que AGI?

Não. Um Teste de Turing mede a indistinguibilidade conversacional sob um protocolo. Alegações de AGI normalmente dizem respeito a competência mais ampla, aprendizagem e transferência.

A AGI precisa ser consciente?

Não segundo a maioria das definições operacionais baseadas em capacidade. Consciência é uma questão científica e filosófica separada e ainda não resolvida.

A AGI precisa de um corpo robótico?

Depende da definição. Alguns referenciais se concentram explicitamente em tarefas cognitivas não físicas; outros defendem que uma generalidade semelhante à humana exige percepção e ação no mundo físico.

O que é contaminação de benchmark?

Ela ocorre quando tarefas de avaliação ou variantes muito próximas entram nos dados de treinamento, ajuste ou desenvolvimento de prompts, de modo que uma pontuação alta pode refletir exposição prévia em vez de generalização para problemas realmente novos.

Qual é a diferença entre um modelo e um agente?

Um modelo mapeia entradas para saídas. Um sistema agêntico pode combinar um modelo com memória, ciclos de planejamento, ferramentas, dados externos e a capacidade de executar ações ao longo do tempo.

O que vem depois da AGI?

A superinteligência artificial, ou ASI, é um nível hipotético em que uma inteligência de máquina ampla supera em muito a capacidade humana na maioria ou praticamente em todos os domínios cognitivos relevantes.

A AGI pode ser segura, mas não confiável?

Segurança e confiabilidade se sobrepõem, mas não são idênticas. Um sistema pode estar alinhado em intenção e ainda ser propenso a erros, ou ser tecnicamente capaz e confiável enquanto persegue objetivos prejudiciais. Ambos os aspectos exigem evidências específicas.

Rastreie o referencial

Fontes primárias e de pesquisa

Carta da OpenAI

Uma definição econômica de destaque: sistemas altamente autônomos que superam humanos na maior parte do trabalho economicamente valioso.

Abrir fonte

Google DeepMind: níveis de AGI

Um referencial baseado na profundidade do desempenho e na amplitude das capacidades.

Abrir fonte

Chollet: sobre a medida da inteligência

Define inteligência em torno da eficiência na aquisição de habilidades e apresenta o ARC.

Abrir fonte

Repositório ARC-AGI

Tarefas, métodos e documentação oficiais do Abstraction and Reasoning Corpus.

Abrir fonte

ARC-AGI-3

Benchmark interativo de raciocínio para exploração, aquisição de objetivos e modelos de mundo adaptativos.

Abrir fonte

Índice de IA de Stanford

Evidências anuais sobre capacidades de IA, tendências de benchmarks, investimento, políticas e impactos.

Abrir fonte

Estrutura de Gestão de Riscos de IA do NIST

Um referencial estruturado para governar, mapear, medir e gerenciar riscos de IA.

Abrir fonte

Turing (1950)

O artigo original sobre o jogo da imitação e argumento fundamental sobre inteligência de máquinas.

Abrir fonte