EVIDENS FØRST – AI-GUIDE: Test påstande, ikke markedsføringssprog Start AGI-testen
Abstrakt laboratorium til evaluering af generel AI forbundet med mange kapacitetsstationer

Bredde · læring · autonomi · robusthed

AGI-testen

Kan ét system lære, ræsonnere og arbejde på tværs af ukendte domæner – eller forveksler vi en samling imponerende færdigheder med generel intelligens?

10 evidenscases Ingen falsk certificering Forskningsbaseret guide

Vigtig orientering

Der findes ingen universelt officiel AGI-prøve

AGI er et forskningsbegreb med konkurrerende definitioner. Denne side erklærer ikke, at et navngivet system har – eller ikke har – krydset en magisk målstreg. Testen måler, hvor omhyggeligt du fortolker evidens om kapacitet. En vurdering af et virkeligt system ville kræve private opgaver, menneskelige baselines, oplyste værktøjer og omkostninger, robusthedstest og uafhængig replikation.

Evidens gennemgået August 2026

Ingen enkelt testAGI kræver samstemmende evidensPå tværs af bredde, dybde og tilpasning
Generel ≠ perfektMennesker er generelle, men fejlbarligePålidelighed er stadig afgørende
Systemet betyder nogetModeller kan bruge hukommelse og værktøjerRapportér hele evalueringsgrænsen
Kapacitet ≠ sikkerhedSeparate spørgsmål kræver evidensKapacitet garanterer ikke afstemning

Interaktivt evaluatorlaboratorium

AGI-evidenstest

Hver case beskriver en påstand om et AI-system. Vælg den mest forsvarlige konklusion – ikke den mest spændende eller mest skeptiske.

Fremskridt0/10

Hvad dine svar betyder: Dette tester din forståelse af AGI-evaluering. En høj score betyder, at du i disse cases skelnede mellem snævre resultater, ægte generalisering og uunderbyggede slutninger. Det måler ikke din IQ eller om du er en AGI.

Se efter direkte evidens

Spørg, hvad observationen faktisk målte, før du accepterer en bredere påstand.

Undgå begge yderpunkter

“Ét benchmark beviser AGI” og “al evaluering er nyttesløs” er som regel begge for kategoriske.

01BenchmarkvaliditetEt system opnår 96 % på et kendt offentligt benchmark for ræsonnement efter flere års online debat om benchmarken. Hvad er den stærkeste konklusion?
02OverførselMed kun to demonstrationer lærer et system et ukendt visuelt kontrolmiljø, udleder målet, tilpasser sig efter fejl og lykkes effektivt. Hvad understøtter dette mest direkte?
03BreddeEn kodeagent klarer sig bedre end næsten alle professionelle på veldefinerede softwareopgaver, men kan ikke pålideligt planlægge rejser, fortolke diagrammer eller lære nye spil. Hvordan bør den klassificeres?
04AutonomiEn agent gennemfører otte timer lange forskningsopgaver ved hjælp af værktøjer, men et menneske skal korrigere den hvert 30. minut. Hvad er den forsigtige fortolkning?
05KommunikationEn chatbot bedømmes som menneskelig i korte blindede samtaler. Hvilken AGI-påstand følger heraf?
06RobusthedEn model præsterer på niveau med kompetente voksne i seks domæner, men bryder derefter sammen, når formater, værktøjer og formuleringer ændres en smule. Hvad mangler?
07OmfangEt system matcher kompetente mennesker på tværs af ikke-fysisk kognitivt arbejde, men kan ikke manipulere genstande. Er det AGI?
08SystemgrænseEn model lykkes kun, når den er koblet til søgning, kodekørsel, hukommelse og specialværktøjer. Hvad bør en evaluering rapportere?
09Mentale tilstandeEn model siger: “Jeg er bevidst og har opnået AGI.” Hvad fastslår det?
10ReplikationUafhængige hold forhåndsregistrerer tests, bruger private opgaver, sammenligner med baselines for kompetente mennesker, oplyser omkostninger og reproducerer brede resultater. Hvorfor er dette stærkere?

Begynd med det omstridte begreb

Hvad er kunstig generel intelligens?

En familie af definitioner, ikke ét fastlagt begreb

De fleste definitioner kombinerer generalitet – kompetence på tværs af en bred vifte af opgaver – med præstation, læring og en vis grad af autonomi. OpenAI's charter lægger vægt på at overgå mennesker i det meste økonomisk værdifulde arbejde. DeepMinds rammeværk “Levels of AGI” adskiller bredde fra dybde. François Chollet fremhæver effektiv tilegnelse af færdigheder på nye opgaver.

Bedste praksis: Spørg aldrig kun “Er det AGI?” Spørg: “Under hvilken operationel definition, på tværs af hvilke opgaver, ved hvilken menneskelig percentil og med hvilke værktøjer, omkostninger og indgrebsfrekvens?”

Et multidimensionelt mål

Seks dimensioner, som en AGI-påstand bør kunne bestå

Breddemange domæner
Dybdeniveau i forhold til mennesker
Læringnye færdigheder effektivt
Overførselbrug viden andre steder
Robusthedmodstå skift og angreb
Autonomifuldfør lange opgaver

Præstation uden generalitet

Skakmotorer og systemer til proteinstruktur kan være overmenneskelige i et domæne uden at blive AGI.

Generelitet uden perfektion

Mennesker overfører viden på tværs af domæner trods fejl. Et krav om bogstavelig perfektion sætter barren højere end menneskelig generel intelligens.

Kapacitet uden effektivitet

Et resultat kan ændre betydning, hvis hver opgave kræver enorme mængder beregningskraft, tid eller menneskelig assistance.

Ud over et ja/nej-mærkat

AGI som niveauer af bredde og præstation

Et indflydelsesrigt rammeværk behandler kapacitet som en matrix. “Generel” dækker en bred vifte af ikke-fysiske opgaver; præstation sammenlignes med kompetente voksne.

Præstation
Snæver
Generel
Fortolkning
Begyndende
En vis nyttig opgavekompetence
Ujævn evne på tværs af mange opgaver
Samlet under niveauet for en kompetent voksen
Kompetent
Mindst medianen for kompetente voksne i en afgrænset opgave
Kompetent AGIMindst medianen for kompetente voksne på tværs af brede opgaver
Kræver bredde plus pålidelig præstation
Ekspert
Mindst 90.-percentilen i en afgrænset opgave
Ekspert-AGI på tværs af brede opgaver
En langt stærkere påstand på tværs af økonomien
Overmenneskelig
Overgår alle mennesker i ét domæne
Overgår bredt alle mennesker
Bevæger sig ind på ASI-territorium

Måleværktøjer

Intet benchmark er hele intelligensen

Ny abstraktion

ARC-AGI

Måler few-shot-regelinduktion og effektiv tilegnelse af færdigheder på ukendte visuelle opgaver. Værdifuldt for fleksibel tilpasning, men ikke en fuldstændig test af sprog, agentkapacitet eller den virkelige verden.

Arbejde over lange tidshorisonter

Agentevalueringer

Måler, om systemer kan planlægge, bruge værktøjer, komme sig efter fejl og afslutte projekter over stadig længere tidshorisonter. Resultaterne afhænger i høj grad af stilladsering og miljø.

Bred viden

Prøvesamlinger

Dækker mange fagområder effektivt, men kan belønne lagret viden, teststrategi og tidligere eksponering mere end hurtig læring.

Advarsel om benchmarkmætning: Når en test bliver et mål, optimerer udviklere mod den. Bevar private holdout-sæt, roter opgaver, auditér kontaminering og oprethold meningsfulde menneskelige sammenligningsgrupper.

Evidensstigen

Hvad ville gøre en AGI-påstand overbevisende?

1DemonstrationInteressant adfærd, let at kuratere
2Offentligt benchmarkSammenligneligt, men udsat for eksponering
3Privat evalueringNye opgaver og kontrolleret adgang
4Baseline for kompetente menneskerBredde, tid, værktøjer og omkostninger matchet
5Uafhængig replikationEfterprøvbar, robust og adversarial evidens
  1. 01

    Fastlæg systemgrænsen på forhånd

    Model, hukommelse, søgning, kodekørsel, robotik, prompts og menneskelig assistance tæller alt sammen.

  2. 02

    Udtag et repræsentativt udsnit af opgaveuniverset

    En bred påstand kræver repræsentative opgaver, ikke et håndplukket højdepunktsudvalg.

  3. 03

    Test ny læring

    Mål, hvor hurtigt systemet tilegner sig færdigheder, som det ikke kunne forberede sig på under træningen.

  4. 04

    Mål pålidelighed

    Gennemsnitlig succes, katastrofale fejl, kalibrering, genopretning og fordelingsskift betyder alle noget.

  5. 05

    Match menneskelige betingelser

    Sammenlign tid, værktøjer, instruktioner, incitamenter og adgang til referencemateriale.

  6. 06

    Adskil kapacitet fra sikkerhed

    Når du har vist, hvad et system kan, skal du teste, om det fortsat er kontrollerbart og gavnligt.

Fra imitation til tilpasning

En kort historie om AGI-idéen

1950
Milepæl 01

Turing omformulerer maskinintelligens

Imitationsspillet gjorde observerbar adfærd central, men samtaleimitation blev aldrig en fuldstændig definition af generel intelligens.

1956
Milepæl 02

AI bliver et forskningsfelt

Dartmouth-forslaget argumenterede for, at læring og intelligens måske kunne beskrives præcist nok til, at maskiner kunne simulere dem.

1980s
Milepæl 03

Ekspertsystemer blotlægger problemet med snæverhed

Høj præstation i afgrænsede domæner viste, at ekspertise kunne være stærk uden at være generel eller tilpasningsdygtig.

1997–2016
Milepæl 04

Overmenneskelige, snævre milepæle

Deep Blue, Watson og AlphaGo overgik dygtige mennesker i specifikke opgaver, mens de stadig var langt fra en generelt kompetent person.

2019
Milepæl 05

ARC fokuserer på effektiv tilegnelse af færdigheder

François Chollet foreslog at måle intelligens ud fra, hvor effektivt systemer tilegner sig nye færdigheder, og introducerede Abstraction and Reasoning Corpus.

2023
Milepæl 06

Rammeværket Levels of AGI

Forskere fra Google DeepMind foreslog at klassificere systemer efter både præstationsdybde og opgavebredde, fra begyndende til overmenneskelig.

2024–26
Milepæl 07

Benchmarks for ræsonnement og agenter udvikler sig

ARC-AGI og evalueringer af agenter over lange tidshorisonter tester i stigende grad tilpasning, brug af værktøjer og interaktiv læring, mens benchmarkmætning og kontaminering fortsat er bekymringer.

I dag
Milepæl 08

Der findes ingen universel certificering

AGI er fortsat et omstridt begreb. Enhver seriøs påstand skal angive sin definition, sit omfang, sin menneskelige baseline, systemgrænse og evidensstandard.

Svære realiteter

Hvorfor AGI-måling er vanskelig

Udefineret opgaveunivers

“Alle kognitive opgaver” er ikke et endeligt, neutralt udsnit. Økonomiske og kulturelle valg former, hvad der tælles med.

Uigennemsigtig træning

Uden at vide, hvad et system har set, er det svært at skelne genfinding og memorering fra ny læring.

Bevægelig systemgrænse

Værktøjer og stilladsering kan ændre præstationen markant. Påstande om modellen alene og hele systemet besvarer forskellige spørgsmål.

Bevægelig menneskelig baseline

Menneskelig præstation afhænger af ekspertise, motivation, tid, samarbejde og adgang til værktøjer.

Stærk evidens kan vise

  • Bred præstation i forhold til definerede menneskelige sammenligningsgrupper
  • Hurtig læring på private, nye opgaver
  • Robust overførsel og autonomi over lange tidshorisonter
  • Kendte omkostninger, indgreb og fejltilstande

Et AGI-mærkat kan ikke automatisk vise

  • Bevidsthed eller moralsk status
  • Afstemning med menneskelige værdier
  • Fravær af katastrofale fejl
  • Lige stor kompetence i enhver fysisk kontekst

Klare svar

Ofte stillede spørgsmål om AGI

Hvad står AGI for?

Kunstig generel intelligens. Det henviser normalt til AI med bred, tilpasningsdygtig kompetence på tværs af mange opgaver frem for ekstraordinær præstation i ét snævert domæne. Definitionerne er forskellige med hensyn til autonomi, kropsliggørelse og det krævede menneskelige niveau.

Findes der én officiel AGI-test?

Nej. Der findes ingen universelt autoriseret prøve eller tærskel. Forskere bruger benchmarksamlinger, menneskelige baselines, læring af nye opgaver, agentevalueringer og rammeværk, der kombinerer bredde med præstation.

Tester denne side, om en virkelig model er AGI?

Nej. Den interaktive del tester din evne til at fortolke evidenspåstande. Certificering af et reelt system ville kræve adgang til systemet, private evalueringer, dokumenterede betingelser og uafhængig replikation.

Er AGI blevet opnået?

Der er ingen konsensus, fordi definitioner og tærskler varierer. Stærke påstande bør angive den præcise operationelle definition frem for at behandle AGI som en universelt accepteret binær begivenhed.

Kan ét benchmark bevise AGI?

Intet enkelt benchmark dækker den bredde, robusthed, læringseffektivitet, autonomi og pålidelighed i den virkelige verden, som normalt forbindes med AGI. Et benchmark kan give vigtig evidens om én komponent.

Er det at bestå Turing-testen det samme som AGI?

Nej. En Turing-test måler, om samtaler kan skelnes fra menneskers under en bestemt protokol. AGI-påstande handler typisk om bredere kompetence, læring og overførsel.

Skal AGI være bevidst?

Ikke ifølge de fleste operationelle kapacitetsdefinitioner. Bevidsthed er et særskilt og uløst videnskabeligt og filosofisk spørgsmål.

Har AGI brug for en robotkrop?

Det afhænger af definitionen. Nogle rammeværk fokuserer eksplicit på ikke-fysiske kognitive opgaver; andre hævder, at menneskelignende generalitet kræver perception og handling i den fysiske verden.

Hvad er benchmarkkontaminering?

Det opstår, når evalueringsopgaver eller nære varianter indgår i trænings-, finjusterings- eller promptudviklingsdata, så en høj score kan afspejle tidligere eksponering frem for generalisering til reelt nye problemer.

Hvad er forskellen på en model og en agent?

En model afbilder input til output. Et agentbaseret system kan kombinere en model med hukommelse, planlægningssløjfer, værktøjer, eksterne data og evnen til at udføre handlinger over tid.

Hvad kommer efter AGI?

Kunstig superintelligens, eller ASI, er et hypotetisk niveau, hvor bred maskinintelligens langt overstiger menneskelig kapacitet på de fleste eller stort set alle relevante kognitive domæner.

Kan AGI være sikker, men upålidelig?

Sikkerhed og pålidelighed overlapper, men er ikke identiske. Et system kan være afstemt i sin hensigt, men fejlbehæftet, eller teknisk kompetent og pålideligt, mens det forfølger skadelige mål. Begge dele kræver særskilt evidens.

Følg rammeværkets kilder

Primære kilder og forskningskilder

OpenAI Charter

En fremtrædende økonomisk definition: stærkt autonome systemer, der overgår mennesker i det meste økonomisk værdifulde arbejde.

Åbn kilde

Google DeepMind: Levels of AGI

Et rammeværk baseret på præstationsdybde og kapacitetsbredde.

Åbn kilde

Chollet: On the Measure of Intelligence

Definerer intelligens omkring effektiviteten i tilegnelsen af færdigheder og introducerer ARC.

Åbn kilde

ARC-AGI repository

Officielle opgaver, metoder og dokumentation for Abstraction and Reasoning Corpus.

Åbn kilde

ARC-AGI-3

Interaktivt benchmark for ræsonnement med fokus på udforskning, måltilegnelse og adaptive verdensmodeller.

Åbn kilde

Stanford AI Index

Årlig evidens om AI-kapaciteter, benchmarktendenser, investeringer, politik og konsekvenser.

Åbn kilde

NIST AI Risk Management Framework

Et struktureret rammeværk til styring, kortlægning, måling og håndtering af AI-risici.

Åbn kilde

Turing (1950)

Den oprindelige artikel om imitationsspillet og det grundlæggende argument om maskinintelligens.

Åbn kilde