Vigtig orientering
Der findes ingen universelt officiel AGI-prøve
AGI er et forskningsbegreb med konkurrerende definitioner. Denne side erklærer ikke, at et navngivet system har – eller ikke har – krydset en magisk målstreg. Testen måler, hvor omhyggeligt du fortolker evidens om kapacitet. En vurdering af et virkeligt system ville kræve private opgaver, menneskelige baselines, oplyste værktøjer og omkostninger, robusthedstest og uafhængig replikation.
Evidens gennemgået August 2026
Interaktivt evaluatorlaboratorium
AGI-evidenstest
Hver case beskriver en påstand om et AI-system. Vælg den mest forsvarlige konklusion – ikke den mest spændende eller mest skeptiske.
Hvad dine svar betyder: Dette tester din forståelse af AGI-evaluering. En høj score betyder, at du i disse cases skelnede mellem snævre resultater, ægte generalisering og uunderbyggede slutninger. Det måler ikke din IQ eller om du er en AGI.
Spørg, hvad observationen faktisk målte, før du accepterer en bredere påstand.
“Ét benchmark beviser AGI” og “al evaluering er nyttesløs” er som regel begge for kategoriske.
Din evaluatorprofil
Hvad dette resultat faktisk betyder
Det certificerer ikke et AI-system som AGI. Du vurderede fiktive evidensudsagn; ingen aktiv model blev testet.
Begynd med det omstridte begreb
Hvad er kunstig generel intelligens?
En familie af definitioner, ikke ét fastlagt begreb
De fleste definitioner kombinerer generalitet – kompetence på tværs af en bred vifte af opgaver – med præstation, læring og en vis grad af autonomi. OpenAI's charter lægger vægt på at overgå mennesker i det meste økonomisk værdifulde arbejde. DeepMinds rammeværk “Levels of AGI” adskiller bredde fra dybde. François Chollet fremhæver effektiv tilegnelse af færdigheder på nye opgaver.
Et multidimensionelt mål
Seks dimensioner, som en AGI-påstand bør kunne bestå
Præstation uden generalitet
Skakmotorer og systemer til proteinstruktur kan være overmenneskelige i et domæne uden at blive AGI.
Generelitet uden perfektion
Mennesker overfører viden på tværs af domæner trods fejl. Et krav om bogstavelig perfektion sætter barren højere end menneskelig generel intelligens.
Kapacitet uden effektivitet
Et resultat kan ændre betydning, hvis hver opgave kræver enorme mængder beregningskraft, tid eller menneskelig assistance.
Ud over et ja/nej-mærkat
AGI som niveauer af bredde og præstation
Et indflydelsesrigt rammeværk behandler kapacitet som en matrix. “Generel” dækker en bred vifte af ikke-fysiske opgaver; præstation sammenlignes med kompetente voksne.
Måleværktøjer
Intet benchmark er hele intelligensen
ARC-AGI
Måler few-shot-regelinduktion og effektiv tilegnelse af færdigheder på ukendte visuelle opgaver. Værdifuldt for fleksibel tilpasning, men ikke en fuldstændig test af sprog, agentkapacitet eller den virkelige verden.
Agentevalueringer
Måler, om systemer kan planlægge, bruge værktøjer, komme sig efter fejl og afslutte projekter over stadig længere tidshorisonter. Resultaterne afhænger i høj grad af stilladsering og miljø.
Prøvesamlinger
Dækker mange fagområder effektivt, men kan belønne lagret viden, teststrategi og tidligere eksponering mere end hurtig læring.
Evidensstigen
Hvad ville gøre en AGI-påstand overbevisende?
- 01
Fastlæg systemgrænsen på forhånd
Model, hukommelse, søgning, kodekørsel, robotik, prompts og menneskelig assistance tæller alt sammen.
- 02
Udtag et repræsentativt udsnit af opgaveuniverset
En bred påstand kræver repræsentative opgaver, ikke et håndplukket højdepunktsudvalg.
- 03
Test ny læring
Mål, hvor hurtigt systemet tilegner sig færdigheder, som det ikke kunne forberede sig på under træningen.
- 04
Mål pålidelighed
Gennemsnitlig succes, katastrofale fejl, kalibrering, genopretning og fordelingsskift betyder alle noget.
- 05
Match menneskelige betingelser
Sammenlign tid, værktøjer, instruktioner, incitamenter og adgang til referencemateriale.
- 06
Adskil kapacitet fra sikkerhed
Når du har vist, hvad et system kan, skal du teste, om det fortsat er kontrollerbart og gavnligt.
Fra imitation til tilpasning
En kort historie om AGI-idéen
Turing omformulerer maskinintelligens
Imitationsspillet gjorde observerbar adfærd central, men samtaleimitation blev aldrig en fuldstændig definition af generel intelligens.
AI bliver et forskningsfelt
Dartmouth-forslaget argumenterede for, at læring og intelligens måske kunne beskrives præcist nok til, at maskiner kunne simulere dem.
Ekspertsystemer blotlægger problemet med snæverhed
Høj præstation i afgrænsede domæner viste, at ekspertise kunne være stærk uden at være generel eller tilpasningsdygtig.
Overmenneskelige, snævre milepæle
Deep Blue, Watson og AlphaGo overgik dygtige mennesker i specifikke opgaver, mens de stadig var langt fra en generelt kompetent person.
ARC fokuserer på effektiv tilegnelse af færdigheder
François Chollet foreslog at måle intelligens ud fra, hvor effektivt systemer tilegner sig nye færdigheder, og introducerede Abstraction and Reasoning Corpus.
Rammeværket Levels of AGI
Forskere fra Google DeepMind foreslog at klassificere systemer efter både præstationsdybde og opgavebredde, fra begyndende til overmenneskelig.
Benchmarks for ræsonnement og agenter udvikler sig
ARC-AGI og evalueringer af agenter over lange tidshorisonter tester i stigende grad tilpasning, brug af værktøjer og interaktiv læring, mens benchmarkmætning og kontaminering fortsat er bekymringer.
Der findes ingen universel certificering
AGI er fortsat et omstridt begreb. Enhver seriøs påstand skal angive sin definition, sit omfang, sin menneskelige baseline, systemgrænse og evidensstandard.
Svære realiteter
Hvorfor AGI-måling er vanskelig
Udefineret opgaveunivers
“Alle kognitive opgaver” er ikke et endeligt, neutralt udsnit. Økonomiske og kulturelle valg former, hvad der tælles med.
Uigennemsigtig træning
Uden at vide, hvad et system har set, er det svært at skelne genfinding og memorering fra ny læring.
Bevægelig systemgrænse
Værktøjer og stilladsering kan ændre præstationen markant. Påstande om modellen alene og hele systemet besvarer forskellige spørgsmål.
Bevægelig menneskelig baseline
Menneskelig præstation afhænger af ekspertise, motivation, tid, samarbejde og adgang til værktøjer.
Stærk evidens kan vise
- Bred præstation i forhold til definerede menneskelige sammenligningsgrupper
- Hurtig læring på private, nye opgaver
- Robust overførsel og autonomi over lange tidshorisonter
- Kendte omkostninger, indgreb og fejltilstande
Et AGI-mærkat kan ikke automatisk vise
- Bevidsthed eller moralsk status
- Afstemning med menneskelige værdier
- Fravær af katastrofale fejl
- Lige stor kompetence i enhver fysisk kontekst
Klare svar
Ofte stillede spørgsmål om AGI
Hvad står AGI for?
Kunstig generel intelligens. Det henviser normalt til AI med bred, tilpasningsdygtig kompetence på tværs af mange opgaver frem for ekstraordinær præstation i ét snævert domæne. Definitionerne er forskellige med hensyn til autonomi, kropsliggørelse og det krævede menneskelige niveau.
Findes der én officiel AGI-test?
Nej. Der findes ingen universelt autoriseret prøve eller tærskel. Forskere bruger benchmarksamlinger, menneskelige baselines, læring af nye opgaver, agentevalueringer og rammeværk, der kombinerer bredde med præstation.
Tester denne side, om en virkelig model er AGI?
Nej. Den interaktive del tester din evne til at fortolke evidenspåstande. Certificering af et reelt system ville kræve adgang til systemet, private evalueringer, dokumenterede betingelser og uafhængig replikation.
Er AGI blevet opnået?
Der er ingen konsensus, fordi definitioner og tærskler varierer. Stærke påstande bør angive den præcise operationelle definition frem for at behandle AGI som en universelt accepteret binær begivenhed.
Kan ét benchmark bevise AGI?
Intet enkelt benchmark dækker den bredde, robusthed, læringseffektivitet, autonomi og pålidelighed i den virkelige verden, som normalt forbindes med AGI. Et benchmark kan give vigtig evidens om én komponent.
Er det at bestå Turing-testen det samme som AGI?
Nej. En Turing-test måler, om samtaler kan skelnes fra menneskers under en bestemt protokol. AGI-påstande handler typisk om bredere kompetence, læring og overførsel.
Skal AGI være bevidst?
Ikke ifølge de fleste operationelle kapacitetsdefinitioner. Bevidsthed er et særskilt og uløst videnskabeligt og filosofisk spørgsmål.
Har AGI brug for en robotkrop?
Det afhænger af definitionen. Nogle rammeværk fokuserer eksplicit på ikke-fysiske kognitive opgaver; andre hævder, at menneskelignende generalitet kræver perception og handling i den fysiske verden.
Hvad er benchmarkkontaminering?
Det opstår, når evalueringsopgaver eller nære varianter indgår i trænings-, finjusterings- eller promptudviklingsdata, så en høj score kan afspejle tidligere eksponering frem for generalisering til reelt nye problemer.
Hvad er forskellen på en model og en agent?
En model afbilder input til output. Et agentbaseret system kan kombinere en model med hukommelse, planlægningssløjfer, værktøjer, eksterne data og evnen til at udføre handlinger over tid.
Hvad kommer efter AGI?
Kunstig superintelligens, eller ASI, er et hypotetisk niveau, hvor bred maskinintelligens langt overstiger menneskelig kapacitet på de fleste eller stort set alle relevante kognitive domæner.
Kan AGI være sikker, men upålidelig?
Sikkerhed og pålidelighed overlapper, men er ikke identiske. Et system kan være afstemt i sin hensigt, men fejlbehæftet, eller teknisk kompetent og pålideligt, mens det forfølger skadelige mål. Begge dele kræver særskilt evidens.
Følg rammeværkets kilder
Primære kilder og forskningskilder
OpenAI Charter
En fremtrædende økonomisk definition: stærkt autonome systemer, der overgår mennesker i det meste økonomisk værdifulde arbejde.
Åbn kildeGoogle DeepMind: Levels of AGI
Et rammeværk baseret på præstationsdybde og kapacitetsbredde.
Åbn kildeChollet: On the Measure of Intelligence
Definerer intelligens omkring effektiviteten i tilegnelsen af færdigheder og introducerer ARC.
Åbn kildeARC-AGI repository
Officielle opgaver, metoder og dokumentation for Abstraction and Reasoning Corpus.
Åbn kildeARC-AGI-3
Interaktivt benchmark for ræsonnement med fokus på udforskning, måltilegnelse og adaptive verdensmodeller.
Åbn kildeStanford AI Index
Årlig evidens om AI-kapaciteter, benchmarktendenser, investeringer, politik og konsekvenser.
Åbn kildeNIST AI Risk Management Framework
Et struktureret rammeværk til styring, kortlægning, måling og håndtering af AI-risici.
Åbn kildeTuring (1950)
Den oprindelige artikel om imitationsspillet og det grundlæggende argument om maskinintelligens.
Åbn kilde
