Viktig orientering
Det finnes ingen universelt offisiell AGI-prøve
AGI er et forskningsbegrep med konkurrerende definisjoner. Denne siden erklærer ikke at noe navngitt system har – eller ikke har – krysset en magisk mållinje. Testen måler hvor nøye du tolker evidens om kapabiliteter. En reell systemvurdering ville kreve private oppgaver, menneskelige referansenivåer, oppgitte verktøy og kostnader, robusthetstesting og uavhengig replikasjon.
Evidens gjennomgått 08 2026
Interaktivt evalueringslaboratorium
AGI-evidenstesten
Hvert tilfelle beskriver en påstand om et KI-system. Velg den best underbygde konklusjonen – ikke den mest spennende eller mest skeptiske.
Hva svarene dine betyr: Dette tester hvor godt du forstår evaluering av AGI. En høy poengsum betyr at du i disse tilfellene skilte mellom smale prestasjoner, reell generalisering og slutninger uten tilstrekkelig grunnlag. Det måler ikke IQ-en din eller om du er en AGI.
Spør hva observasjonen faktisk målte før du godtar en bredere påstand.
«Én benchmark beviser AGI» og «all evaluering er ubrukelig» er vanligvis begge for bastante.
Din evaluatorprofil
Hva dette resultatet faktisk betyr
Det sertifiserer ikke et KI-system som AGI. Du vurderte fiktive evidenspåstander; ingen levende modell ble testet.
Start med det omstridte begrepet
Hva er kunstig generell intelligens?
En familie av definisjoner, ikke ett endelig avklart fenomen
De fleste definisjoner kombinerer generalitet – kompetanse på tvers av et bredt spekter av oppgaver – med ytelse, læring og en viss grad av autonomi. OpenAIs charter legger vekt på å prestere bedre enn mennesker på det meste av økonomisk verdifullt arbeid. DeepMinds rammeverk «Levels of AGI» skiller bredde fra dybde. François Chollet legger vekt på effektiv tilegnelse av ferdigheter på nye oppgaver.
Et flerdimensjonalt mål
Seks dimensjoner en AGI-påstand bør tåle
Ytelse uten generalitet
Sjakkmotorer og systemer for proteinstruktur kan være overmenneskelige på ett område uten å bli AGI.
Generellitet uten perfeksjon
Mennesker overfører kunnskap mellom områder til tross for feil. Å kreve bokstavelig perfeksjon setter listen høyere enn menneskelig generell intelligens.
Kapabilitet uten effektivitet
Et resultat kan få en annen betydning hvis det krever enorme mengder beregningskraft, tid eller menneskelig hjelp for hver oppgave.
Utover en ja/nei-etikett
AGI som nivåer av bredde og ytelse
Et innflytelsesrikt rammeverk behandler kapabilitet som en matrise. «Generell» dekker et bredt spekter av ikke-fysiske oppgaver; ytelsen sammenlignes med kompetente voksne.
Måleverktøy
Ingen benchmark måler hele sinnet
ARC-AGI
Retter seg mot regelinduksjon fra få eksempler og effektiv tilegnelse av ferdigheter på ukjente visuelle oppgaver. Verdifullt for fleksibel tilpasning, men ikke en fullstendig test av språk, agentkapasitet eller den virkelige verden.
Agentevalueringer
Måler om systemer kan planlegge, bruke verktøy, hente seg inn etter feil og fullføre prosjekter over stadig lengre tidshorisonter. Resultatene avhenger sterkt av støtteapparat og miljø.
Prøvesamlinger
Dekker mange fagområder effektivt, men kan belønne lagret kunnskap, prøveteknikk og tidligere eksponering mer enn rask læring.
Evidensstigen
Hva ville gjort en AGI-påstand overbevisende?
- 01
Forhåndsdefiner systemgrensen
Modell, minne, søk, kodekjøring, robotikk, prompter og menneskelig hjelp teller alle med.
- 02
Ta et representativt utvalg av oppgaver
En bred påstand krever representative oppgaver, ikke et håndplukket utvalg av høydepunkter.
- 03
Test læring på nye oppgaver
Mål hvor raskt systemet tilegner seg ferdigheter det ikke kunne forberede seg på under trening.
- 04
Mål pålitelighet
Gjennomsnittlig suksess, katastrofale feil, kalibrering, gjenoppretting og distribusjonsskift betyr alle noe.
- 05
Match menneskelige betingelser
Sammenlign tid, verktøy, instruksjoner, insentiver og tilgang til referansemateriale.
- 06
Skill kapabilitet fra sikkerhet
Etter å ha vist hva et system kan gjøre, må du teste om det fortsatt er kontrollerbart og nyttig.
Fra imitasjon til tilpasning
En kort historie om AGI-ideen
Turing omformulerer spørsmålet om maskinintelligens
Imitasjonsspillet gjorde observerbar atferd sentral, men samtaleimitasjon ble aldri en fullstendig definisjon av generell intelligens.
KI blir et forskningsfelt
Dartmouth-forslaget hevdet at læring og intelligens kanskje kunne beskrives så presist at maskiner kunne simulere dem.
Ekspertsystemer synliggjør problemet med smal intelligens
Høy ytelse på avgrensede områder viste at ekspertise kunne være svært kraftig uten å være generell eller tilpasningsdyktig.
Overmenneskelige milepæler innen smal KI
Deep Blue, Watson og AlphaGo overgikk sterke menneskelige utøvere i bestemte oppgaver, men forble svært ulike et menneske med generell kompetanse.
ARC retter søkelyset mot effektiv tilegnelse av ferdigheter
François Chollet foreslo å måle intelligens gjennom hvor effektivt systemer tilegner seg nye ferdigheter, og introduserte Abstraction and Reasoning Corpus.
Rammeverket «Levels of AGI»
Forskere ved Google DeepMind foreslo å klassifisere systemer etter både ytelsesdybde og oppgavebredde, fra begynnende til overmenneskelig nivå.
Benchmarker for resonnering og agenter utvikler seg
ARC-AGI og agentevalueringer over lange tidshorisonter tester i økende grad tilpasning, verktøybruk og interaktiv læring, samtidig som benchmarkmetning og kontaminering fortsatt er bekymringer.
Ingen universell sertifisering finnes
AGI er fortsatt et omstridt begrep. Enhver seriøs påstand må oppgi definisjon, omfang, menneskelig referansenivå, systemgrense og evidensstandard.
Vanskelige realiteter
Hvorfor AGI-måling er vanskelig
Udefinert oppgaveunivers
«Alle kognitive oppgaver» er ikke et endelig, nøytralt utvalg. Økonomiske og kulturelle valg former hva som blir regnet med.
Ugjennomsiktig trening
Uten å vite hva et system har sett, er det vanskelig å skille gjenhenting og memorering fra ny læring.
Bevegelig systemgrense
Verktøy og støtteapparat kan forandre ytelsen. Påstander om modellen alene og om hele systemet besvarer ulike spørsmål.
Bevegelig menneskelig referansenivå
Menneskelig ytelse avhenger av ekspertise, motivasjon, tid, samarbeid og tilgang til verktøy.
Sterk evidens kan vise
- Bred ytelse relativt til definerte menneskelige grupper
- Rask læring på private, nye oppgaver
- Robust overføring og autonomi over lange tidshorisonter
- Kjente kostnader, inngrep og feilmønstre
En AGI-etikett kan ikke automatisk vise
- Bevissthet eller moralsk status
- Samsvar med menneskelige verdier
- Fravær av katastrofale feil
- Lik kompetanse i enhver fysisk kontekst
Klare svar
Ofte stilte spørsmål om AGI
Hva står AGI for?
Artificial general intelligence, på norsk kunstig generell intelligens. Det viser vanligvis til KI med bred og tilpasningsdyktig kompetanse på tvers av mange oppgaver, fremfor eksepsjonell ytelse på ett smalt område. Definisjonene varierer når det gjelder autonomi, kroppslig forankring og hvilket menneskelig nivå som kreves.
Finnes det én offisiell AGI-test?
Nei. Det finnes ingen universelt autorisert prøve eller terskel. Forskere bruker benchmarksamlinger, menneskelige referansenivåer, læring på nye oppgaver, agentevalueringer og rammeverk som kombinerer bredde med ytelse.
Tester denne siden om en virkelig modell er AGI?
Nei. Den interaktive delen tester evnen din til å tolke evidenspåstander. Å sertifisere et virkelig system ville kreve tilgang til systemet, private evalueringer, dokumenterte betingelser og uavhengig replikasjon.
Er AGI oppnådd?
Det finnes ingen konsensus fordi definisjoner og terskler varierer. Sterke påstander bør angi den nøyaktige operasjonelle definisjonen, i stedet for å behandle AGI som en binær hendelse alle er enige om.
Kan én benchmark bevise AGI?
Ingen enkelt benchmark dekker bredden, robustheten, læringseffektiviteten, autonomien og påliteligheten i den virkelige verden som vanligvis forbindes med AGI. En benchmark kan gi viktig evidens om én komponent.
Er det å bestå Turing-testen det samme som AGI?
Nei. En Turing-test måler hvor vanskelig samtalepartnere er å skille fra hverandre under en bestemt protokoll. AGI-påstander gjelder vanligvis bredere kompetanse, læring og overføring.
Må AGI være bevisst?
Ikke etter de fleste operasjonelle kapabilitetsdefinisjoner. Bevissthet er et separat og uløst vitenskapelig og filosofisk spørsmål.
Trenger AGI en robotkropp?
Det avhenger av definisjonen. Noen rammeverk fokuserer uttrykkelig på ikke-fysiske kognitive oppgaver, mens andre hevder at menneskelignende generell kompetanse krever persepsjon og handling i den fysiske verden.
Hva er benchmarkkontaminering?
Det oppstår når evalueringsoppgaver eller nære varianter havner i treningsdata, finjusteringsdata eller data brukt til promptutvikling, slik at en høy poengsum kan gjenspeile tidligere eksponering fremfor generalisering til genuint nye problemer.
Hva er forskjellen mellom en modell og en agent?
En modell omformer inndata til utdata. Et agentbasert system kan kombinere en modell med minne, planleggingssløyfer, verktøy, eksterne data og evnen til å utføre handlinger over tid.
Hva kommer etter AGI?
Kunstig superintelligens, eller ASI, er et hypotetisk nivå der bred maskinintelligens langt overgår menneskelig kapabilitet på de fleste eller praktisk talt alle relevante kognitive områder.
Kan AGI være trygg, men upålitelig?
Sikkerhet og pålitelighet overlapper, men er ikke det samme. Et system kan være innrettet mot ønskede mål, men likevel feilutsatt, eller være teknisk kapabelt og pålitelig samtidig som det forfølger skadelige mål. Begge deler krever særskilt evidens.
Spor rammeverket
Primær- og forskningskilder
OpenAI Charter
En fremtredende økonomisk definisjon: svært autonome systemer som presterer bedre enn mennesker på det meste av økonomisk verdifullt arbeid.
Åpne kildenGoogle DeepMind: Levels of AGI
Et rammeverk basert på ytelsesdybde og kapabilitetsbredde.
Åpne kildenChollet: On the Measure of Intelligence
Definerer intelligens ut fra effektiv tilegnelse av ferdigheter og introduserer ARC.
Åpne kildenARC-AGI repository
Offisielle oppgaver, metoder og dokumentasjon for Abstraction and Reasoning Corpus.
Åpne kildenARC-AGI-3
Interaktiv benchmark for resonnering, utforskning, målforståelse og adaptive verdensmodeller.
Åpne kildenStanford AI Index
Årlig evidens om KI-kapabiliteter, benchmarktrender, investeringer, politikk og konsekvenser.
Åpne kildenNIST AI Risk Management Framework
Et strukturert rammeverk for styring, kartlegging, måling og håndtering av KI-risiko.
Åpne kildenTuring (1950)
Den opprinnelige artikkelen om imitasjonsspillet og et grunnleggende argument om maskinintelligens.
Åpne kilden
