EVIDENSBASERT KI-GUIDE: Test påstander, ikke markedsføringsspråk Start AGI-testen
Abstrakt laboratorium for evaluering av generell KI, koblet til mange kapabilitetsstasjoner

Bredde · læring · autonomi · robusthet

AGI-testen

Kan ett system lære, resonnere og arbeide på tvers av ukjente områder – eller forveksler vi en samling imponerende ferdigheter med generell intelligens?

10 evidenstilfeller Ingen falsk sertifisering Forskningsforankret veiledning

Viktig orientering

Det finnes ingen universelt offisiell AGI-prøve

AGI er et forskningsbegrep med konkurrerende definisjoner. Denne siden erklærer ikke at noe navngitt system har – eller ikke har – krysset en magisk mållinje. Testen måler hvor nøye du tolker evidens om kapabiliteter. En reell systemvurdering ville kreve private oppgaver, menneskelige referansenivåer, oppgitte verktøy og kostnader, robusthetstesting og uavhengig replikasjon.

Evidens gjennomgått 08 2026

Ingen enkelt testAGI krever sammenfallende evidensPå tvers av bredde, dybde og tilpasning
Generell ≠ perfektMennesker er generelle, men feilbarligePålitelighet er fortsatt avgjørende
Systemet betyr noeModeller kan bruke minne og verktøyOppgi hele evalueringsgrensen
Kapabilitet ≠ sikkerhetSeparate spørsmål krever evidensKraft garanterer ikke samsvar med menneskelige mål

Interaktivt evalueringslaboratorium

AGI-evidenstesten

Hvert tilfelle beskriver en påstand om et KI-system. Velg den best underbygde konklusjonen – ikke den mest spennende eller mest skeptiske.

Fremdrift0/10

Hva svarene dine betyr: Dette tester hvor godt du forstår evaluering av AGI. En høy poengsum betyr at du i disse tilfellene skilte mellom smale prestasjoner, reell generalisering og slutninger uten tilstrekkelig grunnlag. Det måler ikke IQ-en din eller om du er en AGI.

Se etter direkte evidens

Spør hva observasjonen faktisk målte før du godtar en bredere påstand.

Unngå begge ytterpunktene

«Én benchmark beviser AGI» og «all evaluering er ubrukelig» er vanligvis begge for bastante.

01Benchmarkens gyldighetEt system oppnår 96 % på en kjent offentlig benchmark for resonnering etter flere år med omfattende omtale av benchmarken på nettet. Hva er den best underbygde konklusjonen?
02OverføringMed bare to demonstrasjoner lærer et system et ukjent visuelt styringsmiljø, utleder målet, tilpasser seg etter feil og lykkes effektivt. Hva støtter dette mest direkte?
03BreddeEn kodeagent presterer bedre enn nesten alle fagfolk på klart spesifiserte programvareoppgaver, men kan ikke pålitelig planlegge reiser, tolke diagrammer eller lære nye spill. Hvordan bør den klassifiseres?
04AutonomiEn agent fullfører forskningsoppgaver som varer i åtte timer ved hjelp av verktøy, men et menneske må korrigere den hvert 30. minutt. Hva er den forsvarlige tolkningen?
05KommunikasjonEn chatbot blir vurdert som menneskelig i korte, blindede samtaler. Hvilken AGI-påstand følger av dette?
06RobusthetEn modell presterer på nivå med kompetente voksne på seks områder, men bryter sammen når formater, verktøy og formuleringer endres litt. Hva mangler?
07OmfangEt system matcher kompetente mennesker på tvers av ikke-fysisk kognitivt arbeid, men kan ikke manipulere fysiske objekter. Er det AGI?
08SystemgrenseEn modell lykkes bare når den er koblet til søk, kodekjøring, minne og spesialistverktøy. Hva bør en evaluering rapportere?
09Mentale tilstanderEn modell sier: «Jeg er bevisst og har oppnådd AGI.» Hva fastslår dette?
10ReplikasjonUavhengige team forhåndsregistrerer tester, bruker private oppgaver, sammenligner med referansenivåer for kompetente mennesker, oppgir kostnader og reproduserer brede resultater. Hvorfor er dette sterkere evidens?

Start med det omstridte begrepet

Hva er kunstig generell intelligens?

En familie av definisjoner, ikke ett endelig avklart fenomen

De fleste definisjoner kombinerer generalitet – kompetanse på tvers av et bredt spekter av oppgaver – med ytelse, læring og en viss grad av autonomi. OpenAIs charter legger vekt på å prestere bedre enn mennesker på det meste av økonomisk verdifullt arbeid. DeepMinds rammeverk «Levels of AGI» skiller bredde fra dybde. François Chollet legger vekt på effektiv tilegnelse av ferdigheter på nye oppgaver.

Beste praksis: Spør aldri bare «Er det AGI?». Spør: «Etter hvilken operasjonell definisjon, på tvers av hvilke oppgaver, ved hvilken menneskelig persentil og med hvilke verktøy, kostnader og inngrepsrate?»

Et flerdimensjonalt mål

Seks dimensjoner en AGI-påstand bør tåle

Breddemange områder
Dybdenivå relativt til mennesker
Læringnye ferdigheter effektivt
Overføringbruk kunnskap andre steder
Robusthettål endringer og angrep
Autonomifullfør lange oppgaver

Ytelse uten generalitet

Sjakkmotorer og systemer for proteinstruktur kan være overmenneskelige på ett område uten å bli AGI.

Generellitet uten perfeksjon

Mennesker overfører kunnskap mellom områder til tross for feil. Å kreve bokstavelig perfeksjon setter listen høyere enn menneskelig generell intelligens.

Kapabilitet uten effektivitet

Et resultat kan få en annen betydning hvis det krever enorme mengder beregningskraft, tid eller menneskelig hjelp for hver oppgave.

Utover en ja/nei-etikett

AGI som nivåer av bredde og ytelse

Et innflytelsesrikt rammeverk behandler kapabilitet som en matrise. «Generell» dekker et bredt spekter av ikke-fysiske oppgaver; ytelsen sammenlignes med kompetente voksne.

Ytelse
Smal
Generell
Tolkning
Begynnende
Noe nyttig oppgavekompetanse
Ujevn evne på tvers av mange oppgaver
Samlet under nivået til kompetente voksne
Kompetent
Minst medianen for kompetente voksne i en avgrenset oppgave
Kompetent AGIMinst medianen for kompetente voksne på tvers av brede oppgaver
Krever bredde og pålitelig ytelse
Ekspert
Minst 90. persentil i en avgrenset oppgave
Ekspert-AGI på tvers av brede oppgaver
En langt sterkere påstand på tvers av økonomien
Overmenneskelig
Overgår alle mennesker på ett område
Overgår mennesker bredt
Beveger seg inn i ASI-territorium

Måleverktøy

Ingen benchmark måler hele sinnet

Ny abstraksjon

ARC-AGI

Retter seg mot regelinduksjon fra få eksempler og effektiv tilegnelse av ferdigheter på ukjente visuelle oppgaver. Verdifullt for fleksibel tilpasning, men ikke en fullstendig test av språk, agentkapasitet eller den virkelige verden.

Arbeid over lange tidshorisonter

Agentevalueringer

Måler om systemer kan planlegge, bruke verktøy, hente seg inn etter feil og fullføre prosjekter over stadig lengre tidshorisonter. Resultatene avhenger sterkt av støtteapparat og miljø.

Bred kunnskap

Prøvesamlinger

Dekker mange fagområder effektivt, men kan belønne lagret kunnskap, prøveteknikk og tidligere eksponering mer enn rask læring.

Advarsel om benchmarkmetning: Når en test blir et mål i seg selv, optimaliserer utviklere mot den. Behold private holdout-sett, roter oppgaver, revider for kontaminering og oppretthold meningsfulle menneskelige sammenligningsgrupper.

Evidensstigen

Hva ville gjort en AGI-påstand overbevisende?

1DemonstrasjonInteressant atferd, lett å kuratere
2Offentlig benchmarkSammenlignbar, men utsatt for eksponering
3Privat evalueringNye oppgaver og kontrollert tilgang
4Referansenivå for kompetente menneskerBredde, tid, verktøy og kostnader matchet
5Uavhengig replikasjonEtterprøvbar, robust og adversarial evidens
  1. 01

    Forhåndsdefiner systemgrensen

    Modell, minne, søk, kodekjøring, robotikk, prompter og menneskelig hjelp teller alle med.

  2. 02

    Ta et representativt utvalg av oppgaver

    En bred påstand krever representative oppgaver, ikke et håndplukket utvalg av høydepunkter.

  3. 03

    Test læring på nye oppgaver

    Mål hvor raskt systemet tilegner seg ferdigheter det ikke kunne forberede seg på under trening.

  4. 04

    Mål pålitelighet

    Gjennomsnittlig suksess, katastrofale feil, kalibrering, gjenoppretting og distribusjonsskift betyr alle noe.

  5. 05

    Match menneskelige betingelser

    Sammenlign tid, verktøy, instruksjoner, insentiver og tilgang til referansemateriale.

  6. 06

    Skill kapabilitet fra sikkerhet

    Etter å ha vist hva et system kan gjøre, må du teste om det fortsatt er kontrollerbart og nyttig.

Fra imitasjon til tilpasning

En kort historie om AGI-ideen

1950
Milepæl 01

Turing omformulerer spørsmålet om maskinintelligens

Imitasjonsspillet gjorde observerbar atferd sentral, men samtaleimitasjon ble aldri en fullstendig definisjon av generell intelligens.

1956
Milepæl 02

KI blir et forskningsfelt

Dartmouth-forslaget hevdet at læring og intelligens kanskje kunne beskrives så presist at maskiner kunne simulere dem.

1980s
Milepæl 03

Ekspertsystemer synliggjør problemet med smal intelligens

Høy ytelse på avgrensede områder viste at ekspertise kunne være svært kraftig uten å være generell eller tilpasningsdyktig.

1997–2016
Milepæl 04

Overmenneskelige milepæler innen smal KI

Deep Blue, Watson og AlphaGo overgikk sterke menneskelige utøvere i bestemte oppgaver, men forble svært ulike et menneske med generell kompetanse.

2019
Milepæl 05

ARC retter søkelyset mot effektiv tilegnelse av ferdigheter

François Chollet foreslo å måle intelligens gjennom hvor effektivt systemer tilegner seg nye ferdigheter, og introduserte Abstraction and Reasoning Corpus.

2023
Milepæl 06

Rammeverket «Levels of AGI»

Forskere ved Google DeepMind foreslo å klassifisere systemer etter både ytelsesdybde og oppgavebredde, fra begynnende til overmenneskelig nivå.

2024–26
Milepæl 07

Benchmarker for resonnering og agenter utvikler seg

ARC-AGI og agentevalueringer over lange tidshorisonter tester i økende grad tilpasning, verktøybruk og interaktiv læring, samtidig som benchmarkmetning og kontaminering fortsatt er bekymringer.

I dag
Milepæl 08

Ingen universell sertifisering finnes

AGI er fortsatt et omstridt begrep. Enhver seriøs påstand må oppgi definisjon, omfang, menneskelig referansenivå, systemgrense og evidensstandard.

Vanskelige realiteter

Hvorfor AGI-måling er vanskelig

Udefinert oppgaveunivers

«Alle kognitive oppgaver» er ikke et endelig, nøytralt utvalg. Økonomiske og kulturelle valg former hva som blir regnet med.

Ugjennomsiktig trening

Uten å vite hva et system har sett, er det vanskelig å skille gjenhenting og memorering fra ny læring.

Bevegelig systemgrense

Verktøy og støtteapparat kan forandre ytelsen. Påstander om modellen alene og om hele systemet besvarer ulike spørsmål.

Bevegelig menneskelig referansenivå

Menneskelig ytelse avhenger av ekspertise, motivasjon, tid, samarbeid og tilgang til verktøy.

Sterk evidens kan vise

  • Bred ytelse relativt til definerte menneskelige grupper
  • Rask læring på private, nye oppgaver
  • Robust overføring og autonomi over lange tidshorisonter
  • Kjente kostnader, inngrep og feilmønstre

En AGI-etikett kan ikke automatisk vise

  • Bevissthet eller moralsk status
  • Samsvar med menneskelige verdier
  • Fravær av katastrofale feil
  • Lik kompetanse i enhver fysisk kontekst

Klare svar

Ofte stilte spørsmål om AGI

Hva står AGI for?

Artificial general intelligence, på norsk kunstig generell intelligens. Det viser vanligvis til KI med bred og tilpasningsdyktig kompetanse på tvers av mange oppgaver, fremfor eksepsjonell ytelse på ett smalt område. Definisjonene varierer når det gjelder autonomi, kroppslig forankring og hvilket menneskelig nivå som kreves.

Finnes det én offisiell AGI-test?

Nei. Det finnes ingen universelt autorisert prøve eller terskel. Forskere bruker benchmarksamlinger, menneskelige referansenivåer, læring på nye oppgaver, agentevalueringer og rammeverk som kombinerer bredde med ytelse.

Tester denne siden om en virkelig modell er AGI?

Nei. Den interaktive delen tester evnen din til å tolke evidenspåstander. Å sertifisere et virkelig system ville kreve tilgang til systemet, private evalueringer, dokumenterte betingelser og uavhengig replikasjon.

Er AGI oppnådd?

Det finnes ingen konsensus fordi definisjoner og terskler varierer. Sterke påstander bør angi den nøyaktige operasjonelle definisjonen, i stedet for å behandle AGI som en binær hendelse alle er enige om.

Kan én benchmark bevise AGI?

Ingen enkelt benchmark dekker bredden, robustheten, læringseffektiviteten, autonomien og påliteligheten i den virkelige verden som vanligvis forbindes med AGI. En benchmark kan gi viktig evidens om én komponent.

Er det å bestå Turing-testen det samme som AGI?

Nei. En Turing-test måler hvor vanskelig samtalepartnere er å skille fra hverandre under en bestemt protokoll. AGI-påstander gjelder vanligvis bredere kompetanse, læring og overføring.

Må AGI være bevisst?

Ikke etter de fleste operasjonelle kapabilitetsdefinisjoner. Bevissthet er et separat og uløst vitenskapelig og filosofisk spørsmål.

Trenger AGI en robotkropp?

Det avhenger av definisjonen. Noen rammeverk fokuserer uttrykkelig på ikke-fysiske kognitive oppgaver, mens andre hevder at menneskelignende generell kompetanse krever persepsjon og handling i den fysiske verden.

Hva er benchmarkkontaminering?

Det oppstår når evalueringsoppgaver eller nære varianter havner i treningsdata, finjusteringsdata eller data brukt til promptutvikling, slik at en høy poengsum kan gjenspeile tidligere eksponering fremfor generalisering til genuint nye problemer.

Hva er forskjellen mellom en modell og en agent?

En modell omformer inndata til utdata. Et agentbasert system kan kombinere en modell med minne, planleggingssløyfer, verktøy, eksterne data og evnen til å utføre handlinger over tid.

Hva kommer etter AGI?

Kunstig superintelligens, eller ASI, er et hypotetisk nivå der bred maskinintelligens langt overgår menneskelig kapabilitet på de fleste eller praktisk talt alle relevante kognitive områder.

Kan AGI være trygg, men upålitelig?

Sikkerhet og pålitelighet overlapper, men er ikke det samme. Et system kan være innrettet mot ønskede mål, men likevel feilutsatt, eller være teknisk kapabelt og pålitelig samtidig som det forfølger skadelige mål. Begge deler krever særskilt evidens.

Spor rammeverket

Primær- og forskningskilder

OpenAI Charter

En fremtredende økonomisk definisjon: svært autonome systemer som presterer bedre enn mennesker på det meste av økonomisk verdifullt arbeid.

Åpne kilden

Google DeepMind: Levels of AGI

Et rammeverk basert på ytelsesdybde og kapabilitetsbredde.

Åpne kilden

Chollet: On the Measure of Intelligence

Definerer intelligens ut fra effektiv tilegnelse av ferdigheter og introduserer ARC.

Åpne kilden

ARC-AGI repository

Offisielle oppgaver, metoder og dokumentasjon for Abstraction and Reasoning Corpus.

Åpne kilden

ARC-AGI-3

Interaktiv benchmark for resonnering, utforskning, målforståelse og adaptive verdensmodeller.

Åpne kilden

Stanford AI Index

Årlig evidens om KI-kapabiliteter, benchmarktrender, investeringer, politikk og konsekvenser.

Åpne kilden

NIST AI Risk Management Framework

Et strukturert rammeverk for styring, kartlegging, måling og håndtering av KI-risiko.

Åpne kilden

Turing (1950)

Den opprinnelige artikkelen om imitasjonsspillet og et grunnleggende argument om maskinintelligens.

Åpne kilden