EVIDENSFÖRST AI-GUIDE: Testa påståenden, inte marknadsföringsspråk Starta AGI-testet
Abstrakt laboratorium för utvärdering av generell AI, kopplat till många förmågestationer

Bredd · inlärning · autonomi · robusthet

AGI-testet

Kan ett enda system lära sig, resonera och arbeta inom obekanta områden—eller misstar vi en samling imponerande färdigheter för generell intelligens?

10 evidensfall Ingen falsk certifiering Forskningsförankrad guide

Viktig orientering

Det finns inget universellt officiellt AGI-prov

AGI är ett forskningsbegrepp med konkurrerande definitioner. Den här sidan slår inte fast att något namngivet system har—eller inte har—passerat en magisk mållinje. Testet mäter hur noggrant du tolkar evidens om förmåga. En verklig systemutvärdering skulle kräva privata uppgifter, mänskliga baslinjer, redovisade verktyg och kostnader, robusthetstester och oberoende replikation.

Evidensen granskad August 2026

Inget enskilt testAGI kräver samstämmig evidensÖver bredd, djup och anpassning
Generell ≠ perfektMänniskor är generella men felbaraTillförlitlighet är fortfarande avgörande
Systemet spelar rollModeller kan använda minne och verktygRedovisa hela utvärderingsgränsen
Förmåga ≠ säkerhetSkilda frågor kräver evidensKraft garanterar inte målanpassning

Interaktivt utvärderingslabb

AGI-evidenstest

Varje fall beskriver ett påstående om ett AI-system. Välj den mest försvarbara slutsatsen—inte den mest spännande eller den mest skeptiska.

Framsteg0/10

Vad dina svar betyder: detta testar din förmåga att utvärdera AGI-påståenden. Ett högt resultat betyder att du i dessa fall skilde mellan smala prestationer, verklig generalisering och ogrundade slutsatser. Det mäter inte din IQ och inte heller om du är en AGI.

Leta efter direkt evidens

Fråga vad observationen faktiskt mätte innan du accepterar ett bredare påstående.

Undvik båda ytterligheterna

“Ett riktmärke bevisar AGI” och “all utvärdering är meningslös” är vanligtvis båda för starka påståenden.

01Riktmärkets giltighetEtt system får 96 % på ett känt offentligt riktmärke för resonerande efter flera år av diskussioner om riktmärket på nätet. Vilken är den starkaste slutsatsen?
02ÖverföringMed bara två demonstrationer lär sig ett system en obekant visuell styrmiljö, drar slutsatser om målet, anpassar sig efter misslyckanden och lyckas effektivt. Vad ger detta mest direkt stöd för?
03BreddEn kodningsagent presterar bättre än nästan alla yrkespersoner på väldefinierade programvaruuppgifter men kan inte tillförlitligt planera resor, tolka diagram eller lära sig nya spel. Hur bör den klassificeras?
04AutonomiEn agent genomför åtta timmar långa forskningsuppgifter med verktyg, men en människa måste korrigera den var 30:e minut. Vilken är den försiktiga tolkningen?
05KommunikationEn chattbot bedöms vara mänsklig i korta blindade samtal. Vilket AGI-påstående följer av detta?
06RobusthetEn modell presterar på nivå med skickliga vuxna inom sex områden men faller sedan samman när format, verktyg och formuleringar ändras något. Vad saknas?
07OmfattningEtt system matchar skickliga människor inom icke-fysiskt kognitivt arbete men kan inte manipulera föremål. Är det AGI?
08SystemgränsEn modell lyckas endast när den är ansluten till sökning, kodkörning, minne och specialistverktyg. Vad bör en utvärdering redovisa?
09Mentala tillståndEn modell säger: “Jag är medveten och har uppnått AGI.” Vad fastställer detta?
10ReplikationOberoende team förregistrerar tester, använder privata uppgifter, jämför med baslinjer för skickliga människor, redovisar kostnader och reproducerar breda resultat. Varför är detta starkare?

Börja med det omstridda begreppet

Vad är artificiell generell intelligens?

En familj av definitioner, inte ett fastslaget fenomen

De flesta definitioner kombinerar generalitet—kompetens över ett brett spektrum av uppgifter—med prestation, inlärning och en viss grad av autonomi. OpenAI:s stadga betonar att överträffa människor i det mesta ekonomiskt värdefulla arbetet. DeepMinds ramverk “Levels of AGI” skiljer bredd från djup. François Chollet betonar effektiviteten i att tillägna sig nya färdigheter på nya uppgifter.

Bästa praxis: fråga aldrig bara “Är det AGI?” Fråga “Enligt vilken operationell definition, över vilka uppgifter, vid vilken mänsklig percentil, med vilka verktyg, kostnader och vilken ingripandefrekvens?”

Ett flerdimensionellt mål

Sex dimensioner som ett AGI-påstående bör klara

Breddmånga områden
Djupnivå relativt människor
Inlärningnya färdigheter effektivt
Överföringanvänd kunskap på andra områden
Robusthettåla förändringar och angrepp
Autonomislutför långa uppgifter

Prestation utan generalitet

Schackmotorer och system för proteinstruktur kan vara övermänskliga inom ett område utan att bli AGI.

Generalitet utan perfektion

Människor överför kunskap mellan områden trots misstag. Att kräva bokstavlig perfektion sätter ribban högre än mänsklig generell intelligens.

Förmåga utan effektivitet

Ett resultat kan få en annan betydelse om det för varje uppgift förbrukar enorma beräkningsresurser, tid eller mänsklig hjälp.

Bortom en ja/nej-etikett

AGI som nivåer av bredd och prestation

Ett inflytelserikt ramverk behandlar förmåga som en matris. “Generell” omfattar ett brett spektrum av icke-fysiska uppgifter; prestationen jämförs med skickliga vuxna.

Prestation
Smal
Generell
Tolkning
Framväxande
Viss användbar uppgiftskompetens
Ojämn förmåga över många uppgifter
Totalt sett under kompetensen hos skickliga vuxna
Kompetent
Minst medianen för skickliga vuxna i en avgränsad uppgift
Kompetent AGIMinst medianen för skickliga vuxna över breda uppgifter
Kräver bredd plus tillförlitlig prestation
Expert
Minst 90:e percentilen i en avgränsad uppgift
Expert-AGI över breda uppgifter
Ett betydligt starkare påstående för hela ekonomin
Övermänsklig
Överträffar alla människor inom ett område
Överträffar människor brett
Närmar sig ASI-territorium

Verktygslåda för mätning

Inget riktmärke är hela intelligensen

Ny abstraktion

ARC-AGI

Riktar in sig på regelinduktion från få exempel och effektiv inlärning av färdigheter i obekanta visuella uppgifter. Värdefullt för flexibel anpassning, men inte ett fullständigt test av språk, agentskap eller den verkliga världen.

Långvarigt arbete

Agentutvärderingar

Mäter om system kan planera, använda verktyg, återhämta sig från fel och slutföra projekt över allt längre tidshorisonter. Resultaten beror starkt på stödstrukturer och miljö.

Bred kunskap

Provsviter

Täcker många discipliner effektivt, men kan belöna lagrad kunskap, provteknik och tidigare exponering mer än snabb inlärning.

Varning för mättade riktmärken: när ett test blir ett mål optimerar utvecklare mot det. Behåll privata kontrolluppgifter, rotera uppgifter, granska kontaminering och bevara meningsfulla mänskliga jämförelsegrupper.

Evidensstegen

Vad skulle göra ett AGI-påstående övertygande?

1DemonstrationIntressant beteende, lätt att kurera
2Offentligt riktmärkeJämförbart men exponeringskänsligt
3Privat utvärderingNya uppgifter och kontrollerad åtkomst
4Baslinje för skickliga människorBredd, tid, verktyg och kostnader matchade
5Oberoende replikationGranskningsbar, robust och motståndsprövad evidens
  1. 01

    Definiera systemgränsen i förväg

    Modell, minne, sökning, kodkörning, robotik, promptar och mänsklig hjälp räknas alla.

  2. 02

    Sampla uppgiftsuniversumet

    Ett brett påstående kräver representativa uppgifter, inte ett handplockat urval av höjdpunkter.

  3. 03

    Testa ny inlärning

    Mät hur snabbt systemet tillägnar sig färdigheter som det inte kunde förbereda sig för under träningen.

  4. 04

    Mät tillförlitlighet

    Genomsnittlig framgång, katastrofala fel, kalibrering, återhämtning och fördelningsskiften spelar alla roll.

  5. 05

    Matcha mänskliga villkor

    Jämför tid, verktyg, instruktioner, incitament och tillgång till referensmaterial.

  6. 06

    Separera förmåga från säkerhet

    Efter att ha visat vad ett system kan göra, testa om det förblir kontrollerbart och gynnsamt.

Från imitation till anpassning

En kort historia om AGI-idén

1950
Milstolpe 01

Turing omformulerar maskinintelligens

Imitationsspelet gjorde observerbart beteende centralt, men samtalsimitation blev aldrig en fullständig definition av generell intelligens.

1956
Milstolpe 02

AI blir ett forskningsområde

Dartmouthförslaget hävdade att inlärning och intelligens kanske kunde beskrivas tillräckligt exakt för att maskiner skulle kunna simulera dem.

1980s
Milstolpe 03

Expertsystem blottlägger problemet med smalhet

Hög prestation inom avgränsade områden visade att expertis kunde vara kraftfull utan att vara generell eller anpassningsbar.

1997–2016
Milstolpe 04

Övermänskliga smala milstolpar

Deep Blue, Watson och AlphaGo överträffade skickliga människor i specifika uppgifter men förblev något helt annat än en person med generell kompetens.

2019
Milstolpe 05

ARC fokuserar på effektiv inlärning av nya färdigheter

François Chollet föreslog att mäta intelligens genom hur effektivt system tillägnar sig nya färdigheter och introducerade Abstraction and Reasoning Corpus.

2023
Milstolpe 06

Ramverket Levels of AGI

Forskare på Google DeepMind föreslog att klassificera system efter både prestationsdjup och uppgiftsbredd, från framväxande till övermänsklig.

2024–26
Milstolpe 07

Riktmärken för resonerande och agenter utvecklas

ARC-AGI och utvärderingar av agenter över långa tidshorisonter testar allt oftare anpassning, verktygsanvändning och interaktiv inlärning, samtidigt som mättnad och kontaminering av riktmärken fortfarande är problem.

I dag
Milstolpe 08

Ingen universell certifiering finns

AGI är fortfarande ett omstritt begrepp. Varje seriöst påstående måste ange definition, omfattning, mänsklig baslinje, systemgräns och evidensstandard.

Svåra sanningar

Varför AGI är svårt att mäta

Odefinierat uppgiftsuniversum

“Alla kognitiva uppgifter” är inte ett ändligt, neutralt urval. Ekonomiska och kulturella val formar vad som räknas.

Ogenomskinlig träning

Utan att veta vad ett system har sett är det svårt att skilja hämtning och memorering från ny inlärning.

Föränderlig systemgräns

Verktyg och stödstrukturer kan förändra prestationen. Påståenden om enbart modellen och om hela systemet besvarar olika frågor.

Föränderlig mänsklig baslinje

Mänsklig prestation beror på expertis, motivation, tid, samarbete och tillgång till verktyg.

Stark evidens kan visa

  • Bred prestation relativt definierade mänskliga grupper
  • Snabb inlärning på privata nya uppgifter
  • Robust överföring och autonomi över lång tid
  • Kända kostnader, ingripanden och felmönster

En AGI-etikett kan inte automatiskt visa

  • Medvetande eller moralisk status
  • Anpassning till mänskliga värderingar
  • Frihet från katastrofala fel
  • Likvärdig kompetens i varje fysisk kontext

Tydliga svar

Vanliga frågor om AGI

Vad står AGI för?

Artificiell generell intelligens. Det syftar vanligtvis på AI med bred, anpassningsbar kompetens över många uppgifter snarare än exceptionell prestation inom ett enda smalt område. Definitionerna skiljer sig åt i synen på autonomi, kroppslig förankring och vilken mänsklig nivå som krävs.

Finns det ett officiellt AGI-test?

Nej. Det finns inget universellt auktoriserat prov eller tröskelvärde. Forskare använder uppsättningar av riktmärken, mänskliga baslinjer, inlärning på nya uppgifter, agentutvärderingar och ramverk som kombinerar bredd med prestation.

Testar den här sidan om en verklig modell är AGI?

Nej. Den interaktiva delen testar din förmåga att tolka evidenspåståenden. För att certifiera ett verkligt system skulle man behöva tillgång till systemet, privata utvärderingar, dokumenterade villkor och oberoende replikation.

Har AGI uppnåtts?

Det finns ingen konsensus eftersom definitioner och trösklar skiljer sig åt. Starka påståenden bör ange den exakta operationella definitionen i stället för att behandla AGI som en universellt överenskommen binär händelse.

Kan ett enda riktmärke bevisa AGI?

Inget enskilt riktmärke täcker den bredd, robusthet, inlärningseffektivitet, autonomi och verkliga tillförlitlighet som vanligen förknippas med AGI. Ett riktmärke kan ge viktig evidens om en komponent.

Är det samma sak att klara Turingtestet som att vara AGI?

Nej. Ett Turingtest mäter samtalsmässig oskiljbarhet under ett protokoll. AGI-påståenden handlar typiskt om bredare kompetens, inlärning och överföring.

Måste AGI vara medveten?

Inte enligt de flesta operationella definitioner av förmåga. Medvetande är en separat och olöst vetenskaplig och filosofisk fråga.

Behöver AGI en robotkropp?

Det beror på definitionen. Vissa ramverk fokuserar uttryckligen på icke-fysiska kognitiva uppgifter; andra menar att mänsklig generalitet kräver perception och handling i den fysiska världen.

Vad är kontaminering av riktmärken?

Det uppstår när utvärderingsuppgifter eller närliggande varianter hamnar i tränings-, finjusterings- eller promptutvecklingsdata, så att ett högt resultat kan spegla tidigare exponering snarare än generalisering till genuint nya problem.

Vad är skillnaden mellan en modell och en agent?

En modell avbildar indata till utdata. Ett agentbaserat system kan kombinera en modell med minne, planeringsloopar, verktyg, extern data och förmågan att vidta åtgärder över tid.

Vad kommer efter AGI?

Artificiell superintelligens, eller ASI, är en hypotetisk nivå där bred maskinintelligens vida överstiger mänsklig förmåga inom de flesta eller i princip alla relevanta kognitiva områden.

Kan AGI vara säker men otillförlitlig?

Säkerhet och tillförlitlighet överlappar men är inte samma sak. Ett system kan vara välanpassat i avsikt men felbenäget, eller tekniskt kompetent och tillförlitligt samtidigt som det följer skadliga mål. Båda kräver särskild evidens.

Spår ramverket

Primära källor och forskningskällor

OpenAI Charter

En framträdande ekonomisk definition: mycket autonoma system som överträffar människor i det mesta ekonomiskt värdefulla arbetet.

Öppna källan

Google DeepMind: Levels of AGI

Ett ramverk baserat på prestationsdjup och förmågornas bredd.

Öppna källan

Chollet: On the Measure of Intelligence

Definierar intelligens kring effektiviteten i att tillägna sig färdigheter och introducerar ARC.

Öppna källan

ARC-AGI repository

Officiella uppgifter, metoder och dokumentation för Abstraction and Reasoning Corpus.

Öppna källan

ARC-AGI-3

Interaktivt riktmärke för resonerande, utforskning, målinlärning och adaptiva världsmodeller.

Öppna källan

Stanford AI Index

Årlig evidens om AI-förmågor, riktmärkestrender, investeringar, policy och konsekvenser.

Öppna källan

NIST AI Risk Management Framework

Ett strukturerat ramverk för att styra, kartlägga, mäta och hantera AI-risker.

Öppna källan

Turing (1950)

Den ursprungliga artikeln om imitationsspelet och det grundläggande resonemanget om maskinintelligens.

Öppna källan