SPRIEVODCA AI ZALOŽENÝ NA DÔKAZOCH: Testujte tvrdenia, nie marketingové frázy Spustiť test AGI
Abstraktné laboratórium na hodnotenie všeobecnej AI prepojené s viacerými oblasťami schopností

Šírka · učenie · autonómia · robustnosť

Test AGI

Dokáže sa jeden systém učiť, uvažovať a pracovať naprieč neznámymi oblasťami — alebo si súbor pôsobivých zručností zamieňame za všeobecnú inteligenciu?

10 prípadov s dôkazmi Žiadna falošná certifikácia Sprievodca opretý o výskum

Dôležité východisko

Neexistuje univerzálne oficiálna skúška AGI

AGI je výskumný pojem s viacerými konkurenčnými definíciami. Táto stránka netvrdí, že konkrétny pomenovaný systém prekročil — alebo neprekročil — akúsi magickú cieľovú čiaru. Test meria, ako starostlivo interpretujete dôkazy o schopnostiach. Hodnotenie reálneho systému by si vyžadovalo neverejné úlohy, ľudské referenčné úrovne, zverejnené nástroje a náklady, testovanie robustnosti a nezávislú replikáciu.

Dôkazy skontrolované August 2026

Žiadny jediný testAGI si vyžaduje zbiehajúce sa dôkazyNaprieč šírkou, úrovňou a adaptáciou
Všeobecná ≠ dokonaláĽudia sú všeobecne schopní, no omylníSpoľahlivosť je stále nevyhnutná
Záleží na celom systémeModely môžu používať pamäť a nástrojeUveďte úplnú hranicu hodnoteného systému
Schopnosť ≠ bezpečnosťSamostatné otázky potrebujú samostatné dôkazyVýkon nezaručuje zosúladenie

Interaktívne laboratórium hodnotiteľa

Test dôkazov o AGI

Každý prípad opisuje tvrdenie o systéme AI. Vyberte najlepšie obhájiteľný záver — nie ten najpútavejší ani najskeptickejší.

Priebeh0/10

Čo znamenajú vaše odpovede: tento test overuje vašu schopnosť hodnotiť tvrdenia o AGI. Vysoké skóre znamená, že ste v týchto prípadoch rozlíšili úzky úspech, skutočnú generalizáciu a nepodložený záver. Nemeria vaše IQ ani to, či ste AGI.

Hľadajte priame dôkazy

Skôr než prijmete širšie tvrdenie, pýtajte sa, čo pozorovanie skutočne meralo.

Vyhnite sa obom extrémom

Tvrdenia „jeden benchmark dokazuje AGI“ aj „všetko hodnotenie je zbytočné“ sú zvyčajne príliš kategorické.

01Platnosť benchmarkuSystém dosiahne 96 % v známom verejnom benchmarku uvažovania po rokoch, počas ktorých sa o ňom diskutovalo na internete. Aký je najsilnejší oprávnený záver?
02PrenosPo iba dvoch ukážkach sa systém naučí pracovať v neznámom vizuálnom riadiacom prostredí, odvodí cieľ, po neúspechu sa prispôsobí a efektívne uspeje. Čo to najpriamejšie podporuje?
03ŠírkaProgramátorský agent prekonáva takmer každého profesionála v presne vymedzených softvérových úlohách, no nedokáže spoľahlivo plánovať cestovanie, interpretovať diagramy ani sa učiť nové hry. Ako ho treba klasifikovať?
04AutonómiaAgent pomocou nástrojov plní osemhodinové výskumné úlohy, no človek ho musí každých 30 minút opravovať. Aká je opatrná interpretácia?
05KomunikáciaChatbot je v krátkych zaslepených rozhovoroch hodnotený ako človek. Aké tvrdenie o AGI z toho vyplýva?
06RobustnosťModel dosahuje v šiestich oblastiach úroveň kvalifikovaného dospelého, no pri miernej zmene formátu, nástrojov a formulácie jeho výkon skolabuje. Čo mu chýba?
07RozsahSystém sa vyrovná kvalifikovaným ľuďom v nefyzickej kognitívnej práci, ale nedokáže manipulovať s predmetmi. Je to AGI?
08Hranica systémuModel uspeje iba vtedy, keď je pripojený k vyhľadávaniu, spúšťaniu kódu, pamäti a špecializovaným nástrojom. Čo má hodnotenie uviesť?
09Duševné stavyModel povie: „Som vedomý a dosiahol som AGI.“ Čo to preukazuje?
10ReplikáciaNezávislé tímy vopred registrujú testy, používajú neverejné úlohy, porovnávajú výsledky s kvalifikovanými ľuďmi, zverejňujú náklady a reprodukujú výsledky v širokom spektre úloh. Prečo je to silnejší dôkaz?

Začnite sporným pojmom

Čo je umelá všeobecná inteligencia?

Rodina definícií, nie jeden ustálený pojem

Väčšina definícií spája všeobecnosť — schopnosť zvládať široké spektrum úloh — s výkonom, učením a určitou mierou autonómie. Charta OpenAI zdôrazňuje prekonávanie ľudí vo väčšine ekonomicky hodnotnej práce. Rámec DeepMind „Levels of AGI“ oddeľuje šírku schopností od úrovne výkonu. François Chollet zdôrazňuje efektívnosť osvojovania zručností pri nových úlohách.

Odporúčaný postup: nikdy sa nepýtajte iba „Je to AGI?“ Pýtajte sa: „Podľa akej operačnej definície, v akých úlohách, na akom ľudskom percentile, s akými nástrojmi a nákladmi a pri akej miere zásahov?“

Viacrozmerný cieľ

Šesť rozmerov, ktoré musí tvrdenie o AGI ustáť

Šírkamnoho oblastí
Úroveňúroveň vzhľadom na ľudí
Učenieefektívne nové zručnosti
Prenospoužiť znalosti inde
Robustnosťodolávať zmenám a útokom
Autonómiadokončovať dlhé úlohy

Výkon bez všeobecnosti

Šachové programy a systémy na určovanie štruktúry proteínov môžu byť v jednej oblasti nadľudské bez toho, aby sa stali AGI.

Všeobecnosť bez dokonalosti

Ľudia prenášajú schopnosti medzi oblasťami napriek chybám. Požadovať doslovnú dokonalosť znamená nastaviť latku vyššie než pri ľudskej všeobecnej inteligencii.

Schopnosť bez efektívnosti

Význam výsledku sa môže zmeniť, ak každá úloha vyžaduje obrovské množstvo výpočtov, času alebo ľudskej pomoci.

Viac než odpoveď áno/nie

AGI ako úrovne šírky schopností a výkonu

Jeden vplyvný rámec chápe schopnosti ako maticu. „Všeobecná“ zahŕňa široké spektrum nefyzických úloh; výkon sa porovnáva s kvalifikovanými dospelými.

Výkon
Úzka
Všeobecná
Interpretácia
Vznikajúca
Určitá užitočná schopnosť plniť úlohy
Nerovnomerné schopnosti naprieč mnohými úlohami
Celkovo pod úrovňou kvalifikovaného dospelého
Kompetentná
Aspoň medián kvalifikovaných dospelých v ohraničenej úlohe
Kompetentná AGIAspoň medián kvalifikovaných dospelých naprieč širokým spektrom úloh
Vyžaduje šírku schopností aj spoľahlivý výkon
Expertná
Aspoň 90. percentil v ohraničenej úlohe
Expertná AGI naprieč širokým spektrom úloh
Oveľa silnejšie tvrdenie o schopnostiach naprieč ekonomikou
Nadľudská
Prekonáva všetkých ľudí v jednej oblasti
Široko prekonáva všetkých ľudí
Prechádza do oblasti ASI

Súbor nástrojov na meranie

Žiadny benchmark nepokrýva celú inteligenciu

Nová abstrakcia

ARC-AGI

Zameriava sa na odvodzovanie pravidiel z malého počtu príkladov a efektívnosť osvojovania zručností pri neznámych vizuálnych úlohách. Je hodnotný pri meraní pružnej adaptácie, nie je však úplným testom jazyka, autonómneho konania ani fungovania v reálnom svete.

Práca s dlhým horizontom

Hodnotenia agentov

Merajú, či systémy dokážu plánovať, používať nástroje, zotaviť sa z chýb a dokončovať projekty s čoraz dlhším časovým horizontom. Výsledky výrazne závisia od podporných mechanizmov a prostredia.

Široké vedomosti

Súbory skúšok

Efektívne pokrývajú mnoho disciplín, no môžu odmeňovať uložené vedomosti, zručnosť pri riešení testov a predchádzajúci kontakt s úlohami viac než rýchle učenie.

Upozornenie na saturáciu benchmarkov: keď sa test stane cieľom optimalizácie, vývojári sa mu začnú prispôsobovať. Zachovávajte neverejné kontrolné úlohy, obmieňajte zadania, kontrolujte kontamináciu a udržiavajte zmysluplné porovnávacie skupiny ľudí.

Rebrík dôkazov

Čo by urobilo tvrdenie o AGI presvedčivým?

1UkážkaZaujímavé správanie, ktoré možno ľahko vybrať
2Verejný benchmarkPorovnateľný, no náchylný na predchádzajúci kontakt
3Neverejné hodnotenieNové úlohy a kontrolovaný prístup
4Referenčná úroveň kvalifikovaných ľudíZladená šírka úloh, čas, nástroje a náklady
5Nezávislá replikáciaAuditovateľné, robustné a adverzné dôkazy
  1. 01

    Vopred určte hranicu systému

    Počítajú sa model, pamäť, vyhľadávanie, spúšťanie kódu, robotika, prompty aj ľudská pomoc.

  2. 02

    Vyberte reprezentatívnu vzorku úloh

    Široké tvrdenie potrebuje reprezentatívne úlohy, nie účelovo vybranú prehliadku najlepších výsledkov.

  3. 03

    Testujte učenie na nových úlohách

    Merajte, ako rýchlo si systém osvojuje zručnosti, na ktoré sa nemohol pripraviť počas tréningu.

  4. 04

    Merajte spoľahlivosť

    Dôležité sú priemerná úspešnosť, katastrofické zlyhania, kalibrácia, zotavenie aj posun distribúcie.

  5. 05

    Zlaďte podmienky s ľuďmi

    Porovnávajte čas, nástroje, pokyny, motivácie a prístup k referenčným materiálom.

  6. 06

    Oddeľte schopnosti od bezpečnosti

    Po preukázaní toho, čo systém dokáže, testujte, či zostáva kontrolovateľný a prospešný.

Od napodobňovania k adaptácii

Stručná história myšlienky AGI

1950
Míľnik 01

Turing nanovo formuluje otázku strojovej inteligencie

Imitačná hra postavila do centra pozorovateľné správanie, no napodobňovanie konverzácie sa nikdy nestalo úplnou definíciou všeobecnej inteligencie.

1956
Míľnik 02

AI sa stáva výskumnou oblasťou

Dartmouthský návrh tvrdil, že učenie a inteligenciu možno opísať dostatočne presne na to, aby ich stroje dokázali simulovať.

1980s
Míľnik 03

Expertné systémy odhaľujú problém úzkej špecializácie

Vysoký výkon v ohraničených oblastiach ukázal, že odborná schopnosť môže byť veľmi silná bez toho, aby bola všeobecná alebo prispôsobivá.

1997–2016
Míľnik 04

Míľniky úzkej nadľudskej AI

Deep Blue, Watson a AlphaGo prekonali špičkových ľudí v konkrétnych úlohách, no stále sa nepodobali človeku so všeobecnými schopnosťami.

2019
Míľnik 05

ARC sa zameriava na efektívnosť osvojovania zručností

François Chollet navrhol merať inteligenciu podľa efektívnosti, s akou si systémy osvojujú nové zručnosti, a predstavil súbor Abstraction and Reasoning Corpus.

2023
Míľnik 06

Rámec úrovní AGI

Výskumníci z Google DeepMind navrhli klasifikovať systémy podľa úrovne výkonu aj šírky úloh, od vznikajúcej až po nadľudskú úroveň.

2024–26
Míľnik 07

Benchmarky uvažovania a agentov sa vyvíjajú

ARC-AGI a hodnotenia agentov pri dlhodobých úlohách čoraz viac testujú adaptáciu, používanie nástrojov a interaktívne učenie, pričom naďalej zostáva problémom saturácia a kontaminácia benchmarkov.

Dnes
Míľnik 08

Neexistuje univerzálna certifikácia

AGI zostáva sporným pojmom. Každé seriózne tvrdenie musí uviesť definíciu, rozsah, ľudskú referenčnú úroveň, hranicu systému a štandard dôkazov.

Tvrdé fakty

Prečo je meranie AGI náročné

Nedefinovaný priestor úloh

„Všetky kognitívne úlohy“ netvoria konečnú ani neutrálnu vzorku. To, čo sa započítava, ovplyvňujú ekonomické a kultúrne rozhodnutia.

Nepriehľadnosť tréningu

Bez znalosti toho, čo systém počas tréningu videl, je ťažké oddeliť vyhľadanie a memorovanie od nového učenia.

Pohyblivá hranica systému

Nástroje a podporné mechanizmy môžu zásadne meniť výkon. Tvrdenia o samotnom modeli a o celom systéme odpovedajú na odlišné otázky.

Pohyblivá ľudská referenčná úroveň

Ľudský výkon závisí od odbornosti, motivácie, času, spolupráce a prístupu k nástrojom.

Silné dôkazy môžu preukázať

  • Široký výkon vzhľadom na presne vymedzenú skupinu ľudí
  • Rýchle učenie na neverejných nových úlohách
  • Robustný prenos a autonómia pri dlhodobých úlohách
  • Známe náklady, zásahy a režimy zlyhania

Označenie AGI samo osebe nepreukazuje

  • Vedomie ani morálny status
  • Zosúladenie s ľudskými hodnotami
  • Neprítomnosť katastrofických chýb
  • Rovnakú úroveň schopností v každom fyzickom kontexte

Jasné odpovede

Často kladené otázky o AGI

Čo znamená skratka AGI?

Umelá všeobecná inteligencia. Zvyčajne označuje AI so širokými a prispôsobivými schopnosťami v mnohých úlohách, nie iba s výnimočným výkonom v jednej úzkej oblasti. Definície sa líšia v požiadavkách na autonómiu, fyzické stelesnenie a požadovanú ľudskú úroveň.

Existuje jeden oficiálny test AGI?

Nie. Neexistuje univerzálne uznávaná skúška ani prahová hodnota. Výskumníci používajú súbory benchmarkov, ľudské referenčné úrovne, učenie na nových úlohách, hodnotenia agentov a rámce kombinujúce šírku schopností s výkonom.

Testuje táto stránka, či je reálny model AGI?

Nie. Interaktívna časť testuje vašu schopnosť interpretovať tvrdenia založené na dôkazoch. Posúdenie reálneho systému by si vyžadovalo prístup k systému, neverejné hodnotenia, zdokumentované podmienky a nezávislú replikáciu.

Bola už AGI dosiahnutá?

Konsenzus neexistuje, pretože definície a prahové hodnoty sa líšia. Silné tvrdenia by mali uviesť presnú operačnú definíciu, namiesto toho, aby s AGI zaobchádzali ako s univerzálne dohodnutou binárnou udalosťou.

Môže jediný benchmark dokázať AGI?

Žiadny jediný benchmark nepokrýva šírku, robustnosť, efektívnosť učenia, autonómiu a spoľahlivosť v reálnom svete, ktoré sa zvyčajne spájajú s AGI. Benchmark môže poskytnúť dôležitý dôkaz o jednej z týchto zložiek.

Je úspech v Turingovom teste to isté ako AGI?

Nie. Turingov test meria nerozoznateľnosť v konverzácii podľa konkrétneho protokolu. Tvrdenia o AGI sa zvyčajne týkajú širších schopností, učenia a prenosu.

Musí mať AGI vedomie?

Podľa väčšiny operačných definícií schopností nie. Vedomie je samostatná a nevyriešená vedecká i filozofická otázka.

Potrebuje AGI robotické telo?

Závisí to od definície. Niektoré rámce sa výslovne sústreďujú na nefyzické kognitívne úlohy; iné tvrdia, že všeobecnosť podobná ľudskej si vyžaduje vnímanie a konanie vo fyzickom svete.

Čo je kontaminácia benchmarku?

Vzniká vtedy, keď sa hodnotiace úlohy alebo ich blízke varianty dostanú do tréningových dát, dát na dolaďovanie alebo vývoj promptov. Vysoké skóre potom môže odrážať predchádzajúci kontakt s úlohami namiesto generalizácie na skutočne nové problémy.

Aký je rozdiel medzi modelom a agentom?

Model mapuje vstupy na výstupy. Agentný systém môže spájať model s pamäťou, plánovacími slučkami, nástrojmi, externými dátami a schopnosťou vykonávať činnosti v čase.

Čo nasleduje po AGI?

Umelá superinteligencia, čiže ASI, je hypotetická úroveň, na ktorej široká strojová inteligencia výrazne presahuje ľudské schopnosti vo väčšine alebo prakticky vo všetkých relevantných kognitívnych oblastiach.

Môže byť AGI bezpečná, ale nespoľahlivá?

Bezpečnosť a spoľahlivosť sa prekrývajú, no nie sú totožné. Systém môže mať zosúladené zámery, ale byť náchylný na chyby; alebo môže byť technicky schopný a spoľahlivý, no sledovať škodlivé ciele. Obe vlastnosti si vyžadujú samostatné dôkazy.

Pozrite si podklady rámca

Primárne a výskumné zdroje

OpenAI Charter

Významná ekonomická definícia: vysoko autonómne systémy, ktoré prekonávajú ľudí vo väčšine ekonomicky hodnotnej práce.

Otvoriť zdroj

Google DeepMind: Levels of AGI

Rámec založený na úrovni výkonu a šírke schopností.

Otvoriť zdroj

Chollet: On the Measure of Intelligence

Definuje inteligenciu prostredníctvom efektívnosti osvojovania zručností a predstavuje ARC.

Otvoriť zdroj

ARC-AGI repository

Oficiálne úlohy, metódy a dokumentácia súboru Abstraction and Reasoning Corpus.

Otvoriť zdroj

ARC-AGI-3

Interaktívny benchmark uvažovania zameraný na prieskum, osvojovanie cieľov a adaptívne modely sveta.

Otvoriť zdroj

Stanford AI Index

Každoročné údaje o schopnostiach AI, trendoch benchmarkov, investíciách, politikách a vplyvoch.

Otvoriť zdroj

NIST AI Risk Management Framework

Štruktúrovaný rámec na riadenie, mapovanie, meranie a zvládanie rizík AI.

Otvoriť zdroj

Turing (1950)

Pôvodná práca o imitačnej hre a základná argumentácia o strojovej inteligencii.

Otvoriť zdroj