PRŮVODCE AI ZALOŽENÝ NA DŮKAZECH: Testujte tvrzení, ne marketingový jazyk Spustit test AGI
Abstraktní laboratoř pro hodnocení obecné AI propojená s mnoha stanovišti schopností

Šíře · učení · autonomie · robustnost

Test AGI

Dokáže se jeden systém učit, uvažovat a pracovat napříč neznámými oblastmi — nebo si jen pleteme soubor působivých dovedností s obecnou inteligencí?

10 případů s důkazy Žádná falešná certifikace Průvodce propojený s výzkumem

Důležité uvedení

Neexistuje univerzální oficiální zkouška AGI

AGI je výzkumný koncept s konkurenčními definicemi. Tato stránka neprohlašuje, že nějaký konkrétní systém překročil — nebo nepřekročil — pomyslnou cílovou čáru. Test měří, jak pečlivě interpretujete důkazy o schopnostech. Hodnocení skutečného systému by vyžadovalo neveřejné úlohy, lidské srovnávací základny, zveřejněné nástroje a náklady, testování robustnosti a nezávislou replikaci.

Důkazy zkontrolovány 08/2026

Žádný jediný testAGI potřebuje sbíhající se důkazyNapříč šíří, hloubkou a adaptací
Obecné ≠ dokonaléLidé jsou obecně schopní, ale omylníSpolehlivost je stále zásadní
Na systému záležíModely mohou používat paměť a nástrojeUveďte úplnou hranici hodnocení
Schopnost ≠ bezpečnostOddělené otázky vyžadují důkazyVýkon nezaručuje sladění

Interaktivní laboratoř hodnotitele

Test důkazů o AGI

Každý případ popisuje tvrzení o systému AI. Zvolte nejlépe obhajitelný závěr— nikoli ten nejvíce vzrušující ani nejvíce skeptický.

Postup0/10

Co znamenají vaše odpovědi: tento test ověřuje vaši gramotnost při hodnocení AGI. Vysoké skóre znamená, že jste v těchto případech rozlišili úzký úspěch, skutečné zobecnění a nepodložený závěr. Neměří vaše IQ ani to, zda jste AGI.

Hledejte přímé důkazy

Než přijmete širší tvrzení, ptejte se, co pozorování skutečně měřilo.

Vyhněte se oběma extrémům

„Jeden benchmark dokazuje AGI“ i „veškeré hodnocení je k ničemu“ jsou obvykle příliš silná tvrzení.

01Platnost benchmarkuSystém dosáhne 96 % ve známém veřejném benchmarku uvažování po letech, kdy se o tomto benchmarku diskutovalo online. Jaký závěr je nejlépe podložený?
02PřenosPo pouhých dvou ukázkách se systém naučí pracovat v neznámém prostředí s vizuálním řízením, odvodí cíl, po neúspěchu se přizpůsobí a efektivně uspěje. Co to nejpřímočařeji podporuje?
03ŠířeProgramovací agent překonává téměř všechny profesionály v přesně vymezených softwarových úlohách, ale nedokáže spolehlivě plánovat cesty, interpretovat diagramy ani se učit nové hry. Jak by měl být klasifikován?
04AutonomieAgent pomocí nástrojů plní osmihodinové výzkumné úkoly, ale člověk jej musí každých 30 minut opravovat. Jaká je opatrná interpretace?
05KomunikaceChatbot je v krátkých zaslepených rozhovorech posouzen jako člověk. Jaké tvrzení o AGI z toho plyne?
06RobustnostModel dosahuje úrovně kvalifikovaného dospělého v šesti oblastech, ale při mírné změně formátu, nástrojů a formulace se jeho výkon zhroutí. Co mu chybí?
07RozsahSystém se vyrovná kvalifikovaným lidem v ne-fyzické kognitivní práci, ale nedokáže manipulovat s předměty. Je to AGI?
08Hranice systémuModel uspěje pouze tehdy, když je připojen k vyhledávání, spouštění kódu, paměti a specializovaným nástrojům. Co by mělo hodnocení uvádět?
09Mentální stavyModel řekne: „Jsem vědomý a dosáhl jsem AGI.“ Co tím prokazuje?
10ReplikaceNezávislé týmy předregistrují testy, používají neveřejné úlohy, porovnávají se základnou kvalifikovaných lidí, zveřejňují náklady a reprodukují široké výsledky. Proč je to silnější důkaz?

Začněte sporným pojmem

Co je obecná umělá inteligence?

Rodina definic, nikoli jediný ustálený pojem

Většina definic kombinuje obecnost— kompetenci v širokém rozsahu úloh — s výkonem, učením a určitou mírou autonomie. Charta OpenAI zdůrazňuje překonávání lidí ve většině ekonomicky hodnotné práce. Rámec DeepMind „Levels of AGI“ odděluje šíři od hloubky. François Chollet zdůrazňuje efektivitu osvojování dovedností v nových úlohách.

Doporučený postup: neptejte se pouze „Je to AGI?“ Ptejte se: „Podle jaké operační definice, v jakých úlohách, na jakém lidském percentilu, s jakými nástroji, náklady a mírou zásahů?“

Vícedimenzionální cíl

Šest dimenzí, které musí tvrzení o AGI obstát

Šířemnoho oblastí
Hloubkaúroveň vůči lidem
Učeníefektivně nové dovednosti
Přenospoužít znalosti jinde
Robustnostobstát při změnách a útocích
Autonomiedokončit dlouhé úlohy

Výkon bez obecnosti

Šachové enginy a systémy pro strukturu proteinů mohou být v určité oblasti nadlidské, aniž by se staly AGI.

Obecnost bez dokonalosti

Lidé přenášejí schopnosti mezi oblastmi navzdory chybám. Požadovat doslovnou dokonalost nastavuje laťku výše než lidská obecná inteligence.

Schopnost bez efektivity

Význam výsledku se může změnit, pokud každá úloha spotřebuje obrovské množství výpočetního výkonu, času nebo lidské pomoci.

Za hranicí ano/ne

AGI jako úrovně šíře a výkonu

Jeden vlivný rámec chápe schopnost jako matici. „Obecná“ pokrývá širokou škálu ne-fyzických úloh; výkon se porovnává s kvalifikovanými dospělými.

Výkon
Úzká
Obecná
Interpretace
Vznikající
Určitá užitečná kompetence v úloze
Nerovnoměrná schopnost v mnoha úlohách
Celkově pod úrovní kvalifikovaného dospělého
Kompetentní
Alespoň medián kvalifikovaného dospělého v omezené úloze
Kompetentní AGIAlespoň medián kvalifikovaného dospělého napříč širokými úlohami
Vyžaduje šíři a spolehlivý výkon
Expertní
Alespoň 90. percentil v omezené úloze
Expertní AGI napříč širokými úlohami
Mnohem silnější tvrzení pro celou ekonomiku
Nadlidská
Překonává všechny lidi v jedné oblasti
Široce překonává všechny lidi
Přechází do oblasti ASI

Sada nástrojů pro měření

Žádný benchmark není celá mysl

Nová abstrakce

ARC-AGI

Zaměřuje se na indukci pravidel z několika ukázek a efektivitu osvojování dovedností v neznámých vizuálních úlohách. Je cenný pro pružnou adaptaci, ale není úplným testem jazyka, agentnosti ani reálného světa.

Práce s dlouhým horizontem

Hodnocení agentů

Měří, zda systémy dokážou plánovat, používat nástroje, zotavovat se z chyb a dokončovat projekty v rostoucích časových horizontech. Výsledky silně závisí na podpůrné infrastruktuře a prostředí.

Široké znalosti

Sady zkoušek

Efektivně pokrývají mnoho oborů, ale mohou více odměňovat uložené znalosti, dovednost dělat testy a předchozí expozici než rychlé učení.

Varování před saturací benchmarku: jakmile se test stane cílem, vývojáři na něj začnou optimalizovat. Udržujte neveřejné kontrolní sady, střídejte úlohy, auditujte kontaminaci a zachovejte smysluplné lidské srovnávací skupiny.

Žebříček důkazů

Co by učinilo tvrzení o AGI přesvědčivým?

1UkázkaZajímavé chování, snadno vybrané
2Veřejný benchmarkSrovnatelný, ale náchylný k předchozí expozici
3Neveřejné hodnoceníNové úlohy a kontrolovaný přístup
4Základna kvalifikovaných lidíSrovnaná šíře, čas, nástroje a náklady
5Nezávislá replikaceAuditovatelné, robustní, adversariální důkazy
  1. 01

    Předem definujte hranici systému

    Model, paměť, vyhledávání, spouštění kódu, robotika, prompty i lidská pomoc — vše se počítá.

  2. 02

    Vzorkujte prostor úloh

    Široké tvrzení potřebuje reprezentativní úlohy, nikoli ručně vybranou přehlídku nejlepších výsledků.

  3. 03

    Testujte nové učení

    Měřte, jak rychle systém získává dovednosti, na které se nemohl během tréninku připravit.

  4. 04

    Měřte spolehlivost

    Důležité jsou průměrná úspěšnost, katastrofická selhání, kalibrace, zotavení i posun distribuce.

  5. 05

    Srovnejte podmínky s lidmi

    Porovnávejte čas, nástroje, instrukce, motivace a přístup k referenčním materiálům.

  6. 06

    Oddělte schopnost od bezpečnosti

    Po prokázání toho, co systém dokáže, testujte, zda zůstává ovladatelný a prospěšný.

Od imitace k adaptaci

Stručná historie myšlenky AGI

1950
Milník 01

Turing nově rámuje strojovou inteligenci

Imitační hra postavila do centra pozorovatelné chování, ale konverzační napodobování se nikdy nestalo úplnou definicí obecné inteligence.

1956
Milník 02

AI se stává výzkumným oborem

Dartmouthský návrh tvrdil, že učení a inteligenci by bylo možné popsat natolik přesně, aby je stroje mohly simulovat.

1980s
Milník 03

Expertní systémy odhalují problém úzkého zaměření

Vysoký výkon v omezených oblastech ukázal, že odbornost může být velmi silná, aniž by byla obecná nebo adaptivní.

1997–2016
Milník 04

Milníky úzkých nadlidských schopností

Deep Blue, Watson a AlphaGo překonaly silné lidské protivníky v konkrétních úlohách, přesto se nepodobaly obecně schopnému člověku.

2019
Milník 05

ARC se zaměřuje na efektivitu osvojování dovedností

François Chollet navrhl měřit inteligenci podle efektivity, s jakou systémy získávají nové dovednosti, a představil Abstraction and Reasoning Corpus.

2023
Milník 06

Rámec úrovní AGI

Výzkumníci Google DeepMind navrhli klasifikovat systémy podle hloubky výkonu i šíře úloh, od vznikající úrovně až po nadlidskou.

2024–26
Milník 07

Benchmarky uvažování a agentů se vyvíjejí

ARC-AGI a hodnocení agentů s dlouhým horizontem stále více testují adaptaci, používání nástrojů a interaktivní učení, zatímco saturace benchmarků a kontaminace zůstávají problémem.

Dnes
Milník 08

Neexistuje univerzální certifikace

AGI zůstává sporným konceptem. Každé seriózní tvrzení musí uvést definici, rozsah, lidskou srovnávací základnu, hranici systému a standard důkazů.

Nepříjemné skutečnosti

Proč je měření AGI obtížné

Nedefinovaný prostor úloh

„Všechny kognitivní úlohy“ nejsou konečný ani neutrální vzorek. Ekonomické a kulturní volby určují, co se započítává.

Neprůhlednost tréninku

Bez znalosti toho, co systém viděl, je obtížné oddělit vybavování a memorování od nového učení.

Proměnlivá hranice systému

Nástroje a podpůrné struktury mohou výkon zásadně změnit. Tvrzení o samotném modelu a o celém systému odpovídají na různé otázky.

Proměnlivá lidská základna

Lidský výkon závisí na odbornosti, motivaci, čase, spolupráci a přístupu k nástrojům.

Silné důkazy mohou ukázat

  • Široký výkon vůči definované lidské skupině
  • Rychlé učení v neveřejných nových úlohách
  • Robustní přenos a autonomie s dlouhým horizontem
  • Známé náklady, zásahy a režimy selhání

Označení AGI samo o sobě nemůže prokázat

  • Vědomí nebo morální status
  • Sladění s lidskými hodnotami
  • Absenci katastrofických chyb
  • Stejnou kompetenci v každém fyzickém kontextu

Jasné odpovědi

Často kladené otázky o AGI

Co znamená zkratka AGI?

Artificial General Intelligence, česky obecná umělá inteligence. Obvykle označuje AI se širokou a adaptabilní kompetencí v mnoha úlohách, nikoli výjimečný výkon v jediné úzké oblasti. Definice se liší v požadavcích na autonomii, tělesné zakotvení a požadovanou lidskou úroveň.

Existuje jeden oficiální test AGI?

Ne. Neexistuje všeobecně autorizovaná zkouška ani práh. Výzkumníci používají sady benchmarků, lidské srovnávací základny, učení na nových úlohách, hodnocení agentů a rámce kombinující šíři s výkonem.

Testuje tato stránka, zda je skutečný model AGI?

Ne. Interaktivní část testuje vaši schopnost interpretovat tvrzení založená na důkazech. Certifikace skutečného systému by vyžadovala přístup k systému, neveřejná hodnocení, zdokumentované podmínky a nezávislou replikaci.

Bylo již dosaženo AGI?

Konsenzus neexistuje, protože se liší definice i prahy. Silná tvrzení by měla uvádět přesnou operační definici místo toho, aby AGI považovala za všeobecně dohodnutou binární událost.

Může jediný benchmark prokázat AGI?

Žádný jediný benchmark nepokrývá šíři, robustnost, efektivitu učení, autonomii a spolehlivost v reálném světě obvykle spojované s AGI. Benchmark může poskytnout důležitý důkaz o jedné složce.

Je úspěch v Turingově testu totéž jako AGI?

Ne. Turingův test měří konverzační nerozlišitelnost podle určitého protokolu. Tvrzení o AGI se obvykle týkají širší kompetence, učení a přenosu.

Musí být AGI vědomá?

Podle většiny operačních definic schopností ne. Vědomí je samostatná a dosud nevyřešená vědecká i filozofická otázka.

Potřebuje AGI robotické tělo?

Záleží na definici. Některé rámce se výslovně zaměřují na ne-fyzické kognitivní úlohy; jiné tvrdí, že obecnost podobná člověku vyžaduje vnímání a jednání ve fyzickém světě.

Co je kontaminace benchmarku?

Nastává, když se hodnoticí úlohy nebo jejich blízké varianty dostanou do trénovacích dat, ladění nebo vývoje promptů, takže vysoké skóre může odrážet předchozí expozici místo zobecnění na skutečně nové problémy.

Jaký je rozdíl mezi modelem a agentem?

Model převádí vstupy na výstupy. Agentní systém může kombinovat model s pamětí, plánovacími smyčkami, nástroji, externími daty a schopností provádět akce v čase.

Co následuje po AGI?

Umělá superinteligence neboli ASI je hypotetická úroveň, na níž široká strojová inteligence výrazně překonává lidské schopnosti ve většině nebo prakticky všech relevantních kognitivních oblastech.

Může být AGI bezpečná, ale nespolehlivá?

Bezpečnost a spolehlivost se překrývají, ale nejsou totožné. Systém může mít sladěné záměry, ale často chybovat, nebo být technicky schopný a spolehlivý, zatímco sleduje škodlivé cíle. Pro obojí jsou potřeba samostatné důkazy.

Dohledatelnost rámce

Primární a výzkumné zdroje

Charta OpenAI

Významná ekonomická definice: vysoce autonomní systémy překonávající lidi ve většině ekonomicky hodnotné práce.

Otevřít zdroj

Google DeepMind: Úrovně AGI

Rámec založený na hloubce výkonu a šíři schopností.

Otevřít zdroj

Chollet: O měření inteligence

Definuje inteligenci kolem efektivity osvojování dovedností a představuje ARC.

Otevřít zdroj

Repozitář ARC-AGI

Oficiální úlohy, metody a dokumentace pro Abstraction and Reasoning Corpus.

Otevřít zdroj

ARC-AGI-3

Interaktivní benchmark uvažování pro průzkum, osvojování cílů a adaptivní modely světa.

Otevřít zdroj

Stanfordský index AI

Každoroční souhrn důkazů o schopnostech AI, trendech benchmarků, investicích, politice a dopadech.

Otevřít zdroj

NIST: rámec řízení rizik AI

Strukturovaný rámec pro řízení, mapování, měření a zvládání rizik AI.

Otevřít zdroj

Turing (1950)

Původní článek o imitační hře a základní argumentace o strojové inteligenci.

Otevřít zdroj